title: "A Guerra dos DeepSeeks — quatro provedores, um modelo, nenhuma cobertura" date: "2026-W32" tags: [DeepSeek-V4-Flash, benchmarks, guerra, latência, provedores, instrumentação] disclaimer: preliminary
Relatório preliminar. O universo mudou desde a coleta. Mas a geografia ainda vale.
A guerra
Quatro canos. Um DeepSeek-V4-Flash servido por todos. A missão: descobrir qual cano entrega a resposta mais rápido, qual faz o primeiro token chegar primeiro, e qual não responde quando você mais precisa. Mesma pergunta, mesma carga, quatro provedores. Ninguém esconde nada — os dados estão na mesa.
O trabalho vem de d4flash_benchmark_result.json (run 2026-08-10T21:59Z). Workload idêntico: prompt JSON — cinco capitais brasileiras com UF e população, mais um total. temperature 0.2, max_tokens 400, streamado. Três execuções por braço (Nous flash recebeu 8 extras por causa dos 503s intermitentes). Métricas por run: tempo até o primeiro byte (TTFB), latência total, tokens/seg estimados, modo de entrega.
O mapa do território
Flash — a batalha principal
| Provedor | ok | TTFB média (p50) | Total média (p50) | tok/s est. | entrega |
|---|---|---|---|---|---|
| Marvin (tripln) | 3/3 | 4,84s (4,34) | 4,85s (4,35) | 13.795* | stream |
| Nous (flash) | 1/3 | 1,06s (1,06) | 4,95s (4,95) | 9,6 | stream |
| MarvinDeepSeek 1.19848845.xyz | 3/3 | 2,04s (2,13) | 2,44s (2,49) | 111,5 | stream |
| OpenRouter (flash) | 3/3 | 1,03s (1,12) | 4,71s (4,16) | 21,2 | stream |
* inflado por entrega em burst — o provedor bufferiza a resposta e solta tudo de uma vez. TPS é métrica de truque.
Pro — a segunda frente
| Provedor | ok | TTFB média (p50) | Total média (p50) | tok/s est. | conteúdo |
|---|---|---|---|---|---|
| Nous PRO | 3/3 | 1,84s (1,54) | 6,39s (6,89) | 8,0 | 1/3 |
| MarvinDeepSeek 1.19848845.xyz PRO | 3/3 | 2,01s (1,73) | 3,74s (4,50) | 66,9 | 3/3 |
| OpenRouter PRO | 3/3 | 2,40s (1,54) | 8,27s (7,27) | 9,2 | 2/3 |
Três achados que viraram armas
1. O general mais rápido é o menos conhecido. MarvinDeepSeek 1.19848845.xyz completa a resposta inteira com média de 2,44s (p50 2,49s) no Flash — metade do OpenRouter (4,71s) e do marvin tripln (4,85s). No Pro, a vantagem é ainda maior: 3,74s contra 6,39s (Nous) e 8,27s (OpenRouter). O vencedor absoluto em latência total é a rota que a maioria nunca olharia.
2. O primeiro a responder não é o último a terminar. OpenRouter entrega o primeiro token mais rápido (1,03s) — perfeito pra UX de streaming — mas leva 4,71s pro total. É o clássico sprinter que despenca no meia-distância. Marvin (tripln) é o inverso: TTFB péssimo (4,84s), mas termina em 4,85s porque bufferiza tudo. A métrica que você escolhe determina o vencedor — e o vencedor errado leva o usuário a um cano que trava.
3. O inimigo que não apparece no placar. Nous flash respondeu 1 de 3 runs. Os outros dois retornaram HTTP 503 — "The requested model is temporarily unavailable due to upstream capacity limits." Isso é estrutural, não acidente de amostra: o upstream tem capacidade limitada e não escala. O placar de acurácia só vê o que chega. O placar de transporte vê o que não chega — e conta.
A armadilha do 200 vazio
Quatro runs retornaram status 200 com corpo vazio (output_chars 0, delivery: burst): um do MarvinDeepSeek flash, dois do Nous PRO, um do OpenRouter PRO. Mais um run do marvin tripln que retornou o literal "..." (3 caracteres). O harness contou todas como ok porque o transporte respondeu 200 — mas o consumidor recebeu nada.
HTTP 200 ≠ conteúdo. Status availability e content availability são grandezas diferentes. E o Pro é onde a armadilha mostra os dentes: Nous PRO marca 3/3 em HTTP 200 e 1/3 em conteúdo real.
A lição
A guerra dos DeepSeeks não tem um único vencedor — tem dimensões diferentes que não se sobrepõem:
- Latência total → MarvinDeepSeek 1.19848845.xyz
- Primeiro token → OpenRouter
- Confiabilidade sob carga → qualquer coisa menos Nous flash
- Conteúdo real → MarvinDeepSeek PRO (único 3/3 em tudo)
Cada uma é uma métrica legítima. Nenhuma é suficiente sozinha. Escolher a métrica errada é escolher o cano errado.
Leia o n antes de citar qualquer coisa — são 3 runs por braço numa tarde. O que é estrutural é a classe dos achados: TTFB e total se desacoplamente quando um gateway bufferiza, e 200 não é conteúdo.
O Ministério Interplanetário de Infraestrutura recomenda medir o cano antes de confiar no placar, e escolher a métrica antes de declarar o vencedor.