Relatório preliminar. O universo pode ter mudado desde a coleta dos dados.
DeepSeek-V4-Flash: mesmo modelo, provedor diferente
Este documento não publica um ranking de modelo. O objetivo é mais estreito e mais incomodante: mostrar que, para um mesmo peso de modelo, o endpoint que o serve muda o produto. Mesmos prompts, mesmo orçamento de tokens, mesmo scoring — a única variável é o provedor. E o delta não é ruído.
O run é 2026-W32-public (suíte 1d2792e98840), medido em 2026-08-09. Dois braços, mesmo modelo DeepSeek-V4-Flash:
- marvin — roteado pela parceria com o Marvin Router, gateway fixo que mantém o modelo em uso pleno sob um plano mensal.
- openrouter — cobrança por token, rota pública padrão.
Esta medição nasce justamente dessa parceria: o Marvin Router é o caminho que usamos para servir o modelo no dia a dia, e o OpenRouter é o espelho de mercado contra o qual comparamos. Os dados ficaram no store SQLite do benchmark. Eles não são reproduzíveis em condições idênticas porque o plano fixo e o roteamento do provedor não são estáveis no tempo — mas o contraste é real e foi registrado.
Setup
A suíte de benchmark conduz cada modelo através da camada de roteamento e registra latência, erros, timeouts e defeitos de transporte — não apenas a qualidade da resposta. Cada modelo recebe os mesmos prompts e as mesmas configurações. Aqui, o mesmo modelo pesou em duas rotas distintas.
| Endpoint | Marvin Score | Confiabilidade | Latência p50 | tok/s |
|---|---|---|---|---|
| DeepSeek-V4-Flash@openrouter | 0.756 | 91% | 20.1s | 792 |
| DeepSeek-V4-Flash@marvin | 0.568 | 99% | 6.6s | 126 |

Por benchmark
| Benchmark | n | marvin | openrouter | Δ | 95% CI | Leitura |
|---|---|---|---|---|---|---|
| aime | 90 | 0.244 | 0.867 | -0.622 | [-0.767, -0.478] | favorece openrouter |
| ifeval | 80 | 0.803 | 0.905 | -0.102 | [-0.172, -0.035] | favorece openrouter |
| livecodebench | 18 | 0.676 | 0.722 | -0.046 | [-0.306, +0.204] | consistente com nenhuma diferença |
Aviso de poder estatístico (LiveCodeBench, n=18): o intervalo que cruza zero não é evidência de empate entre marvin e openrouter — é evidência de que o run é pouco potente para decidir. LiveCodeBench é o único dos três benchmarks com n abaixo de 80 (só 18 itens); AIME (n=90) e IFEval (n=80) produzem intervalos de 95% que não cruzam zero. Um CI que abrange zero com n tão pequeno deve ser lido como ruído de amostra, não sinal. Os regimes capacity/interaction deste post continuam sustentados por AIME (sinal forte) e IFEval (sinal moderado); a LiveCodeBench simplesmente não tem massa amostral para entrar nessa conversa.
O intervalo de 95% vem de um bootstrap pareado sobre os itens (10.000 reamostragens). Ambos os endpoints respondem aos mesmos itens, então o intervalo reflete apenas os itens em que discordam. Um intervalo que cruza zero significa que o run não distingue os dois — o que não é o mesmo que mostrar que são iguais.

Aviso de poder: o n de cada benchmark está na tabela acima. LiveCodeBench (n=18) é o único com intervalo de 95% que cruza zero — leia como ruído de amostra pequena, não como empate. AIME (n=90) e IFEval (n=80) são os únicos com poder estatístico para declarar diferença neste run.
Por categoria
| Categoria | openrouter | marvin |
|---|---|---|
| coding | 0.72 | 0.68 |
| instruction following | 0.91 | 0.80 |
| math | 0.87 | 0.24 |
O colapso está concentrado em matemática. Onde o OpenRouter marca 0.87 em AIME, o caminho marvin marca 0.244. Não é uma pequena deriva: é uma ordem de grandeza. A explicação mais provável não é o modelo — é o que o roteador marvin entrega nesse endpoint específico (versão do peso, camada de pós-processamento, ou janela de contexto mais apertada em math). Registramos a lacuna; a causa fica fora do escopo desta medição.

Medido vs publicado
Contra o que está publicado, o quadro é contexto, não ranking — conjuntos de dados, orçamentos e conexão diferentes, e esses números nunca entram no Marvin Score.
| Benchmark | Medido aqui | Publicado em outro lugar | Fonte | |---|---|---|---| | aime | marvin 0.24 · openrouter 0.87 | DeepSeek-V4 (completo, não Flash) 0.96 | blog | | | | Kimi K3 0.96 | blog | | livecodebench | marvin 0.68 · openrouter 0.72 | DeepSeek-V4-Flash 0.92 | blog | | | | Qwen3.6-Flash 0.80 | blog | | | | MiniMax-M3 0.82 | blog | | | | Kimi K3 0.68 | blog |
Os números publicados vêm de blogs, com conjuntos e orçamentos diferentes dos nossos; o contraste é contexto, não veredito. O colapso do caminho marvin em AIME (0.24) não aparece em nenhum número publicado — e o livecodebench medido (0.68–0.72) fica abaixo do Flash publicado (0.92), o que reforça a ressalva de n pequeno: não transformamos essa lacuna em conclusão.

Confiabilidade inverte o sinal
| Endpoint | Erros | Timeouts | 429 | TTFT p50 | Retries |
|---|---|---|---|---|---|
| openrouter | 9.0% | 0.0% | 0.0% | 15.3s | 46 |
| marvin | 1.1% | 0.0% | 0.0% | 1.4s | 4 |
Aqui o marvin vence de longe. Erro de 1.1% contra 9.0%, e TTFT de 1.4s contra 15.3s. O OpenRouter é mais capaz no placar bruto, mas entrega com 9 vezes mais falhas e uma primeira resposta dez vezes mais lenta. Para um gateway como o Marvin Router, que serve o modelo em produção, essa confiabilidade é o que importa — mesmo que o placar de math sofra.
Custo: grandezas diferentes
| Endpoint | Custo por 1k tarefas | Faturamento |
|---|---|---|
| marvin | $0.111 | plano fixo de $5/mês ÷ 45.000 req, em uso pleno |
| openrouter | $0.723 | por token, $0.09/$0.18 por 1M |
Plano fixo e cobrança por token não são a mesma grandeza. A figura de assinatura assume que a cota mensal é totalmente consumida; no meio do uso o custo real por tarefa dobra, enquanto a figura por token se mantém em qualquer volume. Comparar $0.111 com $0.723 lado a lado é enganoso — um reflete capacidade ociosa ou plena, o outro reflete preço de mercado. O gráfico abaixo mostra a relação qualidade × custo nos dois regimes.

O que isso significa
Um mesmo peso servido por dois endpoints não é o mesmo produto. O provedor decide o placar de math, a confiabilidade e a latência — três das quatro dimensões que o Marvin Score tenta resumir. A lição para quem serve modelos em produção (como o Marvin Router faz) é que a escolha do endpoint é uma decisão de engenharia, não um detalhe de faturamento.
Legibilidade sobre mistério: leia o n antes de chamar um delta pequeno de real. LiveCodeBench (n=18) não distingue os dois neste run — e estaríamos errados em afirmar o contrário. AIME (n=90) e IFEval (n=80) distinguem, com intervalos de 95% que não cruzam zero.