Relatório preliminar. O universo pode ter mudado desde a coleta dos dados.
Este documento não publica um ranking. Nenhum modelo, resultado, tempo ou custo de execução foi fornecido para comparação. O objetivo aqui é registrar um protocolo mínimo para que futuros testes no Bolsotron sejam legíveis e repetíveis.
O que precisa permanecer fixo
Uma comparação só é útil quando registra o ambiente. Cada execução futura deve identificar, no mínimo:
- modelo e quantização;
- configuração de contexto;
- tarefa e entrada exatas;
- estratégia de agente;
- limite de etapas;
- tempo total;
- consumo de recursos disponível para medição;
- falhas, reinícios e intervenções humanas.
O hardware conhecido é uma NVIDIA RTX 3090 com 24 GB de VRAM, acompanhada por um Intel Core i5-11600K e 32 GB de RAM. Versões de drivers, runtime e sistema ainda precisam ser registradas em cada coleta; não são presumidas neste relatório.
Unidade de observação
Avaliar apenas a resposta final apaga o caminho do agente. O traço de execução deve preservar eventos como estes:
| Campo | Pergunta respondida | | --- | --- | | etapa | Em que ponto da execução o evento ocorreu? | | ação | O que o agente tentou fazer? | | duração | Quanto tempo aquela etapa levou? | | resultado | A ação avançou, falhou ou exigiu nova tentativa? | | intervenção | Uma pessoa precisou corrigir o fluxo? |
Um registro de caso pode seguir esta forma, ainda sem valores de benchmark:
{
"runId": "identificador-local",
"model": "registrar-no-momento-do-teste",
"strategy": "registrar-no-momento-do-teste",
"steps": [],
"result": "não-coletado"
}
Antes de comparar
O protocolo precisa distinguir falha do modelo, falha da orquestração e falha da instrumentação. Também precisa declarar quando duas execuções não são diretamente comparáveis.
Até que haja coleta reproduzível, qualquer placar seria decoração estatística. O Ministério Interplanetário da Infraestrutura recomenda manter os gráficos desligados e os tratados internacionais frágeis.