O ThinkingBox, desenvolvido pela Microsoft em parceria com a Hugging Face, propõe um novo padrão para avaliação de agentes de IA: medir o sucesso não pelo que o agente diz, mas pelo que ele realmente faz no backend. A ferramenta está disponível gratuitamente via Hugging Face e já foi usada para rodar mais de 120 mil tentativas em fluxos empresariais reais.
Avaliação pelo efeito, não pela prosa
O diferencial do ThinkingBox é simples: enquanto benchmarks tradicionais avaliam se a resposta final de um agente parece correta, o ThinkingBox examina o estado real dos registros após a execução. Um agente pode fazer todas as chamadas de ferramenta certas, responder de forma convincente e ainda assim deixar a base de dados em um estado incorreto — e é esse tipo de falha que o benchmark revela (fonte).
No exemplo destacado no anúncio, um agente processa nove etapas para resolver uma entrega atrasada, fecha o ticket como “resolvido” e informa a cliente que o caso foi encerrado. Mas, ao analisar o banco de dados, o status correto deveria ser “em espera”, pois o problema logístico persistia. O ThinkingBox detecta esse tipo de desvio, que passaria despercebido em avaliações superficiais.
Como funciona
O benchmark cobre 507 workflows empresariais (retail, seguros, viagens, bancos digitais, consultoria), cada um rodado 20 vezes a partir de um backend limpo. O resultado é medido por três métricas principais:
- pass@1: percentual de tentativas bem-sucedidas em uma única rodada (equivalente ao score tradicional de benchmarks).
- pass@20: percentual de tarefas resolvidas ao menos uma vez em 20 tentativas.
- observed 20/20: número de tarefas em que o agente acertou nas 20 execuções — o teste de confiabilidade real.
A abordagem expõe o hiato entre respostas “certas” e efeitos reais: dos 121.680 testes válidos, mais da metade falhou nos checadores de estado, mesmo quando não houve erro aparente na resposta final.
Resultados e limitações
Na rodada mais recente, Claude Opus 5.5 liderou entre os modelos proprietários, com 67,16% de pass@1 geral. O melhor modelo open-weight, Kimi-K3, ficou pouco atrás dos líderes proprietários, mostrando maturidade crescente do open source. Modelos como o GPT-5.4 e variantes do Qwen também foram avaliados, com scores detalhados por domínio (retail, seguros, etc).
Apesar do rigor, o ThinkingBox é direcionado para fluxos empresariais com backend estruturado e não se aplica a tarefas puramente textuais ou criativas. Além disso, a configuração exige ambientação dos ambientes simulados e scripts específicos, o que pode ser uma barreira para times sem infraestrutura técnica.
Para quem serve
O ThinkingBox é especialmente útil para equipes que desenvolvem agentes autônomos para processos empresariais — atendimento, operações, automação de backoffice — e precisam garantir que o LLM não só “pareça” correto, mas realmente entregue o efeito esperado no sistema.
Para quem trabalha com fluxos sensíveis a consistência (financeiro, logística, suporte), o benchmark oferece uma camada de validação impossível de obter apenas com análise de logs ou respostas finais. Já para tarefas sem backend ou com foco em geração textual, outras ferramentas seguirão mais adequadas.
Nota e avaliação
O ThinkingBox se destaca como referência para avaliação robusta de agentes, equilibrando rigor técnico e acessibilidade (via Hugging Face). Perde meio ponto pelo foco restrito a workflows empresariais e pela necessidade de setup técnico, mas é hoje o padrão ouro para quem precisa confiar em agentes que mexem com dados reais.