10 de julho de 2026
| # | Modelo | Score | Δ | |
|---|---|---|---|---|
| 01 | Task-Specific Agents (GPT-4o-mini/GPT-4o) Rank #1 geral | 0.402 (overall) | — | |
| 02 | Tossup (GPT-4o-mini-class) Estratégia calibrada por confiança | 0.238 | — | |
| 03 | Bonus (GPT-4o-class) Raciocínio relacional multimodal | 0.164 | — |
A edição 2026 do QANTA, benchmark de question answering multimodal com foco em quizbowl, trouxe como destaque a abordagem task-specific da equipe de Nirjhar Das e Md. Al-Mamun Provath. O sistema venceu a competição com score geral de 0,402, superando concorrentes ao aliar eficiência computacional e raciocínio incremental.
Arquitetura dual e raciocínio calibrado
O desafio deste ano foi dividido entre perguntas do tipo Tossup — que priorizam decisões sob incerteza — e Bonus, que exigem precisão e integração de múltiplas evidências. Para cada tarefa, o time desenvolveu agentes específicos: o Tossup Agent usa um modelo GPT-4o-mini-class (referido nos logs como GPT-4.1-mini), calibrando confiança e aplicando uma política de raciocínio numérico para evitar respostas superconfiantes baseadas em pistas quantitativas isoladas. Já o Bonus Agent utiliza um GPT-4o-class (GPT-4.1) com estratégias de raciocínio relacional e integração multimodal para selecionar respostas exatas.
Diferente de pipelines tradicionais que dependem de busca externa ou ensembles, o sistema aposta em políticas de raciocínio otimizadas para cada subtarefa, operando inteiramente em ambiente hospedado, sem recursos adicionais.
Resultados no leaderboard
Segundo o paper arXiv:2607.09623v1, o sistema alcançou score de 0,238 nos Tossups e 0,164 no Bonus Effect, consolidando-se como o melhor desempenho geral da QANTA 2026. O resultado destaca que estratégias enxutas e bem calibradas podem superar abordagens mais pesadas em benchmarks multimodais sob restrição de recursos.
Por que importa
O resultado reforça a tendência de especialização em agentes para tarefas distintas dentro do mesmo domínio, uma abordagem relevante para aplicações que exigem eficiência e precisão sob demanda. Para equipes brasileiras e desenvolvedores interessados em QA multimodal, a arquitetura dual e o uso de modelos compactos como o GPT-4o-mini oferecem um caminho viável para competir em benchmarks de ponta sem infraestrutura massiva.
A publicação completa, com detalhes de implementação e análise dos scores, está disponível no arXiv.