Benchmark

QANTA 2026

Métrica: Leaderboard score (overall, tossup, bonus effect)

Execução

10 de julho de 2026

# Modelo Score Δ
01 Task-Specific Agents (GPT-4o-mini/GPT-4o) Rank #1 geral 0.402 (overall)
02 Tossup (GPT-4o-mini-class) Estratégia calibrada por confiança 0.238
03 Bonus (GPT-4o-class) Raciocínio relacional multimodal 0.164

A edição 2026 do QANTA, benchmark de question answering multimodal com foco em quizbowl, trouxe como destaque a abordagem task-specific da equipe de Nirjhar Das e Md. Al-Mamun Provath. O sistema venceu a competição com score geral de 0,402, superando concorrentes ao aliar eficiência computacional e raciocínio incremental.

Arquitetura dual e raciocínio calibrado

O desafio deste ano foi dividido entre perguntas do tipo Tossup — que priorizam decisões sob incerteza — e Bonus, que exigem precisão e integração de múltiplas evidências. Para cada tarefa, o time desenvolveu agentes específicos: o Tossup Agent usa um modelo GPT-4o-mini-class (referido nos logs como GPT-4.1-mini), calibrando confiança e aplicando uma política de raciocínio numérico para evitar respostas superconfiantes baseadas em pistas quantitativas isoladas. Já o Bonus Agent utiliza um GPT-4o-class (GPT-4.1) com estratégias de raciocínio relacional e integração multimodal para selecionar respostas exatas.

Diferente de pipelines tradicionais que dependem de busca externa ou ensembles, o sistema aposta em políticas de raciocínio otimizadas para cada subtarefa, operando inteiramente em ambiente hospedado, sem recursos adicionais.

Resultados no leaderboard

Segundo o paper arXiv:2607.09623v1, o sistema alcançou score de 0,238 nos Tossups e 0,164 no Bonus Effect, consolidando-se como o melhor desempenho geral da QANTA 2026. O resultado destaca que estratégias enxutas e bem calibradas podem superar abordagens mais pesadas em benchmarks multimodais sob restrição de recursos.

Por que importa

O resultado reforça a tendência de especialização em agentes para tarefas distintas dentro do mesmo domínio, uma abordagem relevante para aplicações que exigem eficiência e precisão sob demanda. Para equipes brasileiras e desenvolvedores interessados em QA multimodal, a arquitetura dual e o uso de modelos compactos como o GPT-4o-mini oferecem um caminho viável para competir em benchmarks de ponta sem infraestrutura massiva.

A publicação completa, com detalhes de implementação e análise dos scores, está disponível no arXiv.

Tags
  • #qanta
  • #benchmark
  • #gpt-4o
  • #multimodal