A reprodutibilidade de benchmarks em IA ganhou um avanço relevante com a iniciativa conjunta do UK AI Security Institute (AISI) e da EvalEval Coalition. As duas organizações consolidaram um padrão aberto para publicação de resultados, métodos e configurações, usando o schema Every Eval Ever (EEE) e a plataforma Evaluation Cards fonte.
Infraestrutura aberta para benchmarks
AISI e EvalEval começaram a colaborar após um workshop conjunto no NeurIPS 2025. O resultado prático desse trabalho é a publicação aberta de resultados verificados, com contexto detalhado, configuração e métodos dos experimentos. O novo padrão cobre cinco benchmarks centrais — HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro e Terminal-Bench 2.0 — e seis modelos frontier: Claude Opus 4, 4.5, 4.6, GPT-5, 5.2 e 5.4.
Além disso, avaliações relacionadas no domínio de segurança, como Cyber CTFs e The Last Ones, também foram incluídas. Os dados acompanham o artigo “How Inference Compute Shapes Frontier LLM Evaluation”, que analisa como o desempenho dos modelos varia em função de recursos de inferência e do protocolo de avaliação.
Por que padronizar importa
Até recentemente, resultados de benchmarks eram divulgados em formatos díspares, dificultando a comparação e a reprodutibilidade. Avaliações podem ser caras, e a ausência de detalhes sobre configuração e protocolo limita o valor científico dos reports. O EEE e os Evaluation Cards tornam explícitos aspectos como quantidade de tokens usados, feedback de correção, setup experimental e curvas de performance, como destacado no caso do Humanity’s Last Exam — em que a performance dos modelos variou substancialmente conforme o feedback e a quantidade de tentativas permitidas.
Impacto para pesquisa, governança e mercado
A padronização permite que pesquisadores, desenvolvedores e formuladores de políticas possam comparar resultados entre modelos e benchmarks em condições equivalentes, facilitando meta-análises e diagnósticos mais confiáveis. Releases como os do AISI funcionam como pontos de referência, ajudando a interpretar relatórios menos detalhados de outros grupos. A plataforma também facilita a identificação de lacunas e inconsistências em benchmarks amplamente citados.
Limitações e próximos passos
Apesar do avanço, a cobertura dos Evaluation Cards ainda está restrita a benchmarks e modelos mais recentes — especialmente aqueles ligados a institutos de pesquisa e grandes laboratórios. A adoção mais ampla depende do engajamento de outros atores do ecossistema, incluindo desenvolvedores independentes e empresas privadas. A expectativa é que, à medida que mais avaliadores adotem o EEE, a robustez científica dos benchmarks aumente e o setor ganhe em transparência.
Nota do Daily AI
A infraestrutura da EvalEval Coalition e do AISI merece destaque: é o tipo de solução que eleva o padrão do setor e reduz ruído em discussões técnicas. Por ora, a limitação está na adoção restrita. Nota: 4.5/5.