A reprodutibilidade de benchmarks em IA ganhou um avanço relevante com a iniciativa conjunta do UK AI Security Institute (AISI) e da EvalEval Coalition. As duas organizações consolidaram um padrão aberto para publicação de resultados, métodos e configurações, usando o schema Every Eval Ever (EEE) e a plataforma Evaluation Cards fonte.

Infraestrutura aberta para benchmarks

AISI e EvalEval começaram a colaborar após um workshop conjunto no NeurIPS 2025. O resultado prático desse trabalho é a publicação aberta de resultados verificados, com contexto detalhado, configuração e métodos dos experimentos. O novo padrão cobre cinco benchmarks centrais — HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro e Terminal-Bench 2.0 — e seis modelos frontier: Claude Opus 4, 4.5, 4.6, GPT-5, 5.2 e 5.4.

Além disso, avaliações relacionadas no domínio de segurança, como Cyber CTFs e The Last Ones, também foram incluídas. Os dados acompanham o artigo “How Inference Compute Shapes Frontier LLM Evaluation”, que analisa como o desempenho dos modelos varia em função de recursos de inferência e do protocolo de avaliação.

Por que padronizar importa

Até recentemente, resultados de benchmarks eram divulgados em formatos díspares, dificultando a comparação e a reprodutibilidade. Avaliações podem ser caras, e a ausência de detalhes sobre configuração e protocolo limita o valor científico dos reports. O EEE e os Evaluation Cards tornam explícitos aspectos como quantidade de tokens usados, feedback de correção, setup experimental e curvas de performance, como destacado no caso do Humanity’s Last Exam — em que a performance dos modelos variou substancialmente conforme o feedback e a quantidade de tentativas permitidas.

Impacto para pesquisa, governança e mercado

A padronização permite que pesquisadores, desenvolvedores e formuladores de políticas possam comparar resultados entre modelos e benchmarks em condições equivalentes, facilitando meta-análises e diagnósticos mais confiáveis. Releases como os do AISI funcionam como pontos de referência, ajudando a interpretar relatórios menos detalhados de outros grupos. A plataforma também facilita a identificação de lacunas e inconsistências em benchmarks amplamente citados.

Limitações e próximos passos

Apesar do avanço, a cobertura dos Evaluation Cards ainda está restrita a benchmarks e modelos mais recentes — especialmente aqueles ligados a institutos de pesquisa e grandes laboratórios. A adoção mais ampla depende do engajamento de outros atores do ecossistema, incluindo desenvolvedores independentes e empresas privadas. A expectativa é que, à medida que mais avaliadores adotem o EEE, a robustez científica dos benchmarks aumente e o setor ganhe em transparência.

Nota do Daily AI

A infraestrutura da EvalEval Coalition e do AISI merece destaque: é o tipo de solução que eleva o padrão do setor e reduz ruído em discussões técnicas. Por ora, a limitação está na adoção restrita. Nota: 4.5/5.

Tags
  • #evaleval
  • #aisi
  • #benchmarks
  • #transparencia
  • #reproducibilidade