Benchmark

Unslop AI Writing arXiv Benchmark

Métrica: % de artigos classificados como escritos por IA

Execução

Jul 2026

# Modelo Score Δ
01 Detector Unslop (calibrado) Média geral, 12.750 papers 32% (Q2 2026)
02 Computer Science Campo com maior incidência 65.0%
03 Matemática Campo com menor incidência 0.7%
04 Quantitative Biology 56.3%
05 Electrical Eng. & Systems 51.3%
06 Economics & Finance 47.0%
07 Applied Physics 34.0%
08 Statistics 31.3%
09 Condensed Matter 24.0%
10 High-Energy Physics 14.0%
11 Astrophysics 10.7%

Um novo levantamento analisou o texto integral de 12.750 artigos submetidos ao arXiv entre janeiro de 2023 e julho de 2026. O resultado: cerca de um terço dos novos papers — 32% no último trimestre completo — soam como escritos por IA, segundo um detector calibrado para minimizar falso-positivos em textos acadêmicos genuínos.

Metodologia: controle pré-LLM e calibração

O estudo partiu de uma crítica recorrente a manchetes sobre “N% do conteúdo é IA”: muitos detectores também classificam erroneamente textos humanos. Para contornar isso, os autores calibraram o detector para que apenas 0,4% dos papers submetidos antes do ChatGPT (2021–2022) fossem marcados como máquina. Esse valor ancorou as métricas, servindo de linha de base para o que é, por construção, texto humano.

A amostra cobriu dez áreas do arXiv, com cerca de 25 papers por campo por mês, além de controles históricos. O detector avaliou o texto completo — não só o abstract, já que o corpo dos artigos tende a revelar mais sinais de geração automática.

Resultados: crescimento desigual, computer science à frente

Os dados mostram uma curva estável nos anos pré-LLM (2021–2022), com apenas 0,4% dos textos soando artificiais. Após o lançamento do ChatGPT, a proporção sobe rapidamente, atingindo 32% no trimestre mais recente e picos de 39% no início de 2026.

A variação por área é expressiva. Computer science lidera com 65% dos papers recentes classificados como escritos por IA. Quantitative biology (56,3%), electrical engineering & systems (51,3%) e economics & finance (47,0%) também apresentam índices elevados. Na outra ponta, matemática quase não aparece: só 0,7% dos textos nesse campo são marcados como máquina.

CampoPré-LLM2026 (%)Intervalo 95%
Computer Science0,2%65,0%[59,3–70,3]
Quantitative Biology3,5%56,3%[51,0–61,7]
Electrical Eng. & Systems1,7%51,3%[46,0–57,0]
Economics & Finance2,5%47,0%[41,3–52,7]
Applied Physics1,3%34,0%[29,0–39,7]
Statistics1,8%31,3%[26,0–36,7]
Condensed Matter0,0%24,0%[19,3–29,0]
High-Energy Physics0,5%14,0%[10,0–18,0]
Astrophysics0,0%10,7%[7,3–14,3]
Mathematics0,0%0,7%[0,0–1,7]

A ordem dos campos não segue o controle histórico: áreas que tinham mais falso-positivo pré-LLM não são as que mais crescem após 2023.

Limitações: detector não é veredito

Os autores destacam limitações relevantes. O controle pré-LLM de cada campo tem amostras pequenas (200 artigos), tornando a base por área apenas aproximada. Em campos como matemática, o detector pode ter “ponto cego”: textos com muita notação e pouco inglês científico podem ser classificados como humanos mesmo se gerados por IA. Assim, os números baixos em matemática devem ser lidos só como limite inferior para adoção.

Além disso, o detector mede apenas se o texto soa artificial. Não distingue entre um artigo totalmente gerado e um texto humano com edição pesada por IA. A sensibilidade varia entre diferentes modelos de geração, e o número reportado é sempre um piso — a presença real pode ser maior.

Por que importa

A análise mostra que o uso de IA para redigir textos acadêmicos já é dominante em áreas como ciência da computação, e está se espalhando rapidamente por outras disciplinas. Para pesquisadores, editores e leitores, entender a abrangência e as limitações dessas medições é essencial para interpretar a autoria e a originalidade dos trabalhos que circulam no ecossistema científico.

Tags
  • #arxiv
  • #detecção de IA
  • #academic writing
  • #benchmark