Unslop AI Writing arXiv Benchmark
Métrica: % de artigos classificados como escritos por IA
Jul 2026
| # | Modelo | Score | Δ | |
|---|---|---|---|---|
| 01 | Detector Unslop (calibrado) Média geral, 12.750 papers | 32% (Q2 2026) | — | |
| 02 | Computer Science Campo com maior incidência | 65.0% | — | |
| 03 | Matemática Campo com menor incidência | 0.7% | — | |
| 04 | Quantitative Biology | 56.3% | — | |
| 05 | Electrical Eng. & Systems | 51.3% | — | |
| 06 | Economics & Finance | 47.0% | — | |
| 07 | Applied Physics | 34.0% | — | |
| 08 | Statistics | 31.3% | — | |
| 09 | Condensed Matter | 24.0% | — | |
| 10 | High-Energy Physics | 14.0% | — | |
| 11 | Astrophysics | 10.7% | — |
Um novo levantamento analisou o texto integral de 12.750 artigos submetidos ao arXiv entre janeiro de 2023 e julho de 2026. O resultado: cerca de um terço dos novos papers — 32% no último trimestre completo — soam como escritos por IA, segundo um detector calibrado para minimizar falso-positivos em textos acadêmicos genuínos.
Metodologia: controle pré-LLM e calibração
O estudo partiu de uma crítica recorrente a manchetes sobre “N% do conteúdo é IA”: muitos detectores também classificam erroneamente textos humanos. Para contornar isso, os autores calibraram o detector para que apenas 0,4% dos papers submetidos antes do ChatGPT (2021–2022) fossem marcados como máquina. Esse valor ancorou as métricas, servindo de linha de base para o que é, por construção, texto humano.
A amostra cobriu dez áreas do arXiv, com cerca de 25 papers por campo por mês, além de controles históricos. O detector avaliou o texto completo — não só o abstract, já que o corpo dos artigos tende a revelar mais sinais de geração automática.
Resultados: crescimento desigual, computer science à frente
Os dados mostram uma curva estável nos anos pré-LLM (2021–2022), com apenas 0,4% dos textos soando artificiais. Após o lançamento do ChatGPT, a proporção sobe rapidamente, atingindo 32% no trimestre mais recente e picos de 39% no início de 2026.
A variação por área é expressiva. Computer science lidera com 65% dos papers recentes classificados como escritos por IA. Quantitative biology (56,3%), electrical engineering & systems (51,3%) e economics & finance (47,0%) também apresentam índices elevados. Na outra ponta, matemática quase não aparece: só 0,7% dos textos nesse campo são marcados como máquina.
| Campo | Pré-LLM | 2026 (%) | Intervalo 95% |
|---|---|---|---|
| Computer Science | 0,2% | 65,0% | [59,3–70,3] |
| Quantitative Biology | 3,5% | 56,3% | [51,0–61,7] |
| Electrical Eng. & Systems | 1,7% | 51,3% | [46,0–57,0] |
| Economics & Finance | 2,5% | 47,0% | [41,3–52,7] |
| Applied Physics | 1,3% | 34,0% | [29,0–39,7] |
| Statistics | 1,8% | 31,3% | [26,0–36,7] |
| Condensed Matter | 0,0% | 24,0% | [19,3–29,0] |
| High-Energy Physics | 0,5% | 14,0% | [10,0–18,0] |
| Astrophysics | 0,0% | 10,7% | [7,3–14,3] |
| Mathematics | 0,0% | 0,7% | [0,0–1,7] |
A ordem dos campos não segue o controle histórico: áreas que tinham mais falso-positivo pré-LLM não são as que mais crescem após 2023.
Limitações: detector não é veredito
Os autores destacam limitações relevantes. O controle pré-LLM de cada campo tem amostras pequenas (200 artigos), tornando a base por área apenas aproximada. Em campos como matemática, o detector pode ter “ponto cego”: textos com muita notação e pouco inglês científico podem ser classificados como humanos mesmo se gerados por IA. Assim, os números baixos em matemática devem ser lidos só como limite inferior para adoção.
Além disso, o detector mede apenas se o texto soa artificial. Não distingue entre um artigo totalmente gerado e um texto humano com edição pesada por IA. A sensibilidade varia entre diferentes modelos de geração, e o número reportado é sempre um piso — a presença real pode ser maior.
Por que importa
A análise mostra que o uso de IA para redigir textos acadêmicos já é dominante em áreas como ciência da computação, e está se espalhando rapidamente por outras disciplinas. Para pesquisadores, editores e leitores, entender a abrangência e as limitações dessas medições é essencial para interpretar a autoria e a originalidade dos trabalhos que circulam no ecossistema científico.