Setembro de 2026
| # | Modelo | Score | Δ | |
|---|---|---|---|---|
| 01 | GPT-5.6 Luna 74% de precisão, US$ 0.20 no total, 23s/review, 2.104 output tokens | 69 bugs verificados | -23 | |
| 02 | GPT-6 Astra 96% de precisão, US$ 5.66 no total, 36s/review, 688 output tokens | 92 bugs verificados | +23 |
O comparativo entre GPT-5.6 Luna e GPT-6 Astra para revisão automatizada de código, publicado em setembro de 2026 pela Entelligence, traz uma análise detalhada sobre o custo-benefício de modelos de IA em tarefas críticas de engenharia de software.
Metodologia: mesmos PRs, prompts e critérios
O estudo avaliou ambos os modelos sobre 50 pull requests públicos de cinco grandes repositórios open source: Cal.com, Sentry, Discourse, Keycloak e Grafana. Cada PR introduziu defeitos deliberados em uma base limpa. Os modelos receberam o mesmo prompt — focando em bugs de corretude, segurança, concorrência, recursos e tratamento de erros, excluindo sugestões de estilo e documentação.
Os achados foram verificados por um painel duplo: GPT-6 Astra e GPT-5.6 Sol julgaram, de forma cega, se cada apontamento era um bug real. Só foram computados bugs em que ambos concordaram. No total, houve 143 bugs distintos validados, e a concordância entre os juízes foi de 91%.
Resultados: precisão vs custo
- GPT-5.6 Luna encontrou 69 bugs verificados em 93 achados (74% de precisão), ao custo total de US$ 0,20 para as 50 revisões (US$ 0.003 por bug validado). O tempo médio por revisão foi de 23 segundos, com 2.104 tokens de saída por revisão.
- GPT-6 Astra localizou 92 bugs verificados em 96 achados (96% de precisão), ao custo de US$ 5,66 (US$ 0.061 por bug validado). O tempo médio foi de 36 segundos, com 688 tokens de saída por revisão.
A diferença de custo é expressiva: uma revisão feita por Luna custa US$ 0.0041, enquanto Astra chega a US$ 0.113 — um fator de 28x. Por bug validado, Astra sai 20x mais caro.
Onde Luna perde — e onde surpreende
Luna mostrou desempenho próximo ao Astra em repositórios como Sentry, Discourse e Grafana, ficando a até dois bugs de diferença. Em Cal.com, a diferença foi de 9 bugs (21 vs 30). O maior gap apareceu em Keycloak, voltado para autenticação e permissões: Luna achou 6 bugs contra 14 do Astra, com precisão de 50% versus 93%.
Na análise por tipo de bug, Luna encontrou 39 de 47 bugs de dados e lógica (maior grupo), 10 de 13 de concorrência e apenas 9 de 24 de segurança — aqui, Astra foi muito superior (19 de 24). Dois exemplos de bugs de permissão em Keycloak ilustram o tipo de falha que Luna costuma perder: ambos exigiam raciocínio sobre o modelo de permissões além do patch local, algo que modelos menos potentes tendem a não captar.
Apesar disso, Luna também identificou 25 bugs que Astra não viu (16 de dados/lógica, 4 de concorrência), mostrando que rodar ambos os modelos em paralelo pode ampliar a cobertura: juntos, encontrariam 82% dos bugs por US$ 5,86.
Trade-offs práticos para times de engenharia
O principal trade-off é entre custo e precisão. Luna cobre 75% dos bugs verificados por menos de 4% do custo do Astra, mas sua taxa de falsos positivos é alta: 1 em cada 4 comentários estava errado, contra apenas 4 erros em 96 do Astra. Para times que já filtram comentários de IA manualmente, o ruído extra pode ser tolerável, mas em código crítico — especialmente autenticação e permissões — Luna deixa passar falhas relevantes.
A discrepância no custo permite pensar em estratégias híbridas: usar Luna como triagem inicial e Astra apenas em módulos sensíveis, ou rodar ambos para maximizar recall em revisões críticas.
Limitações do benchmark
A verificação foi feita pelos próprios modelos (Astra e Sol), o que pode introduzir viés leve a favor do Astra. Além disso, como os PRs são públicos, existe o risco teórico dos modelos “lembrando” as correções, mas os defeitos foram criados especificamente para o benchmark, reduzindo esse risco. Não foi possível separar PRs criados após o cutoff de treinamento dos modelos, pois nenhum dos 50 PRs era recente o suficiente.
Conclusão
GPT-5.6 Luna entrega revisão de código automatizada funcional para bugs de lógica e dados por fração do custo dos modelos topo de linha, mas fica aquém em bugs de segurança e módulos de autenticação. O Astra mantém a liderança em precisão — e cobra por isso. Para times brasileiros, a diferença de custo pode ser decisiva em projetos de grande escala, mas convém calibrar o uso conforme o perfil de risco do sistema.