A OpenAI anunciou em 30 de setembro de 2026 que identificou e interrompeu uma campanha coordenada para extrair reasoning protegido de seus modelos, prática conhecida como adversarial distillation. A atividade começou na primeira semana de julho e atingiu picos de até 16 mil requisições em apenas dois dias, vindas de mais de 4 mil usuários. O núcleo da operação foi atribuído a indivíduos ligados à Moonshot AI, desenvolvedora do modelo Kimi, embora a OpenAI não tenha confirmado se todos os operadores pertenciam a um único grupo.
Como a extração ocorreu
Segundo a OpenAI, a campanha utilizou técnicas para manipular interações com os modelos e expor reasoning interno — registros intermediários do processo de resolução de tarefas, normalmente ocultos do usuário final. Entre os métodos, operadores copiaram reasoning criptografado de uma conversa e solicitaram a outros modelos que descriptografassem e transcrevessem esse conteúdo. Pesquisadores externos também reportaram vulnerabilidades relacionadas, que foram confirmadas pela equipe de segurança da empresa.
A OpenAI destacou que não houve violação de bases de dados, quebra de criptografia ou acesso direto a conversas armazenadas. O ataque explorou caminhos de prompt e fluxos de interação para contornar proteções e obter reasoning em escala, configurando violação dos termos de serviço da plataforma.
Impacto e resposta
A OpenAI relata que a atividade foi detectada inicialmente em baixo volume, mas escalou rapidamente nos dias 24 e 25 de julho. No total, um cluster de mais de 15 mil usuários esteve envolvido em padrões de extração. A empresa afirma ter interrompido completamente a campanha até 28 de julho, após reforçar controles técnicos, bloquear contas fraudulentas e compartilhar informações relevantes com parceiros do Frontier Model Forum e órgãos governamentais.
As contramedidas incluíram o endurecimento de verificações de cadastro, monitoramento de redes suspeitas e restrição de fluxos que permitiam replay de reasoning criptografado. Proteções também foram ampliadas para cobrir diferentes famílias de modelos, organizações e ambientes de deployment, incluindo parcerias com provedores de nuvem e serviços terceiros.
Por que importa
A adversarial distillation representa risco à segurança e à competitividade no setor de IA. Ao extrair reasoning protegido, terceiros podem treinar modelos concorrentes, potencialmente sem as salvaguardas implementadas pelo desenvolvedor original. Isso acelera a transferência de capacidades avançadas e pode enfraquecer controles de uso dual ou restrições de segurança. O caso evidencia que técnicas semelhantes podem afetar outros fornecedores de modelos avançados — não se trata de uma vulnerabilidade exclusiva da OpenAI.
A empresa ressalta que proteger reasoning intermediário exige defesas adaptativas e colaboração entre provedores. O episódio reforça a necessidade de controles multicamadas, fiscalização contínua e compartilhamento de informações sobre ameaças emergentes.
Próximos passos
A OpenAI continuará investindo em detecção de campanhas coordenadas, reforço de recusas do modelo e propagação de salvaguardas em todos os ambientes, inclusive de parceiros. A expectativa é que tentativas de distillation adversária se tornem mais sofisticadas com a evolução dos modelos frontier. O foco seguirá em três áreas: proteção técnica contra extração, detecção e enforcement, e compartilhamento de inteligência com o setor público e privado.