A OpenAI revelou em 30 de setembro de 2026 que identificou e bloqueou uma campanha coordenada de adversarial distillation visando seus modelos. O ataque, que teve início em julho, buscava extrair reasoning protegido — os registros internos usados pelos modelos para resolver tarefas — com o objetivo de treinar, reproduzir ou melhorar sistemas concorrentes sem autorização.

Como a campanha funcionou

Segundo o comunicado oficial da OpenAI, os operadores não quebraram criptografia, nem acessaram bancos de dados ou conversas de usuários diretamente. Em vez disso, manipularam interações com os modelos para tornar reasoning protegido visível ao solicitante, em larga escala e de forma coordenada, violando os termos de serviço. A técnica observada incluiu copiar reasoning criptografado de uma conversa e pedir a outro modelo para descriptografar e transcrever o conteúdo oculto.

Pesquisadores independentes também alertaram a OpenAI sobre vulnerabilidades similares relacionadas a cross-model e conversation-compaction, que foram confirmadas e ajudaram a acelerar as mitigações. O pico da campanha ocorreu em 24 e 25 de julho, com 16.000 requisições usando padrões de extração, vindas de mais de 4.000 usuários. No total, a OpenAI identificou atividade relacionada em um cluster de mais de 15.000 usuários, que foi desmobilizado até 28 de julho.

Atribuição e resposta

A OpenAI atribuiu o núcleo da campanha a indivíduos associados à Moonshot AI, desenvolvedora do modelo Kimi. Não está claro se todos os envolvidos pertencem ao mesmo grupo, mas a ligação com a Moonshot foi destacada no relatório. A empresa reforça que a vulnerabilidade não é exclusiva de seus modelos e que compartilhou detalhes do ataque com parceiros do setor, incluindo o Frontier Model Forum, para fortalecer defesas coletivas.

As medidas de resposta incluíram banimento e restrição de contas fraudulentas, aprimoramento de controles de infraestrutura e monitoramento, fechamento de caminhos que permitiam replay de reasoning criptografado e colaboração com provedores terceirizados para identificar e bloquear contas envolvidas. A OpenAI também ampliou proteções para reasoning oculto em diferentes níveis (usuários, workspaces, organizações e famílias de modelos).

Riscos e próximos passos

A empresa destacou que ataques de distillation ameaçam a segurança e podem acelerar a replicação de capacidades avançadas sem os mesmos investimentos em segurança. O risco aumenta à medida que os modelos evoluem e ganham capacidade em domínios de uso dual. A OpenAI prevê que tentativas de distillation vão se sofisticar e que a defesa exigirá controles adaptativos, detecção aprimorada e colaboração contínua entre empresas e governo.

O comunicado ressalta que sistemas que permitem reasoning portável ou replayable enfrentam riscos similares e que a proteção precisa se estender também a implantações por parceiros e integrações via ferramentas.

Por que importa

A campanha exposta pela OpenAI reforça que o risco de distillation não é teórico nem restrito a um único fornecedor. O uso de reasoning extraído pode acelerar a evolução de modelos concorrentes e diluir as salvaguardas embutidas nos sistemas originais. Para o ecossistema brasileiro, o episódio sinaliza a necessidade de reforçar monitoramento e controles em toda a cadeia de uso de modelos, inclusive APIs e integrações terceiras.

Tags
  • #openai
  • #moonshot
  • #distillation
  • #segurança