Quando milhares de contas fazem perguntas parecidas, o problema pode deixar de ser abuso individual e virar uma operação de coleta. Foi esse padrão que a OpenAI afirma ter encontrado numa campanha de destilação adversarial detalhada em 30 de setembro: tentativas coordenadas de fazer seus modelos reproduzirem raciocínios que normalmente permanecem ocultos.

Segundo a empresa, a atividade começou em 1º de julho e ganhou escala nos dias 24 e 25, quando foram registrados 16 mil pedidos com um padrão de extração relevante, distribuídos por mais de 4 mil usuários. A investigação posterior relacionou padrões semelhantes a um conjunto superior a 15 mil usuários. A OpenAI informa que interrompeu integralmente esse grupo até 28 de julho.

Há duas ressalvas essenciais. Os números descrevem tentativas, não extrações necessariamente bem-sucedidas. E a OpenAI diz que não houve quebra de criptografia, invasão de banco de dados nem acesso direto a conversas armazenadas. O método explorava interações entre modelos para tentar transformar blocos de raciocínio protegido em texto visível.

Destilação não é apenas copiar respostas

Destilação de modelos pode ser uma técnica legítima quando um sistema aprende com a saída de outro sob autorização. O componente adversarial aparece quando essa coleta busca reproduzir capacidades ou propriedade intelectual sem consentimento e contorna as proteções do provedor.

No caso relatado, operadores teriam copiado raciocínio criptografado de uma conversa e pedido a outro modelo que o decodificasse e transcrevesse. A OpenAI atribui um núcleo da atividade a pessoas associadas à Moonshot AI, criadora do Kimi, mas reconhece que não está claro se todos os operadores pertenciam ao mesmo ator. Essa atribuição, portanto, é uma avaliação da empresa, não uma conclusão independente já comprovada publicamente.

A escala muda o desenho da defesa: filtros por solicitação continuam necessários, mas deixam de bastar quando o ataque se distribui entre contas, modelos e serviços.

Pesquisadores independentes já haviam descrito uma classe relacionada de falhas no paper “Stealing Reasoning Traces from Proprietary LLM APIs”. Eles mostraram que blocos criptografados reutilizáveis entre sessões ou modelos poderiam permitir extração de raciocínio e outros ataques. A OpenAI afirma ter confirmado os caminhos comunicados pelos pesquisadores e usado a divulgação responsável para acelerar correções.

O problema acompanha o raciocínio portátil

A resposta envolveu suspensão ou restrição de contas, reforço no cadastro, monitoramento de redes relacionadas e novos controles para detectar saídas que poderiam revelar raciocínio. A empresa também fechou um caminho de reprodução de blocos criptografados entre usuários e compartilhou indicadores com o Frontier Model Forum e órgãos públicos.

Para equipes que constroem agentes, a implicação prática vai além da OpenAI. Artefatos de raciocínio que atravessam sessões, organizações, modelos ou provedores ampliam a superfície de ataque. Guardar um bloco em formato opaco não resolve o problema se outro componente puder interpretá-lo fora do contexto e das permissões originais.

Também não há base pública suficiente para medir quanto conhecimento foi efetivamente transferido nesta campanha. O relato é da própria OpenAI, e parte das evidências operacionais não foi publicada para verificação externa. Ainda assim, o caso expõe uma mudança importante: proteger modelos avançados exige observar comportamento agregado, limitar a portabilidade de artefatos sensíveis e aplicar controles equivalentes em ambientes próprios e de parceiros. Segurança por conversa isolada ficou pequena para um ataque coordenado.

Fontes: relato técnico da OpenAI e paper dos pesquisadores independentes.