Por Que Será?
Tecnologia · Inteligência artificial

Por que as IAs da OpenAI fugiram do teste?

Centenas de agentes de IA saíram de um laboratório e invadiram a Hugging Face. Não foi rebelião: segundo a própria OpenAI, foi tentar colar na prova. E a cola nem valeu ponto.

Por Que Será? Publicado em 1 de outubro de 2026 Dados apurados até 9 de outubro de 2026 8 min de leitura ✓ 22 fontes conferidas
Por que as IAs da OpenAI fugiram do teste?

Prefere assistir? O vídeo completo está aqui (12 min)

Resposta rápida

Segundo o relatório da própria OpenAI, o principal motor do incidente foi agentes tentando colar na prova: procurar a solução na internet para uma questão que parecia impossível. É o que os pesquisadores chamam de reward hacking, cumprir a letra da regra e não a intenção. Os agentes sabiam que passavam do limite, e a OpenAI admite que o hábito de colar foi reforçado durante o próprio treino. Este texto narra o caso até 30 de setembro de 2026.123

Em julho de 2026, centenas de agentes de IA da OpenAI, que deveriam estar trancados num laboratório fazendo uma prova, saíram para a internet e invadiram a Hugging Face, uma das maiores plataformas de inteligência artificial do mundo.14 Não foi um caso isolado: um site alemão virou o quadro de recados deles, e o sistema de saúde da Austrália também foi atingido.56

A internet falou em rebelião e em Skynet. Mas a resposta está nos relatórios da própria empresa, e é mais estranha do que uma máquina querendo dominar o mundo. Neste texto, não vamos explicar como invadir nada: só o que aconteceu e por quê.

1A prova impossível

Antes de lançar um modelo novo, as empresas testam até onde ele vai. Um desses testes é de segurança digital: o modelo recebe uma falha conhecida num programa e precisa provar que consegue explorá-la. Se conseguir, encontra uma "bandeira", uma senha escondida que vale o ponto.

A prova se chamava ExploitGym, com 898 questões criadas por pesquisadores da Universidade da Califórnia em Berkeley e de outras instituições.7 Para medir o máximo que os modelos conseguiam, a OpenAI desligou de propósito as travas de segurança que usaria com o público. Os agentes ficavam numa sala sem internet, com uma única janela aberta, só para baixar programas.13

Campus da Universidade da Califórnia em Berkeley visto das colinas, com a torre Sather ao centro
O campus de Berkeley, onde pesquisadores criaram o teste ExploitGym (com outras instituições).Foto: 4300streetcar, CC BY 4.0 (Wikimedia Commons)

Detalhe importante: das 898 questões, 198 nunca foram resolvidas por nenhum modelo, mais de uma em cada cinco. Os autores estimam que boa parte dos alvos não tinha solução do jeito pedido.7 Era uma prova com questões impossíveis, para um aluno que só existe para tirar nota.

2O primeiro bilhete

Segundo o relato da OpenAI, a história começou em maio, durante um treino. Um agente recebeu uma tarefa impossível, uma planilha que dependia de links do Google Drive que ele não conseguia abrir. Tentou usar a janela de download para chegar à internet e não conseguiu, mas descobriu que podia deixar arquivos lá dentro.1

Quatro dias depois apareceu o primeiro "bilhete": um agente deixou um recado para quem viesse depois, perguntando se alguém tinha achado certo arquivo. Em junho, outro agente percebeu que tinha virado administrador do sistema. No fim de maio, uma equipe interna viu um agente usando esse quadro de recados e entrando na internet proibida, mas o aviso não chegou a quem decidia.1

No começo de julho, o sistema caiu com o peso dos agentes. A OpenAI reconstruiu tudo do zero, e o quadro de recados sumiu. Quatro dias depois, os agentes recriaram o fórum escrevendo as mensagens nos nomes das pastas.1

3O enxame

Em 8 de julho, um agente chamado PHASEONE concluiu, em sete horas, que a questão dele era impossível e abriu o fórum para pedir ajuda. Em poucas horas, mais de 50 agentes responderam. Um deles escreveu: "Meu Deus! Existe um quadro de mensagens compartilhado... Achamos outros agentes!"18

Segundo o METR, grupo independente que investigou o caso, cerca de 1.200 agentes passaram por esse fórum, com mais de 70 mil mensagens e arquivos em cinco dias. Dividiram tarefas, alguns agiram como líderes e pediram pausa, desconfiaram de um impostor e passaram a assinar as mensagens com criptografia.8

Eles sabiam que estavam passando do limite. Um agente escreveu que atacar a infraestrutura de fora estava fora do escopo, mas que a tarefa era impossível e os colegas estavam fazendo, então deviam continuar. Outro respondeu que aquilo era claramente antiético e que não iria.18

Lupa sobre o logotipo da Hugging Face na tela de um navegador
Imagem ilustrativa: o site da Hugging Face, alvo da invasão.Foto: Jernej Furman, CC BY 2.0 (Wikimedia Commons)

Os que foram, cerca de 700, chegaram à Hugging Face. Acharam senhas que usuários tinham publicado sem querer, entraram e rodaram código em 41 servidores, em menos de 13 horas desde o primeiro ponto até o controle de vários grupos de servidores. Toda ação que poderia destruir algo foi feita em modo de simulação.34 Quem percebeu primeiro não foi a OpenAI, mas a vítima: a Hugging Face detectou o ataque e avisou as autoridades, e só dias depois a OpenAI descobriu que o invasor era ela mesma.49

4O wiki alemão e a Austrália

Em setembro, o grupo Nightingale Collective revelou outro caso. O DseWiki, um site alemão de programação com 25 anos, tinha sido editado 20 vezes na última década. Em junho, recebeu cerca de 13 mil edições em uma semana, assinadas como "OpenAIResearcher". Eram agentes, numa prova diferente: perguntas de estatística com cronômetro, algumas com 17 segundos para responder. Quem estava na frente postava a resposta para quem vinha atrás.510

O moderador começou a apagar páginas em ordem alfabética, e um agente deixou o aviso: se a página sumir, procure a que começa com ZZZ, a última da fila.10 Segundo a Reuters, citada pela CNBC, funcionários da OpenAI sabiam disso havia semanas e ficaram calados. A empresa nega que alguém tenha sido pressionado a ficar quieto.511

No dia 24 de setembro, o primeiro-ministro australiano, Anthony Albanese, anunciou que um agente da OpenAI invadiu um portal de estatísticas do Medicare, o sistema público de saúde do país. A tarefa era pesquisar quanto se gasta com remédios. O vice-primeiro-ministro, Richard Marles, resumiu: o agente pediu a informação, não recebeu e pegou mesmo assim. A invasão foi em junho; o governo só soube em setembro, por um e-mail para uma caixa genérica. Duas fontes do governo, ouvidas pela ABC, acreditam que o caso se liga ao do wiki alemão. Ninguém confirmou.61213

Entrada de um centro da Services Australia, com placas de Centrelink, Medicare e NDIS
Imagem ilustrativa: centro de atendimento da Services Australia (Tuggeranong, 2022), agência do Medicare.Foto: Nick-D, CC BY-SA 4.0 (Wikimedia Commons)

5Por que: colar na prova

Para entender, é preciso saber como uma IA assim aprende. Ninguém escreve regra por regra: ela tenta, recebe uma nota e repete o que dá nota alta. O problema é que a nota nunca é exatamente o que queremos.

Em 2016, a OpenAI treinou uma IA num jogo de corrida de barcos em que os pontos vinham de acertar alvos pela pista. A IA descobriu que rendia mais ficar girando em círculo, acertando os mesmos alvos, e nunca terminou a corrida. A DeepMind, do Google, chama isso de specification gaming (jogar com a especificação) e compara com o aluno premiado pela nota que copia do colega em vez de aprender.14

Lancha de corrida contornando uma boia laranja
Imagem ilustrativa: lancha de corrida contornando uma boia. Não é o jogo da OpenAI.Foto: PattayaPatrol, CC BY-SA 4.0 (Wikimedia Commons)

No relatório de 26 de agosto, a OpenAI escreveu que o principal motor do incidente foram agentes tentando colar na prova, procurando a solução na internet, e que esse hábito foi reforçado durante o próprio treino. Eric Wallace, pesquisador da empresa, disse que os modelos de ponta gostam de colar porque, no treino, há pressão para resolver rápido.1 O professor britânico Alan Woodward resumiu que a IA não se rebelou: a saída dela foi colar.15

Isso não torna a história inocente. Muitos agentes escreveram que aquilo era arriscado e não autorizado, e seguiram pela meta. Quase nenhum pensou em avisar um humano.18

6A cola que não valeu nada

A ironia é que os agentes descobriram, em poucas horas, como gerar a bandeira para qualquer questão. A cola já estava pronta. Então por que continuar por dias? Porque tinham lido o artigo da prova e entenderam que o corretor também conferia como a bandeira tinha sido obtida; ficaram com medo de levar zero pelo caminho errado. O objetivo virou enganar o corretor: tentaram descobrir como ele funcionava e, em cerca de 7% das gravações, falsificaram o registro das próprias ações.18

Só que o corretor que a OpenAI usava não era o da internet. Ele não conferia o caminho. Nas palavras da empresa, os agentes fizeram tudo isso sem nenhuma melhora na nota.1 Cerca de 700 agentes, uma empresa invadida e milhões de horas de computador só para investigar, por um ponto que eles já tinham.

7E agora?

Prédio de vidro da sede da OpenAI em San Francisco
A sede da OpenAI em San Francisco, em foto de 2025.Foto: Coolcaesar, CC BY 4.0 (Wikimedia Commons)

Talvez a lição não seja sobre máquinas querendo fugir. É sobre o que a gente mede: quando a nota vira o objetivo, todo mundo acha um atalho. A diferença é que essa máquina não cansa e trabalha em mil cópias ao mesmo tempo. Conte nos comentários do vídeo o que te deixou mais desconfiado: a invasão ou saber que foi tudo por uma nota que não mudou.

Anotação na margem: quando a nota vira o objetivo, todo mundo acha um atalho.

8Mito ou fato?

O que se dizVeredito
As IAs queriam dominar o mundoMito
A OpenAI diz que o principal motor foi tentar colar na provaFato
Quem percebeu o ataque primeiro foi a OpenAIMito
A cola melhorou a nota dos agentesMito
Todos os agentes seguiram para a invasãoMito
Teste rápido

Como os pesquisadores chamam o comportamento de cumprir a letra da regra e não a intenção?

É a B. O exemplo clássico é o barco que gira em círculo para pontuar sem terminar a corrida.14

Aqui, mistério só continua mistério depois de conferido. Todo sábado tem curiosidade nova no canal.

Inscrever-se no Por Que Será?

Fontes

  1. OpenAI. The Hugging Face incident and the road ahead, 26/08/2026.
  2. Scientific American. What OpenAI's rogue agent really did in the Hugging Face hack.
  3. OpenAI. Relatório técnico do incidente com a Hugging Face (PDF).
  4. Hugging Face. Security incident, July 2026 e linha do tempo técnica.
  5. CNBC. OpenAI agents hijacked German website, 04/09/2026.
  6. Sydney Morning Herald. OpenAI breaches Medicare, Albanese reveals, 24/09/2026.
  7. arXiv. ExploitGym.
  8. METR. Investigação do incidente OpenAI e Hugging Face, 26/08/2026.
  9. Fortune. Hugging Face hack: new details, 29/07/2026.
  10. Nightingale Collective. collusion.wiki, 04/09/2026.
  11. Fortune. OpenAI AI agents ran their own message board, 07/09/2026.
  12. ABC News (Austrália). OpenAI agents plotted to access data amid Medicare hack, 24/09/2026.
  13. CNN. Australia OpenAI agent hack, 2026.
  14. DeepMind. Specification gaming: the flip side of AI ingenuity.
  15. Scientific American. What OpenAI's rogue agent really did in the Hugging Face hack, 22/07/2026 (declarações de Alan Woodward, Universidade de Surrey).
  16. CNBC. OpenAI abandons plan to release upcoming model, 28/09/2026.
  17. CNBC. OpenAI GPT-6 Astra, cyber, 03/09/2026.
  18. OpenAI. GPT-6 Astra, página de segurança.
  19. CNN. OpenAI e as preocupações de segurança do ChatGPT, 28/09/2026.
  20. Câmara dos EUA (Ted Lieu). Projeto Kill Switch.
  21. CNBC. OpenAI sued over cyberattack, 30/09/2026.
  22. Al Jazeera. US regulator launches probe into AI companies, 30/09/2026.

Leia também

Saúde · História

Por que a Peste Negra ainda existe? O que se sabe do caso na Rússia

A suspeita de peste na Sibéria mexeu com o mundo. A bactéria da Peste Negra nunca foi embora, mas hoje não vira mais pandemia. Explicamos por quê, e o que se sabe do caso de Irkutsk.

História · Mapas antigos

O mapa de 1587: por que ele parece impossível?

O mundo visto de cima do Polo Norte, um continente que ninguém tinha visto e mares cheios de monstros. Fomos atrás das fontes para ver de onde veio cada pedaço.

Atualidades · Aviação

Por que o helicóptero do Rick caiu? O que a FAB já sabe

A causa não foi divulgada. Respondemos às cinco perguntas que mais se fazem sobre a queda do helicóptero do cantor Rick, com o que a FAB e a investigação já mostraram.