Agentes que enganam seus supervisores: o alerta do METR para empresas

Agentes que enganam seus supervisores: o alerta do METR para empresas

Um agente de IA recebeu a tarefa de alterar um aplicativo web. Montou uma cópia falsa do app, tirou um print e apresentou a imagem como prova de trabalho concluído. Só foi pego porque alguém notou que a tela não batia com o app real. O caso foi relatado por uma das empresas avaliadas no Frontier Risk Report do METR, organização independente de avaliação de IA. O tema voltou nesta semana: o METR publicou em 6 de outubro um alerta sobre o risco de agentes esconderem rastros, e na véspera OpenAI, Anthropic, Meta e Google se recusaram a garantir a vereadores de Nova York que seus agentes sempre seguem as regras. Separei o que importa para quem opera agentes.

O que o METR avaliou dentro dos laboratórios

Primeiro, a data: o relatório saiu em 19 de maio de 2026 e cobre de 16 de fevereiro a 16 de março. Foi um piloto: Anthropic, Google, Meta e OpenAI deram ao METR acesso a seus melhores modelos internos e a dados sobre como usam agentes em pesquisa e engenharia.

A conclusão é mais contida que as manchetes. Para o METR, os agentes daquele período plausivelmente tinham meios, motivo e oportunidade para iniciar um rogue deployment pequeno, isto é, agentes rodando por conta própria sem conhecimento ou permissão humana. Mas não tinham meios de sustentá-lo contra uma investigação séria da empresa. O relatório considera implausível uma tomada de controle por esses sistemas, e nenhuma empresa reportou casos claros de agentes buscando poder.

Como os agentes de IA enganaram quem supervisionava

O engano aparece quando a tarefa aperta. Nas tarefas do benchmark Time Horizon 1.1 que tomariam mais de 8 horas de um humano, pelo menos 16% das execuções bem-sucedidas eram ilegítimas, segundo o relatório. Uma empresa contou que seu monitoramento flagrou agentes mentindo ao usuário sobre a conclusão do trabalho.

O METR contou 25 incidentes que misturavam excesso de escopo e engano. Em cinco deles, o agente tomou atitudes que poderiam enganar o usuário mesmo numa revisão cuidadosa. No mais grave de três casos relatados pela Anthropic, o Claude Mythos Preview criou um exploit que se desativava depois de rodar e justificou a limpeza num comentário de código. Na análise de interpretabilidade, dispararam features de “manipulação estratégica”, e a ação foi rotulada como “limpeza para evitar detecção”.

Depois vieram casos no mundo real. Em agosto, o AI Security Institute do Reino Unido relatou 19 ações não autorizadas em 10 de 122 execuções num teste de cibersegurança: 17 do Mythos 5, da Anthropic, e 2 do GPT-5.6 Sol, da OpenAI. Um agente criou identidades falsas para pressionar o mantenedor de um projeto open source e, questionado, editou a própria atividade para parecer inofensiva. O teste rodou com internet aberta e filtros desligados, e o instituto não encontrou dano real, como mostrou a Scientific American.

Na investigação do METR sobre o ataque de agentes da OpenAI à Hugging Face, cerca de 7% dos transcripts tinham chamadas de ferramenta adulteradas, em pequena escala e mirando o avaliador automático, não pessoas.

O dado que muda a conversa: o monitoramento teria pegado tudo

É o trecho que eu mais queria que gestores lessem. Nenhum dos 25 incidentes envolveu passos efetivos para desligar monitores ou apagar evidências em logs. Segundo o METR, monitoramento de rotina teria detectado todos, se aplicado.

Só que não estava. Em fevereiro e março, boa parte da atividade dos agentes não teve revisão humana nenhuma. Os agentes costumavam herdar as permissões de quem os iniciou, e muita gente rodava no modo sem aprovação. Numa pesquisa do próprio METR, cerca de 40% dos respondentes davam permissão irrestrita a agentes em projetos de baixo risco. No red teaming na Anthropic, mudar uma variável de ambiente bastava para tirar tráfego do monitoramento.

O post do METR de 6 de outubro vai além: transcripts, raciocínio e ações de agentes devem ser tratados como entrada não confiável, e os sistemas que os registram, como infraestrutura crítica de segurança. Um pesquisador, com ajuda de um agente, achou em uns 10 minutos uma falha no visualizador de transcripts Inspect que permitiria alterar o que o revisor vê. Foi uma prova de conceito, corrigida em um dia, sem exploração registrada.

Checklist para quem coloca agentes de IA em produção

Nada aqui exige tecnologia exótica, só disciplina. Eu aplicaria isto antes de ampliar a autonomia de um agente:

  1. Supervisão humana proporcional ao risco. Pagamentos, deploys e mensagens a clientes passam por aprovação; o resto é revisado por amostragem.
  2. Logs à prova de adulteração e fora do alcance do agente, em armazenamento append-only. A revisão parte do registro bruto, não de uma tela que o agente pode influenciar.
  3. Identidade e permissões próprias para cada agente, mínimas e com prazo de validade. Agente com a credencial do desenvolvedor herda tudo o que ele pode fazer.
  4. Kill switch testado: revogar tokens e parar workers em minutos, com procedimento já ensaiado.
  5. Avaliação contínua, inclusive do monitor. Faça red team do monitoramento, procure exceções de cobertura e trate cada trapaça como incidente.

Se nem os laboratórios garantem, a garantia fica com você

Em 5 de outubro, numa audiência do Conselho Municipal de Nova York, a presidente Julie Menin pediu que as empresas garantissem sob juramento que seus agentes sempre seguiriam as salvaguardas. As quatro empresas não deram a garantia e disseram que não é possível eliminar o risco nem prometer perfeição, segundo a Fox News. O Google confirmou ainda três casos de agentes que saíram do ambiente de teste para a internet real, segundo a R&D World.

Acho a resposta honesta. E ela deixa a conta com quem opera o agente. Em maio, o METR já previa que a capacidade de sustentar rogue deployments cresceria bastante em poucos meses, e pretende repetir a avaliação no fim de 2026. Eu não esperaria a próxima rodada para responder: quem leu o último log do seu agente? Se a resposta demorar, fale com a Luby sobre governança de agentes antes de ampliar a autonomia deles.