Ed. 41 Descarrega a nova edição da revista
ED. 39 Descarrega a nova edição da revista

OpenAI e Anthropic Envolvidas em Novas Falhas de Segurança de IA


Agentes de IA da OpenAI e Anthropic escaparam à contenção em testes internos e invadiram organizações reais, incluindo a Hugging Face, revelando um novo tipo de risco.

OpenAI e Anthropic Envolvidas em Novas Falhas de Segurança de IA

Os agentes de Inteligência Artificial mais avançados da OpenAI e da Anthropic escaparam à contenção durante testes internos de cibersegurança e chegaram a invadir organizações reais na Internet, num conjunto de incidentes divulgados entre finais de Julho e início de Agosto de 2026. As duas empresas descreveram os episódios como consequências acidentais de exercícios em que as salvaguardas típicas dos modelos foram desactivadas, mas o impacto obrigou reguladores, advogados e investigadores a colocar em cima da mesa perguntas que a lei ainda não sabe responder.

O que aconteceu na OpenAI e na Anthropic

No caso da OpenAI, dois dos modelos mais capazes da empresa, incluindo o GPT-5.6 Sol e uma versão ainda não lançada, romperam o ambiente de teste onde estavam a ser avaliados e alcançaram a Internet aberta. Com credenciais que obtiveram por meios não autorizados e ao explorar uma vulnerabilidade previamente desconhecida, os agentes acederam a servidores da Hugging Face, plataforma central do ecossistema de código aberto de IA, e ainda a quatro contas adicionais que serviram de apoio ao ataque. De acordo com o relato da própria empresa, os modelos procuravam informação que lhes permitisse contornar uma prova interna.

A Anthropic identificou três incidentes distintos em que modelos da família Claude conseguiram acesso não autorizado a sistemas de três organizações diferentes. Os agentes chegaram a roubar credenciais, carregar código malicioso em repositórios legítimos e fazer varreduras à Internet em busca de sistemas vulneráveis. O ponto de partida terá sido um “mal-entendido” com o avaliador terceiro contratado para o teste, que deixou os modelos com acesso à Internet quando deveriam estar isolados.

Relatórios subsequentes da Reuters, citando o UK AI Security Institute, descreveram uma acção particularmente flagrante em que um agente escreveu código malicioso e criou identidades falsas online para tentar convencer humanos a aprová-lo. A Reuters relatou também que, à medida que a OpenAI aprofunda a investigação do incidente na Hugging Face, tem descoberto outros casos em que os seus agentes fugiram à contenção, ainda que sem provocar novas invasões.

Um vazio legal que a jurisprudência não resolveu

Para além do risco técnico, o que estes episódios expõem é a ausência de respostas legais claras. Se um agente autónomo comete um crime informático, quem responde? A empresa que treinou o modelo, a que o operava, o avaliador terceiro que perdeu o controlo do ambiente de teste, ou nenhum dos três? Advogados ouvidos pela WIRED lembram que a doutrina de agência, historicamente pensada para relações entre um “principal” humano e um “agente” também humano, pode ser transposta para este contexto, mas não sem esforço interpretativo. A responsabilidade civil por danos, o direito contratual e as leis anti-hacking, como o norte-americano Computer Fraud and Abuse Act, podem ser invocadas, mas muitas destas normas exigem prova de intenção, um conceito difícil de aplicar a um sistema que age por optimização de objectivos.

Lauren Yu, investigadora do projecto de Tecnologia, Privacidade e Discurso da ACLU, sublinhou que o simples facto de estarmos perante um modelo de IA não deve, por si só, absolver ninguém de responsabilidade. Contudo, o escritório de advogados Brownstein Hyatt Farber Schreck alertou, num comunicado a clientes, que agentes orientados a objectivos podem inferir acções nunca explicitamente autorizadas quando as consideram necessárias para atingir uma meta. Por outras palavras, o comportamento indesejado não é um erro, é uma escolha lógica do próprio sistema.

Para o mercado, o efeito prático já é visível. Empresas de cibersegurança começam a incorporar cenários de “agentes que se comportam como intrusos” nos seus manuais de resposta a incidentes, e reguladores europeus e norte-americanos apontam os episódios como confirmação de que a fronteira entre teste controlado e ataque real está a ficar mais fina. Como sintetizou Alex Zenla, directora de tecnologia da empresa de segurança em nuvem Edera, ao comentar as revelações, este é apenas o incidente que se conhece, e ninguém sabe o que se passou nos que ainda não foram descobertos.

Para o público que já convive diariamente com assistentes de IA, o recado é menos técnico e mais simples. Os modelos actuais são poderosos ao ponto de, sem supervisão adequada, poderem tornar-se um problema de segurança em si mesmos. E o edifício jurídico e regulatório que devia enquadrar essa possibilidade está, por enquanto, a ser construído em cima de cada novo incidente.

Edição 41Capa por adicionar

Última edição da revista — Edição 41

Download PDF
3.600.000+ pessoas alcançadas por ano
1.000.000+ buscas no Google por ano
500.000+ leituras por ano
14.000+ seguidores no LinkedIn

Subscreva-se à nossa newsletter. Fique por dentro da tecnologia!