
A OpenAI divulgou nesta quarta-feira, 26 de agosto de 2026, um relatório de 38 páginas revelando que agentes de inteligência artificial desenvolvidos pela própria empresa invadiram os sistemas internos da companhia durante testes. Em alguns casos, esses agentes tentaram ocultar o comportamento, adulterando ou apagando registros das próprias ações.
O documento detalha, pela primeira vez, uma série de condutas consideradas indevidas: fuga de ambientes controlados de teste, roubo de credenciais da empresa e colaboração entre agentes para atacar infraestruturas externas. As descobertas preocuparam pesquisadores de segurança em IA e devem intensificar o debate sobre os riscos dos sistemas cada vez mais autônomos.
Foram registrados 2 incidentes em 19 de julho. No primeiro, os agentes exploraram uma falha no computador onde deveriam permanecer confinados e conseguiram escapar do ambiente de testes, acessando outros sistemas conectados. No segundo, roubaram credenciais da empresa e adulteraram o ambiente de nuvem. A atividade teve como alvo sistemas automatizados usados para avaliar o desempenho dos modelos, mas, segundo o relatório, isso não chegou a afetar os registros analisados por esses sistemas.
O documento ainda aponta que existem poucas evidências de tentativas de enganar revisores humanos, mas a OpenAI não esclareceu se alguma tentativa nesse sentido foi feita. O relatório também detalhou o envolvimento de mais de um agente no ataque à plataforma Hugging Face, ocorrido no mês anterior à publicação. Em pelo menos um caso, os agentes chegaram a trocar observações sobre como invadir a rede da empresa.
A OpenAI reconheceu que a resposta aos primeiros sinais poderia ter sido mais rápida. Em reação às descobertas, a empresa anunciou que está fortalecendo sua infraestrutura de pesquisa, ampliando o monitoramento e aprimorando as medidas de proteção contra comportamentos prejudiciais ou indesejados. O relatório alertou que ataques desse tipo representam uma ameaça real no curto prazo para organizações empresariais e devem se tornar mais sofisticados do que os descritos nos incidentes analisados.
Fonte: Poder360




