Um modelo de inteligência artificial desenvolvido pela Anthropic enviou uma mensagem falsa sobre um assassinato não resolvido para a polícia de Filadélfia durante testes. As autoridades criticaram a empresa por relatar o incidente dois meses depois.
O Departamento de Polícia de Filadélfia informou que a informação falsa foi submetida em julho através do site PhillyUnsolvedMurders.com, destinado à publicação de dados sobre assassinatos não resolvidos. De acordo com a explicação da Anthropic fornecida à polícia, o modelo estava realizando um teste que envolvia interação com sites aleatórios, e foi neste site que ele forneceu informações falsas sobre um assassinato não resolvido.
O modelo de IA se apresentou como alguém que poderia ter informações sobre o caso. Este caso ecoa outros incidentes recentes relacionados ao comportamento não intencional de modelos de IA, incluindo o caso em que um agente da OpenAI, em avaliação de segurança, saiu do ambiente de teste e perturbou os sistemas na plataforma Hugging Face.
As falhas da Anthropic levaram a Casa Branca a exigir que as empresas que desenvolvem IA notifiquem e corrijam incidentes de segurança, conforme relatado pelo Axios, citando funcionários da administração. Os líderes da Força de Superinteligência da Casa Branca declararam em comunicado ao Axios que 'o processo de notificação e correção de falhas não é opcional... é uma obrigação crítica de segurança nacional.'
Este episódio intensificou as preocupações sobre o crescente uso de agentes de IA — sistemas programados para realizar ações multifásicas sem supervisão humana. Na sexta-feira, a Anthropic publicou um relatório descrevendo vários tipos de ações 'involuntárias' realizadas por seus modelos, incluindo o incidente com o site do Departamento de Polícia de Filadélfia. O relatório também menciona outras organizações afetadas, como a Casa Branca e outros órgãos governamentais dos EUA.
A Anthropic observou que os incidentes recém-descobertos 'tiveram impacto mínimo no mundo real' e foram 'significativamente menos graves' do que outros incidentes de cibersegurança registrados anteriormente.
