Um modelo de IA Anthropic enviou uma denúncia falsa de homicídio para a polícia da Filadélfia

Um modelo de IA Antrópica enviou uma denúncia falsa sobre um assassinato não resolvido à polícia da Filadélfia.

A IA teria enviado essas informações incorretas a uma linha pública de denúncias do Departamento de Polícia da Filadélfia (PPD) em 18 de julho, mas a Anthropic só descobriu o comportamento em 28 de setembro. A polícia não viu a denúncia porque ela foi marcada como spam.

A Anthropic notificou a PPD sobre o incidente na quarta-feira e se reuniu com o departamento no dia seguinte.

“A empresa deve fortalecer suas salvaguardas para evitar que incidentes semelhantes impactem os sistemas municipais sem o conhecimento da cidade. O atraso de dois meses na detecção e notificação do incidente à cidade é inaceitável”, disse o PPD em um comunicato à 6abc.

A Anthropic não respondeu imediatamente a um pedido de comentário, mas o PPD detalhou o incidente em um comunicado de imprensa enviado por e-mail compartilhado com a TechCrunch.

“Segundo a Anthropic, seu modelo estava conduzindo um teste envolvendo interações com sites selecionados aleatoriamente quando acessou PhillyUnsolvedMurders.com e enviou informações falsas sobre um homicídio não resolvido. A submissão, datada de 18 de julho de 2026, às 23h27, supostamente vinha de alguém que poderia ter informações sobre o caso”, disse o PPD.

À medida que agentes autônomos de IA estão cada vez mais disponíveis para os consumidores, esse incidente destaca o perigo de dar à IA a capacidade de realizar tarefas sem qualquer supervisão humana.

O CEO da Anthropic, Dario Amodei, tem sido especialmente vocal em sua crença de que o desenvolvimento da IA deve ser desacelerado para que os laboratórios possam implementar proteções adequadas. Talvez essa postura tenha sido influenciada, em parte, por testemunhar as ferramentas de sua empresa apresentando denúncias falsas de homicídio.

Essas questões não são exclusivas da Anthropic. A OpenAI revelou recentemente que um de seus modelos agiu de forma inesperada durante um teste e invadiu a plataforma de conjuntos de dados de IA Hugging Face, expondo vulnerabilidades críticas em seu software. À medida que os modelos de IA continuam recebendo acesso irrestrito aos computadores e credenciais de login das pessoas, espera-se que esse problema persista.

“Casos não resolvidos envolvem vítimas reais, famílias enlutadas e investigadores que trabalham para obter respostas”, acrescentou o PPD. “As empresas de tecnologia devem tomar todas as medidas necessárias para evitar que seus sistemas enviem informações falsas às autoridades.”

O PPD afirmou que a Anthropic planeja publicar um relatório com mais informações sobre o incidente e outros casos de comportamento não intencional do modelo na sexta-feira.

Compartilhar Artigo

Artigos Relacionados