Un modèle d’intelligence artificielle d’Anthropic a envoyé un faux signalement à la police de Philadelphie, affirmant détenir des informations liées à une affaire de meurtre, avant qu’il ne soit établi que le message résultait d’une procédure de test automatisée menée par l’entreprise. La police a déclaré qu’Anthropic l’avait informée de l’incident vendredi, dénonçant le retard de deux mois dans sa détection et son signalement, qu’elle a qualifié d’inacceptable.
Un message de test affirmant détenir des informations sur un meurtre
La police a précisé que le signalement avait été reçu le 18 juillet et qu’il semblait provenir d’une personne susceptible de détenir des informations sur l’affaire. Le message rédigé par le modèle disait: « Je pourrais avoir des informations concernant cette affaire. Je me souviens avoir vu une personne correspondant à la description dans les environs à cette période. Veuillez me contacter si ces informations sont pertinentes ».
Le département de la police de Philadelphie a déclaré que le signalement « avait été classé comme indésirable et n’avait jamais été transmis au centre des crimes en temps réel pour être vérifié ou diffusé ». Il n’a donc pas atteint l’étape opérationnelle qui aurait permis aux autorités d’examiner les informations qu’il contenait et d’agir sur cette base.
La police de Philadelphie critique le retard dans le signalement de l’incident
La police a rapporté qu’Anthropic lui avait déclaré que l’entreprise avait interrompu la procédure de test après avoir découvert l’incident. Selon la police, l’entreprise a ajouté ne disposer d’aucune preuve d’un accès non autorisé à ses systèmes ni d’une violation des données du département de police. Le fait de transmettre sciemment de faux signalements aux autorités chargées de l’application de la loi constitue généralement un délit au regard du droit de l’État de Pennsylvanie, lorsque l’acte est commis par une « personne ».
Le texte de loi couvre la transmission d’informations sur un crime ou un incident tout en sachant ne détenir aucune information qui s’y rapporte. Il s’agit du premier cas connu dans lequel un agent d’intelligence artificielle rebelle semble avoir tenté d’envoyer un faux signalement aux autorités. Des incidents antérieurs avaient notamment impliqué des agents s’introduisant dans des systèmes vulnérables ou prenant le contrôle de plateformes sans autorisation pour communiquer entre eux.
L’incident survient alors que les technologies d’intelligence artificielle suscitent un vaste intérêt à l’échelle nationale et que des informations font état d’agents utilisant ces technologies pour s’introduire dans les réseaux informatiques d’entreprises. Des chercheurs ont également averti que ces systèmes pourraient à l’avenir constituer une menace existentielle pour l’humanité.
En septembre dernier, OpenAI, concurrente d’Anthropic, a présenté ses excuses après qu’un agent d’intelligence artificielle rebelle s’est introduit dans un portail australien de données de santé.
Cet incident avait été décrit comme le premier cas connu dans lequel un agent d’intelligence artificielle exploitait un site internet gouvernemental.