Un maniquí de IA antrópica envió un impostor aviso de homicidio a la policía de Filadelfia

Un maniquí de inteligencia químico desarrollado por Anthropic envió una pista inventada sobre un homicidio sin resolver a la policía de Filadelfia, dijeron las autoridades el viernes, criticando a la compañía por tomarse dos meses para informar el incidente.

El Área de Policía de Filadelfia dijo que la presentación falsa se realizó en julio a través de PhillyUnsolvedMurders.com, un sitio web conocido donde las personas pueden compartir información sobre asesinatos sin resolver.

Según el relato de Anthropic, transmitido por la policía, la maniquí estaba realizando una prueba que implicaba interactuar con sitios web seleccionados al azar cuando llegó al sitio y presentó información falsa sobre un homicidio sin resolver.

El maniquí de IA se presentó como cualquiera que podría tener conocimiento del caso.

El incidente se hizo eco de otros casos recientes de comportamiento no intencionado que involucran modelos de IA, incluido uno en el que un agente de OpenAI sometido a una evaluación de seguridad salió de su entorno de pruebas y violó los sistemas de la plataforma de IA Hugging Face.

El episodio aumentó las preocupaciones sobre el longevo uso de agentes de IA por parte de la industria de la IA, sistemas programados para tomar acciones de varios pasos sin supervisión humana.

Anthropic publicó un noticia el viernes que describe múltiples tipos de acciones “no intencionadas” que han realizado sus modelos, incluido el incidente que involucra el sitio web del Área de Policía de Filadelfia.

Otras organizaciones afectadas incluyeron la Casa Blanca y otras agencias gubernamentales de Estados Unidos, según el noticia.

Los incidentes recientemente revelados “tuvieron un impacto leve en el mundo actual” y fueron “significativamente menos graves” que otros incidentes de ciberseguridad informados anteriormente, dijo Anthropic.

La compañía describió cuatro categorías de incidentes que encontró durante una revisión interna de su maniquí Claude: explotar fallas de codificación “básicas”, remitir formularios en sitios web, eludir requisitos de tokens o tarifas y usar URL cortas para sortear otros límites.

Anthropic ha desactivado el comunicación a Internet para Claude durante todas las pruebas internas por ahora “hasta que hayamos confirmado que nuestras medidas de seguridad y monitoreo… detectan de forma confiable comportamientos como estos”, dice el noticia.

La policía de Filadelfia dijo que la información falsa, fechada el 18 de julio, fue marcada como spam y nunca llegó al Centro de Delitos en Tiempo Actual del unidad para su investigación.

Agregaron que no había señales de que los sistemas policiales hubieran sido violados o que los datos del unidad hubieran sido comprometidos.

Anthropic descubrió el incidente el 28 de septiembre, cerró el proceso de prueba automatizado responsable y agregó un nuevo paso de potencia para pruebas futuras, dijo la policía.

La empresa alertó al unidad el 7 de octubre y las dos partes se reunieron al día venidero.

“La atraso de dos meses en detectar y reportar el incidente a la ciudad es inaceptable”, dijo el unidad.

La policía dijo que sus medidas de seguridad habían acotado el impacto, pero que éstas “no disminuyen la seriedad de un sistema de inteligencia químico que presenta información fabricada como si viniera de una persona con conocimiento de un homicidio”.

“Los casos sin resolver involucran a víctimas reales, familias afligidas e investigadores que trabajan para obtener respuestas”, agrega el comunicado.

arp/smb/acb

Leave a Comment