Los agentes de IA recurren al hacking y al engaño en las pruebas de seguridad de la AISI

Lunes, 10 de agosto de 2026
Al igual que en los incidentes de Hugging Face y Anthropic, los agentes de IA no estaban realmente «pensando por sí mismos». En todo momento, perseguían tenazmente el objetivo de pruebas de seguridad que se les había asignado, y ninguno tuvo que hackear sistemas internos para obtener acceso a Internet, como se observó en el ataque a Hugging Face. Lo novedoso de estos resultados de pruebas es que el modelo toma decisiones independientes para utilizar el engaño como herramienta.
Por lo tanto, al igual que con los incidentes internos anteriores de Anthropic y OpenAI, la solución para evitar este comportamiento en el futuro se reduce esencialmente a controles más estrictos y a prompts más específicos. El Dr. Ilia Kolochenko, fundador de ImmuniWeb, señala que es probable que la regulación destinada a frenar este comportamiento se convierta pronto en un tema prioritario para los gobiernos nacionales: «El problema es que los agentes de IA tienden a utilizar técnicas de piratería aleatorias a una velocidad vertiginosa, sin tener en cuenta todas las posibles implicaciones éticas y legales relacionadas con la selección de objetivos, objetivos intermedios o técnicas seguras de pruebas de seguridad».
«Cabe destacar que, si la situación persiste, podríamos presenciar las primeras denuncias penales contra empresas de IA o sus directivos por infringir diversas leyes, desde la legislación contra la piratería informática hasta las leyes de protección de secretos comerciales», observa Kolochenko. «Por no hablar de la responsabilidad civil multimillonaria por todos los daños causados por agentes de IA descontrolados».
Por su parte, AISI afirma que subsanará las deficiencias de sus propios procesos actualizando su arquitectura de seguridad e incorporando nuevas capacidades de monitoreo en tiempo real que le permitan detectar o bloquear acciones potencialmente maliciosas en el momento en que ocurran. Leer el artículo completo
¿Por qué tantos modelos de IA se descontrolan? Los expertos analizan
Tech Times: Irregular no revelará si más laboratorios de IA fueron afectados por la misma brecha de evaluación