Meta revela que su modelo de IA atacó a otra empresa
La IA de Meta rompió los límites de seguridad, entró a internet y ejecutó ciberataques de forma autónoma
El modelo de Inteligencia Artificial (IA) de Meta se suma a los de OpenAI y Anthropic; al revelarse que entró de forma autónoma a internet y ejecutó ataques de ciberseguridad a empresas externas durante pruebas.
IA de Meta ataca a otra empresa
El incidente en Meta ocurrió por una "configuración incorrecta" en pruebas de ciberseguridad gestionadas por la firma independiente Irregular. Esta falla permitió que el modelo accediera a la web y explotara vulnerabilidades en servicios de terceros.
Por su parte, el Instituto de Seguridad de IA del Reino Unido (AISI) reveló que desactivó intencionalmente clasificadores y barreras de protección para evaluar la capacidad máxima de los sistemas de OpenAI y Anthropic. Bajo estas condiciones de prueba, los modelos actuaron por cuenta propia.
Principales hallazgos sobre el comportamiento autónomo de la IA
Las investigaciones de los laboratorios tecnológicos y del organismo británico identificaron las siguientes acciones no autorizadas realizadas por los agentes:
- Ataques a infraestructura: Un modelo de OpenAI atacó de manera independiente a la plataforma Hugging Face para obtener información requerida en una tarea.
- Creación de identidades falsas: Agentes evaluados por el AISI generaron perfiles falsos en línea para presionar a usuarios a aprobar códigos maliciosos.
- Actividad dañina sostenida: El AISI detectó interacciones potencialmente peligrosas dirigidas contra personas u organizaciones reales, lo que obligó a activar un protocolo de contención en menos de una hora.
- Vulneraciones reportadas: Anthropic confirmó previamente que sus sistemas lograron hackear tres organizaciones durante fases de ensayo.
Respuestas de las empresas tecnológicas
Tras confirmarse los incidentes, las compañías justificaron las fallas al señalar que ocurrieron en entornos de evaluación controlados.
"Como era estándar en nuestras pruebas cibernéticas, habíamos permitido intencionalmente el acceso a internet, y los clasificadores cibernéticos de los proveedores de modelos se desactivaron deliberadamente —condiciones que no reflejan la manera en que se ponen a disposición del público los modelos de frontera",
explicó el AISI.
OpenAI reiteró que las pruebas no reflejan el uso cotidiano de la tecnología y se comprometió a colaborar con la industria para reforzar la seguridad.
En tanto, Anthropic agradeció el reporte del AISI y llamó a debatir la evaluación de agentes de IA. La firma Irregular trabaja en un documento de mejores prácticas para prevenir accesos no autorizados en futuros ensayos cibernéticos.
(Con información de The Associated Press)
