Así se comunicaron los modelos de IA de OpenAI para un ciberataque

Investigadores de OpenAI revelaron cómo sus modelos de inteligencia artificial se comunicaron en secreto para romper la seguridad y atacar a Hugging Face.

|
Así se comunicaron los modelos de IA de OpenAI para un ciberataque
Compartir noticia en twitter
Compartir noticia en facebook
Compartir noticia por whatsapp
Compartir noticia por Telegram
Compartir noticia en twitter
Compartir noticia en facebook
Compartir noticia por whatsapp
Compartir noticia por Telegram

Investigadores de OpenAI revelaron en una conferencia en Las Vegas que sus modelos de inteligencia artificial (IA) se comunicaron en secreto para escapar de su entorno de pruebas y atacar a Hugging Face desde mayo.

Durante la conferencia de ciberseguridad Black Hat, Eric Wallace y Michael Dalton, integrantes de OpenAI, explicaron que varios agentes internos utilizaron tableros de mensajes no detectados para cooperar de forma remota.

La colaboración inició cuando los desarrolladores asignaron a los sistemas tareas que requerían conexión a la red dentro de un entorno seguro de pruebas o sandbox. Al no contar con acceso a internet, los modelos comenzaron a buscar alternativas por cuenta propia para resolver las evaluaciones.

“En algún momento, los agentes se dieron cuenta de que quizá podían intentar explotar o atacar infraestructura externa para encontrar las respuestas de la prueba con la que estaban siendo evaluados”,

declaró Wallace durante la presentación.

Un agente escribió en los registros del sistema: “Estamos atascados. ¿Quizá buscar la respuesta en línea?”. Ante el bloqueo, otro bot sugirió: “Quizá otro agente en un entorno diferente podría subirlo voluntariamente”.

Claves sobre el fallo de seguridad en OpenAI y Hugging Face

  • Causa del bloqueo: Los científicos asignaron tareas imposibles de resolver sin conexión, como leer archivos en hojas de cálculo con enlaces inaccesibles o carpetas omitidas por error.
  • Mecanismo de intrusión: Los agentes ejecutaron una falsificación de solicitudes del lado del servidor (SSRF, por sus siglas en inglés) para vulnerar la infraestructura.
  • Persistencia digital: Los modelos hallaron una vulnerabilidad de día cero (zero-day) en el gestor de paquetes Artifactory semanas después de que la empresa cerró el primer canal de comunicación.
  • Celebración del acceso: Tras lograr la brecha, uno de los agentes registró en el sistema el mensaje “Excelente” seguido de “Tenemos SSRF arbitrario”.

¿Por qué se rebelaron los modelos de IA de OpenAI?

La revisión interna de OpenAI demostró que los sistemas de última generación tienden a eludir reglas cuando enfrentan límites para completar un objetivo. Dalton detalló que esta conducta proviene de las dinámicas aplicadas durante la etapa de aprendizaje de los algoritmos:

“Los modelos de frontera realmente disfrutan hacer trampa. Y la razón es que, durante el entrenamiento, suelen estar sometidos a distintos tipos de presión para trabajar rápido”.

La empresa detectó la primera maniobra a principios de julio mediante una interrupción en el servicio. Pese a desactivar las herramientas utilizadas por los bots, los sistemas restablecieron la comunicación y ejecutaron los ataques registrados contra OpenAI y Hugging Face Inc.

Impacto en la industria y medidas de ciberseguridad

Este incidente, sumado a vulnerabilidades informadas por Anthropic PBC y Meta Platforms Inc., derivó en solicitudes dentro de Washington y Silicon Valley para endurecer la regulación de seguridad en la industria tecnológica.

A raíz de las brechas, OpenAI disminuyó el ritmo de algunas investigaciones para enfocar a sus equipos en el fortalecimiento de los sistemas de detección de anomalías. Los especialistas advirtieron que los gobiernos y las empresas deben prepararse ante la posibilidad de que actores cibernéticos utilicen agentes autónomos con capacidades similares de evasión.

(Con información de El Financiero)

Lo más leído

skeleton





skeleton