Modelo avanzado de IA escapó de su servidor de prueba para incrustarse en uno externo, advierte OpenAI
“Consideramos este incidente un ciberataque sin precedentes”, señala un comunicado de OpenAI. Esta compañía considera que este tipo de ataques será más común en la medida que salgan modelos más avanzados de Inteligencia Artificial
Un problema de seguridad sin precedentes fue reportado por OpenAI, tras descubrir que uno de sus modelos más avanzados de Inteligencia Artificial logró salir de un servidor de prueba aislado en el que se encontraba y se incrustó en un servidor externo de otra empresa.
“Este incidente en particular fue impulsado por una combinación de modelos de OpenAI, incluidos GPT-5.6 Sol y un modelo de prelanzamiento aún más capaz, todos con rechazos cibernéticos reducidos para fines de evaluación, mientras se estaban probando internamente”, señala un comunicado de OpenAI.
MIRA AQUÍ: Taiwán acusa exempleado de TSMC de intentar filtrar tecnología a China
De acuerdo al documento, la IA tenía por objetivo para medir las capacidades avanzadas de ciberataque y pese a que se encontraba en un entorno muy limitado, el modelo logró acceso a Internet y se incrustó en un servidor de Hugging Face, con el objetivo de buscar respuestas a la prueba que debía cumplir.
“Nuestros modelos invirtieron una cantidad considerable de recursos computacionales en la búsqueda de acceso abierto a Internet para resolver el problema de evaluación. Para obtener dicho acceso, los modelos identificaron y explotaron una vulnerabilidad (...) hasta alcanzar acceso a Internet”, señala un documento de OpenAI.
Una vez con acceso a la red mundial, los modelos dedujeron que Hugging Face potencialmente alojaba modelos, conjuntos de datos y soluciones a la prueba.
La compañía señaló que los sistemas de IA estaban “hiperfocalizados” en resolver ExploitGym, un benchmark de seguridad, y que por eso buscaron caminos extremos para cumplir ese objetivo.
OpenAI afirmó que los modelos encontraron y explotaron una vulnerabilidad. A partir de ahí, realizaron acciones hasta alcanzar un nodo con acceso a internet. Una vez conectados, dedujeron que Hugging Face podía alojar modelos, datos y soluciones relacionadas con ExploitGym, por lo que buscaron información secreta para hacer trampa en la evaluación.
La empresa añadió que, en al menos un caso, el modelo combinó credenciales robadas y fallas para hallar una ruta de ejecución remota de código en servidores de Hugging Face.
OpenAI dijo que su equipo de seguridad detectó internamente la actividad anómala, mientras que Hugging Face confirmó que identificó y detuvo la intrusión en su infraestructura.
MIRA AQUÍ: Modi: “La tecnología solo puede generar progreso cuando se democratiza”
Tras el incidente, OpenAI anunció controles más estrictos en su configuración de infraestructura, una investigación forense conjunta con Hugging Face, refuerzos en futuras evaluaciones y nuevas medidas de monitoreo.
La compañía considera a este caso como un hecho “sin precedentes” y advirtió que con las capacidades avanzadas de los nuevos modelos de IA, serán más frecuentes este tipo de situaciones.