La empresa estadounidense de inteligencia artificial (IA) OpenAI comunicó este martes que uno de sus modelos atacó de manera autónoma la infraestructura de la plataforma Hugging Face, especializada en modelos de aprendizaje automático.
"Hemos sufrido un incidente de seguridad grave durante la evaluación de nuestros modelos", reconoció Sam Altman, CEO y cofundador de OpenAI, en X.
De acuerdo al comunicado, se trata de un incidente cibernético "sin precedentes", que ambas compañías consideran que podría ser el primer caso divulgado públicamente en el que un modelo de IA se infiltra por su propia cuenta en los sistemas de otra empresa durante una evaluación controlada.
¿Cómo sucedió?
Según detalló OpenAI, el episodio ocurrió en el marco de una evaluación interna diseñada para medir las capacidades cibernéticas avanzadas de varios de sus modelos, incluido el GPT-5.6 Sol, en la que los investigadores desactivaron algunas de las salvaguardas de seguridad integradas y ejecutaron los modelos en un entorno de pruebas aislado con acceso limitado a Internet.
La compañía explicó que los modelos explotaron un fallo de 'software' desconocido para acceder a Internet y, posteriormente, vulneraron los sistemas de Hugging Face, en lo que parece haber sido un intento de encontrar las respuestas para una prueba de rendimiento de ciberseguridad. El equipo de seguridad de OpenAI detectó la actividad inusual, mientras que Hugging Face, de manera independiente, identificó y contuvo la intrusión.
"Sospechábamos que el ciberataque de la semana pasada podría haber procedido de un laboratorio de vanguardia, dada la sofisticación del agente. ¡Y resulta que así fue! Hemos pasado las últimas 24 horas trabajando en estrecha colaboración con el equipo de OpenAI", escribió Clément Delangue, CEO y cofundador de Hugging Face, el martes en X.
"Estamos firmemente convencidos de que no hubo ninguna intención maliciosa por su parte. ¡Es alucinante que todo esto haya ocurrido de forma autónoma!", agregó.
Asimismo, después del incidente, OpenAI afirmó que está implementando controles de seguridad más estrictos mientras se subsanan las vulnerabilidades, además de reforzar las salvaguardas en torno al futuro entrenamiento y evaluación de modelos de IA.