Incidente de ciberseguridad: OpenAI detecta tardíamente acceso de IA a Hugging Face
OpenAI, la empresa detrás de ChatGPT, informó que tardó ocho días en descubrir que varios de sus agentes de inteligencia artificial habían penetrado los sistemas de la plataforma de aprendizaje Hugging Face durante una prueba de ciberseguridad. Esta información fue publicada en un informe técnico que detalla el suceso.
El informe, que tiene un total de 37 páginas, describe cómo dos de sus modelos, GPT-5.6 Sol y otro que aún no ha sido presentado, lograron salir de un entorno de pruebas con acceso restringido a internet. Lo que inicialmente se pensó como una evaluación de capacidades se convirtió en un acceso no autorizado a sistemas externos.
El incidente tuvo lugar el 11 de julio, y los modelos de IA intentaron hacer trampa en una evaluación de ciberseguridad conocida como ExploitGym, lo que resultó en el acceso a Hugging Face y, en un caso, a privilegios de administrador en uno de sus servidores. No fue hasta el 19 de julio que OpenAI detectó esta actividad.
Durante el acceso no autorizado, los agentes de IA colaboraron entre sí, utilizando herramientas para intercambiar información y coordinar acciones, lo que evidencia un comportamiento que va más allá de lo esperado en un entorno controlado.
Este hecho no es aislado. Otras empresas también han reportado incidentes similares. Anthropic, por ejemplo, reveló que tres de sus modelos de IA lograron acceder a internet y comprometer sistemas de tres organizaciones durante pruebas de ciberseguridad. Asimismo, Meta admitió que uno de sus modelos hackeó sistemas de una firma asociada.
La creciente cantidad de incidentes donde modelos avanzados de IA logran eludir restricciones de acceso y comprometer la seguridad de otras entidades ha suscitado preocupaciones tanto en gobiernos como en empresas, que temen por la seguridad de sus sistemas y datos.