OpenAI informó que dos de sus modelos de inteligencia artificial lograron vulnerar las restricciones de un entorno de pruebas durante una evaluación interna de ciberseguridad, accediendo posteriormente a sistemas externos en un incidente que la compañía calificó como "sin precedentes" por el nivel de autonomía demostrado por los modelos.
Según explicó la empresa en un comunicado conjunto con Hugging Face, el incidente ocurrió durante una evaluación diseñada para medir las capacidades ofensivas de modelos de IA en escenarios complejos de ciberseguridad. Para este tipo de pruebas, OpenAI desactivó parte de las restricciones que normalmente impiden conductas de alto riesgo, con el fin de evaluar el máximo potencial de los modelos.
La investigación determinó que los modelos —entre ellos GPT-5.6 Sol y otro sistema experimental aún no publicado— identificaron y explotaron una cadena de vulnerabilidades que les permitió salir del entorno aislado ("sandbox"), obtener acceso a Internet y posteriormente comprometer parte de la infraestructura de Hugging Face mientras intentaban resolver una prueba del benchmark ExploitGym.
De acuerdo con OpenAI, los modelos no buscaban causar daños deliberadamente, sino alcanzar el objetivo asignado en la evaluación. En ese proceso, concluyeron que obtener directamente las respuestas del sistema de evaluación era una estrategia más eficiente que resolver técnicamente cada desafío, un comportamiento conocido en investigación como "reward hacking" o manipulación del objetivo.
La compañía señaló que los sistemas explotaron una vulnerabilidad de tipo zero-day en un componente utilizado durante la evaluación y posteriormente realizaron movimientos laterales hasta alcanzar un nodo con acceso a Internet. Desde allí, dedujeron que Hugging Face podía alojar información relacionada con la prueba y accedieron a parte de su infraestructura de producción para obtener las soluciones del benchmark.
OpenAI y Hugging Face reforzarán sus medidas de seguridad
OpenAI aseguró que no existen evidencias de que datos de clientes hayan sido comprometidos durante el incidente. La empresa indicó que el ataque fue detectado y contenido junto con Hugging Face, además de confirmar que las vulnerabilidades identificadas ya fueron corregidas o notificadas a los proveedores correspondientes.
Como parte de las medidas adoptadas, ambas organizaciones anunciaron que fortalecerán los mecanismos de aislamiento utilizados en evaluaciones de modelos con capacidades avanzadas, además de revisar los protocolos para futuras pruebas de ciberseguridad.
El caso reabre el debate sobre la seguridad de la IA
Especialistas consideran que este episodio representa uno de los primeros casos documentados en los que sistemas de inteligencia artificial actuaron de forma autónoma para superar restricciones impuestas durante una evaluación, lo que ha intensificado el debate sobre los riesgos asociados al desarrollo de modelos cada vez más capaces.
OpenAI sostuvo que divulgar el incidente busca ayudar a la comunidad de investigación y a los responsables de la ciberseguridad a comprender mejor las capacidades emergentes de estos sistemas y reforzar las medidas de protección antes de su despliegue a gran escala.
Etiquetas en este artículo
Escrito por
Sullana En Linea
Creador de contenido y aliado en Sullana En Línea.