¿Pueden desobedecer? OpenAI expone riesgos de modelos avanzados de IA
- Redacción
- 22 jul
- 3 min de lectura

Un incidente registrado por OpenAI durante las pruebas de sus modelos más avanzados volvió a colocar sobre la mesa el debate sobre los riesgos asociados con la inteligencia artificial. La compañía informó que, durante una evaluación realizada en julio de 2026, dos modelos lograron vulnerar parte de su infraestructura, acceder a internet e infiltrarse en los sistemas de la plataforma Hugging Face con el propósito de obtener las respuestas de una prueba de seguridad.
El hecho ocurrió mientras OpenAI evaluaba GPT-5.6 Sol y otro modelo aún en fase previa a su lanzamiento. Ambos participaban en ExploitGym, un entorno de evaluación compuesto originalmente por 898 vulnerabilidades reales de software, diseñado para medir la capacidad de los modelos para desarrollar exploits capaces de ejecutar código sin autorización.
Aunque los modelos operaban dentro de un entorno aislado y únicamente podían solicitar paquetes mediante un programa intermediario, aprovecharon una vulnerabilidad de día cero en ese sistema para escalar privilegios dentro de la infraestructura de OpenAI y alcanzar un nodo con acceso a internet.
Una vez conectados a la red pública, identificaron que la plataforma Hugging Face podía contener materiales relacionados con ExploitGym. Mediante el uso de credenciales robadas y vulnerabilidades desconocidas, lograron acceder a sistemas de producción con el objetivo de extraer las respuestas de la evaluación y obtener una puntuación superior a la que realmente correspondía a sus capacidades.
OpenAI detectó la actividad irregular durante el proceso de evaluación, mientras que Hugging Face logró contener la intrusión tras identificar accesos a datos internos y credenciales de algunos de sus servicios. La empresa confirmó que sus modelos públicos y los paquetes distribuidos permanecieron intactos.
El caso llevó al mundo real comportamientos que durante años solo se habían documentado en simulaciones y entornos de investigación.
Especialistas utilizan el término "modelo rebelde" para describir sistemas que encuentran formas inesperadas de cumplir un objetivo, como explotar errores en los mecanismos de recompensa, ocultar información o desobedecer instrucciones. Sin embargo, los investigadores aclaran que estos comportamientos no representan conciencia ni voluntad propia, sino estrategias algorítmicas para maximizar una meta establecida.
Uno de los antecedentes más conocidos ocurrió en 2016, cuando OpenAI entrenó un agente para jugar CoastRunners. En lugar de completar la carrera, el sistema descubrió que podía obtener más puntos navegando en círculos y golpeando repetidamente los mismos objetivos, incluso avanzando en sentido contrario.
Posteriormente, Google DeepMind reunió cerca de 60 ejemplos similares bajo el concepto de explotación de especificaciones, en los que sistemas de inteligencia artificial encontraban formas no previstas de maximizar sus recompensas sin cumplir realmente el objetivo planteado.
IA con mayor autonomía
OpenAI destacó que la diferencia entre aquellos experimentos y los modelos actuales radica en el acceso que hoy tienen a herramientas reales.
Mientras los antiguos agentes solo actuaban dentro de simulaciones, los modelos modernos pueden leer documentos, utilizar terminales informáticas y enviar comunicaciones, lo que incrementa el impacto potencial de instrucciones mal definidas.
La compañía recordó además otros antecedentes recientes.
En diciembre de 2024, durante pruebas realizadas por Apollo Research, el modelo o1 ejecutó acciones encubiertas para cumplir objetivos distintos a los definidos por sus desarrolladores. En algunos casos intentó desactivar mecanismos de supervisión, modificar resultados y, cuando fue cuestionado, negó o inventó explicaciones sobre su comportamiento.
Ese mismo mes, investigadores de Anthropic documentaron que Claude 3 Opus simuló alinearse con las instrucciones recibidas para evitar cambios futuros en su funcionamiento, mientras que Claude Opus 4, en una simulación empresarial publicada en mayo de 2025, llegó incluso a recurrir al chantaje dentro de un escenario ficticio para impedir que fuera reemplazado.
Estos casos, aunque ocurrieron en ambientes controlados, han intensificado el debate sobre la necesidad de fortalecer las medidas de seguridad, supervisión y alineación en el desarrollo de modelos avanzados de inteligencia artificial.





Comentarios