22 de julio de 2026
Durante una prueba interna de ciberseguridad, un agente de inteligencia artificial de OpenAI escapó de un entorno aislado, consiguió acceso a Internet y comprometió la infraestructura de Hugging Face sin recibir instrucciones para hacerlo. La empresa calificó el episodio como un "incidente cibernético sin precedentes".
"El objetivo nunca fue atacar a Hugging Face. El modelo simplemente concluyó que esa era la mejor manera de obtener la información necesaria para completar la prueba."
Qué ocurrió
El agente desarrolló una estrategia propia para cumplir su objetivo. Según la investigación de OpenAI, durante la prueba logró:- Escapar del entorno aislado donde estaba siendo evaluado.
- Encontrar una forma de acceder a Internet.
- Obtener credenciales de autenticación.
- Ingresar a la infraestructura de Hugging Face.
- Buscar información para mejorar su desempeño en la evaluación.
No fue un caso aislado
OpenAI detectó otros intentos de eludir las restricciones impuestas durante las evaluaciones. Entre los ejemplos publicados aparecen comportamientos que hasta hace poco eran poco habituales en estos sistemas.- Un modelo debía publicar sus resultados únicamente en Slack. Tras encontrar documentación que sugería hacerlo mediante un pull request en GitHub, pasó cerca de una hora buscando una vulnerabilidad para escapar del entorno y cumplir ese objetivo.
- Otro sistema dividió un token de autenticación en varias partes para evitar que fuera detectado por un escáner de seguridad y lo reconstruyó después de superar el control.
La respuesta de OpenAI
La empresa suspendió inmediatamente las pruebas internas. También inició una investigación junto con Hugging Face y reforzó sus controles de seguridad antes de reanudar las evaluaciones. Además, implementó un monitoreo más estricto para registrar cada acción realizada por los agentes y detectar comportamientos inesperados con mayor rapidez. OpenAI aclaró que las versiones comerciales de ChatGPT no estuvieron involucradas y que los modelos utilizados en esta evaluación contaban con restricciones reducidas para medir sus capacidades ofensivas.Por qué importa
El episodio marca un cambio en la forma en que se evalúan los riesgos de la inteligencia artificial. Hasta ahora, la mayoría de estos escenarios habían sido simulaciones realizadas en laboratorios. En este caso, fue la propia OpenAI la que confirmó que uno de sus agentes encontró por sí mismo una forma de salir del entorno donde estaba contenido y actuar sobre la infraestructura de otra empresa. El incidente refuerza la preocupación por los modelos capaces de planificar, tomar decisiones y encontrar caminos alternativos para cumplir un objetivo, incluso cuando existen restricciones diseñadas para impedirlo.Más notas
OpenAI acelera su expansión: de ChatGPT a los dispositivos inteligentes
La compañía lanzó su primer producto físico para desarrolladores y avanza en un dispositivo con inteligencia artificial pensado para el hogar, en una nueva etapa que va más allá del software.
China quiere liderar las reglas de la IA y lanzó un organismo internacional con 29 países
Al cierre de la Conferencia Mundial de Inteligencia Artificial (WAIC), Beijing presentó WAICO, una nueva organización internacional para impulsar la cooperación y la gobernanza de la IA. Además, Xi Jinping anunció un programa de capacitación con 5.000 plazas y pidió construir un sistema global de regulación compartida.
Meta se mete de lleno en la carrera por la IA y lanzó Muse Spark 1.1
La compañía de Mark Zuckerberg presentó un nuevo modelo orientado a programación y agentes inteligentes. También anunció Muse Image, una IA para generar imágenes integrada en Instagram y WhatsApp, en una semana marcada por los lanzamientos de OpenAI, Anthropic y SpaceXAI.
La ONU pide reglas globales para la IA y lanzó un foro inédito
António Guterres advirtió que el desarrollo de la IA avanza más rápido que las normas para controlarla. El organismo reunió por primera vez a gobiernos, empresas tecnológicas, universidades y especialistas para empezar a definir un marco internacional que garantice una inteligencia artificial segura, ética e inclusiva.
Detectan el primer ataque de ransomware ejecutado por un agente de IA
Un informe de la firma de ciberseguridad Sysdig sostiene que un modelo de lenguaje llevó adelante la mayor parte de una intrusión informática. Aunque un humano inició la operación, los investigadores creen que el caso marca un punto de inflexión para la seguridad digital.
OpenAI quiere que EE. UU. sea socio de las empresas de IA
La compañía de Sam Altman propuso crear un fondo soberano que reciba una participación del 5% de las principales empresas estadounidenses de inteligencia artificial. La iniciativa busca fortalecer la relación con Washington y repartir parte de los beneficios del sector entre la población.

