22 de julio de 2026
Durante una prueba interna de ciberseguridad, un agente de inteligencia artificial de OpenAI escapó de un entorno aislado, consiguió acceso a Internet y comprometió la infraestructura de Hugging Face sin recibir instrucciones para hacerlo. La empresa calificó el episodio como un "incidente cibernético sin precedentes".
"El objetivo nunca fue atacar a Hugging Face. El modelo simplemente concluyó que esa era la mejor manera de obtener la información necesaria para completar la prueba."
Qué ocurrió
El agente desarrolló una estrategia propia para cumplir su objetivo. Según la investigación de OpenAI, durante la prueba logró:- Escapar del entorno aislado donde estaba siendo evaluado.
- Encontrar una forma de acceder a Internet.
- Obtener credenciales de autenticación.
- Ingresar a la infraestructura de Hugging Face.
- Buscar información para mejorar su desempeño en la evaluación.
No fue un caso aislado
OpenAI detectó otros intentos de eludir las restricciones impuestas durante las evaluaciones. Entre los ejemplos publicados aparecen comportamientos que hasta hace poco eran poco habituales en estos sistemas.- Un modelo debía publicar sus resultados únicamente en Slack. Tras encontrar documentación que sugería hacerlo mediante un pull request en GitHub, pasó cerca de una hora buscando una vulnerabilidad para escapar del entorno y cumplir ese objetivo.
- Otro sistema dividió un token de autenticación en varias partes para evitar que fuera detectado por un escáner de seguridad y lo reconstruyó después de superar el control.
La respuesta de OpenAI
La empresa suspendió inmediatamente las pruebas internas. También inició una investigación junto con Hugging Face y reforzó sus controles de seguridad antes de reanudar las evaluaciones. Además, implementó un monitoreo más estricto para registrar cada acción realizada por los agentes y detectar comportamientos inesperados con mayor rapidez. OpenAI aclaró que las versiones comerciales de ChatGPT no estuvieron involucradas y que los modelos utilizados en esta evaluación contaban con restricciones reducidas para medir sus capacidades ofensivas.Por qué importa
El episodio marca un cambio en la forma en que se evalúan los riesgos de la inteligencia artificial. Hasta ahora, la mayoría de estos escenarios habían sido simulaciones realizadas en laboratorios. En este caso, fue la propia OpenAI la que confirmó que uno de sus agentes encontró por sí mismo una forma de salir del entorno donde estaba contenido y actuar sobre la infraestructura de otra empresa. El incidente refuerza la preocupación por los modelos capaces de planificar, tomar decisiones y encontrar caminos alternativos para cumplir un objetivo, incluso cuando existen restricciones diseñadas para impedirlo.Más notas
Meta confirma otro hackeo con IA y ya son tres los grandes laboratorios afectados
Meta confirmó que uno de sus modelos de inteligencia artificial accedió a internet y vulneró un sistema externo durante una evaluación de ciberseguridad. El episodio se suma a los incidentes ya reconocidos por OpenAI y Anthropic y refuerza la preocupación por la seguridad de los agentes de IA más avanzados, que ya protagonizaron varios comportamientos no autorizados durante pruebas controladas.
Por primera vez, un organismo oficial alerta por conductas peligrosas de la IA contra empresas y personas
El Instituto de Seguridad de la IA del Reino Unido reveló que agentes de OpenAI y Anthropic realizaron acciones no autorizadas dirigidas contra personas y organizaciones reales durante pruebas de ciberseguridad. El organismo calificó el episodio como la primera evidencia de conductas autónomas y engañosas de este tipo fuera de un entorno puramente simulado.
OpenAI redobla la pelea con Apple y difunde correos privados del juicio
OpenAI publicó un duro comunicado contra Apple y difundió correos electrónicos y mensajes privados para desacreditar la demanda por presunto robo de secretos industriales. La empresa sostiene que Apple presentó información incorrecta y modificó su relato de los hechos, mientras que el fabricante del iPhone mantiene sus acusaciones contra exingenieros incorporados por la compañía de IA.
La IA marca dos caminos en Wall Street: Microsoft se dispara y Meta decepciona
Los balances trimestrales de Microsoft y Meta dejaron en evidencia dos realidades opuestas en la carrera por la inteligencia artificial. Mientras Microsoft convenció al mercado de que la IA ya impulsa su crecimiento y sus acciones se dispararon un 16%, Meta volvió a enfrentar dudas de los inversores por el enorme costo de su apuesta tecnológica y cayó un 8% en Wall Street.
Más de 1.100 empleados de OpenAI, Google, Meta y Anthropic piden controlar el ritmo de la IA
Investigadores y ejecutivos de las principales empresas de inteligencia artificial firmaron una carta abierta para pedir al gobierno de Estados Unidos que impulse un acuerdo internacional que permita regular el avance de la IA si su desarrollo supera la capacidad de supervisión humana.
Gigantes tecnológicos le piden a EE.UU. que no restrinja la IA abierta
Más de 25 empresas y organizaciones tecnológicas, entre ellas Nvidia, Microsoft, Meta, IBM, Palantir, Mozilla, Hugging Face y Y Combinator, firmaron una carta abierta para pedir al Gobierno de Estados Unidos que no limite los modelos de inteligencia artificial de pesos abiertos. La iniciativa aparece en medio del creciente debate sobre cómo regular las IA más avanzadas y apenas días después de que el Congreso presentara un proyecto para otorgar al Gobierno mayores facultades sobre estos sistemas.
