OpenAI, Ciberseguridad

OpenAI frena parte del entrenamiento de sus modelos para reforzar la seguridad


OpenAI pausó parte del entrenamiento de sus modelos más avanzados para reforzar sus sistemas de seguridad, monitoreo y alineación. La compañía explicó que el ritmo de progreso de sus modelos se aceleró y que necesita asegurarse de que sus controles puedan acompañar ese nuevo nivel de capacidades.

La pausa incluye un entrenamiento de refuerzo de dos semanas sobre modelos destinados a futuros despliegues. El mayor entrenamiento de frontera previsto por la compañía continúa suspendido mientras realizan nuevas pruebas y evalúan el comportamiento de los modelos.

OpenAI también anunció nuevos controles:

  • Mayor aislamiento de los entornos donde se entrenan y prueban los modelos.
  • Restricciones de acceso a internet y redes internas para los sistemas de mayor riesgo.
  • Monitoreo continuo de los modelos durante entrenamientos y evaluaciones con herramientas.
  • Nuevas técnicas de alineación para detectar comportamientos peligrosos o no autorizados.

La decisión llega después del incidente de Hugging Face y de que OpenAI determinara que su próximo modelo Astra podría alcanzar un nivel crítico de capacidades de ciberseguridad.

Sam Altman aseguró que la compañía “se preocupa profundamente” por la seguridad de la IA y que espera que, a medida que los modelos sean más capaces, la confianza en sus mecanismos de seguridad empiece a determinar el ritmo al que avanza su desarrollo.

Compartir

Más historias

¡La forma más inteligente de empezar tu semana!

Más de 500 lectores ya reciben el resumen semanal de QUVO en su bandeja.