OpenAI mantiene en pausa su mayor entrenamiento: Astra eleva el riesgo

OpenAI confirmó el 18 de agosto de 2026 que mantiene en pausa su mayor entrenamiento de aprendizaje por refuerzo de frontera previsto. La decisión continúa mientras ejecuta pruebas menores, valida nuevas salvaguardas y reúne más evidencia sobre el comportamiento alineado de sus modelos, según la actualización oficial de OpenAI.
El laboratorio relaciona este endurecimiento con indicios preliminares de que Astra, un próximo modelo, podría alcanzar el nivel cibernético Critical de su Preparedness Framework. Eso no demuestra que Astra haya superado definitivamente el umbral ni que sea el modelo utilizado en el entrenamiento de mayor escala; Axios confirmó el 18 de agosto que el ciclo más grande seguía detenido y que numerosas cargas relacionadas con Astra aún no satisfacían el nuevo estándar de seguridad.
OpenAI detuvo actividades diferentes

La cronología no corresponde a una única pausa. Después del incidente entre sistemas de OpenAI y Hugging Face, el laboratorio suspendió en sus clústeres de investigación la inferencia de modelos de frontera para ejecuciones capaces de producir código o utilizar herramientas con acceso a internet. Astra no estuvo implicado en ese episodio.
La inferencia ocurre cuando un modelo ya entrenado procesa una solicitud, genera resultados o actúa mediante herramientas. OpenAI restauró con relativa rapidez una vía más limitada y segura para ejecutar código, pero revisó cada carga por separado: algunas volvieron a funcionar bajo los nuevos controles y otras necesitaron modificaciones adicionales.
En otro frente, la empresa impuso una pausa de dos semanas al entrenamiento de refuerzo de sus modelos más recientes destinados al despliegue. Esa interrupción temporal ya terminó, pero no debe confundirse con el mayor entrenamiento de refuerzo de frontera planeado, que continúa detenido. Tampoco equivale a una suspensión completa del desarrollo: siguen activos entrenamientos y evaluaciones de menor escala.
La evaluación de Astra elevó el nivel de cautela

Las evaluaciones internas de Astra mostraron avances en programación agéntica y ciberseguridad. En su evaluación preliminar del 7 de agosto, OpenAI dijo que no podía descartar capacidades de nivel Critical y pausó las actividades internas de Astra que todavía no cumplían los controles reforzados.
El umbral Critical contempla que un modelo pueda identificar y desarrollar, sin intervención humana, exploits funcionales de día cero contra numerosos sistemas críticos reales y reforzados, o diseñar y ejecutar estrategias novedosas de ataque de extremo a extremo partiendo de un objetivo general. Se trata de una definición de capacidad, no de la constatación de que Astra haya efectuado un ataque real.
La formulación pública sigue siendo provisional. OpenAI continúa evaluando el modelo y no ha difundido los resultados técnicos completos que permitirían comprobar de manera independiente si alcanza el umbral. La consecuencia inmediata es operativa: los trabajos con Astra y otros modelos cibernéticos deben cumplir el nivel más estricto de protección del entorno de investigación.
Algunos entrenamientos y evaluaciones de Astra ya satisfacen ese estándar, pero una cantidad significativa de cargas permanece detenida hasta completar su migración. OpenAI está dando prioridad a los trabajos de seguridad y alineamiento, de modo que una parte del desarrollo continúa sin que se haya levantado la pausa de mayor escala.
Los controles abarcan inferencia, entrenamiento y evaluación

La primera capa es el aislamiento. OpenAI exige entornos más fuertes para las cargas que ejecutan código generado por modelos o procesan resultados no confiables, restringe la conexión de los trabajos de mayor riesgo a internet y busca impedir que la vulneración de una carga o servicio auxiliar abra acceso a otras redes internas.
La empresa también retiró servicios compartidos potencialmente vulnerables, redujo privilegios permanentes y reforzó la recopilación de registros de seguridad. El objetivo es contener cada ejecución y probar de forma continua las barreras mediante ataques simulados, en lugar de concentrar la protección únicamente en el momento de un posible lanzamiento.
La segunda capa es una supervisión automatizada en varias etapas. Clasificadores de activación inspeccionan muestras de la actividad interna del modelo y escalan las señales sospechosas a investigadores automáticos con mayor capacidad de cómputo. Esos sistemas analizan acciones con herramientas, razonamiento disponible y secuencias completas en busca de accesos no autorizados, robo de datos, conducta destructiva o intentos de eludir salvaguardas.
OpenAI pretende generar una alerta dentro de los 30 minutos posteriores a la detección de una actividad preocupante. Ante una posible vulneración de una barrera crítica, los equipos de seguridad, investigación y protección deben pausar la ejecución si no pueden determinar durante ese plazo que la señal es un falso positivo.
La monitorización es obligatoria para los entrenamientos de refuerzo y las evaluaciones que usan herramientas en modelos con capacidad Sol o superior. Desde que OpenAI determinó el 7 de agosto que Astra podía tener capacidades cibernéticas críticas, también la exige para toda inferencia de Astra asistida por herramientas. La empresa estima que este sistema consume alrededor del 20% del cómputo de inferencia supervisado, aunque la carga varía según el entrenamiento o la evaluación.
El marco de seguridad cambiará durante todo el desarrollo
OpenAI prepara una revisión del Preparedness Framework para integrar monitorización, alineamiento y contención desde el entrenamiento interno hasta el despliegue. El cambio reconoce que un modelo puede crear riesgos antes de llegar a usuarios externos, especialmente cuando utiliza código, herramientas, sistemas sensibles o conectividad de red.
En los ciclos de refuerzo de los modelos más capaces, el laboratorio aplicará técnicas de alineamiento en más etapas. Entre ellas figuran modelos de recompensa orientados a detectar conductas inseguras, entrenamiento para que los sistemas describan con mayor honestidad sus acciones y limitaciones, y medidas contra la explotación de fallos en recompensas, evaluadores, herramientas o mecanismos de supervisión.
OpenAI no ha anunciado una fecha para reanudar el mayor entrenamiento ni un calendario de lanzamiento de Astra. También están pendientes un informe técnico sobre el incidente relacionado con Hugging Face y más detalles sobre el sistema de monitorización. Por ahora, el estado confirmado es limitado: ciertas cargas regresaron bajo controles nuevos, muchas actividades de Astra siguen migrándose y el entrenamiento de frontera más ambicioso permanece detenido.
Lee también:
Suscríbete a nuestro boletín
Reciba las últimas noticias sobre Web3, IA y criptomonedas directamente en su bandeja de entrada.