← Portada /Tecnologia
Tecnologia

OpenAI lanza Astra, su primer modelo de nivel crítico en ciberseguridad

Astra puede encontrar fallas de seguridad desconocidas y construir el exploit por sí solo, sin guía humana. Es el primer modelo de OpenAI clasificado como 'Critical' en ciberseguridad.

Josué GO ·
Visualización abstracta de un núcleo de red neuronal encerrado en una estructura de contención, representando las salvaguardas de un modelo de IA de alto riesgo

Un modelo que cruza un umbral que OpenAI mismo definió

OpenAI clasificó a su nuevo modelo, Astra, como "Critical" en la categoría de ciberseguridad de su Preparedness Framework, el sistema interno que la empresa usa para evaluar el riesgo de un modelo antes de lanzarlo. Es la primera vez que uno de sus modelos llega a ese nivel, el más alto de la escala.

El umbral se activa cuando un sistema puede "identificar y desarrollar exploits zero-day funcionales de todos los niveles de severidad en muchos sistemas críticos reales endurecidos sin intervención humana", o "idear y ejecutar estrategias de ciberataque de extremo a extremo contra objetivos endurecidos a partir de solo un objetivo de alto nivel". En otras palabras: no es que el modelo ayude a alguien a hackear algo. Es que puede encontrar la falla y construir el exploit por sí mismo, sin que nadie le indique los pasos.

Lo que se restringe y lo que no

Esa capacidad ofensiva específica queda encerrada detrás de un programa llamado Daybreak Blue, al que solo acceden "defensores verificados". El resto del modelo —razonamiento general, programación, ingeniería de software— se distribuye con normalidad en ChatGPT y en la API, sin restricciones adicionales.

OpenAI reporta mejoras concretas en sus pruebas internas: la tasa de rechazo ante intentos de jailbreak en su evaluación de ciberseguridad pasó de 59% en el modelo anterior a 91,5% en Astra. La empresa también añadió clasificadores que detectan patrones de abuso cibernético durante el uso del modelo, entrenamiento para que el rechazo no se degrade en conversaciones largas, y desde el 1 de septiembre exige llaves de seguridad físicas para acceder a cualquier cuenta de Daybreak. Astra también es el primer modelo de OpenAI que pasó por una revisión formal de ciberseguridad del gobierno de Estados Unidos antes de su lanzamiento.

La aclaración que OpenAI hace por su cuenta

La empresa insiste en un matiz: la clasificación Critical describe el techo de lo que el modelo podría hacer sin supervisión contra un objetivo bien defendido, no una advertencia de que cualquier conversación con Astra sea peligrosa. El razonamiento y la programación generales del modelo, dice OpenAI, siguen siendo tan útiles para defensa como para cualquier otro uso legítimo.

Hay un detalle técnico que complica esa tranquilidad: según reportes sobre su arquitectura, Astra usa un mecanismo de "profundidad recurrente" que mueve parte de su razonamiento a un espacio más difícil de inspeccionar para los sistemas de monitoreo basados en texto. Es decir, cuesta más leer por qué el modelo decidió lo que decidió, comparado con los modelos que razonan en cadena de texto visible.

No todos están convencidos

En la discusión que generó el anuncio en Hacker News, varios comentaristas cuestionaron el fondo del argumento de seguridad. Uno señaló que un modelo puede alcanzar el 100% en ExploitBench —una prueba estándar de desarrollo de exploits— y que eso no resuelve la duda de si esa capacidad ofensiva puede convivir de forma confiable con restricciones. Otro planteó algo más incómodo: meses de entrenamiento por refuerzo pueden enseñarle a un modelo a "cubrir mejor sus huellas" durante la evaluación, no necesariamente a comportarse mejor fuera de ella. También se señalaron restricciones de acceso por nacionalidad sin criterios publicados, algo que choca con el discurso de OpenAI sobre hacer sus modelos "ampliamente accesibles".

Un umbral pensado para escalar con el modelo

El Preparedness Framework no nació con Astra. OpenAI lo usa desde hace tiempo para clasificar el riesgo de cada modelo nuevo en varias categorías —ciberseguridad, armas biológicas, persuasión, entre otras— antes de decidir cómo lanzarlo. Lo que cambia esta vez es que, por primera vez, un modelo cruza el techo de esa escala en una categoría completa. No hay un nivel superior a "Critical" en el marco actual de la empresa; lo que sigue, si aparece un modelo todavía más capaz, tendría que resolverse con salvaguardas nuevas, no con una categoría que ya existía para contenerlo.

Eso es lo que hace del caso de Astra un precedente más que un incidente aislado: define de facto cómo va a lidiar OpenAI —y probablemente el resto de la industria, que observa de cerca estos marcos— con la siguiente generación de modelos que también toquen ese límite.

Infografía comparando la tasa de rechazo de jailbreaks de ciberseguridad entre el modelo anterior de OpenAI (59%) y Astra (91,5%)

Fuentes

Más lecturas

related