Actualidad

OpenAI frena el lanzamiento de GPT-6.1 Astra tras detectar fallas de seguridad en sus pruebas

Imagen principal
POR Michelle Roble Muñoz |

El modelo estaba previsto para octubre y había mostrado avances en tareas complejas. Sin embargo, evaluaciones internas detectaron problemas de alineación y autonomía.

OpenAI decidió cancelar el lanzamiento de GPT-6.1 Astra, su próximo modelo de inteligencia artificial, luego de identificar problemas de seguridad durante las pruebas internas.

La compañía tenía previsto presentar el sistema en octubre, pero las evaluaciones mostraron retrocesos en aspectos considerados clave para su funcionamiento seguro. Entre ellos, su capacidad para respetar los límites establecidos por los usuarios y comunicar de manera adecuada las acciones que realizaba.

La decisión se conoce en medio de una revisión más amplia de incidentes protagonizados por agentes de inteligencia artificial de OpenAI, algunos de los cuales involucraron actividades no autorizadas en servicios y sitios externos.

Las pruebas detectaron problemas en GPT-6.1 Astra

De acuerdo con The New York Times y The Wall Street Journal, Saachi Jain, responsable de sistemas de seguridad de OpenAI, explicó que Astra presentó retrocesos frente a su predecesor en dos áreas.

Una de ellas fue la alineación, es decir, la capacidad del modelo para actuar de acuerdo con las instrucciones y límites establecidos por las personas. Las evaluaciones también detectaron mayores niveles de comportamiento engañoso. En determinadas situaciones, el modelo no informaba de manera transparente las acciones que había realizado.

Otro problema estuvo relacionado con la autorización. Astra podía continuar una tarea sin solicitar permiso al usuario y, en algunos casos, recurrir a herramientas o servicios externos aunque hacerlo pudiera implicar riesgos de seguridad.

“Queremos asegurarnos de que el desarrollo de nuestro modelo sea seguro sin importar si está en la empresa o cuándo lo enviamos a los usuarios”, señaló Jain, según el reporte.

Pese a estas dificultades, las pruebas también mostraron avances en capacidades. Astra logró completar trabajos complejos de principio a fin, superando a versiones anteriores en determinadas evaluaciones.

Astra también fue evaluado por sus capacidades de ciberseguridad

Los problemas detectados no se limitaron a las evaluaciones internas. El Instituto de Seguridad de IA de Reino Unido (AISI) sometió a GPT-6.1 Astra a pruebas simuladas de ciberseguridad.

El organismo informó que el modelo realizó acciones no autorizadas en escenarios simulados, incluyendo intentos de ataques contra cadenas de suministro de software.

Los resultados llevaron a los investigadores a advertir que, además de las medidas de alineación, serán necesarios mecanismos como monitoreo y aislamiento para reducir los riesgos asociados a agentes cada vez más autónomos.

La decisión se produce mientras OpenAI mantiene bajo revisión distintos episodios vinculados al comportamiento no autorizado de sus agentes. Aunque GPT-6.1 Astra no llegará al público en su forma prevista, parte de su desarrollo seguirá utilizándose en futuras generaciones de modelos de inteligencia artificial.