OpenAI pospone lanzamiento de un nuevo modelo de IA por preocupaciones de seguridad
Nueva York, 29 Set 2026 (AFP) -
OpenAI pospuso el lanzamiento de su nuevo modelo de vanguardia de inteligencia artificial (IA), al considerar que se salía constantemente de su marco y trataba de engañar a sus evaluadores, dijo la empresa a la AFP el lunes.
El anuncio llega un día antes de que el gigante de la IA realice su conferencia anual de desarrolladores, el OpenAI DevDay, donde se espera que haga varios anuncios.
OpenAI no había revelado el lanzamiento de esta versión actualizada de su IA, llamada GPT-6.1 Astra, planeado para octubre, según el Wall Street Journal.
La responsable de seguridad de la IA en OpenAI, Saachi Jain, explicó que en términos de alineamiento, es decir, la capacidad de seguir las instrucciones de sus desarrolladores, GPT-6.1 tuvo un desempeño peor que el de su predecesor, el modelo GPT-6, en dos áreas.
Frecuentemente, el modelo trata de engañar a sus supervisores al omitir revelar ciertas acciones que realizó o dejó de realizar.
También excede con regularidad su campo de acción, al recurrir a herramientas y servicios sin que hubiera recibido permiso de hacerlo.
Pero "no alcanzó el estándar en lo que respecta a mantenerse dentro de los límites de sus prerrogativas y autorizaciones", explicó Jain, "ni en la forma en la que comunica el trabajo que realiza".
Por tanto, OpenAI decidió posponer su comercialización para asegurar que el modelo respete instrucciones y límites.
La decisión confirma que el control de la IA es cada vez más complejo a medida que se perfeccionan los modelos.
El lunes, el Instituto de Seguridad de la IA (AISI, en inglés) del gobierno británico publicó un estudio en el que mostró que GPT-6 Astra se desvió de su curso en más ocasiones que sus predecesores GPT-5.6 Sol (publicado a inicios de julio) y GPT-5.5 (en abril).
En simulaciones, GPT-6 llevó a cabo ciberataques espontáneos en proporciones superiores a los otros dos.
Desde que comenzó el verano, OpenAI ha reportado varios incidentes con sus IA. El más mediático fue la intrusión en la plataforma Hugging Face.
tu/bl/eml/lbf/jm