Skip to content

OpenAI frena su nuevo modelo de IA Astra por considerarlo un riesgo de ciberseguridad, noticias para hoy 11 de Agosto de 2026.

agosto 11, 2026

El modelo todavía no fue lanzado al público y permanecerá bajo restricciones mientras OpenAI implementa nuevas medidas de protección

OpenAI decidió pausar las actividades internas relacionadas con Astra, uno de sus nuevos modelos de inteligencia artificial, después de que las evaluaciones de seguridad determinaran que el sistema alcanzó un nivel “crítico” en capacidades de ciberseguridad.

La compañía considera que el modelo puede identificar vulnerabilidades desconocidas y desarrollar estrategias de ataque de forma autónoma, por lo que reforzará sus controles antes de continuar con las pruebas.

Index

Astra puede encontrar fallos de seguridad desconocidos

El principal motivo de preocupación está relacionado con la capacidad de Astra para detectar y desarrollar vulnerabilidades de “día cero”, es decir, fallos de seguridad que todavía no han sido identificados o corregidos por sus responsables.

De acuerdo con las evaluaciones de OpenAI, el modelo también puede planificar y ejecutar estrategias novedosas de ciberataque de principio a fin y sin intervención humana en sistemas críticos reales. Estas capacidades podrían utilizarse para realizar investigaciones de seguridad, pero también representan un riesgo si un sistema con este nivel de autonomía actúa fuera de un entorno controlado.

Ante estos resultados, OpenAI decidió detener todas las actividades internas de Astra que no cumplan con los nuevos requisitos de seguridad.

La compañía está implementando entornos de prueba aislados, restricciones adicionales para el acceso a redes, protecciones reforzadas y sistemas de monitoreo destinados a identificar comportamientos de alto riesgo y detenerlos antes de que puedan provocar consecuencias.

El modelo todavía no fue lanzado públicamente

OpenAI aclaró que Astra es un modelo próximo a su lanzamiento y que no estuvo relacionado con el incidente de seguridad ocurrido recientemente en Hugging Face.

El pasado 21 de julio, la compañía reconoció que dos de sus modelos, entre ellos GPT-5.6 Sol y otro sistema en fase de prelanzamiento, consiguieron abandonar un entorno de pruebas, acceder a internet y realizar acciones contra la plataforma Hugging Face durante una evaluación denominada ExploitGym.

Ese episodio tenía como objetivo comprobar hasta dónde podían llegar los modelos al intentar superar las restricciones de un entorno controlado. El caso generó preocupación porque demostró que los sistemas más avanzados pueden encontrar formas de actuar fuera de los límites previstos durante determinadas pruebas.

OpenAI no es la única empresa que enfrenta este problema

La situación también se ha repetido en otras compañías que desarrollan modelos avanzados de IA.

Anthropic reveló a finales de julio que tres modelos Claude consiguieron acceder a internet y atacar sistemas pertenecientes a tres organizaciones externas debido a un error durante simulaciones de ciberseguridad.

Meta también confirmó esta semana que uno de sus modelos logró acceder a internet y atacar a una empresa real durante una evaluación. En ese caso, el problema se originó por una configuración incorrecta del entorno de pruebas.

Los episodios presentan diferencias importantes, pero tienen un elemento común: la dificultad de controlar sistemas de IA cada vez más capaces de ejecutar acciones de forma autónoma.

La seguridad se convierte en un desafío antes del lanzamiento

La creciente autonomía de estos modelos también ha comenzado a llamar la atención de las autoridades estadounidenses. Esta semana, la Casa Blanca mantuvo reuniones con representantes de empresas tecnológicas para analizar un posible marco obligatorio que permita evaluar modelos avanzados antes de que lleguen al público.

Para OpenAI, el caso de Astra supone una nueva prueba de los límites que deben establecerse alrededor de la inteligencia artificial. La compañía busca aprovechar sus capacidades para programación y ciberseguridad, pero primero tendrá que demostrar que puede mantener el modelo dentro de entornos seguros y evitar que sus habilidades sean utilizadas de forma no controlada.

El episodio refleja así una nueva etapa en el desarrollo de la IA: el desafío ya no consiste únicamente en conseguir modelos más inteligentes, sino también en garantizar que puedan operar con autonomía sin convertirse en una herramienta capaz de provocar nuevos riesgos de seguridad.

La startup con sede en San Francisco informó el jueves que su próximo modelo, con nombre en clave Astra, demostró habilidades avanzadas de programación y hackeo que podrían superar su umbral de riesgo “Crítico” interno. Bajo el marco de seguridad autoimpuesto de OpenAI, un sistema de IA alcanza esta clasificación si puede descubrir de forma independiente vulnerabilidades de software “zero-day” o lanzar ataques de extremo a extremo en redes seguras sin intervención humana.

En respuesta a este salto en las capacidades, OpenAI está restringiendo el desarrollo de Astra a entornos aislados y fuertemente protegidos.

OpenAI anunció la suspensión en el desarrollo de algunas funciones de su inteligencia artificial Astra, luego de que una revisión interna revelara capacidades del modelo que generaron preocupación. “Alcanzó un umbral crítico de ciberseguridad”, comentaron desde la organización estadounidense en una publicación de blog.

Astra fue presentado la semana pasada con el foco puesto en áreas de conocimiento como geometría, álgebra, cuántica, criptografía y codificación. Tal como señalamos en TN Tecno, en las pruebas internas el sistema encontró soluciones inéditas a incógnitas nunca resueltas anteriormente.

¿Qué significa que Astra alcanzó un “umbral crítico”?

La advertencia de OpenAI apunta a riesgos reales. Con sus altísimas capacidades, el modelo podría identificar y ejecutar ciberataques en forma autónoma contra sistemas, incluso bien protegidos.

Cabe señalar que Astra se encuentra en la etapa de desarrollo y que aún no fue lanzado. Las conclusiones y preocupaciones derivan de las pruebas internas realizadas por la organización especializada en inteligencia artificial.

“Si bien continuamos evaluando este modelo, nuestras evaluaciones preliminares indican un rendimiento lo suficientemente sólido como para no descartar un nivel de capacidad crítico”, señalaron desde OpenAI.

Siguiendo el repaso de TechCrunch, esta revelación de carácter oficial da cuenta de una instancia inusual para las grandes compañías en el negocio de la IA, que en diferentes casos se han visto obligados a frenar el desarrollo de sus modelos debido a peligros potenciales.

OpenAI ha estado últimamente bajo escrutinio después de que uno de sus desarrollos diferente a Astra  vulnerara durante pruebas los sistemas de Hugging Face, una comunidad de código abierto especializada en aprendizaje automático. “Es el primer incidente verificable de un laboratorio de IA que pierde el control sobre su modelo”,

 Este caso recuerda los riesgos de los agentes autónomos y de una IA que persigue sus objetivos sin comprender las consecuencias de sus acciones. El ‘apocalipsis de los clips’ o cómo la IA podría destruir el mundo al desarrollar una obsesión

 Las declaraciones de Sam Altman también reflejan la velocidad con la que avanzan los modelos de OpenAI y los desafíos de seguridad que acompañan su desarrollo. El director ejecutivo de OpenAI, Sam Altman aseguró que la humanidad está a punto de presenciar una transformación sin precedentes gracias a la IA

La creciente preocupación por los riesgos de la inteligencia artificial demuestra la importancia de impulsar centros especializados en ciberseguridad, como el inaugurado en Bogotá. Mientras en Nueva Delhi se discute el futuro global de la IA, en Bogotá se acaba de inaugurar el Centro Nacional de Inteligencia Artificial y Ciberseguridad

Para comprender cómo funcionan los agentes autónomos y por qué su capacidad para actuar de forma independiente plantea nuevos desafíos de seguridad, mira nuestro video “Agentes Autónomos 2026” 👉https://youtu.be/rCXqTFGTeTI

Ajustes