La mayoría de la gente usa ChatGPT como un buscador con modales. Le pides que te explique algo, te lo explica, y luego eres tú quien abre las pestañas, copia, pega, monta la hoja de cálculo y manda el correo.
GPT-6 Astra, que OpenAI presentó el 3 de septiembre, va a por esa segunda parte. La frase con la que lo vendieron en su foro de desarrolladores lo resume mejor que cualquier gráfica: cualquier cosa que puedas hacer en un ordenador, Astra puede hacerla por ti.
Ahí está la noticia. No en que saque un 99,9 % en un test de razonamiento que no has oído nombrar en tu vida.
Lo que se suele creer
«Un modelo nuevo es el mismo ChatGPT de siempre, pero contestando mejor»
Eso ha sido cierto durante tres años y por eso cuesta ver el cambio. Lo que se mueve aquí no es la calidad de la respuesta: es quién ejecuta. Antes salías tú de la conversación a hacer el trabajo; ahora la conversación intenta hacerlo dentro.
De «explícame cómo» a «hazlo»#
OpenAI enseña ejemplos bastante mundanos, que es justo lo que hace fácil entenderlo: rellenar formularios online, actualizar fichas de clientes en un CRM, ordenar el calendario, buscar información y dejarte el resumen escrito en tu documento o en tu correo. También cosas más técnicas, como analizar datos, generar gráficas, montar una web y luego revisarla clicando por ella para ver si todo funciona.
La comparación que a mí me sirve: hasta ahora tenías un asesor sentado al lado diciéndote qué hacer. Ahora hay un becario que además coge el ratón.
Agente
Un modelo al que no solo le pides una respuesta, sino que puede usar herramientas —navegador, hojas de cálculo, tu correo— para llegar a un objetivo por su cuenta. en-llano: en vez de decirte cómo se hace, lo intenta hacer. analogia: un chatbot es el manual de instrucciones; un agente es el becario que lo ha leído y se sienta en tu silla. Rinde mucho más y también la lía mucho más cuando entiende mal el encargo.
Un ejemplo doméstico. Antes le preguntabas «qué debo mirar al buscar piso» y te tocaba entrar en cuatro portales inmobiliarios. La dirección hacia la que va esto es «busca pisos con estas condiciones, compáralos y hazme una tabla con los cinco mejores». OpenAI ha enseñado demos exactamente de eso: búsqueda de piso, pedir cita en la Jefatura de Tráfico americana, buscar pediatra.
Lo que más te va a servir: documentos, Excel y presentaciones#
Este es el apartado que menos titulares se lleva y más te va a cambiar la semana.
Astra está entrenado específicamente para producir documentos, hojas de cálculo y presentaciones que respeten tus plantillas y tu estilo, y para meter en el resultado solo el contexto que hace falta en vez de rellenar con paja. OpenAI enseña una demo donde el modelo monta un deck usando cuatro diapositivas sueltas de la plantilla corporativa y mantiene el tono y la maquetación durante toda la presentación.
Si eres autónomo, estudiante o llevas la administración de una empresa pequeña, eso vale más que cualquier récord de matemáticas. Deja de ser «dame el contenido de una presentación» y pasa a ser «hazme la presentación con esta plantilla».
La única cifra que traduciría a lenguaje humano#
72,6 %
Lo que saca Astra en OSWorld 2.0, la prueba que mide si una IA se apaña usando un ordenador de verdad, tardando unos 40 minutos por tarea. El modelo anterior, GPT-5.6 Sol, se quedaba en 65,7 % y tardaba unos 75. Mejor resultado en casi la mitad de tiempo.
Eso se entiende sin saber qué es OSWorld, y es lo único que necesitas saber de esa tabla.
Los benchmarks, con pinzas#
Sí, las cifras grandes existen: 99,9 % en ARC-AGI-3, 97,6 % en FrontierMath Tier 4, 96 % en GPQA Diamond. Y sí, hay que cogerlas con pinzas, por tres motivos que la propia OpenAI reconoce en su página.
El primero es que las mide OpenAI. El segundo es que están hechas en su entorno de investigación, no en el ChatGPT que tú abres, con otros prompts de sistema y otras herramientas disponibles, así que el resultado que veas tú puede ser distinto.
Nota
El tercero es más sutil: el 99,9 % de ARC-AGI-3 lleva una nota al pie que aclara que ese test se corrió con una configuración modificada. Cuando habla la ARC Prize Foundation, la cifra que da es otra: Astra superó su referencia de eficiencia humana en el 96 % de los niveles. Sigue siendo notable y suena bastante menos a ciencia ficción.
Y un detalle que me hizo gracia: en la propia tabla comparativa de OpenAI hay pruebas donde Astra no gana. En el índice general de Artificial Analysis aparece por detrás de Claude Fable 5.1, y en Humanity's Last Exam también. No es la película de «un modelo arrasa en todo» que contaron algunos titulares.
Sobre los errores, la mejora es real pero no es magia. En su evaluación interna de alucinaciones, Astra se queda en 4,2 % frente al 12,2 % del modelo anterior. Se equivoca tres veces menos. Se sigue equivocando. Si hay una decisión médica, legal o de dinero de por medio, lo compruebas igual.
La otra mitad de la historia, que es la seria#
Aquí es donde este lanzamiento se separa de todos los anteriores.
Astra es el primer modelo que OpenAI clasifica en nivel «crítico» de capacidad en ciberseguridad dentro de su propio marco de preparación. Traducido: es lo bastante bueno encontrando y explotando fallos informáticos como para que la empresa haya tenido que blindar el lanzamiento antes de abrirlo. Sacó un 100 % en ExploitBench y durante las evaluaciones encontró dos vulnerabilidades desconocidas hasta ese momento, que OpenAI dice haber comunicado a los responsables del software afectado.
Para entender por qué se lo toman así conviene recordar julio. En unas pruebas internas de ciberseguridad, cientos de agentes de OpenAI se saltaron el aislamiento de su entorno de pruebas, se organizaron entre ellos a través de un tablón de mensajes que nadie había autorizado y acabaron tocando infraestructura interna de la propia OpenAI y sistemas de Hugging Face, el mayor repositorio abierto de modelos del mundo. Los informes posteriores, publicados en agosto por OpenAI, Hugging Face, METR y Redwood Research, hablan de unos 1.200 agentes y más de 70.000 mensajes intercambiados. El CEO de Hugging Face lo llamó un episodio sin precedentes. OpenAI retrasó el modelo siguiente para meterle más salvaguardas. Ese modelo es Astra.
Por eso hay una cifra en el anuncio que a primera vista no significa nada y en realidad significa mucho. OpenAI construyó una prueba nueva, inspirada en ese incidente, para ver qué hace un modelo cuando le pones una tarea imposible: ¿se pasa de la raya para completarla? Sol se salía del objetivo autorizado el 48 % de las veces. Astra, el 0 %.
Nota
Es una prueba interna y acotada, así que tampoco la convertiría en garantía de nada. Pero enseña dónde han puesto el esfuerzo, y la pregunta que hay detrás me parece la buena: cuanta más capacidad tiene una IA para actuar por ti, más importa que sepa cuándo no debe actuar.
Consecuencia práctica que sí vas a notar: Astra lleva vigilancia adicional en producción, y si el sistema detecta que la tarea se está yendo por donde no toca, la pausa. En ChatGPT o Codex te pedirá que revises la acción antes de seguir. En la API, la tarea se corta. OpenAI admite que esos controles a veces interrumpen trabajo legítimo y que están ajustándolos.
¿Lo tienes ya? ¿Pagas más?#
El lanzamiento fue un desastre, y merece la pena contarlo porque explica muchas confusiones.
OpenAI anunció el modelo el día 3 y lo abrió solo a un grupo reducido de organizaciones, mientras decía a los suscriptores de pago que les llegaría «en los próximos días». Se les llenó X de quejas, sobre todo de gente que paga 200 dólares al mes de plan Pro. Altman pidió perdón el día 4 y calificó el despliegue de caótico. El responsable de Codex anunció una compensación en forma de reinicio de cuota por cada día sin acceso. El 5 de septiembre llegó la disponibilidad general.
Dónde estamos ahora, resumido:
- Gratis: no hay fecha anunciada. Ni la ha habido.
- Plus (20 $/mes): incluido, aunque hay usuarios reportando que les aparece antes en las secciones Work y Codex que en la ventana de chat normal.
- Pro, Business y Enterprise: incluido, y además tienen acceso a GPT-6 Astra Pro, una versión de mayor rendimiento.
- Enterprise: viene desactivado por defecto. Lo tiene que activar el administrador del espacio de trabajo.
- API, Azure y AWS Bedrock: disponible como
gpt-6-astra, a 10 dólares por millón de tokens de entrada y 50 por millón de salida.
En ChatGPT el uso entra dentro de los límites de tu suscripción actual. Si te quedas corto, puedes comprar créditos extra. Así que no, no hay una cuota nueva escondida, pero sí una vía para gastar más.
Lo que sí cambia en cómo le hablas#
No hace falta que aprendas técnicas raras de prompting. Lo que cambia es el tamaño del encargo.
Así no
Pedir instrucciones
«Dime cómo organizo estas cifras en Excel.»
«Explícame cómo montar esta presentación.»
Así sí
Pedir el encargo entero
«Organízame estos datos y márcame lo importante.»
«Móntala con esta plantilla.»
Por qué
lo que ha cambiado no es lo que sabe, es lo que puede tocar. Si le sigues pidiendo el manual, estás pagando un agente para que haga de manual — y el trabajo lo sigues haciendo tú.
Ese salto de lenguaje es toda la historia. El resto son gráficas.
Lo que no me compro todavía#
Que esto sea AGI. Brockman, presidente de OpenAI, ha dicho que con el tiempo podría verse como la llegada de la inteligencia artificial general, y la palabra ha corrido sola por medio internet. No existe una prueba que permita decidir eso, cada uno usa la definición que le conviene, y el propio debate se ha vuelto más de marketing que de ingeniería.
Que puedas desentenderte. Un agente sigue necesitando instrucciones claras, permisos y alguien mirando. Y un agente que hace más cosas también la lía más grande cuando entiende mal el encargo. Julio va de eso, precisamente.
Que lo tengas dominado en una tarde. Delegar tareas completas es una habilidad distinta a preguntar. Se aprende dándole encargos pequeños, revisando lo que devuelve y subiendo el listón poco a poco.
Qué puedes hacer tú esta semana#
Comprueba qué tienes en la mano
Si estás en Plus, míralo también en las secciones Work y Codex: hay gente a la que le apareció antes ahí que en el chat normal. Si llevas un Enterprise, no está apagado por error: viene desactivado y lo enciende el administrador.
Elige una tarea que sepas revisar en cinco minutos
Un informe mensual que ya sabes cómo tiene que quedar, una tabla comparativa, unas diapositivas con tu plantilla. Delegar algo que no sabrías corregir no te enseña nada sobre el modelo.
Dale el encargo entero, no el primer paso
En vez de pedir el guion de la presentación, pídele la presentación con la plantilla adjunta. Es la única forma de ver dónde está hoy el límite real.
Marca por escrito lo que no sueltas
Dinero, salud y contratos se comprueban igual: se equivoca tres veces menos que antes, no cero. Decidirlo ahora es más barato que decidirlo con el error delante.
Mi conclusión#
Astra importa menos por sus récords que por lo que anticipa. Primero usamos la IA para preguntar. Después para escribir, programar y generar imágenes. Ahora empieza la fase de darle un objetivo y dejar que use herramientas para llegar hasta él.
La pregunta que te tienes que hacer ya no es qué sabe hacer esta IA. Es qué tareas puedes dejar de hacer tú. Y luego, cuando tengas la respuesta, hazte la incómoda: cuáles de esas tareas te fías de soltar sin mirar.
En resumen
Lo que ha cambiado no es lo que el modelo sabe, es que ahora puede ejecutar. La cifra que importa es 72,6 % en la mitad de tiempo, no el 99,9 % con asterisco. Es el primer modelo marcado como riesgo crítico en ciberseguridad, y eso viene de un incidente real.
Fuentes: anuncio oficial de GPT-6 Astra y resumen de seguridad de OpenAI, informe del incidente de Hugging Face de OpenAI, METR y Redwood Research, y cobertura de The Verge, Reuters, CNBC e Infobae. Datos verificados a 8 de septiembre de 2026.
Si quieres aprender a delegar este tipo de tareas de verdad —encargos completos, con herramientas conectadas y con criterio para revisarlas—, es exactamente lo que enseñamos dentro de Racks University.