
Hace una semana, GPT-6 Astra estaba reconstruyendo Manhattan calle por calle dentro de un motor de juego, asombrando a los usuarios con sus capacidades. Esta semana, la misma multitud está publicando capturas de pantalla preguntando a OpenAI qué le pasó a su modelo.
"Astra me parece significativamente más tonto hoy", publicó en X el popular desarrollador seudónimo synthwavedd. "Era solo cuestión de tiempo antes de la lobotomía post-lanzamiento. Una pena."
Es un estribillo familiar, con usuarios de IA acostumbrados a que sus chatbots y agentes favoritos de repente parezcan haber sido "nerfeados". La mayoría de las veces hay explicaciones razonables para la caída percibida en el rendimiento de estos modelos. Pero cuando suficientes personas empiezan a decir lo mismo al mismo tiempo, vale la pena examinar qué está sucediendo. Y las redes sociales en este momento están repletas de ejemplos de usuarios que rápidamente se están desencantando con GPT-6 Astra.
El desarrollador Pranjal Paliwal, quien previamente había elogiado el modelo, volvió y leyó el código que Astra le había escrito. No le gustó lo que encontró.
"No tenemos IGA", publicó. "Tenemos una regresión".
Dios, finalmente eché un vistazo al código que Astra escribió.
Me retracto de mis palabras.No tenemos IGA.
Tenemos una regresión.¡Cómo puede ser tan inteligente y tan tonto al mismo tiempo!
— Pranjal Paliwal (@betterclever) 11 de septiembre de 2026
IGA, abreviatura de inteligencia general artificial, es el término de la industria para una máquina que puede hacer esencialmente cualquier cosa que un humano pueda hacer cognitivamente. El propio presidente de OpenAI usó la palabra en el lanzamiento de Astra. Una semana después, uno de sus usuarios la está utilizando para describir lo contrario.
Las quejas comparten una forma similar. El desarrollador Pankaj Kumar enumeró los síntomas: respuestas más rápidas, peor calidad y la sospecha de que OpenAI "redujo el valor del jugo". La fundadora Saba preguntó directamente a OpenAI por qué ahora tiene que "simplificarlo" para que las tareas se realicen.
"Valor del jugo" no es un término oficial. Nadie lo ha definido. Pero es una taquigrafía que todos aquí entienden: la cantidad de esfuerzo computacional que el modelo dedica a pensar antes de responder, y la sospecha de que OpenAI bajó discretamente ese dial una vez que las demostraciones de lanzamiento cumplieron su cometido.
Algunas personas lo probaron correctamente. Salio y el investigador Md Ismail Sojal ejecutaron el mismo prompt idéntico en la versión de lanzamiento de Astra y en la versión actual, y ambos obtuvieron peores resultados de la actual.
La salida de GPT-6 Astra de hoy se ve peor.
GPT-6 Astra en el lanzamiento vs GPT-6 Astra hoy.- Tibo dijo que tienen capacidad computacional
- Mismo prompt, la misma configuración.
- Evan ejecuté el mismo prompt exacto en GPT-6 Astra en el lanzamiento y de nuevo hoy.
- La diferencia es mayor de lo que esperaba...— Md Ismail Šojal 🕷️ (@0x0SojalSec) 11 de septiembre de 2026
Otros simplemente están volviendo atrás. Dax Raad, quien desarrolla la herramienta de codificación Opencode, dijo que su equipo ha vuelto al predecesor de Astra, GPT-5.6 Sol, porque el gasto se duplicó por desventajas que no valían la pena. El usuario de ChatGPT Mustafa Sahinli lo expresó de forma más contundente: Astra ahora le hace sentir como Claude Opus 4.6 "después de 1 semana de su lanzamiento", un dardo a la propia reacción negativa post-lanzamiento de Anthropic.
Sin embargo, no todos piensan que OpenAI ha "nerfeado" intencionadamente su modelo más reciente. El usuario seudónimo Antikythera publicó la refutación más detallada del conjunto, argumentando que la cronología es inversa.
"Es tan tonto como lo fue en el lanzamiento", escribió Antikythera. "El modelo es bueno, pero tiene muchos problemas. Es perezoso. Escribe como un adicto a los puntos... la gente estaba sobreexcitada en la semana de lanzamiento, ahora han tenido tiempo de probarlo y ver sus errores".
En otras palabras: nada cambió. Simplemente dejaste de estar deslumbrado el tiempo suficiente para darte cuenta de que el modelo siempre fue un poco adicto a los puntos.
El fundador de T3Chat, Theo, tiene una idea algo similar: Astra es en realidad más inconsistente que Claude Fable, por lo que a veces puede producir código excepcional o francamente estúpido. Lo que parece estar sucediendo es una oleada de usuarios publicando los resultados más tontos con mayor frecuencia ahora que la luna de miel ha terminado.
GPT-6 Astra ha hecho cosas increíbles que nunca pensé que un modelo podría hacer. También ha hecho algunas de las cosas más estúpidas que he visto hacer a un modelo.
En general, Fable 5.1 simplemente hace lo que le pido. pic.twitter.com/X2UwI7tDnD
— Theo - t3.gg (@theo) 8 de septiembre de 2026
Esto tampoco es nuevo. El último buque insignia de OpenAI, GPT-5.6 Sol, pasó por el mismo ciclo en julio, cuando los usuarios informaron que su modo de razonamiento superior se había vuelto superficial de la noche a la mañana. El ejecutivo de OpenAI, Tibo Sottiaux, negó haberlo debilitado deliberadamente, al tiempo que confirmó que la compañía había estado experimentando con el esfuerzo de razonamiento, la configuración que controla cuántos pasos un modelo "piensa" antes de responder.
Una respuesta resumió la broma recurrente: los laboratorios cerrados lanzan un modelo, y este "contrae algún tipo de enfermedad unos días después y de repente se vuelve más tonto". Otro ofreció la teoría del cínico en una sola línea: "Probablemente se cuantifican para no quemar tanto dinero de las empresas".
esta vez eran tontos al llegar, sin embargo. Le di a Astra exactamente una tarea, que falló estrepitosamente, 5.6 SOL en xHigh hizo la limpieza...
— Physicist 🏖️ 💻 (@heisenberg_btc) 11 de septiembre de 2026
Cuantificar un modelo significa reducir la precisión de sus cálculos internos para reducir costos, a menudo a expensas de la exactitud. OpenAI nunca ha confirmado haber hecho eso a propósito con un modelo ya lanzado.
OpenAI aún no ha emitido una declaración al estilo Sol sobre Astra. El modelo sigue siendo el primero de la compañía en cruzar lo que denomina el umbral crítico de riesgo de ciberseguridad, lo que significa que puede encontrar y encadenar vulnerabilidades de software desconocidas sin orientación humana, una capacidad restringida a defensores verificados bajo el programa Daybreak de OpenAI.
Más tonto o no, todavía cuesta $10 por millón de tokens de entrada y $50 por millón de tokens de salida, 2.5 veces lo que Sol cobraba en su lanzamiento.








