InicioCentro de noticias de LBank
El prompt de IA más sencillo acaba de superar meses de meticulosa ingeniería de prompts para diseño de juegos
dumbest-ai-prompt-claude-beat-careful-game-design
El prompt de IA más sencillo acaba de superar meses de meticulosa ingeniería de prompts para diseño de juegos
El desarrollador le dijo a Claude Opus 5 que fuera "absolutamente perfecto" y dejó el resto en manos del modelo; los resultados resultaron ser absolutamente perfectos, para un modelo de IA.
2026-07-28 Fuente:decrypt.co

En resumen

  • Claude Opus 5 “creó de golpe” un juego de disparos en primera persona con una instrucción tan simple, y resultados tan impresionantes, que la gente tiene dificultades para creerlo.
  • Otros han vuelto a ejecutar la instrucción y los resultados son consistentes.
  • Matt Shumer, el creador del juego asistido por Claude, llama al método un Gauntlet Loop: darle a un agente un objetivo real que superar, dividir el trabajo entre críticos nuevos y nunca dejar que el constructor califique su propio trabajo.

Solo dos días después del lanzamiento de Claude Opus 5, el inversor en IA y ex CEO de HyperWrite, Matt Shumer, publicó un video de un juego de disparos en primera persona completamente jugable que el modelo había construido enteramente por sí mismo.

"Claude Opus 5 creó este juego de golpe", escribió, añadiendo que ningún activo externo se incluyó en la construcción.

Ahora, podrías pensar que una salida de tan buena calidad requirió una instrucción larga, detallada y cuidadosa para guiar a los modelos de IA a través de las complejidades de construir un juego de disparos en primera persona pulido.

Piénsalo de nuevo.

Claude Opus 5 one-shotted this game.

EVERYTHING you see in this demo is custom code... not a single external asset was used.

AI games are going to be amazing.

(sound on) pic.twitter.com/zc7C61kgv1

— Matt Shumer (@mattshumer_) July 25, 2026

La instrucción detrás de esto consistió en tres párrafos cortos, publicados íntegramente en GitHub. Le indicaba a Opus 5 que construyera un juego de disparos al nivel de los juegos más recientes de Call of Duty, que distribuyera subagentes —trabajadores que cada uno tiene su propia memoria separada y un trabajo específico— para abordar las piezas individualmente, y que siguiera iterando en cada pieza con un crítico separado y exigente hasta que se comparara favorablemente con imágenes reales de Call of Duty en una comparación a ciegas. El resultado, según la instrucción, debía ser “absolutamente perfecto”.


Esto es una inversión de cómo los ingenieros de prompts han enseñado a la gente a trabajar. El consejo durante el auge del "vibe-coding" era especificar criterios en lugar de adjetivos: decir qué significa "bueno" en lugar de solo pedirlo. Qué debería considerar el código en lugar de decir "AAA".

La versión de Shumer hace casi lo contrario, pidiendo a sus propios subagentes que estén "completamente asombrados", y dejando la definición real a un crítico que Opus 5 construyó para sí mismo.

Eso fue casi todo el resumen. Shumer escribió más tarde que nunca especificó el renderizador, enumeró los sistemas del juego, o definió qué debía incluir la "calidad AAA". Ha comenzado a llamar a este enfoque un Gauntlet Loop: entregar a un agente un objetivo real e inspeccionable en lugar de una instrucción vaga, dejar que divida el trabajo en pequeñas piezas y dirigir cada pieza a través de un crítico que nunca ve el propio razonamiento del constructor para sus elecciones.

Dos características de Claude Code implementan ese ciclo. Los subagentes se activan en ventanas de contexto aisladas con sus propias instrucciones y acceso a herramientas, de modo que un crítico que evalúa el modelo del arma no hereda las excusas del constructor sobre por qué se ve de esa manera. Ultracode es una configuración de Claude Code que impulsa al modelo a su máximo esfuerzo de razonamiento y le permite escribir su propio plan de orquestación, distribuyendo el trabajo entre hasta 16 agentes a la vez, con un límite de 1.000 por ejecución.

La habilidad /loop integrada de Anthropic, diseñada para ciclos repetidos de arreglar-probar-ajustar, fue lo que evitó que la ejecución se detuviera en el momento en que el juego se veía decente. Shumer nunca especificó un número de rondas. Dejó que el crítico siguiera señalando una nueva deficiencia y mantuvo al constructor persiguiéndola durante horas antes de que él mismo cerrara la sesión.

La compilación final se ejecuta en Three.js y WebGL2 puro, con aproximadamente 55.000 líneas de código distribuidas en 11 subsistemas. Cada textura, malla, animación y sonido se genera dentro del navegador en el momento de la carga; sin modelos descargados, HDRIs, archivos de imagen o archivos de audio. El propio registro de crítico publicado por Shumer muestra que la puntuación subió de 3,59 sobre 10 a poco más de 5, todavía por detrás del juego real en cada ronda.

Los escépticos asumieron horas de codificación manual oculta, así que Shumer publicó la instrucción completa y el código. Fue entonces cuando comenzaron los imitadores.

El mismo truco, tres constructores diferentes

James Altucher, el ex gestor de fondos de cobertura y podcaster, ejecutó la misma instrucción e informó haber pasado "un poco más de diez horas" y aproximadamente 1,3 millones de tokens en Opus 5 para lograrlo. Su creación, Operation Blackout, se puede jugar gratis en el navegador y se ve impresionante.

Puedes jugar a ese juego aquí.

El desarrollador de Prompt Silo dirigió la misma solicitud al buque insignia rival de OpenAI, publicando "Sol 5.6 Ultra con la misma instrucción"—siendo Sol el nivel superior de la familia de tres modelos GPT-5.6 que OpenAI puso a disposición general el 9 de julio junto con las versiones más económicas Terra y Luna.

Sol 5.6 Ultra with same prompt. pic.twitter.com/89EhfiCvg0

— Rich · Atom Tan Studio (@atomtanstudio) July 26, 2026

El desarrollador Leon Lin intentó el movimiento opuesto, optando por la instrucción detallada habitual. En lugar de copiar la versión corta de Shumer, se propuso "hacer ingeniería inversa de una instrucción para este juego", produciendo un documento de unas 20 secciones que detalla todo, desde físicas de ragdoll hasta mapas de sombras en cascada. Alimentó eso en Cursor usando Opus 5 normal con alto esfuerzo, sin subagentes ni ultracode, y el resultado —un juego de disparos callejero llamado Dust Corridor— también se juega en el navegador y también se ve genial.

Ninguna de las construcciones subsiguientes ha superado la prueba ciega que Shumer realizó en su propio proyecto. Su registro de crítico todavía muestra que el Call of Duty real gana cada ronda que registró —el listón que Altucher y Atom Tan Studio persiguen con su instrucción exacta de tres párrafos, y el que Leon Lin persigue con aproximadamente 20 secciones propias.

¿Cuánto de esto es realmente nuevo?

Las herramientas de codificación agentiva como Claude Code escriben software de la misma manera que lo haría un ingeniero junior supervisado: leen archivos, ejecutan código, observan las capturas de pantalla que generan y asignan piezas del trabajo a subagentes y críticos que comprueban el resultado con un objetivo establecido. Ese ciclo es real, y el Gauntlet Loop de Shumer es una forma genuina de estructurarlo. Nada de esto, por sí solo, demuestra que el modelo diseñó un juego desde la imaginación en lugar de recombinar patrones de código que ya había absorbido.

Three.js ofrece sus propios controles de cámara de bloqueo de puntero como ejemplo oficial, y ese patrón base —mirada con el ratón, movimiento WASD, raycasting para disparos— ha sido bifurcado y tutorializado en GitHub, gists y foros de desarrolladores durante más de una década. Un modelo de codificación entrenado en repositorios públicos casi con certeza ha visto cientos, si no miles, de juegos de disparos casi idénticos antes de leer la instrucción de Shumer.

Eso no hace que Claude of Duty sea falso, pero hace que la afirmación de "construido desde cero" sea más difícil de acreditar por completo, así que toma esos resultados con un grano de sal.

Los investigadores que estudian los modelos de generación de código tienen un nombre para el problema más amplio: contaminación de datos, que ocurre cuando un modelo tiene éxito en una tarea principalmente porque ejemplos casi idénticos ya estaban en sus datos de entrenamiento, no porque razonó algo nuevo.

Ninguna de las construcciones de juegos de disparos en primera persona publicó una verificación de ese tipo de contaminación. El propio repositorio de Shumer sí contiene la propia creatividad de Claude, si es justo llamarlo así. Esa es una razón para leer "creó de golpe un juego AAA" como un agente capaz trabajando dentro de uno de los géneros más documentados en programación, no como prueba de que una IA diseñó un juego de disparos sin arte previo en el que apoyarse.