
Los entusiastas de la IA están muy entusiasmados con un modelo de IA llamado Ox Alpha, que apareció en OpenRouter el 20 de agosto sin ningún nombre de empresa adjunto.
La descripción lo presenta como "un modelo de razonamiento diseñado para codificación, trabajo agéntico sostenido y cargas de trabajo de producción", construido por un proveedor externo que ha elegido permanecer en el anonimato durante la vista previa.
Es más, el misterioso modelo de IA ya supera a Claude Fable 5 de Anthropic y GPT-5.6 Sol de OpenAI en impresionantes benchmarks de codificación.
DeepSWE—un benchmark que mide la frecuencia con la que un agente de codificación resuelve correctamente problemas reales de GitHub en su primer intento, medido como un porcentaje de tareas superadas entre 113 tareas extraídas de 91 repositorios—muestra que Ox Alpha es competitivo frente a los mejores modelos.
El desarrollador Ben Davis ejecutó una muestra inicial de 10 tareas y logró que Ox Alpha obtuviera un 80% en la primera pasada, superando el 65% de Claude Fable 5 y el 52% de GPT-5.6 Sol. Ese número se volvió viral en un día, y versiones del mismo siguen circulando como si Ox Alpha tuviera una clara ventaja sobre ambos modelos.
I ran this thing through 10 tasks on DeepSWE (so there could be a ton of variance in it's real score, this is a subset), but uh...
gpt-5.6-sol: 52%
fable: 65%
whatever the hell this is: 80% (was a near miss on the "x"s so actually over 80%)I am very confused https://t.co/VfH6n5i7xc pic.twitter.com/NdDSTjoHLj
— Ben Davis (@davis7) August 21, 2026
Hasta el 22 de agosto, Ox Alpha aún no tenía entrada en Artificial Analysis ni en LMSys Arena.
El modelo es de uso gratuito, lee hasta aproximadamente 1 millón de tokens en una sola ventana de contexto y acepta texto, imágenes y video como entrada mientras devuelve texto. También admite la invocación de herramientas y funciones, aunque su salida JSON no está validada por esquema, una brecha real para los desarrolladores que construyen agentes que esperan respuestas estructuradas.
OpenCode dijo que su ruta podría manejar 100 billones de tokens al día; Nous Research, ofreciendo el modelo de forma gratuita a través de su propio portal, afirmó una capacidad de 1 cuatrillón. Los tokens son la unidad básica de información que un modelo puede manejar, y un rendimiento como este lo pone a la par de los modelos más utilizados y capaces del mercado actual.
Tales cifras facilitan la conclusión de que el modelo es tan bueno que esperan mucho uso y el proveedor tiene suficiente infraestructura para soportar la carga.
Ox Alpha (stealth model) is free for the next week
- 1M Context
- Multi-modal
- Zero Data RetentionGenerous rate limits, near unlimited usage
We have capacity for 100T tokens per day, lets see what you can do
— OpenCode (@opencode) August 20, 2026
El CEO de Stripe, Patrick Collison, cuya empresa acordó el 19 de agosto adquirir OpenRouter, calificó a Ox Alpha como "muy impresionante" en una publicación en X. Esa única línea de un conocido ejecutivo tecnológico ayudó a impulsar el modelo a una conversación más amplia a las pocas horas de su lanzamiento.
$ ori --model stealth/ox-alpha
It's very impressive. https://t.co/LRISKwKTOL
— Patrick Collison (@patrickc) August 21, 2026
Nadie se ha presentado para reclamar su autoría. El analista de IA Andrew Curran publicó el viernes que la gente "parece menos segura de nada" sobre el origen de Ox Alpha.
A medida que el modelo crecía en popularidad, el juego de las adivinanzas se dividió rápidamente. Los desarrolladores propusieron la familia MAI no lanzada de Microsoft, la línea MiMo de Xiaomi, DeepSeek, Qwen de Alibaba e incluso Gemini de Google —suficiente gente apostó por Gemini como para que un desarrollador bromeara con que Google estaba usando un modelo sigiloso de la competencia como marketing para el suyo. La mayoría de esos candidatos no sobrevivieron al contacto con la evidencia.
MiMo v2.5 de Xiaomi acepta entrada de audio, una característica principal que Ox Alpha rechaza rotundamente. DeepSeek nunca ha lanzado capacidad de video y publica pesos abiertos en lugar de ejecutar vistas previas sigilosas. Google y Qwen usan diferentes tokenizadores y codificadores de video por completo, por lo que es difícil establecer un vínculo sólido con esos modelos.
Lo que queda apunta a la familia de modelos de Zhipu AI. La identificación independiente de huellas digitales coincidió con el tokenizador de Ox Alpha con GLM-5.3 en todas las pruebas normalizadas y su gasto de tokens de video con GLM-5V-Turbo exactamente en cuatro clips separados, y comparte los errores distintivos y el comportamiento de rechazo de audio de GLM.
Ox Alpha's tokenizer is one for one identical to GLM's. No other lab's tokenizer gets past 4/11 when it comes to tokenizer similarity.https://t.co/3K25G4U2hX
(h/t: @sushsrinivasan)(3/n) pic.twitter.com/dNwwZmCYZ7
— Ananay (@ananayarora) August 21, 2026
Sin embargo, un detalle complica una coincidencia clara. GLM-5.3 se lanzó el 14 de agosto como un modelo solo de texto, seis días antes de que Ox Alpha apareciera con soporte completo de video. Si la identificación de huellas dactilares se mantiene, es más probable que Ox Alpha sea una actualización multimodal no lanzada de esa línea que una copia idéntica, algo que los analistas han comenzado a llamar GLM-5.3 Flash.
Zhipu AI no ha dicho nada públicamente sobre Ox Alpha.
Un modelo sigiloso es un sistema de IA de clase frontera lanzado sin atribución a través de una plataforma de enrutamiento como OpenRouter, lo que permite a un laboratorio recopilar datos de uso en el mundo real antes de comprometerse con un lanzamiento público.
El patrón se ha vuelto rutinario para los laboratorios chinos. El propio Pony Alpha de Zhipu AI fue desenmascarado como GLM-5 en cinco días en febrero, Hunter Alpha de Xiaomi resultó ser MiMo-V2-Pro en marzo, y Meituan dejó que su Owl Alpha operara de forma anónima durante dos meses antes de confirmarlo como LongCat-2.0 en junio.
Ox Alpha está disponible ahora en OpenRouter bajo la ID de modelo stealth/ox-alpha, y a través de OpenCode, Cline y Nous Portal, todo de consulta gratuita. La nota de lanzamiento de OpenCode fijó la ventana gratuita en aproximadamente una semana desde el debut del 20 de agosto, lo que sitúa el probable corte alrededor del 27 de agosto; después de eso, si el patrón de los últimos cuatro modelos anónimos se mantiene, alguien podría finalmente ponerle un nombre.