¿Me paso de Claude Code a Codex? La tabla completa: GPT-6 Astra vs Claude Fable 5.1 vs Claude Opus 5
GPT-6 Astra vs Fable 5.1 vs Opus 5 prueba a prueba: precios, regresiones, quién dice cada cifra y veredicto por caso de uso.
- #modelos
- #claude-code
- #openai
Usas Claude Code y hoy te pica la duda: ¿me paso a Codex por GPT-6 Astra? Aquí tienes la respuesta partida en dos: lo que dice OpenAI de su propio modelo y lo que mide Artificial Analysis por su cuenta. Cada cifra lleva su fuente. Donde no hay dato público verificado va un guion, no un número inventado. Y al final, el veredicto según lo que hagas tú, no según el bando.
La tabla, prueba a prueba
Los tres modelos que importan si estás en Claude Code: GPT-6 Astra (OpenAI, 3-sep-2026), Claude Fable 5.1 (el frontier de Anthropic) y Claude Opus 5 (Anthropic, 24-jul-2026, el “casi el top a mitad de precio”).
| Prueba | Qué mide | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5 | Fuente |
|---|---|---|---|---|---|
| Coding Agent Index | Rendir como agente de código dentro de su herramienta (Codex, Claude Code) | 67 | 70 (en Claude Code) | a la par de Astra, sin cifra pública | Artificial Analysis (análisis independiente) |
| Intelligence Index | Inteligencia general: media de pruebas de razonamiento, código y conocimiento | 61 (igual que GPT-5.6 Sol) | +5 sobre Astra (≈66) | — | Artificial Analysis (análisis independiente) |
| Terminal-Bench 4.0 | Tareas reales en una terminal: instalar, configurar, arreglar por línea de comandos | 57,7% | 55,8% | — | OpenAI (anuncio 3-sep-2026) |
| OSWorld 2.0 | Manejar un ordenador: abrir apps, clicar, terminar tareas de escritorio | 72,6%, con ~47% menos tiempo por tarea que Sol | — | supera a Fable 5, sin cifra pública | OpenAI (3-sep-2026) · Anthropic (24-jul-2026) |
| ExploitBench | Encontrar y explotar vulnerabilidades de seguridad | 100% | — | — | OpenAI (anuncio 3-sep-2026) |
| FrontierMath Tier 4 | Matemáticas de nivel investigación | 98% | — | — | OpenAI (anuncio 3-sep-2026) |
| ARC-AGI-3 | Razonar sobre problemas que no ha visto nunca | 99,9% | — | 3x el siguiente mejor (julio), sin cifra pública | OpenAI (3-sep-2026) · Anthropic (24-jul-2026) |
| CursorBench 3.2 | Programar dentro de Cursor | — | referencia | dentro del 0,5% de Fable 5, a mitad de coste | Anthropic (24-jul-2026) |
| Tasa de alucinación | Cuántas veces se inventa la respuesta en vez de decir que no la sabe | 51% (venía del 92%), a máximo esfuerzo, con +4 puntos de exactitud | — | — | Artificial Analysis (análisis independiente) |
| GDPval-AA v2 | Tareas de trabajo real con valor económico | −80 Elo respecto a Sol (empeora) | — | — | Artificial Analysis (análisis independiente) |
| SciCode | Programar soluciones a problemas científicos | −2 a −3 puntos respecto a Sol (empeora) | — | — | Artificial Analysis (análisis independiente) |
| τ³-Banking | Agente con reglas y herramientas atendiendo un caso de banca | −2 a −3 puntos respecto a Sol (empeora) | — | — | Artificial Analysis (análisis independiente) |
| Razonamiento de contexto largo | Mantener el hilo con mucho texto de entrada | −2 a −3 puntos respecto a Sol (empeora) | — | — | Artificial Analysis (análisis independiente) |
| AA-Briefcase | Tareas largas, de muchos pasos | +80 puntos respecto a Sol | — | — | Artificial Analysis (análisis independiente) |
| Eficiencia en tokens | Cuántos tokens gasta para resolver lo mismo | 70% más eficiente que Sol | — | — | Artificial Analysis (análisis independiente) |
— = sin dato público verificado a fecha de esta tabla. Ojo con el referente: las filas de regresiones, tokens y AA-Briefcase comparan Astra con GPT-5.6 Sol, su antecesor, no con Claude. Las dos primeras filas sí enfrentan Astra con Fable 5.1 directamente.
Precio y coste: mira contra quién se compara
| Modelo | Entrada / salida (por millón de tokens) | Lectura | Fuente |
|---|---|---|---|
| GPT-6 Astra | $10 / $50 | 2,5x el precio de GPT-5.6 Sol. A máximo esfuerzo, ~75% más caro por tarea que Sol | Artificial Analysis (análisis independiente) |
| Claude Opus 5 | $5 / $25 | El mismo precio que Opus 4.8. Anthropic lo presenta como “la mitad de precio” que Fable 5 | Anthropic (24-jul-2026) |
| Claude Fable 5.1 | — | Sin precio verificado para esta tabla | — |
Y la fila que parece contradecir la anterior hasta que miras el referente:
| Comparación | Dato | Referente | Fuente |
|---|---|---|---|
| Coste por tarea de código | Astra cuesta menos de la mitad | frente a Fable 5 | OpenAI (dato propio, sin verificación independiente) |
| Coste por tarea a máximo esfuerzo | Astra cuesta ~75% más | frente a GPT-5.6 Sol | Artificial Analysis (análisis independiente) |
Las dos cosas pueden ser verdad a la vez porque cada una se compara con un modelo distinto. Si vienes de Claude Code, la cifra que te afecta es la primera. Y es justo la que solo dice OpenAI.
Dónde lo tienes:
- Astra: ChatGPT Plus, Pro, Business y Enterprise, API y AWS. Despliegue por fases; el programa de ciberseguridad va primero y por solicitud.
- Opus 5: API, Claude Max (es el modelo por defecto), Claude Pro, Claude Code y Claude Cowork.
Lo que empeora (y OpenAI no cuenta)
Medido por Artificial Analysis, respecto a GPT-5.6 Sol:
- GDPval-AA v2: −80 Elo. Tareas de trabajo real con valor económico. Es la caída más gorda.
- SciCode: −2 a −3 puntos. Código para problemas científicos.
- τ³-Banking: −2 a −3 puntos. Agente con reglas y herramientas en un caso de banca.
- Razonamiento de contexto largo: −2 a −3 puntos. Mantener el hilo con mucho texto de entrada.
Un modelo nuevo no mejora en todo. Este, en cuatro pruebas, retrocede respecto al anterior.
Lo que sí mejora de verdad
- Manejar el ordenador: OSWorld 2.0 al 72,6%, con ~47% menos tiempo por tarea que Sol. (OpenAI)
- Terminal: Terminal-Bench 4.0 al 57,7% frente al 55,8% de Fable 5.1. Casi dos puntos. (OpenAI)
- Alucina menos: del 92% al 51% a máximo esfuerzo, con 4 puntos más de exactitud. (Artificial Analysis)
- Sesiones largas en Codex: mantiene notas entre ventanas de contexto en vez de recomprimir todo en un resumen, y las ventanas anteriores siguen siendo buscables. Para depurar durante horas, es lo que evita perder el porqué del primer intento fallido. (OpenAI)
- Velocidad en Codex: su agente va 1,9x más rápido que con Sol en Mind2Web. (OpenAI)
- Tokens: 70% más eficiente que Sol. (Artificial Analysis)
- Tareas largas: +80 puntos en AA-Briefcase. (Artificial Analysis)
Veredicto por caso de uso
- Agentes de código en Claude Code → hoy, sin motivo para cambiarte. 70 de Fable 5.1 frente a 67 de Astra, y cinco puntos más de inteligencia general. Astra queda a la par de Opus 5 y Fable 5, no por encima.
- Manejar el ordenador, automatizar el escritorio → Astra da un salto real: 72,6% y casi la mitad de tiempo por tarea. Ojo: Opus 5 también supera a Fable 5 en esta prueba según Anthropic, y no hay comparación directa Astra-Opus 5 aquí.
- Terminal y tareas de sistema → Astra ligeramente por delante: casi dos puntos sobre Fable 5.1. Ventaja real, no abismo.
- Ciberseguridad → Astra, 100% en ExploitBench. Pero con acceso restringido, por fases y por solicitud. Puede que hoy ni te lo den.
- Ciencia y matemáticas → Astra: 98% en FrontierMath Tier 4 y 99,9% en ARC-AGI-3.
- Sesiones largas de depuración en Codex → mejora real por las notas entre ventanas de contexto. Es el argumento más sólido para probar Codex si tu trabajo son horas seguidas sobre el mismo bug.
- Pagas por token a máximo esfuerzo → mira el referente antes de decidir. Astra sale ~75% más caro por tarea que Sol (independiente) y menos de la mitad por tarea de código que Fable 5 (lo dice OpenAI). Haz la cuenta por tarea completa, no por token.
- Quieres lo más barato de Anthropic con casi el top → Opus 5: $5/$25, dentro del 0,5% de Fable 5 en CursorBench 3.2 y por encima de Fable 5 en OSWorld 2.0 a poco más de un tercio del coste.
- Trabajo de oficina con valor económico, código científico, banca con herramientas o contexto largo → Astra retrocede respecto a Sol. No hay cifra de Claude en esas pruebas para compararlo, así que tampoco es un argumento para cambiarte.
Sin bandos: Astra gana en unas cosas y pierde en otras. Lo que decide es lo que haces tú cada día.
Fuentes y fecha
- Cifras de OpenAI: anuncio de GPT-6 Astra del 3 de septiembre de 2026 → openai.com
- Cifras independientes: análisis de Artificial Analysis publicado tras el lanzamiento → artificialanalysis.ai
- Cifras de Opus 5: Anthropic, 24 de julio de 2026 → anthropic.com/news/claude-opus-5. Guía propia: Opus 5: qué cambia, cuánto cuesta y cómo usarlo ya
Los índices de Artificial Analysis se actualizan. Esta tabla es una foto a 4 de septiembre de 2026: si la lees semanas después, revisa los números antes de decidir.
Regla de oro
Cambia de herramienta por lo que haces, no por el titular. Y cuando una cifra te impresione, pregunta dos cosas: contra quién se compara y quién la mide.
Sígueme para más trucos con Claude Code e IA → @pabloinpublic
Más recursos → pabloinpublic.com/recursos
o sígueme en Instagram → @pabloinpublic