Claude Opus 5.5 vs GPT-6 Astra: la pelea ya no es por quién responde mejor
Anthropic lanzó Claude Opus 5.5 pocas semanas después de GPT-6 Astra. Los nuevos modelos llevan la competencia hacia programación autónoma, investigación, uso de herramientas, seguridad y, sobre todo, cuánto trabajo real pueden terminar por cada dólar.
Septiembre de 2026 nos dejó una comparación bastante buena para entender hacia dónde se está moviendo la inteligencia artificial.
OpenAI presentó GPT-6 Astra el 3 de septiembre. Diecinueve días después, Anthropic respondió con Claude Opus 5.5.
Después de revisar ambos lanzamientos, lo que más me interesa no es decidir cuál responde mejor una pregunta. Eso ya me parece una comparación demasiado básica.
La batalla ahora está en otra parte: cuánto trabajo puedes delegarle a un modelo, durante cuánto tiempo puede hacerlo y cuánto te cuesta que termine la tarea.
Dos modelos pensados para trabajar
GPT-6 Astra es el modelo más capaz que OpenAI ofrece actualmente para trabajos complejos de principio a fin.
Tiene una ventana de contexto de 1.05 millones de tokens y permite hasta 128,000 tokens de salida. OpenAI lo posiciona para razonamiento complejo, programación, investigación, manejo de computadora y creación de documentos.
Claude Opus 5.5 llega con una filosofía parecida, aunque Anthropic está poniendo mucho énfasis en la eficiencia.
La compañía asegura que el nuevo modelo necesita menos pasos y menos tokens para resolver muchas tareas que Opus 5.
Eso parece un detalle técnico hasta que dejamos trabajando un agente durante horas.
Entonces cada llamada a una herramienta, cada razonamiento y cada token empieza a aparecer en la factura.
Los números interesantes
Comparar benchmarks entre fabricantes siempre requiere cuidado porque las configuraciones, herramientas y niveles de razonamiento pueden cambiar.
Aun así, hay pruebas donde tenemos resultados comparables.
| Prueba | Claude Opus 5.5 | GPT-6 Astra |
|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 57.9% |
| FrontierCode v1.1 | 54.4% | 53.3% |
| AutomationBench | 40.0% | 41.4% |
| Humanity's Last Exam con herramientas | 67.7% | 57.2% |
| Terminal-Bench Science | 58.7% | 64.6% |
Fuente: Anthropic, Claude Opus 5.5 y OpenAI, GPT-6 Astra.
No veo aquí un modelo aplastando al otro en absolutamente todo.
Veo especialización.
Claude tiene resultados especialmente interesantes en programación agéntica y trabajo profesional. Astra muestra mucha fuerza en investigación científica, automatización y otras tareas donde el agente necesita interactuar con herramientas y entornos.
Y eso me parece más interesante que declarar un ganador universal.
Claude hizo una migración de 680,000 líneas
Anthropic mostró un caso que me llamó bastante la atención.
Uno de sus evaluadores utilizó Opus 5.5 para completar una migración sobre 680,000 líneas de código en menos de un día.
Otro evaluador lo dejó trabajando durante más de 18 horas sin supervisión sobre una tarea que involucraba seis repositorios.
También realizaron una prueba sobre una base de aproximadamente 200,000 líneas. Opus 5.5 completó la auditoría y las correcciones en menos de tres horas; Opus 5 necesitó más de 20.
Son pruebas proporcionadas por Anthropic y sus evaluadores, así que las tomaría como ejemplos de capacidad y no como garantía de que obtendremos esos mismos resultados en cualquier proyecto.
Pero muestran perfectamente hacia dónde va esto.
Hace relativamente poco evaluábamos una IA preguntando:
¿Puede escribir esta función?
Ahora empezamos a preguntar:
¿Puede encargarse de esta migración completa mientras yo hago otra cosa?
Ese cambio es enorme.
El precio puede terminar siendo más importante que el benchmark
Aquí Anthropic hizo un movimiento agresivo.
Claude Opus 5.5 cuesta:
- $4 USD por millón de tokens de entrada.
- $20 por millón de tokens de salida.
- $0.20 por millón de tokens leídos desde caché.
GPT-6 Astra cuesta:
- $10 USD por millón de tokens de entrada.
- $50 por millón de tokens de salida.
- $1 por millón de tokens de entrada almacenados en caché.
Además, OpenAI aplica precios superiores cuando una solicitud supera los 272,000 tokens de entrada.
Sobre el papel, Astra cuesta 2.5 veces más por token de entrada y salida.
Pero tampoco podemos simplemente multiplicar tokens y declarar un ganador.
Un modelo más caro que termine una tarea utilizando menos intentos podría acabar costando menos.
Por eso me gusta mucho más una métrica que veremos cada vez más: costo por tarea terminada correctamente.
Anthropic ya está utilizando precisamente ese argumento. Según sus propias mediciones, Opus 5.5 puede igualar o superar resultados de Astra en determinadas pruebas de programación utilizando una fracción del costo por tarea.
Eso habrá que comprobarlo con cargas reales.
OpenAI tiene una carta bastante seria: Astra
Sería un error interpretar el lanzamiento de Anthropic como si Astra hubiera quedado viejo tres semanas después.
Hay capacidades del modelo de OpenAI que llaman mucho la atención.
Una de ellas es investigación científica.
En Terminal-Bench Science 0.1, Astra alcanza 64.6%, frente al 58.7% reportado para Opus 5.5.
OpenAI también reporta avances fuertes en uso de computadora, navegación, matemáticas y resolución de problemas en entornos desconocidos.
Pero hay un dato todavía más llamativo.
GPT-6 Astra es el primer modelo que OpenAI clasifica en nivel Critical para capacidades de ciberseguridad dentro de su Preparedness Framework.
Eso significa que la empresa considera que, teniendo las herramientas y el acceso adecuados, el modelo puede descubrir vulnerabilidades previamente desconocidas y desarrollar maneras de explotarlas en sistemas protegidos sin necesitar instrucciones humanas para cada paso.
Eso es impresionante.
También explica por qué OpenAI está poniendo tantas restricciones alrededor del modelo.
Anthropic también está endureciendo la seguridad
Y aquí aparece una coincidencia interesante entre las dos compañías.
Anthropic afirma que Opus 5.5 es menos propenso a ejecutar acciones difíciles de revertir o salirse de los límites establecidos por el usuario.
También mejoró su resistencia contra ataques de prompt injection.
Hay una razón bastante obvia.
Los modelos anteriores principalmente hablaban.
Estos modelos actúan.
Pueden utilizar navegadores, terminales, aplicaciones, archivos y servicios externos.
Cuando un modelo tiene ese nivel de acceso, una equivocación deja de ser únicamente una respuesta incorrecta.
Puede convertirse en una acción incorrecta.
Por eso creo que veremos cada vez más trabajo alrededor de permisos, aislamiento, monitoreo y límites para agentes.
También cambió algo que normalmente ignoramos: la comunicación
Anthropic reconoce que una de las críticas a Opus 5 era su manera de comunicarse.
Opus 5.5 intenta poner primero la información importante, utilizar menos jerga y producir respuestas más fáciles de revisar durante sesiones largas.
Puede parecer cosmético.
Para mí no lo es.
Si voy a dejar un agente trabajando durante cuatro, diez o dieciocho horas, necesito entender rápidamente qué hizo, qué cambió y dónde encontró problemas.
La capacidad técnica sirve poco si necesito media hora para descifrar el reporte del agente.
Esto cambia cómo elegiría un modelo
Hace un año tenía sentido comparar modelos principalmente por inteligencia.
Ahora agregaría varias preguntas.
¿Cuánto cuesta terminar mi tarea?
No cuánto cuesta un millón de tokens.
Cuánto cuesta resolver el problema completo.
¿Cuánto puede trabajar sin intervención?
Un modelo excelente que necesita confirmación cada tres minutos puede resultar menos útil que otro ligeramente menos capaz que completa correctamente una tarea de dos horas.
¿Qué herramientas puede manejar?
Navegador, terminal, documentos, APIs y aplicaciones están convirtiéndose en parte del modelo práctico que utilizamos.
¿Qué pasa cuando algo sale mal?
Para mí esta será una de las preguntas más importantes de 2027.
Un agente inteligente también necesita saber cuándo detenerse.
Y todavía falta Sonnet 5.5
Anthropic tampoco terminó con este lanzamiento.
La compañía confirmó que Claude Sonnet 5.5 y Claude Haiku 5.5 llegarán en las próximas semanas.
Eso puede ser incluso más importante para muchos desarrolladores que Opus.
Los modelos intermedios suelen terminar siendo los que utilizamos en producción porque ofrecen una combinación más razonable entre velocidad, capacidad y costo.
Si Sonnet 5.5 hereda una buena parte de las mejoras de eficiencia de Opus 5.5, ahí podríamos tener una comparación todavía más interesante contra los modelos más económicos de OpenAI.
Lo que me llevo
Esta generación me deja cuatro cosas claras.
- La programación con IA está pasando de generación de código a delegación de proyectos.
- El costo por tarea terminada empieza a importar más que el precio aislado por token.
- Los agentes pueden trabajar durante periodos cada vez más largos sin supervisión.
- Seguridad y permisos empiezan a ser parte fundamental de la arquitectura.
Para quienes desarrollamos software, la última me parece especialmente importante.
Estamos empezando a darle a la IA acceso a las mismas herramientas que utilizamos nosotros.
Conclusión
GPT-6 Astra y Claude Opus 5.5 muestran dos aproximaciones interesantes a la misma dirección.
OpenAI está empujando muy fuerte las capacidades de frontera: ciencia, uso de computadora, investigación, ciberseguridad y tareas complejas completas.
Anthropic está atacando simultáneamente capacidad y eficiencia, intentando que un agente pueda trabajar más tiempo utilizando menos pasos, tokens y dinero.
Los benchmarks seguirán cambiando cada pocas semanas.
Lo que sí parece bastante más estable es la dirección.
Ya no estamos comparando asistentes que escriben código. Estamos empezando a comparar trabajadores digitales capaces de recibir una tarea, utilizar herramientas y pasar horas intentando terminarla.
Para mí, ahí está el cambio importante de estos lanzamientos.
Y antes de elegir uno para producción, probaría ambos con una tarea real del proyecto y mediría tres cosas: resultado correcto, tiempo total y costo final.
La IA debe servirnos, no decidir por nosotros
La IA puede ahorrar tiempo y abrir oportunidades, pero también puede concentrar poder y desplazar decisiones humanas. El reto no es frenar la tecnología, sino usarla con criterio.
Leer artículoMicrosoft Build 2026 y la nueva PC para developers con IA local
Microsoft Build 2026 mostró algo más grande que Copilot: una nueva generación de PCs para developers capaces de correr modelos de IA localmente y conectarse con la nube.
Leer artículoAgentes de IA en Windows: oportunidades y controles para empresas
Los agentes de IA prometen ejecutar más tareas. La oportunidad para las empresas está en diseñar procesos, permisos y controles antes de automatizar.
Leer artículo