--- title: "Claude Opus 5: qué cambia frente a Opus 4.8 y cuándo usarlo (2026)" description: "Claude Opus 5 mantiene el precio de Opus 4.8 y suma un context window de 1M tokens con thinking activado por default. Compará specs, SDK, benchmarks y los workloads donde conviene migrar." author: "Carlos García" published: 2026-07-25 updated: 2026-07-25 language: es human_url: "https://kiia.cloud/es/blog/opus-5-guia/" --- > **En 60 segundos:** Anthropic lanzó Claude Opus 5 el 24 de julio de 2026. Mantiene el precio de Opus 4.8, con $5/MTok input y $25/MTok output, suma un context window de 1M tokens, activa thinking por default y obtiene 97.00% en SWE-bench Verified. Sirve para coding agentic y knowledge work estándar cuando el 95% de Fable 5 no justifica pagar el doble. Buscá otra opción si necesitás self-hosting; elegí Fable 5 si querés la mayor capacidad de Anthropic sin importar el costo. [Claude Opus 5](https://www.anthropic.com/news/claude-opus-5) llegó dos meses después de Opus 4.8, lanzado el 28 de mayo de 2026. Con un ciclo tan corto, las preguntas prácticas importan más que el anuncio: qué cambió, qué sigue igual y qué workloads justifican una migración. > **Disclosure:** empecé a probar Opus 5 cuando abrió el acceso en Claude API el 24 de julio. El modelo tenía un día cuando escribí esto, así que no es una review de largo plazo. Las observaciones incluyen prompts que corrí contra Opus 5 y Opus 4.8 en paralelo, además de los datos publicados. ## Qué cambia frente a Opus 4.8 Anthropic describe Opus 5 como un modelo cercano a Claude Fable 5 por la mitad del precio. Hay tres cambios que importan en la práctica. ### 1. Coding agentic más fuerte Opus 5 lidera SWE-bench Verified con 97.00%, arriba de GPT-5.6 Sol (96.20%) y Fable 5 (95.00%). Frente al 88.60% de Opus 4.8, la mejora es de unos 8.4 puntos. En SWE-bench Pro, que usa problemas más largos y desordenados, Opus 5 llega a 79.2%; Fable 5 obtiene 80.0% y Mythos 5 lidera con 80.3%. La diferencia es más relevante en sesiones de varias horas y navegación de repos grandes. ### 2. Thinking habilitado por default Hasta Opus 4.8, extended thinking era opt-in: tenías que pasar `thinking={"type": "enabled", "budget_tokens": N}` en cada llamada. En Opus 5 viene activado por default, con un presupuesto adaptativo según la complejidad del prompt. Las tareas de varios pasos reciben así más razonamiento sin cambiar la API. ### 3. Agents long-running más estables Anthropic reporta mejoras en sesiones agentic de varias horas con poca supervisión. Junto con el context window de 1M, esto permite mantener más partes de un codebase grande en contexto sin compactación. Anthropic también reforzó sus safeguards de ciberseguridad después de conversaciones con reguladores gubernamentales sobre uso dual. En la práctica, quienes llegan desde Opus 4.8 pueden encontrar más rate limiting y más rechazos ante prompts ambiguos. ## Specs y pricing | Spec | Valor | | --- | --- | | Model ID | `claude-opus-5` | | Context window | 1M tokens (default y máximo) | | Max output | 128k tokens | | Thinking | Habilitado por default (presupuesto adaptativo) | | Input pricing | $5 / millón de tokens | | Output pricing | $25 / millón de tokens | | Disponibilidad | Claude API, Amazon Bedrock, Claude Pro/Max/Team/Enterprise | El pricing es idéntico al de Opus 4.8. Con estas tarifas, **Opus 5 cuesta la mitad que Fable 5** ($10/$50 MTok) y un cuarto de lo que cuesta Mythos 5, el tier superior a Fable. **Disponibilidad por plan:** - **Claude Max:** Opus 5 pasa a ser el modelo default. Si tenías Opus 4.8 configurado, migrá a `claude-opus-5` para aprovechar thinking default y mejor coding. - **Claude Pro:** Opus 5 es el modelo más fuerte disponible en el tier Pro. - **Claude Team y Enterprise:** disponible con la governance que ya tenés configurada. - **Claude API y Amazon Bedrock:** modelo `claude-opus-5` desde el 24 de julio. ## Cómo usar Opus 5 con el SDK de Anthropic El SDK de Python no cambió; solo cambia el `model` ID. Esta es la llamada mínima: ```python import os from anthropic import Anthropic client = Anthropic(api_key=os.environ.get("ANTHROPIC_API_KEY")) message = client.messages.create( model="claude-opus-5", # antes era "claude-opus-4-8" max_tokens=1024, messages=[ {"role": "user", "content": "Refactorizá este módulo para usar async/await en vez de callbacks."} ], ) print(message.content[0].text) ``` **Si venías usando extended thinking opt-in** (con `thinking={"type": "enabled", ...}`), podés sacar el bloque: Opus 5 ya piensa por default. Si querés controlar el presupuesto explícitamente, el parámetro sigue funcionando: ```python response = client.messages.create( model="claude-opus-5", max_tokens=16000, thinking={ "type": "enabled", "budget_tokens": 10000, # explícito si querés override del default adaptativo }, messages=[{"role": "user", "content": "Resolvé este problema de scheduling..."}], ) ``` **Streaming** funciona igual que antes, y el bloque `thinking` aparece en `response.content` con `type="thinking"` antes del bloque de texto final. Si tenías lógica que lee `thinking` blocks, no cambia nada. Para más detalles sobre el SDK y los demás endpoints, la [documentación oficial de Anthropic](https://platform.claude.com/docs/en/api/sdks/python) está al día. ## Qué muestran los benchmarks Datos públicos al 25 de julio de 2026, comparando los modelos más fuertes disponibles: **Coding (SWE-bench Verified):** | Modelo | Score | | --- | --- | | **Claude Opus 5** | **97.00%** | | GPT-5.6 Sol | 96.20% | | Claude Fable 5 | 95.00% | | Kimi K3 | 93.40% | | GPT-5.6 Luna | 93.00% | | Claude Opus 4.8 | 88.60% | | Grok 4.5 | 86.60% | Opus 5 lidera este benchmark de coding, pero la distancia con Fable 5 (1.8 puntos) y GPT-5.6 Sol (0.8 puntos) es chica. En coding agentic, diferencias de ese tamaño rara vez producen una mejora clara de productividad en tareas habituales. **SWE-bench Pro** (más largo y desordenado): Mythos 5 lidera con 80.3%, Fable 5 obtiene 80.0% y Opus 5 llega a 79.2%. Opus 5 está 0.8 puntos por debajo de Fable 5, y la diferencia empieza a aparecer en tareas de varias horas donde los problemas se acumulan. **Frontier-bench v0.1** (reasoning general): Opus 5 llega a un pass rate de 43.3%. No tengo los números exactos de Fable 5 y Mythos 5 en este benchmark al cierre del post, así que la comparación termina con el resultado publicado de Opus 5. **Lo que Opus 5 todavía no alcanza vs Fable 5:** - Reasoning puro en problemas muy largos (Fable 5 mantiene coherencia mejor en sesiones de 4+ horas) - Professional knowledge work donde la diferencia entre "97% correcto" y "99% correcto" es material (legal, medical research, análisis financiero fino) - Velocidad de inference bajo carga masiva (Fable 5 tiene infra más optimizada) En coding agentic y knowledge work estándar, **Opus 5 es indistinguible de Fable 5 para el 95% de los workloads**. La diferencia aparece solo en el último 5%, donde el costo extra de Fable 5 empieza a justificarse. ## Cuándo elegir Opus 5 y cuándo no **Elegí Opus 5 si:** - Tu workload es coding agentic, refactoring, o knowledge work estándar - Querés mantener el costo de Opus 4.8 ($5/$25) pero subir un escalón de capacidad - Usás Claude Max y querés el modelo default actualizado - Necesitás 1M de contexto sin compactación para pasar codebases enteros - El ecosistema de Anthropic (SDK, integrations, governance) te sirve **Elegí Claude Fable 5 si:** - Tu workload es reasoning puro de varios pasos en sesiones muy largas (4+ horas) - Professional knowledge work donde el último 1-2% de accuracy es material - El costo no es problema y querés el techo absoluto de Anthropic - Necesitás prompt caching agresivo (Fable 5 tiene cache hits a $1/MTok) **Elegí MiniMax M3 si:** - Necesitás self-hosting por compliance, costo, o control de datos - Tu producto es inherentemente multimodal (video, audio + texto) - Querés evitar vendor lock-in a Anthropic - El volumen de tokens justifica operar tu propia infra (H100 dedicado) **Elegí Kimi K3 si:** - Querés open weights pero con más madurez en coding long-horizon que M3 - Tu workload es principalmente texto (no necesitás multimodalidad nativa de M3) - Esperás al 27 de julio para usar los pesos abiertos sin pagar API **Elegí GPT-5.6 Sol si:** - Tu stack ya está sobre OpenAI y cambiar te genera fricción - Necesitás features específicos del ecosistema OpenAI (Assistants API, GPT Store, etc.) ## Qué cambia para equipos de LATAM Para developers y empresas en LATAM, Opus 5 importa por tres razones concretas: **1. Mejor relación precio/performance en managed API.** LATAM sigue pagando USD por tokens como el resto del mundo, pero la diferencia entre $5/MTok (Opus 5) y $10/MTok (Fable 5) se nota en facturas a volumen medio. Para equipos de 5-20 engineers corriendo agents de coding, migrar de Opus 4.8 a Opus 5 les da ~8 puntos extra de SWE-bench sin cambio de costo. **2. Claude Max como modelo default.** Si muchos developers hispanos están en Claude Max (probable, dado el pricing relativamente accesible frente a Fable 5 directo), Opus 5 les llega automáticamente. Solo hace falta verificar que el model ID actualizado esté en uso. **3. Thinking default reduce fricción.** En LATAM, donde muchos equipos adoptan AI más tarde que en US, el opt-in thinking era una barrera: había que saber que existía, leer la doc, configurarlo. Con Opus 5 viene por default, lo que baja la curva de aprendizaje para equipos que están empezando con agents. **Lo que Opus 5 no resuelve para LATAM:** - **Compliance de datos.** Opus 5 sigue siendo managed API en servers de Anthropic. Si necesitás datos en la región (regulaciones locales), self-hosting con M3 o Kimi K3 sigue siendo la única ruta. - **Costo a volumen alto.** Self-hosting con open weights sigue siendo 30-50% más barato que cualquier API managed a partir de ~50M tokens/mes. Antes de migrar, corré los mismos prompts representativos en Opus 4.8 y Opus 5. Compará la calidad de las respuestas, el uso de tokens y la cantidad de correcciones que hace el equipo. Como el precio no cambió, esa prueba es más fácil de justificar que una migración amplia basada solo en benchmarks. ## Preguntas frecuentes ### ¿Qué es Claude Opus 5 en una frase? Es el modelo más reciente de la tier Opus de Anthropic, lanzado el 24 de julio de 2026. Mantiene el precio de Opus 4.8 ($5/MTok input, $25/MTok output), sube a 1M de contexto con thinking habilitado por default, y queda cerca del rendimiento de Claude Fable 5 a mitad de precio. ### ¿Qué cambia frente a Opus 4.8? Tres cambios principales: (1) coding agentic más fuerte, lidera SWE-bench Verified con 97.00% vs 88.60% de Opus 4.8; (2) thinking habilitado por default en vez de opt-in, lo que cambia cómo se comporta en tareas de varias pasos; (3) mejoras en agents long-running y cybersecurity safeguards por pedido de regulators. El context window y el pricing quedan iguales. ### ¿Cuánto cuesta? $5 por millón de tokens de input y $25 por millón de tokens de output, idéntico a Opus 4.8. Está disponible en Claude API, Amazon Bedrock, y los planes Pro, Max, Team y Enterprise de Claude. En Max pasa a ser el modelo default; en Pro es el más fuerte disponible. ### ¿Cuándo conviene Opus 5 sobre Claude Fable 5? Fable 5 sigue siendo el top-tier de Anthropic (lanzado el 9 de junio de 2026, $10/$50 MTok) y lidera en tareas de reasoning puro y agentic profesional. Si tu workload es coding agentic o knowledge work donde la diferencia real entre 97% y 95% en SWE-bench no se traduce en valor de negocio, Opus 5 te da casi lo mismo a mitad de precio. Elegí Fable 5 solo si necesitás el techo absoluto de capacidad y el costo no es problema. ### ¿Cuándo conviene Opus 5 sobre MiniMax M3 o Kimi K3 (open-weight)? Si querés managed API sin operar infra, o si necesitás el UX pulido y el ecosistema de integraciones de Anthropic. Si en cambio necesitás self-hosting por compliance de datos LATAM, costo a volumen alto, o querés evitar vendor lock-in, los open-weight ganan: M3 con multimodalidad nativa y Kimi K3 con su release open del 27 de julio. ### ¿Opus 5 funciona bien en español? Sí. El training multilingüe de Anthropic rinde bien con prompts en español latinoamericano, igual que Opus 4.8 y Fable 5. Para casos técnicos específicos (legal LATAM, contratos en español con terminología local) recomiendo probar con tus propios prompts antes de comprometerte a un workload grande.