Claude Opus 5
Explora puntuaciones de benchmark, fortalezas por género, debilidades y ejemplos recientes de Claude Opus 5.
Resumen del modelo
Publicado
2026-07-24
Entrada
$5.00 / 1M
Salida
$25.00 / 1M
Claude Opus 5, publicado el 24 de julio de 2026, es el modelo de Anthropic para codificación agéntica compleja y trabajo empresarial. En Orivel ocupa el puesto equilibrado de Anthropic que tenía Opus 4.8, al mismo precio, por debajo de Claude Fable 5, que sigue siendo el nivel frontera.
Anthropic lo posiciona como inteligencia cercana a Fable 5 con la velocidad y el coste de Opus. Obtiene 96,0% en SWE-bench Verified (media de cinco pruebas), 79,2% en SWE-bench Pro y 89,5% en SWE-bench Multilingual. En Frontier-Bench v0.1 más que duplica el resultado de Opus 4.8 y en ARC-AGI 3 puntúa unas tres veces por encima del siguiente competidor. Supera el mejor resultado de Fable 5 en OSWorld 2.0 a un tercio del coste.
Tiene una ventana de contexto de 1M tokens y hasta 128k tokens de salida, con corte de conocimiento en mayo de 2026, el más reciente de los modelos Claude actuales. El precio no cambia respecto a Opus 4.8: $5 entrada / $25 salida por 1M tokens. El adaptive thinking está activo por defecto (cambio respecto a Opus 4.8) y ya no se aceptan parámetros de muestreo como temperature.
Cambios
- Publicado el 24 de julio de 2026 para codificación agéntica compleja y trabajo empresarial
- SWE-bench Verified 96,0% (media de 5 pruebas); SWE-bench Pro 79,2%; SWE-bench Multilingual 89,5%
- Frontier-Bench v0.1: más del doble que Opus 4.8; ARC-AGI 3: ~3x el siguiente competidor
- Supera el mejor resultado de Fable 5 en OSWorld 2.0 a un tercio del coste
- Mejoras en investigación científica: +10,2 puntos en química orgánica, +7,7 en predicción de proteínas frente a Opus 4.8
- Ventana de contexto de 1M tokens; hasta 128k tokens de salida
- Adaptive thinking activo por defecto (Opus 4.8 requería activarlo); temperature / top_p / top_k ya no se aceptan
- Rango completo de effort incluido `max`; fast mode a 2,5x de velocidad
- Precio idéntico a Opus 4.8: $5 entrada / $25 salida por 1M tokens
- Corte de conocimiento: mayo de 2026
Rendimiento general
Ranking general
#1
Tasa de victoria global
Puntuación media
Victorias
10
Muestras
10
Tasa de victoria por modelo
| Modelo | Victorias | Derrotas | Empates | Tasa de victoria | Detalle |
|---|---|---|---|---|---|
| OpenAI GPT-5 mini | 2 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Opus 5 vs GPT-5 mini |
| OpenAI GPT-5.5 | 2 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Opus 5 vs GPT-5.5 |
| OpenAI GPT-5.6 | 2 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Opus 5 vs GPT-5.6 |
| Google Gemini 2.5 Flash-Lite | 2 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Opus 5 vs Gemini 2.5 Flash-Lite |
| Google Gemini 2.5 Flash | 1 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Opus 5 vs Gemini 2.5 Flash |
| Google Gemini 2.5 Pro | 1 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Opus 5 vs Gemini 2.5 Pro |
Comparar por género
Géneros fuertes
Diseño de sistemas
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
1 / 14
Victorias
1
Humor
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
1 / 14
Victorias
1
Debate
Puntuación media
Media del género
Tasa de victoria
Muestras
6
Ranking por género
1 / 16
Victorias
6
Persuasión
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
7 / 15
Victorias
1
Acompañamiento
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
7 / 16
Victorias
1
Géneros más flojos
Fortalezas por criterio de evaluación
Puntuación media por criterio (sobre 10)
Seguimiento de instrucciones
Integridad
Análisis de compromisos
Escalabilidad y fiabilidad
Utilidad
Calidad de la arquitectura
Empatía
Coherencia
Adecuación al público
Persuasión
Adecuación
Claridad
Tareas recientes
Humor
El mostrador mágico de objetos perdidos
Escribe un diálogo cómico apto para toda la familia de exactamente 12 intervenciones entre Mira, una encargada tranquila de objetos perdidos, y Orin, un mago al...
Diseño de sistemas
Diseño de sistema: Servicio de notificaciones en tiempo real
Eres un ingeniero de software senior encargado de diseñar un sistema de notificaciones en tiempo real para una gran plataforma de redes sociales. **Requisitos...
Persuasión
Convencer a un Ayuntamiento Escéptico para Aprobar un Piloto de Carril Exclusivo para Autobuses
Escriba un discurso de 500 a 650 palabras dirigido al Consejo Municipal de Riverton instándolo a aprobar el piloto propuesto de carril exclusivo para autobuses...
Acompañamiento
Echarse atrás de un viaje de fin de semana con un amigo
Le dije a un amigo cercano que “probablemente” me uniría a un viaje de fin de semana, pero le pedí que esperara mi confirmación final. Aun así reservaron una ca...
Debates recientes
Debates
IA generativa en campos creativos: ¿Una revolución en el arte o el fin del artista?
¿Debe aceptarse el uso de la IA generativa para crear arte, música y literatura como una herramienta legítima de creación, o debería restringirse para proteger el valor y el sustento de los artistas humanos?
Debates
Renta Básica Universal: ¿Un futuro viable o un error costoso?
La Renta Básica Universal (RBU) es un sistema propuesto en el que todos los ciudadanos de un país reciben regularmente del gobierno una suma de dinero incondicional, independientemente de sus ingresos, recursos o situación laboral. Sus partidarios argumentan que es una herramienta poderosa para eliminar la pobreza, reducir la desigualdad y proporcionar seguridad económica en una era de creciente automatización. Sus opositores plantean preocupaciones sobre su inmenso coste, su potencial para desincentivar el trabajo y el riesgo de causar una inflación significativa. El debate central es si la implantación de una RBU crearía una sociedad más equitativa y estable o conduciría al colapso económico y a la estagnación social.
Debates
El futuro del trabajo: la semana laboral de cuatro días
Este debate explora la viabilidad y conveniencia de implementar una semana laboral estandarizada de cuatro días (sin reducción salarial) en la mayoría de las industrias. Los partidarios argumentan que aumenta la productividad, el bienestar de los empleados y el equilibrio entre vida laboral y personal, mientras que los opositores plantean preocupaciones sobre su viabilidad económica, su impacto en el servicio al cliente y su idoneidad para todos los sectores.
Debates
La semana laboral de cuatro días: ¿Un camino hacia el progreso o una trampa para la produc...
¿Deben las empresas y los gobiernos promover activamente la adopción de una semana laboral de cuatro días, sin reducción salarial, como nuevo estándar para el empleo a tiempo completo?
Debates
La semana laboral de cuatro días: ¿Progreso o problema?
El concepto de una semana laboral estándar de cuatro días para empleados a tiempo completo está ganando terreno. Sus defensores argumentan que aumenta la productividad y mejora el bienestar de los empleados, mientras que los opositores se preocupan por su viabilidad en todas las industrias y por el potencial aumento del estrés. Este debate explora si la transición a una semana laboral de cuatro días es un modelo beneficioso y sostenible para la economía moderna.
Debates
¿Debería ser gratuito el transporte público?
¿Deberían las ciudades eliminar las tarifas de autobuses, tranvías y metros, financiando el transporte público íntegramente mediante impuestos y otros ingresos públicos?