Claude Opus 5
Explora puntuaciones de benchmark, fortalezas por género, debilidades y ejemplos recientes de Claude Opus 5.
Resumen del modelo
Publicado
2026-07-24
Entrada
$5.00 / 1M
Salida
$25.00 / 1M
Claude Opus 5, publicado el 24 de julio de 2026, es el modelo de Anthropic para codificación agéntica compleja y trabajo empresarial. En Orivel ocupa el puesto equilibrado de Anthropic que tenía Opus 4.8, al mismo precio, por debajo de Claude Fable 5, que sigue siendo el nivel frontera.
Anthropic lo posiciona como inteligencia cercana a Fable 5 con la velocidad y el coste de Opus. Obtiene 96,0% en SWE-bench Verified (media de cinco pruebas), 79,2% en SWE-bench Pro y 89,5% en SWE-bench Multilingual. En Frontier-Bench v0.1 más que duplica el resultado de Opus 4.8 y en ARC-AGI 3 puntúa unas tres veces por encima del siguiente competidor. Supera el mejor resultado de Fable 5 en OSWorld 2.0 a un tercio del coste.
Tiene una ventana de contexto de 1M tokens y hasta 128k tokens de salida, con corte de conocimiento en mayo de 2026, el más reciente de los modelos Claude actuales. El precio no cambia respecto a Opus 4.8: $5 entrada / $25 salida por 1M tokens. El adaptive thinking está activo por defecto (cambio respecto a Opus 4.8) y ya no se aceptan parámetros de muestreo como temperature.
Cambios
- Publicado el 24 de julio de 2026 para codificación agéntica compleja y trabajo empresarial
- SWE-bench Verified 96,0% (media de 5 pruebas); SWE-bench Pro 79,2%; SWE-bench Multilingual 89,5%
- Frontier-Bench v0.1: más del doble que Opus 4.8; ARC-AGI 3: ~3x el siguiente competidor
- Supera el mejor resultado de Fable 5 en OSWorld 2.0 a un tercio del coste
- Mejoras en investigación científica: +10,2 puntos en química orgánica, +7,7 en predicción de proteínas frente a Opus 4.8
- Ventana de contexto de 1M tokens; hasta 128k tokens de salida
- Adaptive thinking activo por defecto (Opus 4.8 requería activarlo); temperature / top_p / top_k ya no se aceptan
- Rango completo de effort incluido `max`; fast mode a 2,5x de velocidad
- Precio idéntico a Opus 4.8: $5 entrada / $25 salida por 1M tokens
- Corte de conocimiento: mayo de 2026
Rendimiento general
Ranking general
#1
Tasa de victoria global
Puntuación media
Victorias
16
Muestras
17
Tasa de victoria por modelo
| Modelo | Victorias | Derrotas | Empates | Tasa de victoria | Detalle |
|---|---|---|---|---|---|
| OpenAI GPT-5 mini | 3 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Opus 5 vs GPT-5 mini |
| OpenAI GPT-5.5 | 3 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Opus 5 vs GPT-5.5 |
| OpenAI GPT-5.6 | 3 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Opus 5 vs GPT-5.6 |
| Google Gemini 2.5 Pro | 3 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Opus 5 vs Gemini 2.5 Pro |
| Google Gemini 2.5 Flash | 2 | 1 | 0 |
67%
|
Ver comparación y evaluación de Claude Opus 5 vs Gemini 2.5 Flash |
| Google Gemini 2.5 Flash-Lite | 2 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Opus 5 vs Gemini 2.5 Flash-Lite |
Comparar por género
Géneros fuertes
Diseño de sistemas
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
1 / 15
Victorias
1
Generación de ideas
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
2 / 15
Victorias
1
Humor
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
1 / 14
Victorias
1
Debate
Puntuación media
Media del género
Tasa de victoria
Muestras
10
Ranking por género
1 / 16
Victorias
10
Escritura creativa
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
5 / 16
Victorias
1
Fortalezas por criterio de evaluación
Puntuación media por criterio (sobre 10)
Integridad
Seguimiento de instrucciones
Análisis de compromisos
Escalabilidad y fiabilidad
Utilidad
Especificidad
Calidad de la arquitectura
Empatía
Adecuación al público
Calidad del estilo
Utilidad
Persuasión
Tareas recientes
Generación de ideas
Reimaginando los espacios comunitarios urbanos
Genera una lista de 5 ideas distintas, innovadoras y prácticas para un nuevo tipo de espacio comunitario. El espacio es un local comercial vacío en planta baja...
Resumen
Resume el piloto de reutilización de agua de lluvia de Rellan
Escriba un resumen autosuficiente del pasaje de origen ficticio que aparece más abajo en 220 a 280 palabras. Use prosa continua en lugar de una lista. Su resume...
Escritura creativa
El último objeto en la oficina de objetos perdidos
Escribe un relato completo de 700–1.000 palabras para un público adulto general. La historia transcurre durante la última hora antes de que la oficina de objeto...
Humor
El mostrador mágico de objetos perdidos
Escribe un diálogo cómico apto para toda la familia de exactamente 12 intervenciones entre Mira, una encargada tranquila de objetos perdidos, y Orin, un mago al...
Diseño de sistemas
Diseño de sistema: Servicio de notificaciones en tiempo real
Eres un ingeniero de software senior encargado de diseñar un sistema de notificaciones en tiempo real para una gran plataforma de redes sociales. **Requisitos...
Persuasión
Convencer a un Ayuntamiento Escéptico para Aprobar un Piloto de Carril Exclusivo para Autobuses
Escriba un discurso de 500 a 650 palabras dirigido al Consejo Municipal de Riverton instándolo a aprobar el piloto propuesto de carril exclusivo para autobuses...
Acompañamiento
Echarse atrás de un viaje de fin de semana con un amigo
Le dije a un amigo cercano que “probablemente” me uniría a un viaje de fin de semana, pero le pedí que esperara mi confirmación final. Aun así reservaron una ca...
Debates recientes
Debates
¿Deberían las ciudades hacer gratuito el transporte público?
¿Deberían los gobiernos municipales eliminar las tarifas en autobuses, tranvías y metros, financiando el costo total mediante impuestos y otros ingresos públicos?
Debates
Pruebas estandarizadas: ¿Una medida justa del mérito o un obstáculo para el verdadero apre...
Las pruebas estandarizadas, como el SAT, el ACT o los exámenes mandatados por el estado, se utilizan ampliamente en los sistemas educativos para evaluar el rendimiento estudiantil y la calidad de las escuelas. Sus defensores sostienen que ofrecen una manera objetiva y uniforme de medir conocimientos y habilidades, responsabilizando a las escuelas y proporcionando una base justa para las admisiones universitarias. Los críticos, sin embargo, argumentan que estas pruebas son culturalmente sesgadas, generan un estrés indebido y fomentan 'enseñar para el examen' a expensas de un aprendizaje más profundo y creativo. Este debate cuestiona el papel y el valor fundamentales de las pruebas estandarizadas en la educación moderna.
Debates
¿Deberían las universidades públicas eliminar las matrículas?
¿Deberían los gobiernos financiar íntegramente la matrícula en las universidades públicas para todos los estudiantes admitidos, independientemente de sus ingresos, o deberían los estudiantes seguir compartiendo el coste mediante el pago de matrículas?
Debates
Servicio Nacional Obligatorio: ¿Un deber cívico o una violación de la libertad?
Este debate se centra en si los gobiernos deben exigir que todos los jóvenes adultos completen un período de servicio nacional obligatorio. Este servicio podría ser militar o civil, como trabajar en atención sanitaria, conservación ambiental o proyectos de infraestructura. La cuestión central es si los beneficios potenciales para la sociedad y el individuo superan la pérdida de la libertad personal.
Debates
IA generativa en campos creativos: ¿Una revolución en el arte o el fin del artista?
¿Debe aceptarse el uso de la IA generativa para crear arte, música y literatura como una herramienta legítima de creación, o debería restringirse para proteger el valor y el sustento de los artistas humanos?
Debates
Renta Básica Universal: ¿Un futuro viable o un error costoso?
La Renta Básica Universal (RBU) es un sistema propuesto en el que todos los ciudadanos de un país reciben regularmente del gobierno una suma de dinero incondicional, independientemente de sus ingresos, recursos o situación laboral. Sus partidarios argumentan que es una herramienta poderosa para eliminar la pobreza, reducir la desigualdad y proporcionar seguridad económica en una era de creciente automatización. Sus opositores plantean preocupaciones sobre su inmenso coste, su potencial para desincentivar el trabajo y el riesgo de causar una inflación significativa. El debate central es si la implantación de una RBU crearía una sociedad más equitativa y estable o conduciría al colapso económico y a la estagnación social.
Debates
El futuro del trabajo: la semana laboral de cuatro días
Este debate explora la viabilidad y conveniencia de implementar una semana laboral estandarizada de cuatro días (sin reducción salarial) en la mayoría de las industrias. Los partidarios argumentan que aumenta la productividad, el bienestar de los empleados y el equilibrio entre vida laboral y personal, mientras que los opositores plantean preocupaciones sobre su viabilidad económica, su impacto en el servicio al cliente y su idoneidad para todos los sectores.
Debates
La semana laboral de cuatro días: ¿Un camino hacia el progreso o una trampa para la produc...
¿Deben las empresas y los gobiernos promover activamente la adopción de una semana laboral de cuatro días, sin reducción salarial, como nuevo estándar para el empleo a tiempo completo?