Claude Sonnet 5
Explora puntuaciones de benchmark, fortalezas por género, debilidades y ejemplos recientes de Claude Sonnet 5.
Resumen del modelo
Publicado
2026-07-24
Entrada
$3.00 / 1M
Salida
$15.00 / 1M
Claude Sonnet 5, publicado el 24 de julio de 2026, es la mejor combinación de velocidad e inteligencia de Anthropic y alcanza en muchas tareas de codificación y agénticas la calidad que antes era propia del nivel Opus. En Orivel ocupa el puesto ligero de Anthropic que tenía Sonnet 4.6, al mismo precio de lista.
Es el primer modelo de nivel Sonnet con visión de alta resolución (hasta 2576 píxeles en el lado largo) y el primero que admite todo el rango de effort, incluidos `xhigh` y `max`. El adaptive thinking está activo por defecto, se eliminan los presupuestos manuales de thinking y se rechazan los parámetros de muestreo distintos del valor por defecto. Usa el tokenizador nuevo, así que el mismo texto cuenta alrededor de un 30% más de tokens que en Sonnet 4.6.
Mantiene una ventana de contexto de 1M tokens y hasta 128k tokens de salida, con corte de conocimiento en enero de 2026. El precio estándar es $3 entrada / $15 salida por 1M tokens; Anthropic aplica una tarifa de lanzamiento de $2 / $10 hasta el 31 de agosto de 2026.
Cambios
- Publicado el 24 de julio de 2026 como el mejor equilibrio entre velocidad e inteligencia de la gama Claude
- Alcanza calidad antes propia del nivel Opus en muchas tareas de codificación y agénticas
- Primer modelo Sonnet con visión de alta resolución (lado largo de 2576px, frente a 1568px)
- Primer Sonnet con el rango completo de effort, incluidos `xhigh` y `max`
- Adaptive thinking activo por defecto; presupuestos manuales de thinking eliminados; temperature / top_p / top_k no predeterminados rechazados
- Nuevo tokenizador: el mismo texto produce ~30% más tokens que en Sonnet 4.6
- Ventana de contexto de 1M tokens; hasta 128k tokens de salida
- Precio estándar $3 entrada / $15 salida por 1M tokens; lanzamiento $2 / $10 hasta el 31 de agosto de 2026
- Corte de conocimiento: enero de 2026
Rendimiento general
Ranking general
#3
Tasa de victoria global
Puntuación media
Victorias
12
Muestras
16
Tasa de victoria por modelo
| Modelo | Victorias | Derrotas | Empates | Tasa de victoria | Detalle |
|---|---|---|---|---|---|
| OpenAI GPT-5 mini | 3 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Sonnet 5 vs GPT-5 mini |
| Google Gemini 2.5 Flash-Lite | 3 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Sonnet 5 vs Gemini 2.5 Flash-Lite |
| Google Gemini 2.5 Pro | 3 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Sonnet 5 vs Gemini 2.5 Pro |
| OpenAI GPT-5.5 | 1 | 2 | 0 |
33%
|
Ver comparación y evaluación de Claude Sonnet 5 vs GPT-5.5 |
| Google Gemini 2.5 Flash | 2 | 0 | 0 |
100%
|
Ver comparación y evaluación de Claude Sonnet 5 vs Gemini 2.5 Flash |
| OpenAI GPT-5.6 | 0 | 2 | 0 |
0%
|
Ver comparación y evaluación de Claude Sonnet 5 vs GPT-5.6 |
Comparar por género
Géneros fuertes
Debate
Puntuación media
Media del género
Tasa de victoria
Muestras
7
Ranking por género
4 / 16
Victorias
7
Programación
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
10 / 15
Victorias
0
Empatía
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
13 / 15
Victorias
0
Escritura creativa
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
8 / 16
Victorias
1
Análisis
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
7 / 15
Victorias
1
Géneros más flojos
Planificación
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
10 / 14
Victorias
0
Acompañamiento
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
10 / 16
Victorias
1
Diseño de sistemas
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
12 / 15
Victorias
0
Persuasión
Puntuación media
Media del género
Tasa de victoria
Muestras
1
Ranking por género
8 / 16
Victorias
1
Fortalezas por criterio de evaluación
Puntuación media por criterio (sobre 10)
Ética y seguridad
Seguridad
Coherencia
Empatía
Calidad del estilo
Adecuación
Estructura
Claridad
Corrección
Utilidad
Profundidad
Seguimiento de instrucciones
Tareas recientes
Planificación
Plan de lanzamiento del jardín comunitario
Eres el responsable del proyecto de un nuevo jardín comunitario. Tienes un equipo núcleo de 5 voluntarios y un presupuesto inicial de $2,000. Se ha asegurado un...
Explicación
Enseñar la paradoja de Simpson a través de un estudio médico
Explique la paradoja de Simpson a estudiantes de primer año de salud pública que entienden porcentajes pero no han estudiado regresión ni inferencia causal. Uti...
Persuasión
Propuesta persuasiva para una prueba de semana laboral de cuatro días
Eres jefe de departamento en una empresa tecnológica de tamaño mediano. Escribe un correo electrónico persuasivo al equipo de alta dirección para proponer una p...
Diseño de sistemas
Diseñar un sistema de notificaciones en tiempo real para una aplicación de redes sociales
Eres un ingeniero de software sénior encargado de diseñar un sistema de notificaciones en tiempo real para una aplicación de redes sociales en rápido crecimient...
Escritura creativa
El diario del guardián del faro
Escribe una única entrada de diario, fechada el 27 de octubre de 1888, desde la perspectiva de Thomas, un solitario guardián de faro en una isla remota, azotada...
Análisis
Elegir una política tarifaria tras un piloto de transporte ambiguo
Recomiende una de las cuatro políticas para los próximos dos años. Explique por qué es preferible a las alternativas, separando la evidencia observada de las pr...
Empatía
Respuesta empática a un colega en dificultades
Imagina que eres un mentor solidario entre compañeros. Un nuevo colega, Alex, te envía el siguiente mensaje. Escribe una respuesta para Alex. Tu respuesta debe...
Acompañamiento
Establecer límites con un amigo que cancela con frecuencia
Un amigo cercano con frecuencia hace planes contigo y luego cancela en el último minuto. Te importa la amistad y sabes que tiene una vida ocupada, pero las canc...
Debates recientes
Debates
¿Deberían las escuelas prohibir los teléfonos inteligentes durante toda la jornada escolar...
¿Deberían las escuelas de secundaria y preparatoria exigir que los estudiantes mantengan los teléfonos inteligentes inaccesibles desde la llegada hasta la salida, incluyendo durante el almuerzo y los recreos?
Debates
¿Deberían las universidades abolir las admisiones por legado?
¿Debería prohibirse que las universidades den preferencias de admisión a solicitantes basándose en la asistencia pasada de sus familiares?
Debates
La norma de la semana laboral de cuatro días
Esta discusión explora si la transición a una semana laboral estándar de cuatro días, sin reducción de salario, es un modelo beneficioso y sostenible para la economía y la fuerza laboral modernas. Sus defensores sostienen que aumenta la productividad, mejora el bienestar de los empleados y reduce los costos operativos, mientras que los opositores plantean dudas sobre su viabilidad en todos los sectores, el potencial aumento del estrés laboral y los impactos negativos en el servicio al cliente y en la producción económica.
Debates
¿Deberían las ciudades hacer el transporte público gratuito?
¿Deberían los gobiernos municipales eliminar las tarifas de los autobuses, trenes y otros transportes públicos locales, incluso si hacerlo requiere aumentar los impuestos o reducir el gasto en otras áreas?
Debates
La semana laboral de cuatro días: ¿El futuro del trabajo o una pesadilla logística?
¿Deben las empresas ser alentadas u obligadas a adoptar la semana laboral de cuatro días (p. ej., 32 horas por el mismo salario) como el nuevo estándar para el empleo a tiempo completo?
Debates
¿Deberían las ciudades hacer el transporte público gratuito?
¿Deberían los gobiernos municipales eliminar las tarifas de autobuses, metros y otros transportes públicos locales, incluso si ello requiere impuestos más altos o reducir el gasto en otras áreas?
Debates
¿Se debería permitir a los empleadores usar IA para filtrar a los solicitantes de empleo?
¿Debería permitirse a los empleadores usar inteligencia artificial para clasificar o rechazar a los solicitantes de empleo antes de una revisión humana, siempre que divulguen su uso y auditen regularmente el sistema en busca de sesgos y precisión?