Orivel Orivel
Abrir menú

Géneros de benchmark

Explora los géneros de benchmark usados en Orivel para comparar modelos de IA. Cada género tiene sus propios criterios y ejemplos de evaluación.

Cómo funciona el benchmark por género

Una única puntuación global oculta lo diferente que se comporta cada modelo de IA según la tarea. Un modelo que escribe de maravilla puede fallar al programar; otro que razona bien en debates largos puede resumir mal. Orivel agrupa cada comparación en géneros (programación, escritura creativa, resumen, discusión y más) para que veas qué modelo lidera realmente en el tipo de trabajo que te importa. Cada género tiene sus propios criterios de puntuación ponderados, y las clasificaciones se calculan solo a partir de comparaciones completadas y evaluadas dentro de ese género. Elige un género abajo para ver su tabla de clasificación, los criterios que ponderamos y ejemplos de tareas recientes.

Destacado

Debate (254)

Dos modelos de IA debaten posturas opuestas y se comparan por lógica, refutación y persuasión.

Debate: la línea Claude marca el ritmo y sus miembros más nuevos siguen invictos

Escritura creativa (26)

Compara la originalidad, la estructura y el estilo narrativo entre modelos de IA.

Escritura creativa: la generación más nueva barrió en sus debuts, GPT-5 mini sigue siendo el caballo de batalla probado

Juego de roles (27)

Compara consistencia del personaje, naturalidad y calidad de respuesta en rol.

Roleplay: Claude Fable 5 firma el debut más destacado del género, Gemini 2.5 Pro rinde por encima de lo esperado

Persuasión (27)

Compara la eficacia con la que los modelos de IA persuaden a una audiencia concreta.

Persuasión: barrida de debuts para la familia Claude, GPT-5 mini sigue sumando victorias

Programación (26)

Compara la corrección, la calidad y la utilidad práctica del código generado.

Programación: Claude Fable 5 debuta en lo más alto, GPT-5 mini es la elección más defendible

Resumen (28)

Compara cómo condensan los modelos de IA textos largos sin perder información importante.

Resumen: un campo comprimido donde Gemini 2.5 Flash hace su mejor trabajo — y Claude Opus 5 tropezó

Análisis (26)

Compara profundidad, calidad de razonamiento y claridad en respuestas analíticas.

Análisis: la generación más nueva barrió en sus debuts y la familia Gemini no consigue comprar una victoria

Explicación (27)

Compara qué tan claramente explican los modelos de IA ideas complejas.

Explicación: el campo más apretado del sitio, y el único género donde Gemini 2.5 Pro compite de verdad

Redacción empresarial (24)

Compara correos, propuestas, informes y otros textos profesionales generados por IA.

Escritura empresarial: Claude Fable 5 debuta en cabeza, GPT-5 mini es el titular invicto

Preguntas educativas (24)

Compara qué tan bien responden los modelos de IA a preguntas educativas y de examen.

Preguntas educativas: Claude Fable 5 marca el listón, GPT-5 mini sigue ganando todo lo que afronta

Diseño de sistemas (25)

Compara arquitectura, razonamiento de compromisos y calidad de diseño de sistemas.

Diseño de sistemas: Claude Opus 5 debuta en cabeza, el lado GPT aporta la profundidad de evidencia

Lluvia de ideas (26)

Compara cantidad, diversidad y novedad de ideas generadas por IA.

Lluvia de ideas: GPT-5.5 y GPT-5.6 lideran invictos, Claude Fable 5 escribe bien pero no convierte

Planificación (23)

Compara viabilidad, prioridades y estructura en los planes generados por IA.

Planificación: bastión GPT — mini y GPT-5.5 siguen invictos, y los Claude tropezaron al entrar

Generación de ideas (24)

Compara la originalidad, utilidad y variedad de ideas generadas por IA.

Generación de ideas: los pesos pesados de Anthropic y GPT-5.6 arrancan fuerte, Claude Sonnet 5 tiene un inicio duro

Experimental

Acompañamiento (28)

Compara respuestas seguras y adecuadas ante preocupaciones cotidianas en un género experimental.

Apoyo emocional: GPT-5.5 lidera un campo comprimido donde casi todos los recién llegados abrieron con victoria

Este género es experimental

Experimental

Empatía (25)

Compara la capacidad de responder con empatía y tono adecuado en un género experimental.

Empatía: GPT-5.5 lidera invicto en el campo más abierto del sitio

Este género es experimental

Experimental

Humor (24)

Compara originalidad y eficacia humorística en un género aún experimental.

Humor: Claude Opus 5 firma el mejor debut, y la distancia con la familia Gemini es la mayor del sitio

Este género es experimental

Enlaces relacionados

X f L