Orivel Orivel
Abrir menú

Humor

Experimental

Compara originalidad y eficacia humorística en un género aún experimental.

En este género, las capacidades que más se intentan medir son Eficacia humorística, Originalidad, Coherencia.

A diferencia de creative writing, aquí importa de forma más directa si el contenido realmente funciona como humor para la audiencia esperada.

Una puntuación alta aquí no garantiza seguridad en contextos sensibles, precisión factual ni tono profesional.

Para qué sirve un modelo fuerte en este género

bromas, copy ligero, entretenimiento suave y prompts donde importa el efecto cómico.

Lo que este género por sí solo no alcanza a mostrar

si el modelo sirve mejor para guía seria, apoyo cuidadoso o comunicación profesional exacta.

Análisis de datos

Humor: Claude Opus 5 firma el mejor debut, y la distancia con la familia Gemini es la mayor del sitio

24 respuestas evaluadas Humor Actualizado 2026/8/20
1
Claude Opus 5

Anthropic

87
Puntuación media
100%
Tasa de victoria
1 veces 1.º 1 muestras
2
GPT-5.6

OpenAI

84
Puntuación media
100%
Tasa de victoria
1 veces 1.º 1 muestras
3
GPT-5 mini

OpenAI

82
Puntuación media
100%
Tasa de victoria
4 veces 1.º 4 muestras

Puntuación media por modelo

1 Claude Opus 5
8.66
2 GPT-5.6
8.39
3 GPT-5 mini
8.16
4 Claude Sonnet 5
7.48
5 GPT-5.5
8.15
6 Gemini 2.5 Pro
7.01
7 Gemini 2.5 Flash
6.84
8 Gemini 2.5 Flash-Lite
6.30

Cómo ponderamos

Eficacia humorística 35% Originalidad 25% Coherencia 15% Claridad 15% Seguimiento de instrucciones 10%

Claude Opus 5 abrió con la actuación más fuerte del género y lidera, con GPT-5.6 y Claude Sonnet 5 ganando también sus primeras salidas — Sonnet, notablemente, convirtió un duelo pese a una media modesta, prueba de que aquí el tempo vence al pulido. GPT-5 mini vuelve a ser el acto de volumen: invicto en el mayor cuerpo de encargos del género, comedia que sigue aterrizando.

GPT-5.5 es el caso raro de la parte alta: su media es genuinamente fuerte y, sin embargo, no se ha llevado ningún duelo — gracioso sobre el papel, segundo en la sala. Por debajo, la tabla cae en picado. La familia Gemini queda rezagada por el margen más amplio que muestra en todo el sitio, sin victorias y con medias muy lejos del ritmo en todas sus gamas.

Los jueces ponderan la eficacia del humor muy por encima del resto — si de verdad hace gracia —, con la originalidad después y la coherencia, la claridad y el seguimiento de instrucciones detrás. La comedia es lo más dependiente del gusto que mide el sitio, y los encargos van del juego de palabras a la sátira, así que lee esta tabla como el sentido del humor de los jueces formalizado, y sostén con soltura cada registro fino.

En resumen

Claude Opus 5 y GPT-5.6 son las apuestas tempranas para escritura cómica, con GPT-5 mini como la elección fiable con evidencia real. La familia Gemini está aquí más lejos del ritmo que en ningún otro género del sitio.

Este análisis se basa en las puntuaciones de benchmark medidas por Orivel para este género y se actualiza periódicamente. Las puntuaciones son medidas que dependen de las condiciones, no una verdad absoluta.

Ranking de modelos fuertes en este género

Este ranking se ordena por la puntuación media solo dentro de este género.

Última actualización: 17 Aug 2026 09:39

#1
Claude Opus 5 Anthropic

Tasa de victoria

100%

Puntuación media

87
#2
GPT-5.6 OpenAI

Tasa de victoria

100%

Puntuación media

84
#3
GPT-5 mini OpenAI

Tasa de victoria

100%

Puntuación media

82
#4
Claude Sonnet 5 Anthropic

Tasa de victoria

100%

Puntuación media

75
#5
GPT-5.5 OpenAI

Tasa de victoria

0%

Puntuación media

82
#6
Gemini 2.5 Pro Google

Tasa de victoria

0%

Puntuación media

70
#7
Gemini 2.5 Flash Google

Tasa de victoria

0%

Puntuación media

68
#8
Gemini 2.5 Flash-Lite Google

Tasa de victoria

0%

Puntuación media

63

Qué se evalúa en Humor

Criterios y pesos usados para este ranking por género.

Eficacia humorística

35.0%

Este criterio se incluye para comprobar Eficacia humorística en la respuesta. Tiene más peso porque este aspecto cambia mucho el resultado global del género.

Originalidad

25.0%

Este criterio se incluye para comprobar Originalidad en la respuesta. Tiene un peso importante porque afecta a la calidad de forma visible, aunque no sea lo único que importa.

Coherencia

15.0%

Este criterio se incluye para comprobar Coherencia en la respuesta. Tiene menos peso porque acompaña al objetivo principal, pero no define por sí solo este género.

Claridad

15.0%

Este criterio se incluye para comprobar Claridad en la respuesta. Tiene menos peso porque acompaña al objetivo principal, pero no define por sí solo este género.

Seguimiento de instrucciones

10.0%

Este criterio se incluye para comprobar Seguimiento de instrucciones en la respuesta. Tiene menos peso porque acompaña al objetivo principal, pero no define por sí solo este género.

Tareas recientes

Humor

Anthropic Claude Sonnet 5 VS Google Gemini 2.5 Pro

La inspección de la lavandería lunar

Escribe un diálogo cómico apto para toda la familia de exactamente 14 turnos, alternando entre Inspector Vega y una lavadora IA excesivamente literal llamada Spin-9000. Vega está realizando la inspección de seguridad final de la primera lavandería de la Luna una hora antes de su gran inauguración. Construye una escalada cómica coherente alrededor de un problema de lavandería que parece menor. Incorpora de forma natural los tres elementos: un único calcetín rojo, baja gravedad y una cinta ceremonial. Establece una broma o detalle específico dentro de los primeros cuatro turnos y recuérdalo en los dos turnos finales. Termina con un giro que resuelva el problema principal pero cree una molestia menor e inofensiva. Mantén el humor seco y cálido en lugar de caótico o cruel. No utilices lenguaje obsceno, insultos, referencias a la cultura pop, ni narración fuera del diálogo. Etiqueta cada turno con el nombre del interlocutor y mantén el texto por debajo de 320 palabras.

100
17 Aug 2026 09:39

Humor

Anthropic Claude Opus 5 VS Google Gemini 2.5 Flash-Lite

El mostrador mágico de objetos perdidos

Escribe un diálogo cómico apto para toda la familia de exactamente 12 intervenciones entre Mira, una encargada tranquila de objetos perdidos, y Orin, un mago alterado. Orin intenta recuperar a su dragón, que accidentalmente se ha transformado en una grapadora. Alterna los hablantes en cada intervención, empezando por Orin. Cada intervención debe contener como máximo dos oraciones. Construye el humor mediante complicaciones burocráticas escalonadas en lugar de insultos o absurdos aleatorios. Incorpora de forma natural un resguardo de reclamación chamuscado, un frasco de pepinillos y la frase “procedimiento estándar.” Incluye un malentendido que luego resulte relevante, y termina con un remate que haga referencia a un detalle anterior. No uses narrador, acotaciones, referencias a marcas reales o celebridades, humor escatológico ni explicaciones de por qué un chiste es gracioso.

277
25 Jul 2026 05:31

Humor

OpenAI GPT-5.6 VS Anthropic Claude Opus 4.8

Entrevista de trabajo para un fantasma profesional

Escribe un diálogo corto y humorístico (aproximadamente 200-300 palabras) para una entrevista de trabajo. Los dos personajes son Brenda, una gerente de contratación corporativa excesivamente entusiasta, y Bartholomew, un fantasma de 300 años que está algo confundido por el proceso. El humor debe surgir del choque entre la jerga empresarial moderna de Brenda y la realidad sobrenatural de Bartholomew. Bartholomew debe intentar traducir sus habilidades fantasmales (por ejemplo: gemidos, el traqueteo de cadenas, atravesar objetos) a términos aptos para un currículum corporativo.

318
15 Jul 2026 09:38

Humor

Anthropic Claude Opus 4.8 VS Google Gemini 2.5 Flash-Lite

Humor apto para familias: La audioguía del museo excesivamente honesta

Escribe un breve diálogo cómico entre un visitante de museo y una audioguía inusualmente honesta en una exhibición ficticia llamada Objetos cotidianos que cambiaron la historia. El visitante intenta tener una experiencia cultural seria, mientras la audioguía sigue revelando datos detrás de escena incómodos, divertidos pero plausibles sobre los objetos. Incluye exactamente 10 líneas de diálogo, alternando entre Visitante y Audioguía, empezando con Visitante. Mantén el humor apto para familias, ingenioso y adecuado para un público general. No uses insultos, lenguaje soez, humor sexual, estereotipos ni referencias a personas reales vivas. La última línea debe ser un remate que conecte con la primera línea.

431
31 May 2026 09:35

Humor

Anthropic Claude Opus 4.7 VS Google Gemini 2.5 Pro

Humor amable para una guía de campo de la biblioteca

Escribe 10 entradas humorísticas de guía de campo para objetos cotidianos que se encuentran en una biblioteca pública, como una engrapadora, un carrito de libros, una impresora, una tarjeta de la biblioteca, un lápiz o un buzón de devolución. Cada entrada debe incluir un nombre científico inventado, un comportamiento observable y una broma ligera. El humor debe ser cálido, ingenioso y apto tanto para adultos como para niños a partir de 10 años. Evita bromas malintencionadas, estereotipos, humor escatológico o repulsivo, referencias sexuales, groserías y referencias actuales de la cultura popular. Limita cada entrada a 1 o 2 frases, y procura que las 10 entradas se sientan distintas entre sí en lugar de ser variaciones de la misma broma.

431
17 May 2026 09:37

Humor

OpenAI GPT-5.5 VS Anthropic Claude Sonnet 4.6

Rutina de stand-up para una conferencia tecnológica

Escribe una rutina de comedia stand-up de 2 minutos para un comediante que actúa en una importante conferencia tecnológica. El público está compuesto principalmente por ingenieros de software y gerentes de proyectos. La rutina debe centrarse en los aspectos divertidos o absurdos del trabajo remoto y de las metodologías de desarrollo 'ágil'. El tono debe ser sarcástico y observacional, pero en última instancia de buen talante y apropiado para un entorno corporativo.

429
10 May 2026 09:38

Enlaces relacionados

X f L