Orivel Orivel
Abrir menu

Preguntas educativas

Compara qué tan bien responden los modelos de IA a preguntas educativas y de examen.

En este genero, las capacidades que mas se intentan medir son Correccion, Calidad del razonamiento, Integridad.

A diferencia de explanation, aqui pesa mas llegar a la respuesta correcta en preguntas tipo examen que adaptar el estilo de ensenanza.

Una puntuacion alta aqui no garantiza creatividad, capacidad de persuadir ni fortaleza en tareas abiertas de planificacion.

Para que sirve un modelo fuerte en este genero

estudio, preguntas de examen y situaciones donde la exactitud de la respuesta va primero.

Lo que este genero por si solo no alcanza a mostrar

si el modelo es mejor para explicaciones largas, lluvia de ideas o escritura profesional.

Analisis de datos

Preguntas educativas: un género centrado en la corrección donde GPT-5 mini gana por resultado directo

29 respuestas evaluadas Preguntas educativas Actualizado 2026/7/1
1
Claude Fable 5

Anthropic

95
Puntuacion media
100%
Tasa de victoria
1 veces 1.o 1 muestras
2
GPT-5 mini

OpenAI

90
Puntuacion media
100%
Tasa de victoria
5 veces 1.o 5 muestras
3
Claude Sonnet 4.6

Anthropic

93
Puntuacion media
75%
Tasa de victoria
3 veces 1.o 4 muestras

Puntuacion media por modelo

1 Claude Fable 5
9.46
2 GPT-5 mini
9.01
3 Claude Sonnet 4.6
9.29
4 GPT-5.5
9.01
5 Claude Opus 4.8
8.92
6 Gemini 2.5 Flash
6.77
7 Gemini 2.5 Flash-Lite
7.21
8 Gemini 2.5 Pro
8.41

Como ponderamos

Correccion 45% Calidad del razonamiento 20% Integridad 15% Claridad 10% Seguimiento de instrucciones 10%

Sobre 34 respuestas puntuadas, este es el género más estricto en precisión factual: la Corrección por sí sola pesa 45, más que en cualquier otro género. GPT-5 mini ocupa el puesto 1 con la mejor evidencia del campo: 5 muestras, 5 primeros puestos y un 100 % de victorias. Su media de 9,01 no es, sin embargo, la más alta, y ahí está la clave de este género.

El puesto aquí lo marca la tasa de victorias, no la media, y ambas se separan. Claude Sonnet 4.6 logra la media más alta de todo el campo (9,29) pero queda 2.º con un 75 % de victorias, así que la media del líder es en realidad 0,28 inferior a la del segundo. La brecha se invierte también en la parte baja: Gemini 2.5 Pro promedia un respetable 8,41, más que varios modelos por encima, pero queda último porque no ganó ninguno de sus 4 enfrentamientos.

El punto débil más claro son las gamas ligeras de Gemini y Claude en las preguntas difíciles: Claude Haiku 4.5 (7,78) y Gemini 2.5 Flash (6,77) quedan muy por debajo de los líderes de 9 puntos. Como la Corrección domina la rúbrica, esas brechas reflejan errores factuales en prompts difíciles, justo donde un benchmark de conocimiento debe separar modelos. Aun así, todo el campo abarca solo 0,6 puntos de la media más alta a la más baja.

La mayoría de modelos se apoyan en apenas 2 a 6 muestras, así que el orden fino es provisional y son probables las oscilaciones de muestra pequeña, sobre todo en las entradas de dos muestras en el centro de la tabla. El orden por tasa de victorias es real, pero siguen siendo medidas dependientes de las condiciones, no un ranking general de conocimiento.

En resumen

Para preguntas factuales, GPT-5 mini es la elección más defendible (5 muestras, 100 % de victorias, a coste de gama ligera), mientras que Claude Sonnet 4.6 tiene la media más alta (9,29) si ponderas la corrección bruta por encima de las victorias directas. Las gamas ligeras de Gemini son las más débiles aquí.

Este analisis se basa en las puntuaciones de benchmark medidas por Orivel para este genero y se actualiza periodicamente. Las puntuaciones son medidas que dependen de las condiciones, no una verdad absoluta.

Ranking de modelos fuertes en este genero

Este ranking se ordena por la puntuacion media solo dentro de este genero.

Ultima actualizacion: 07 Jul 2026 09:43

#1
Claude Fable 5 Anthropic

Tasa de victoria

100%

Puntuacion media

95
#2
GPT-5 mini OpenAI

Tasa de victoria

100%

Puntuacion media

90
#3
Claude Sonnet 4.6 Anthropic

Tasa de victoria

75%

Puntuacion media

93
#4
GPT-5.5 OpenAI

Tasa de victoria

50%

Puntuacion media

90
#5
Claude Opus 4.8 Anthropic

Tasa de victoria

50%

Puntuacion media

89
#6
Gemini 2.5 Flash Google

Tasa de victoria

25%

Puntuacion media

68
#7
Gemini 2.5 Flash-Lite Google

Tasa de victoria

14%

Puntuacion media

72
#8
Gemini 2.5 Pro Google

Tasa de victoria

0%

Puntuacion media

84

Que se evalua en Preguntas educativas

Criterios y pesos usados para este ranking por genero.

Correccion

45.0%

Este criterio se incluye para comprobar Correccion en la respuesta. Tiene mas peso porque este aspecto cambia mucho el resultado global del genero.

Calidad del razonamiento

20.0%

Este criterio se incluye para comprobar Calidad del razonamiento en la respuesta. Tiene un peso importante porque afecta la calidad de forma visible, aunque no sea lo unico que importa.

Integridad

15.0%

Este criterio se incluye para comprobar Integridad en la respuesta. Tiene menos peso porque acompana el objetivo principal, pero no define por si solo este genero.

Claridad

10.0%

Este criterio se incluye para comprobar Claridad en la respuesta. Tiene menos peso porque acompana el objetivo principal, pero no define por si solo este genero.

Seguimiento de instrucciones

10.0%

Este criterio se incluye para comprobar Seguimiento de instrucciones en la respuesta. Tiene menos peso porque acompana el objetivo principal, pero no define por si solo este genero.

Tareas recientes

Preguntas educativas

Anthropic Claude Fable 5 VS Google Gemini 2.5 Flash-Lite

Carrera de patrones con moneda sesgada

Pregunta tipo examen: Una moneda tiene probabilidad p de salir cara en cada lanzamiento, donde 0 < p < 1. Sea q = 1 - p. Lanzas la moneda repetidamente hasta que uno de los dos patrones de tres lanzamientos HTH o HHT aparece por primera vez como un bloque consecutivo. Por ejemplo, en la secuencia T H H T, el patrón HHT aparece terminando en el cuarto lanzamiento. Responda lo siguiente: 1. ¿Cuál es la probabilidad de que HTH aparezca antes que HHT? 2. ¿Cuál es el número esperado de lanzamientos hasta que HTH o HHT aparezca por primera vez? 3. Explique brevemente por qué una solución que trata bloques no solapados de tres lanzamientos como ensayos independientes da un resultado erróneo.

116
07 Jul 2026 09:43

Preguntas educativas

Anthropic Claude Opus 4.8 VS OpenAI GPT-5.5

Problema de física: la distorsión temporal del reloj de abuelo

Un reloj de abuelo utiliza un péndulo de latón para medir el tiempo, y está calibrado para ser perfectamente preciso a una temperatura ambiente de 20.0°C. Durante una ola de calor veraniega, la temperatura media de la habitación sube a 35.0°C. Basándose en el contexto proporcionado, responda lo siguiente: 1. Calcule la nueva longitud del péndulo de latón. Suponga que su longitud original (a 20.0°C) era exactamente 1.000 metro. 2. Calcule el nuevo periodo del péndulo a 35.0°C. 3. Determine cuántos segundos ganará o perderá el reloj en un periodo de 24 horas (que son 86,400 segundos). 4. Proporcione una explicación clara y paso a paso de los principios físicos que conducen a su conclusión, detallando cómo la temperatura afecta la precisión del reloj.

147
28 Jun 2026 09:40

Preguntas educativas

Anthropic Claude Opus 4.8 VS OpenAI GPT-5 mini

Control hormonal del ciclo menstrual

Se diagnostica a una paciente con una condición genética rara que provoca la incapacidad completa de su glándula pituitaria para producir Hormona luteinizante (LH), mientras que la producción de Hormona estimulante del folículo (FSH) permanece normal. Explique los efectos fisiológicos en cascada que esta deficiencia específica tendría sobre el ciclo menstrual de la paciente. Su explicación debe detallar los cambios esperados en la fase folicular, la ovulación, la fase lútea y el revestimiento uterino a lo largo de un ciclo típico. Asuma que la paciente está en edad reproductiva y por lo demás sana.

234
04 Jun 2026 09:39

Preguntas educativas

OpenAI GPT-5.5 VS Google Gemini 2.5 Flash-Lite

Explica por qué el hielo flota: una difícil pregunta de examen de química

El agua sólida (hielo) es menos densa que el agua líquida cerca de 0 °C, lo cual es inusual en comparación con la mayoría de las sustancias cuyas fases sólidas son más densas que sus fases líquidas. Escribe una respuesta tipo ensayo de examen (aproximadamente 350–550 palabras) que trate TODOS los siguientes puntos: 1. Indica las densidades aproximadas del hielo a 0 °C y del agua líquida a 0 °C y a 4 °C, e identifica la temperatura a la que el agua líquida alcanza su densidad máxima. 2. Explica, a nivel molecular, por qué el hielo tiene una densidad menor que el agua líquida. Tu explicación debe hacer referencia a: enlaces de hidrógeno, la coordinación tetraédrica de las moléculas de agua en el hielo hexagonal (Ih) y la estructura de red abierta con cavidades vacías. 3. Explica por qué el agua líquida cerca de 0 °C es más densa que el hielo pero sigue siendo menos densa que el agua a 4 °C. Describe la competencia entre dos efectos cuando la temperatura aumenta de 0 °C a 4 °C: el colapso parcial de racimos residuales con enlaces de hidrógeno similares a los del hielo (que aumenta la densidad) y la expansión térmica normal (que disminuye la densidad). 4. Da al menos dos consecuencias ecológicas o geofísicas importantes de esta anomalía (por ejemplo, la estratificación de lagos en invierno, la supervivencia de la vida acuática o el comportamiento del hielo marino). 5. Compara brevemente el agua con otra molécula pequeña (p. ej., H2S, NH3 o CH4) para mostrar por qué los enlaces de hidrógeno específicamente —no sólo el tamaño molecular o la polaridad— son responsables de la anomalía. Sé preciso con la terminología (p. ej., "enlace de hidrógeno" frente a "enlace covalente", "densidad" frente a "volumen específico"). Cuando cites valores numéricos, exprésalos con las unidades apropiadas y cifras significativas razonables.

437
28 Apr 2026 09:37

Preguntas educativas

Anthropic Claude Opus 4.7 VS Google Gemini 2.5 Flash-Lite

Analizar por qué un producto no es un polinomio

Un estudiante afirma que, dado que f(x) = (x^2 - 1)/(x - 1) se simplifica a x + 1 para x ≠ 1, la función g(x) = ((x^2 - 1)/(x - 1)) · |x - 1| es un polinomio igual a (x + 1)|x - 1|. Evalúa esta afirmación. Responde todas las partes: 1. Simplifica g(x) tanto como sea posible para x ≠ 1. 2. Determina si g(x) puede extenderse a un polinomio en todos los números reales. Justifica tu conclusión. 3. Indica si g es diferenciable en x = 1, y muestra el cálculo clave que respalde tu respuesta. 4. Explica brevemente el error conceptual en el razonamiento del estudiante. Tu respuesta debe ser matemáticamente rigurosa pero comprensible para un estudiante avanzado de secundaria.

501
24 Apr 2026 09:37

Preguntas educativas

Anthropic Claude Haiku 4.5 VS OpenAI GPT-5 mini

Bucles de retroalimentación hormonal en el ciclo menstrual humano

Explique el control hormonal del ciclo menstrual humano, centrándose en las fases folicular y lútea. Su explicación debe detallar los roles de la Hormona liberadora de gonadotropina (GnRH), la Hormona luteinizante (LH), la Hormona foliculoestimulante (FSH), el estrógeno y la progesterona. Específicamente, describa los mecanismos de retroalimentación positiva y negativa que regulan el ciclo, incluido el evento que desencadena la ovulación.

438
06 Apr 2026 09:37

Enlaces relacionados

X f L