Preguntas educativas
Compara qué tan bien responden los modelos de IA a preguntas educativas y de examen.
En este genero, las capacidades que mas se intentan medir son Correccion, Calidad del razonamiento, Integridad.
A diferencia de explanation, aqui pesa mas llegar a la respuesta correcta en preguntas tipo examen que adaptar el estilo de ensenanza.
Una puntuacion alta aqui no garantiza creatividad, capacidad de persuadir ni fortaleza en tareas abiertas de planificacion.
Para que sirve un modelo fuerte en este genero
estudio, preguntas de examen y situaciones donde la exactitud de la respuesta va primero.
Lo que este genero por si solo no alcanza a mostrar
si el modelo es mejor para explicaciones largas, lluvia de ideas o escritura profesional.
Preguntas educativas: un género centrado en la corrección donde GPT-5 mini gana por resultado directo
Anthropic
OpenAI
Anthropic
Puntuacion media por modelo
Como ponderamos
Sobre 34 respuestas puntuadas, este es el género más estricto en precisión factual: la Corrección por sí sola pesa 45, más que en cualquier otro género. GPT-5 mini ocupa el puesto 1 con la mejor evidencia del campo: 5 muestras, 5 primeros puestos y un 100 % de victorias. Su media de 9,01 no es, sin embargo, la más alta, y ahí está la clave de este género.
El puesto aquí lo marca la tasa de victorias, no la media, y ambas se separan. Claude Sonnet 4.6 logra la media más alta de todo el campo (9,29) pero queda 2.º con un 75 % de victorias, así que la media del líder es en realidad 0,28 inferior a la del segundo. La brecha se invierte también en la parte baja: Gemini 2.5 Pro promedia un respetable 8,41, más que varios modelos por encima, pero queda último porque no ganó ninguno de sus 4 enfrentamientos.
El punto débil más claro son las gamas ligeras de Gemini y Claude en las preguntas difíciles: Claude Haiku 4.5 (7,78) y Gemini 2.5 Flash (6,77) quedan muy por debajo de los líderes de 9 puntos. Como la Corrección domina la rúbrica, esas brechas reflejan errores factuales en prompts difíciles, justo donde un benchmark de conocimiento debe separar modelos. Aun así, todo el campo abarca solo 0,6 puntos de la media más alta a la más baja.
La mayoría de modelos se apoyan en apenas 2 a 6 muestras, así que el orden fino es provisional y son probables las oscilaciones de muestra pequeña, sobre todo en las entradas de dos muestras en el centro de la tabla. El orden por tasa de victorias es real, pero siguen siendo medidas dependientes de las condiciones, no un ranking general de conocimiento.
En resumen
Para preguntas factuales, GPT-5 mini es la elección más defendible (5 muestras, 100 % de victorias, a coste de gama ligera), mientras que Claude Sonnet 4.6 tiene la media más alta (9,29) si ponderas la corrección bruta por encima de las victorias directas. Las gamas ligeras de Gemini son las más débiles aquí.
Este analisis se basa en las puntuaciones de benchmark medidas por Orivel para este genero y se actualiza periodicamente. Las puntuaciones son medidas que dependen de las condiciones, no una verdad absoluta.
Ranking de modelos fuertes en este genero
Este ranking se ordena por la puntuacion media solo dentro de este genero.
Ultima actualizacion: 07 Jul 2026 09:43
Tasa de victoria
Puntuacion media
Tasa de victoria
Puntuacion media
Tasa de victoria
Puntuacion media
Tasa de victoria
Puntuacion media
Tasa de victoria
Puntuacion media
Tasa de victoria
Puntuacion media
Tasa de victoria
Puntuacion media
Tasa de victoria
Puntuacion media
| Modelos clasificados |
|
|
Detalle | ||||
|---|---|---|---|---|---|---|---|
| #1 | Claude Fable 5 | Anthropic |
100%
|
95
|
1 | 1 | Ver la evaluacion y la puntuacion de Claude Fable 5 |
| #2 | GPT-5 mini | OpenAI |
100%
|
90
|
5 | 5 | Ver la evaluacion y la puntuacion de GPT-5 mini |
| #3 | Claude Sonnet 4.6 | Anthropic |
75%
|
93
|
3 | 4 | Ver la evaluacion y la puntuacion de Claude Sonnet 4.6 |
| #4 | GPT-5.5 | OpenAI |
50%
|
90
|
1 | 2 | Ver la evaluacion y la puntuacion de GPT-5.5 |
| #5 | Claude Opus 4.8 | Anthropic |
50%
|
89
|
1 | 2 | Ver la evaluacion y la puntuacion de Claude Opus 4.8 |
| #6 | Gemini 2.5 Flash |
25%
|
68
|
1 | 4 | Ver la evaluacion y la puntuacion de Gemini 2.5 Flash | |
| #7 | Gemini 2.5 Flash-Lite |
14%
|
72
|
1 | 7 | Ver la evaluacion y la puntuacion de Gemini 2.5 Flash-Lite | |
| #8 | Gemini 2.5 Pro |
0%
|
84
|
0 | 4 | Ver la evaluacion y la puntuacion de Gemini 2.5 Pro |
Que se evalua en Preguntas educativas
Criterios y pesos usados para este ranking por genero.
Correccion
45.0%
Este criterio se incluye para comprobar Correccion en la respuesta. Tiene mas peso porque este aspecto cambia mucho el resultado global del genero.
Calidad del razonamiento
20.0%
Este criterio se incluye para comprobar Calidad del razonamiento en la respuesta. Tiene un peso importante porque afecta la calidad de forma visible, aunque no sea lo unico que importa.
Integridad
15.0%
Este criterio se incluye para comprobar Integridad en la respuesta. Tiene menos peso porque acompana el objetivo principal, pero no define por si solo este genero.
Claridad
10.0%
Este criterio se incluye para comprobar Claridad en la respuesta. Tiene menos peso porque acompana el objetivo principal, pero no define por si solo este genero.
Seguimiento de instrucciones
10.0%
Este criterio se incluye para comprobar Seguimiento de instrucciones en la respuesta. Tiene menos peso porque acompana el objetivo principal, pero no define por si solo este genero.
Tareas recientes
Preguntas educativas
Carrera de patrones con moneda sesgada
Pregunta tipo examen: Una moneda tiene probabilidad p de salir cara en cada lanzamiento, donde 0 < p < 1. Sea q = 1 - p. Lanzas la moneda repetidamente hasta que uno de los dos patrones de tres lanzamientos HTH o HHT aparece por primera vez como un bloque consecutivo. Por ejemplo, en la secuencia T H H T, el patrón HHT aparece terminando en el cuarto lanzamiento. Responda lo siguiente: 1. ¿Cuál es la probabilidad de que HTH aparezca antes que HHT? 2. ¿Cuál es el número esperado de lanzamientos hasta que HTH o HHT aparezca por primera vez? 3. Explique brevemente por qué una solución que trata bloques no solapados de tres lanzamientos como ensayos independientes da un resultado erróneo.
Preguntas educativas
Problema de física: la distorsión temporal del reloj de abuelo
Un reloj de abuelo utiliza un péndulo de latón para medir el tiempo, y está calibrado para ser perfectamente preciso a una temperatura ambiente de 20.0°C. Durante una ola de calor veraniega, la temperatura media de la habitación sube a 35.0°C. Basándose en el contexto proporcionado, responda lo siguiente: 1. Calcule la nueva longitud del péndulo de latón. Suponga que su longitud original (a 20.0°C) era exactamente 1.000 metro. 2. Calcule el nuevo periodo del péndulo a 35.0°C. 3. Determine cuántos segundos ganará o perderá el reloj en un periodo de 24 horas (que son 86,400 segundos). 4. Proporcione una explicación clara y paso a paso de los principios físicos que conducen a su conclusión, detallando cómo la temperatura afecta la precisión del reloj.
Preguntas educativas
Control hormonal del ciclo menstrual
Se diagnostica a una paciente con una condición genética rara que provoca la incapacidad completa de su glándula pituitaria para producir Hormona luteinizante (LH), mientras que la producción de Hormona estimulante del folículo (FSH) permanece normal. Explique los efectos fisiológicos en cascada que esta deficiencia específica tendría sobre el ciclo menstrual de la paciente. Su explicación debe detallar los cambios esperados en la fase folicular, la ovulación, la fase lútea y el revestimiento uterino a lo largo de un ciclo típico. Asuma que la paciente está en edad reproductiva y por lo demás sana.
Preguntas educativas
Explica por qué el hielo flota: una difícil pregunta de examen de química
El agua sólida (hielo) es menos densa que el agua líquida cerca de 0 °C, lo cual es inusual en comparación con la mayoría de las sustancias cuyas fases sólidas son más densas que sus fases líquidas. Escribe una respuesta tipo ensayo de examen (aproximadamente 350–550 palabras) que trate TODOS los siguientes puntos: 1. Indica las densidades aproximadas del hielo a 0 °C y del agua líquida a 0 °C y a 4 °C, e identifica la temperatura a la que el agua líquida alcanza su densidad máxima. 2. Explica, a nivel molecular, por qué el hielo tiene una densidad menor que el agua líquida. Tu explicación debe hacer referencia a: enlaces de hidrógeno, la coordinación tetraédrica de las moléculas de agua en el hielo hexagonal (Ih) y la estructura de red abierta con cavidades vacías. 3. Explica por qué el agua líquida cerca de 0 °C es más densa que el hielo pero sigue siendo menos densa que el agua a 4 °C. Describe la competencia entre dos efectos cuando la temperatura aumenta de 0 °C a 4 °C: el colapso parcial de racimos residuales con enlaces de hidrógeno similares a los del hielo (que aumenta la densidad) y la expansión térmica normal (que disminuye la densidad). 4. Da al menos dos consecuencias ecológicas o geofísicas importantes de esta anomalía (por ejemplo, la estratificación de lagos en invierno, la supervivencia de la vida acuática o el comportamiento del hielo marino). 5. Compara brevemente el agua con otra molécula pequeña (p. ej., H2S, NH3 o CH4) para mostrar por qué los enlaces de hidrógeno específicamente —no sólo el tamaño molecular o la polaridad— son responsables de la anomalía. Sé preciso con la terminología (p. ej., "enlace de hidrógeno" frente a "enlace covalente", "densidad" frente a "volumen específico"). Cuando cites valores numéricos, exprésalos con las unidades apropiadas y cifras significativas razonables.
Preguntas educativas
Analizar por qué un producto no es un polinomio
Un estudiante afirma que, dado que f(x) = (x^2 - 1)/(x - 1) se simplifica a x + 1 para x ≠ 1, la función g(x) = ((x^2 - 1)/(x - 1)) · |x - 1| es un polinomio igual a (x + 1)|x - 1|. Evalúa esta afirmación. Responde todas las partes: 1. Simplifica g(x) tanto como sea posible para x ≠ 1. 2. Determina si g(x) puede extenderse a un polinomio en todos los números reales. Justifica tu conclusión. 3. Indica si g es diferenciable en x = 1, y muestra el cálculo clave que respalde tu respuesta. 4. Explica brevemente el error conceptual en el razonamiento del estudiante. Tu respuesta debe ser matemáticamente rigurosa pero comprensible para un estudiante avanzado de secundaria.
Preguntas educativas
Bucles de retroalimentación hormonal en el ciclo menstrual humano
Explique el control hormonal del ciclo menstrual humano, centrándose en las fases folicular y lútea. Su explicación debe detallar los roles de la Hormona liberadora de gonadotropina (GnRH), la Hormona luteinizante (LH), la Hormona foliculoestimulante (FSH), el estrógeno y la progesterona. Específicamente, describa los mecanismos de retroalimentación positiva y negativa que regulan el ciclo, incluido el evento que desencadena la ovulación.