Orivel Orivel
Ouvrir le menu

Questions éducatives

Compare la précision des modèles d’IA sur des questions éducatives et de type examen.

Dans ce genre, les capacites surtout observees sont Exactitude, Qualite du raisonnement, Completude.

Contrairement a explanation, ce genre valorise davantage l arrivee a la bonne reponse sur des questions de type examen que le style pedagogique.

Un score eleve ici ne garantit ni creativite, ni persuasion, ni grande force sur des taches de planification ouvertes.

Usages adaptes aux modeles forts dans ce genre

aide a l etude, questions d examen et situations ou l exactitude de la reponse passe avant tout.

Ce que ce genre ne permet pas de juger a lui seul

si le modele est meilleur pour les longues explications, le brainstorming ou l ecriture professionnelle.

Analyse des donnees

Questions pédagogiques : un genre centré sur la justesse, mené par GPT-5 mini au bilan des duels

29 reponses evaluees Questions éducatives Mis a jour le 2026/7/1
1
Claude Fable 5

Anthropic

95
Score moyen
100%
Taux de victoire
1 fois 1er 1 echantillons
2
GPT-5 mini

OpenAI

90
Score moyen
100%
Taux de victoire
5 fois 1er 5 echantillons
3
Claude Sonnet 4.6

Anthropic

93
Score moyen
75%
Taux de victoire
3 fois 1er 4 echantillons

Score moyen par modele

1 Claude Fable 5
9.46
2 GPT-5 mini
9.01
3 Claude Sonnet 4.6
9.29
4 GPT-5.5
9.01
5 Claude Opus 4.8
8.92
6 Gemini 2.5 Flash
6.77
7 Gemini 2.5 Flash-Lite
7.21
8 Gemini 2.5 Pro
8.41

Notre ponderation

Exactitude 45% Qualite du raisonnement 20% Completude 15% Clarte 10% Respect des consignes 10%

Sur 34 réponses notées, c'est le genre le plus strict sur l'exactitude factuelle : la Justesse à elle seule pèse 45, plus que dans tout autre genre. GPT-5 mini occupe la 1re place avec la meilleure preuve du peloton : 5 échantillons, 5 premières places et 100 % de victoires. Sa moyenne de 9,01 n'est pourtant pas la plus haute, et c'est là tout l'enjeu de ce genre.

Le classement se joue ici sur le taux de victoires, non sur la moyenne, et les deux se séparent. Claude Sonnet 4.6 affiche la meilleure moyenne de tout le peloton (9,29) mais se classe 2e avec 75 % de victoires ; la moyenne du leader est donc en réalité inférieure de 0,28 à celle du dauphin. L'écart s'inverse aussi en bas de tableau : Gemini 2.5 Pro affiche une moyenne respectable de 8,41, supérieure à plusieurs modèles au-dessus de lui, mais ferme la marche car il n'a gagné aucun de ses 4 duels.

Le point faible le plus net, ce sont les gammes légères de Gemini et Claude sur les questions difficiles : Claude Haiku 4.5 (7,78) et Gemini 2.5 Flash (6,77) restent bien en dessous des leaders à 9 points. La Justesse dominant la grille, ces écarts traduisent des erreurs factuelles sur les prompts difficiles, là précisément où un benchmark de connaissances doit départager les modèles. Malgré tout, l'ensemble du peloton ne s'étale que sur 0,6 point de la meilleure à la plus basse moyenne.

La plupart des modèles ne reposent que sur 2 à 6 échantillons, donc l'ordre fin est provisoire et des oscillations de petit échantillon sont probables, surtout pour les entrées à deux échantillons au milieu du tableau. Le classement par taux de victoires est réel, mais ce sont des mesures dépendantes des conditions, non un classement général des connaissances.

En bref

Pour les questions factuelles, GPT-5 mini est le choix le plus défendable (5 échantillons, 100 % de victoires, au coût de la gamme légère), tandis que Claude Sonnet 4.6 a la meilleure moyenne (9,29) si l'on privilégie la justesse brute sur les victoires directes. Les gammes légères de Gemini sont les plus faibles ici.

Cette analyse s appuie sur les scores de benchmark mesures par Orivel pour ce genre et est mise a jour periodiquement. Les scores sont des mesures dependantes des conditions, pas une verite absolue.

Classement des modeles forts dans ce genre

Ce classement est trie par score moyen uniquement dans ce genre.

Derniere mise a jour: 07 Jul 2026 09:43

#1
Claude Fable 5 Anthropic

Taux de victoire

100%

Score moyen

95
#2
GPT-5 mini OpenAI

Taux de victoire

100%

Score moyen

90
#3
Claude Sonnet 4.6 Anthropic

Taux de victoire

75%

Score moyen

93
#4
GPT-5.5 OpenAI

Taux de victoire

50%

Score moyen

90
#5
Claude Opus 4.8 Anthropic

Taux de victoire

50%

Score moyen

89
#6
Gemini 2.5 Flash Google

Taux de victoire

25%

Score moyen

68
#7
Gemini 2.5 Flash-Lite Google

Taux de victoire

14%

Score moyen

72
#8
Gemini 2.5 Pro Google

Taux de victoire

0%

Score moyen

84

Ce qui est evalue dans Questions éducatives

Criteres et poids utilises pour ce classement par genre.

Exactitude

45.0%

Ce critere est present pour verifier Exactitude dans la reponse. Il a plus de poids parce que cet aspect influence fortement le resultat global de ce genre.

Qualite du raisonnement

20.0%

Ce critere est present pour verifier Qualite du raisonnement dans la reponse. Il garde un poids important parce qu il change visiblement la qualite, meme si ce n est pas le seul element qui compte.

Completude

15.0%

Ce critere est present pour verifier Completude dans la reponse. Il est plus legerement pondere parce qu il soutient l objectif principal sans definir a lui seul le genre.

Clarte

10.0%

Ce critere est present pour verifier Clarte dans la reponse. Il est plus legerement pondere parce qu il soutient l objectif principal sans definir a lui seul le genre.

Respect des consignes

10.0%

Ce critere est present pour verifier Respect des consignes dans la reponse. Il est plus legerement pondere parce qu il soutient l objectif principal sans definir a lui seul le genre.

Taches recentes

Questions éducatives

Anthropic Claude Fable 5 VS Google Gemini 2.5 Flash-Lite

Course de motifs pour une pièce biaisée

Question de type examen : Une pièce tombe sur face (H) avec probabilité p à chaque lancer, où 0 < p < 1. Soit q = 1 - p. On lance la pièce de manière répétée jusqu'à ce que l'un des deux motifs de trois lancers HTH ou HHT apparaisse pour la première fois en tant que bloc consécutif. Par exemple, dans la séquence T H H T, le motif HHT apparaît en se terminant au quatrième lancer. Répondez aux questions suivantes : 1. Quelle est la probabilité que HTH apparaisse avant HHT ? 2. Quelle est la durée espérée (en nombre de lancers) jusqu'à ce que l'un des motifs HTH ou HHT apparaisse pour la première fois ? 3. Expliquez brièvement pourquoi une solution qui traite des blocs non chevauchants de trois lancers comme des essais indépendants donne un résultat erroné.

116
07 Jul 2026 09:43

Questions éducatives

Anthropic Claude Opus 4.8 VS OpenAI GPT-5.5

Problème de physique : Le décalage temporel de l'horloge de grand-père

Une horloge de grand-père utilise un pendule en laiton pour garder le temps, et elle est étalonnée pour être parfaitement précise à une température ambiante de 20.0°C. Pendant une canicule d'été, la température ambiante moyenne augmente jusqu'à 35.0°C. Sur la base du contexte fourni, répondez aux questions suivantes : 1. Calculez la nouvelle longueur du pendule en laiton. Supposons que sa longueur initiale (à 20.0°C) était exactement de 1.000 mètre. 2. Calculez la nouvelle période du pendule à 35.0°C. 3. Déterminez combien de secondes l'horloge gagnera ou perdra en une période de 24 heures (soit 86 400 secondes). 4. Fournissez une explication claire, étape par étape, des principes physiques qui conduisent à votre conclusion, détaillant comment la température affecte la précision de l'horloge.

147
28 Jun 2026 09:40

Questions éducatives

Anthropic Claude Opus 4.8 VS OpenAI GPT-5 mini

Contrôle hormonal du cycle menstruel

Une patiente est diagnostiquée avec une affection génétique rare entraînant l'incapacité complète de son hypophyse à produire l'hormone lutéinisante (LH), tandis que la production d'hormone folliculo-stimulante (FSH) reste normale. Expliquez les effets physiologiques en cascade que cette carence spécifique aurait sur le cycle menstruel de la patiente. Votre explication doit détailler les changements attendus pendant la phase folliculaire, l'ovulation, la phase lutéale et au niveau de la muqueuse utérine tout au long d'un cycle typique. Supposez que la patiente soit en âge de procréer et par ailleurs en bonne santé.

234
04 Jun 2026 09:39

Questions éducatives

OpenAI GPT-5.5 VS Google Gemini 2.5 Flash-Lite

Expliquer pourquoi la glace flotte : une question difficile d'examen de chimie

L'eau solide (glace) est moins dense que l'eau liquide près de 0 °C, ce qui est inhabituel par rapport à la plupart des substances dont les phases solides sont plus denses que les phases liquides. Rédigez une réponse de type dissertation d'examen (environ 350–550 mots) qui traite TOUS les points suivants : 1. Indiquez les densités approximatives de la glace à 0 °C et de l'eau liquide à 0 °C et à 4 °C, et identifiez la température à laquelle l'eau liquide atteint sa densité maximale. 2. Expliquez, au niveau moléculaire, pourquoi la glace a une densité plus faible que l'eau liquide. Votre explication doit faire référence à : la liaison hydrogène, la coordination tétraédrique des molécules d'eau dans la glace hexagonale (Ih), et la structure en réseau ouvert avec cavités vides. 3. Expliquez pourquoi l'eau liquide près de 0 °C est plus dense que la glace mais reste moins dense que l'eau à 4 °C. Décrivez la compétition entre deux effets lorsque la température augmente de 0 °C à 4 °C : l'effondrement partiel des amas résiduels d'eau liés par des liaisons hydrogène semblables à la glace (qui augmente la densité) et l'expansion thermique normale (qui diminue la densité). 4. Donnez au moins deux conséquences écologiques ou géophysiques importantes de cette anomalie (par exemple, la stratification des lacs en hiver, la survie de la vie aquatique, ou le comportement de la banquise). 5. Comparez brièvement l'eau avec une autre petite molécule (par ex. H2S, NH3 ou CH4) pour montrer pourquoi la liaison hydrogène spécifiquement — pas seulement la taille moléculaire ou la polarité — est responsable de l'anomalie. Soyez précis dans la terminologie (par ex. "liaison hydrogène" vs. "liaison covalente", "densité" vs. "volume spécifique"). Lorsque vous citez des valeurs numériques, donnez-les avec les unités appropriées et un nombre de chiffres significatifs raisonnable.

437
28 Apr 2026 09:37

Questions éducatives

Anthropic Claude Opus 4.7 VS Google Gemini 2.5 Flash-Lite

Analyser pourquoi un produit n'est pas un polynôme

Un élève affirme que, parce que f(x) = (x^2 - 1)/(x - 1) se simplifie en x + 1 pour x ≠ 1, la fonction g(x) = ((x^2 - 1)/(x - 1)) · |x - 1| est un polynôme égal à (x + 1)|x - 1|. Évaluez cette affirmation. Répondez à toutes les parties : 1. Simplifiez g(x) autant que possible pour x ≠ 1. 2. Déterminez si g(x) peut être prolongée en un polynôme sur l'ensemble des réels. Justifiez votre conclusion. 3. Indiquez si g est différentiable en x = 1, et montrez le calcul clé qui soutient votre réponse. 4. Expliquez brièvement l'erreur conceptuelle dans le raisonnement de l'élève. Votre réponse doit être rigoureuse sur le plan mathématique mais compréhensible pour un bon lycéen.

501
24 Apr 2026 09:37

Questions éducatives

Anthropic Claude Haiku 4.5 VS OpenAI GPT-5 mini

Boucles de rétroaction hormonale dans le cycle menstruel humain

Expliquez le contrôle hormonal du cycle menstruel humain, en vous concentrant sur les phases folliculaire et lutéale. Votre explication doit détailler les rôles de l'hormone de libération des gonadotrophines (Gonadotropin-Releasing Hormone, GnRH), de l'hormone lutéinisante (Luteinizing Hormone, LH), de l'hormone folliculo-stimulante (Follicle-Stimulating Hormone, FSH), des œstrogènes et de la progestérone. Décrivez spécifiquement les mécanismes de rétroaction positive et négative qui régulent le cycle, y compris l'événement qui déclenche l'ovulation.

438
06 Apr 2026 09:37

Liens associes

X f L