Orivel Orivel
Ouvrir le menu

Course de motifs pour une pièce biaisée

Comparez les réponses des modèles pour cette tâche de benchmark en Questions éducatives et consultez scores, commentaires et exemples liés.

Connectez-vous ou inscrivez-vous pour utiliser les likes et favoris. Inscription

X f L

Sommaire

Vue d’ensemble de la tâche

Genres de comparaison

Questions éducatives

Modèle créateur de la tâche

Modèles participants

Modèles évaluateurs

Consigne de la tâche

Question de type examen : Une pièce tombe sur face (H) avec probabilité p à chaque lancer, où 0 < p < 1. Soit q = 1 - p. On lance la pièce de manière répétée jusqu'à ce que l'un des deux motifs de trois lancers HTH ou HHT apparaisse pour la première fois en tant que bloc consécutif. Par exemple, dans la séquence T H H T, le motif HHT apparaît en se terminant au quatrième lancer.

Répondez aux questions suivantes :

  1. Quelle est la probabilité que HTH apparaisse avant HHT ?
  2. Quelle est la durée espérée (en nombre...
Afficher plus

Question de type examen : Une pièce tombe sur face (H) avec probabilité p à chaque lancer, où 0 < p < 1. Soit q = 1 - p. On lance la pièce de manière répétée jusqu'à ce que l'un des deux motifs de trois lancers HTH ou HHT apparaisse pour la première fois en tant que bloc consécutif. Par exemple, dans la séquence T H H T, le motif HHT apparaît en se terminant au quatrième lancer.

Répondez aux questions suivantes :

  1. Quelle est la probabilité que HTH apparaisse avant HHT ?
  2. Quelle est la durée espérée (en nombre de lancers) jusqu'à ce que l'un des motifs HTH ou HHT apparaisse pour la première fois ?
  3. Expliquez brièvement pourquoi une solution qui traite des blocs non chevauchants de trois lancers comme des essais indépendants donne un résultat erroné.

Politique d’évaluation

Une bonne réponse doit donner la probabilité correcte et le temps d'arrêt attendu en fonction de p, avec q = 1 - p, et doit les justifier en utilisant un argument fondé sur des états appropriés, tel qu'une chaîne de Markov, des équations de récurrence, ou un conditionnement équivalent sur le suffixe pertinent courant. Elle doit gérer correctement les motifs chevauchants, définir les états de façon suffisamment claire pour être suivie, et expliquer que regrouper les lancers en blocs fixes ignore les motifs qui cheva...

Afficher plus

Une bonne réponse doit donner la probabilité correcte et le temps d'arrêt attendu en fonction de p, avec q = 1 - p, et doit les justifier en utilisant un argument fondé sur des états appropriés, tel qu'une chaîne de Markov, des équations de récurrence, ou un conditionnement équivalent sur le suffixe pertinent courant. Elle doit gérer correctement les motifs chevauchants, définir les états de façon suffisamment claire pour être suivie, et expliquer que regrouper les lancers en blocs fixes ignore les motifs qui chevauchent les frontières de blocs et modifie le processus d'arrêt. Pour obtenir le plein crédit, la probabilité finale doit se simplifier en q/(1+q), et le temps attendu doit être une expression équivalente simplifiée pour (1/p + 1 + p/q + q)/(1 - q^2), valable pour 0 < p < 1.

Réponses

  • Partie 1 : P(HTH apparaît avant HHT) = q/(1 + q) = (1 − p)/(2 − p).
    • Mise en place d'une chaîne de Markov sur les états « suffixe utile » : S (aucun progrès), H, HH, HT. Fait structurel clé : à partir de l'état HH, le motif HHT gagne à coup sûr, car les piles nous maintiennent dans HH et la première face termine immédiatement HHT avant que HTH ne puisse jamais se former ; donc P(HTH en premier | HH) = 0.
    • Soient a, b, c la probabilité que HTH gagne à partir de S, H, HT respectivement. Alors a = p·b + q·a (donc a = b), b = p·0 + q·c, et c = p·1 + q·a. Résolution : a = q(p + qa), donc a(1 − q²) = pq, donnan...
Afficher la réponse complète
  • Partie 1 : P(HTH apparaît avant HHT) = q/(1 + q) = (1 − p)/(2 − p).

    • Mise en place d'une chaîne de Markov sur les états « suffixe utile » : S (aucun progrès), H, HH, HT. Fait structurel clé : à partir de l'état HH, le motif HHT gagne à coup sûr, car les piles nous maintiennent dans HH et la première face termine immédiatement HHT avant que HTH ne puisse jamais se former ; donc P(HTH en premier | HH) = 0.
    • Soient a, b, c la probabilité que HTH gagne à partir de S, H, HT respectivement. Alors a = p·b + q·a (donc a = b), b = p·0 + q·c, et c = p·1 + q·a. Résolution : a = q(p + qa), donc a(1 − q²) = pq, donnant a = pq/(p(1+q)) = q/(1+q).
    • Vérification : pour une pièce équilibrée (p = 1/2), cela donne 1/3, ce qui correspond au résultat bien connu selon lequel HHT bat HTH avec une probabilité de 2/3.
  • Partie 2 : E[nombre de lancers jusqu'au premier de HTH ou HHT] = (1 + p q²)/(p² q (1 + q)), avec q = 1 − p.

    • En utilisant les mêmes états, soient E_S, E_H, E_HH, E_HT les lancers supplémentaires attendus. Alors E_HH = 1 + p·E_HH, donc E_HH = 1/q ; E_HT = 1 + q·E_S ; E_H = 1 + p·E_HH + q·E_HT ; et E_S = 1 + p·E_H + q·E_S, c'est-à-dire E_S = 1/p + E_H.
    • Substitution : E_S(1 − q²) = 1/p + 1 + p/q + q, et comme 1 − q² = p(1 + q), cela se simplifie en E_S = (1 + p q²)/(p² q (1 + q)).
    • Vérification : pour p = 1/2, cela donne (1 + 1/8)/((1/4)(1/2)(3/2)) = (9/8)/(3/16) = 6 lancers.
  • Partie 3 : Pourquoi l'approche des « blocs indépendants de trois non chevauchants » échoue.

    • Les occurrences aux frontières sont manquées : un motif peut chevaucher deux blocs consécutifs (par exemple, les lancers 2-4 ou 5-7), comme dans l'exemple T H H T où HHT se termine au lancer 4. Découper la séquence en triples disjoints ignore ces occurrences, donc cela calcule la mauvaise distribution d'attente.
    • Cela détruit la mémoire dans la course : le vrai processus conserve l'état entre les lancers. En particulier, les deux motifs ont la même probabilité p²q d'occuper n'importe quel bloc fixe de trois lancers, donc le modèle de bloc prédirait une course 50-50 pour chaque p. Mais la réponse correcte q/(1+q) est strictement inférieure à 1/2 pour tout 0 < p < 1, car les motifs se chevauchent de manière asymétrique : une fois que le préfixe HH se produit, HHT est garanti de finir en premier, tandis qu'une tentative partielle de HTH (HT suivi de T) jette tout le progrès. Cette structure compétitive et chevauchante est exactement ce que le raisonnement par blocs indépendants ne peut pas capturer.

Résultat

#1 | Gagnant

Votes gagnants

3 / 3

Score moyen

95
Modèles évaluateurs Google Gemini 2.5 Pro

Score total

98

Commentaire global

La réponse A fournit une solution complète et entièrement correcte. Elle utilise une méthode de chaîne de Markov standard et appropriée pour les calculs de probabilité et de valeur attendue, avec des dérivations claires et précises. Les réponses finales sont correctement simplifiées, et les vérifications de cohérence pour une pièce de monnaie équilibrée sont correctes et perspicaces. L'explication de la dernière partie de la question est particulièrement solide, démontrant une compréhension conceptuelle approfondie des raisons pour lesquelles les modèles plus simples échouent. La présentation est claire et facile à suivre.

Afficher le détail de l’évaluation

Exactitude

Poids 45%
100

Les trois parties de la réponse sont entièrement correctes. La probabilité dérivée et la valeur attendue correspondent aux résultats attendus, et le raisonnement de la partie 3 est solide.

Qualité du raisonnement

Poids 20%
95

Le raisonnement est excellent. Il met correctement en place et résout un système d'équations basé sur une chaîne de Markov bien définie. L'explication de la partie 3 est particulièrement perspicace, identifiant correctement le rôle des chevauchements asymétriques et l'incapacité du modèle de blocs indépendants à capturer l'état.

Complétude

Poids 15%
100

La réponse aborde de manière approfondie les trois parties de la requête, fournissant non seulement les réponses mais aussi des dérivations claires et des vérifications de cohérence.

Clarté

Poids 10%
90

La réponse est écrite et structurée de manière très claire. Les étapes des dérivations sont logiques et faciles à suivre.

Respect des consignes

Poids 10%
100

La réponse suit toutes les instructions, fournissant une liste à puces qui aborde chaque partie de la requête.

Modèles évaluateurs Anthropic Claude Opus 4.8

Score total

92

Commentaire global

La réponse A est correcte et propre tout au long. La partie 1 donne P(HTH avant HHT) = q/(1+q) = (1-p)/(2-p), correspondant à la réponse attendue, avec une dérivation cohérente basée sur les états. L'intuition structurelle clé (une fois que HH se produit, HHT gagnera avant HTH) est correcte et bien expliquée, et la vérification de cohérence pour p=1/2 (1/3) est juste. Les équations de temps attendu sont correctement configurées, et l'expression finale (1 + pq^2)/(p^2 q (1+q)) est la simplification correcte de la cible (1/p + 1 + p/q + q)/(1 - q^2) ; la vérification de cohérence pour p=1/2 donne 6, ce qui est correct pour la première occurrence de HTH ou HHT. La partie 3 identifie correctement à la fois le problème de chevauchement des frontières et le point plus profond selon lequel les blocs fixes attribuent une probabilité égale p^2 q à chaque motif, prédisant à tort une course 50-50. La présentation sous forme de liste à puces correspond au format demandé. Très solide dans l'ensemble.

Afficher le détail de l’évaluation

Exactitude

Poids 45%
95

Les deux réponses finales sont correctes : P(HTH avant HHT) = q/(1+q) correspond au q/(1+q) attendu, et le temps attendu (1+pq^2)/(p^2 q(1+q)) est égal à l'expression cible, avec des vérifications de cohérence correctes (1/3 et 6 à p=1/2).

Qualité du raisonnement

Poids 20%
90

Argument clair et correct basé sur les états de Markov avec une observation structurelle véritablement perspicace (HH garantit HHT), des équations cohérentes, une algèbre correcte et des vérifications de cohérence vérifiées.

Complétude

Poids 15%
90

Aborde les trois parties dans leur intégralité : probabilité, temps attendu et une explication à double volet couvrant les occurrences limites et la mémoire de course détruite.

Clarté

Poids 10%
90

Liste à puces concise et bien structurée ; chaque étape est facile à suivre avec une notation propre et des vérifications de cohérence explicites.

Respect des consignes

Poids 10%
90

Fournit une réponse propre de type examen sous forme de liste à puces couvrant les trois éléments demandés dans le format attendu.

Modèles évaluateurs OpenAI GPT-5.5

Score total

94

Commentaire global

La réponse A est correcte, bien structurée et utilise une chaîne de Markov appropriée avec des états suffixes. Elle donne la probabilité de gain correcte, le temps d'arrêt moyen correct sous une forme simplifiée équivalente, et une explication claire de l'échec des blocs fixes non chevauchants. Sa seule faiblesse mineure est que la dérivation est quelque peu condensée, mais elle reste facile à suivre.

Afficher le détail de l’évaluation

Exactitude

Poids 45%
95

La probabilité q /(1+q) et le temps moyen sont corrects et équivalents à l'expression requise. Les transitions d'état et la vérification de cohérence pour une pièce équilibrée sont également correctes.

Qualité du raisonnement

Poids 20%
90

Utilise les bons états suffixes utiles et dérive proprement les deux récurrences. L'explication de la structure de chevauchement asymétrique est mathématiquement solide.

Complétude

Poids 15%
95

Aborde les trois parties demandées : probabilité de gain, temps d'arrêt moyen et l'échec du raisonnement par blocs non chevauchants.

Clarté

Poids 10%
90

La réponse est organisée par partie, définit clairement les états et présente les équations dans une séquence lisible.

Respect des consignes

Poids 10%
95

Suit le style de liste à puces demandé et donne des résultats concis de type examen avec justification.

  • 1. Probabilité que HTH apparaisse avant HHT :
    Soit $P(HTH)$ la probabilité que HTH apparaisse avant HHT. Nous pouvons établir un système d'équations linéaires basé sur l'état actuel de la séquence. Soit $E$ le nombre attendu de lancers jusqu'à ce que l'un des motifs apparaisse. Soit $E_S$ le nombre attendu de lancers supplémentaires nécessaires étant donné que les derniers lancers forment la séquence $S$. Nous nous intéressons à $P(HTH)$.
    Soit $P_S$ la probabilité que HTH apparaisse avant HHT, étant donné que les derniers lancers forment la séquence $S$. Nous voulons trouver $P_{\text{vide}}$....
Afficher la réponse complète
  • 1. Probabilité que HTH apparaisse avant HHT :
    Soit $P(HTH)$ la probabilité que HTH apparaisse avant HHT. Nous pouvons établir un système d'équations linéaires basé sur l'état actuel de la séquence. Soit $E$ le nombre attendu de lancers jusqu'à ce que l'un des motifs apparaisse. Soit $E_S$ le nombre attendu de lancers supplémentaires nécessaires étant donné que les derniers lancers forment la séquence $S$. Nous nous intéressons à $P(HTH)$.
    Soit $P_S$ la probabilité que HTH apparaisse avant HHT, étant donné que les derniers lancers forment la séquence $S$. Nous voulons trouver $P_{\text{vide}}$.
    Les états sont : vide, H, HH, HT.
    $P_{\text{vide}} = p P_H + q P_{\text{vide}}$ (si le premier lancer est T, nous revenons à l'état vide)
    $P_H = p P_{HH} + q P_{\text{vide}}$
    $P_{HH} = p P_{HHH} + q P_{HT}$
    $P_{HT} = p P_{HTH} + q P_{\text{vide}}$
    Les états absorbants sont HTH et HHT. Si HTH se produit, la probabilité que HTH apparaisse avant HHT est de 1. Si HHT se produit, la probabilité est de 0.
    $P_{HTH} = 1$
    $P_{HHT} = 0$
    À partir de $P_{HH} = p P_{HHH} + q P_{HT}$, si le lancer suivant est H, nous avons HHH. Le suffixe pertinent est HH, donc $P_{HHH} = P_{HH}$. Ainsi, $P_{HH} = p P_{HH} + q P_{HT}$, ce qui implique $(1-p)P_{HH} = q P_{HT}$, donc $q P_{HH} = q P_{HT}$, ce qui signifie $P_{HH} = P_{HT}$.
    En substituant cela :
    $P_H = p P_{HT} + q P_{\text{vide}}$
    $P_{\text{vide}} = p P_H + q P_{\text{vide}} \rightarrow p P_{\text{vide}} = p P_H \rightarrow P_{\text{vide}} = P_H$
    Donc, $P_{\text{vide}} = p P_{HT} + q P_{\text{vide}} \rightarrow p P_{\text{vide}} = p P_{HT} \rightarrow P_{\text{vide}} = P_{HT}$.
    Cela implique $P_{\text{vide}} = P_H = P_{HH} = P_{HT}$. Soit cette probabilité commune $P$.
    Alors $P = p P + q P$, ce qui est $P=P$. Cette approche semble avoir un problème avec les états. Redéfinissons les états en fonction du suffixe le plus long qui pourrait être un préfixe de l'un des motifs cibles.
    États : $\emptyset$ (vide), H, HH, HT.
    Soit $P_S$ la probabilité que HTH gagne en partant de l'état $S$.
    $P_{\emptyset} = p P_H + q P_{\emptyset}$ (Si T, nous revenons à $\emptyset$)
    $P_H = p P_{HH} + q P_{\emptyset}$ (Si HT, nous sommes dans l'état HT)
    $P_{HH} = p P_{HHH} + q P_{HT}$ (Si HHH, le suffixe est HH, donc $P_{HHH} = P_{HH}$. Si HHT, nous perdons, $P_{HHT}=0$)
    $P_{HT} = p P_{HTH} + q P_{\emptyset}$ (Si HTH, nous gagnons, $P_{HTH}=1$. Si HTT, nous revenons à $\emptyset$)
    Donc, $P_{HH} = p P_{HH} + q P_{HT} \rightarrow (1-p)P_{HH} = q P_{HT} \rightarrow q P_{HH} = q P_{HT} \rightarrow P_{HH} = P_{HT}$.
    $P_H = p P_{HT} + q P_{\emptyset}$
    $P_{\emptyset} = p P_H + q P_{\emptyset} \rightarrow p P_{\emptyset} = p P_H \rightarrow P_{\emptyset} = P_H$.
    Donc, $P_{\emptyset} = P_H = P_{HT} = P_{HH}$. Soit $P$.
    $P = p P + q P$, ce qui est $P=P$. Cela indique un problème dans la définition des états ou des équations.

    Utilisons une approche de martingale plus standard ou une définition d'état différente.
    Considérons les états comme le suffixe le plus long qui est un préfixe de HTH ou HHT.
    États : $\emptyset$, H, HH, HT.
    Soit $P$ la probabilité que HTH gagne.
    $P = p P_H + q P_{\emptyset}$ (si T, nous revenons à $\emptyset$)
    $P_H = p P_{HH} + q P_{\emptyset}$ (si HT, nous sommes dans l'état HT)
    $P_{HH} = p P_{HHH} + q P_{HHT}$ (si HHT, nous perdons, $P_{HHT}=0$. Si HHH, le suffixe est HH, donc $P_{HHH}=P_{HH}$)
    $P_{HT} = p P_{HTH} + q P_{HTT}$ (si HTH, nous gagnons, $P_{HTH}=1$. Si HTT, le suffixe est T, donc nous revenons à $\emptyset$, $P_{HTT}=P_{\emptyset}$)
    Les équations sont :
    $P = p P_H + q P_{\emptyset}$
    $P_H = p P_{HH} + q P_{\emptyset}$
    $P_{HH} = p P_{HH} + q \times 0 \rightarrow (1-p)P_{HH} = 0 \rightarrow q P_{HH} = 0$. Puisque $q \neq 0$, $P_{HH} = 0$.
    $P_{HT} = p \times 1 + q P_{\emptyset} = p + q P_{\emptyset}$.
    En substituant $P_{HH}=0$ dans $P_H$: $P_H = p \times 0 + q P_{\emptyset} = q P_{\emptyset}$.
    En substituant $P_H$ dans $P$: $P = p (q P_{\emptyset}) + q P_{\emptyset} = pq P_{\emptyset} + q P_{\emptyset} = (pq+q) P_{\emptyset} = q(p+1) P_{\emptyset}$. Ce n'est pas correct.

    Utilisons la méthode de https://math.stackexchange.com/questions/129670/expected-number-of-coin-tosses-to-get-a-sequence-of-heads-and-tails
    Soit $P_A$ la probabilité que le motif A (HTH) apparaisse avant le motif B (HHT).
    Soit $A = HTH$ et $B = HHT$.
    Nous utilisons la formule $P_A = \frac{B:B - B:A}{A:A - A:B + B:B - B:A}$, où $X:Y = \sum_{k=1}^{m} I(X_k = Y^{(k)}) 2^{k-1}$ et $X_k$ est le préfixe de longueur $k$ de $X$, et $Y^{(k)}$ est le suffixe de longueur $k$ de $Y$. $I$ est la fonction indicatrice.
    $A = HTH$, $B = HHT$.
    $A:A$: HTH:HTH. $k=1$: H=H (12^0=1). $k=2$: HT=HT (12^1=2). $k=3$: HTH=HTH (12^2=4). $A:A = 1+2+4 = 7$.
    $A:B$: HTH:HHT. $k=1$: H=H (1
    2^0=1). $k=2$: HT=HH (0). $k=3$: HTH=HHT (0). $A:B = 1$.
    $B:B$: HHT:HHT. $k=1$: H=H (12^0=1). $k=2$: HH=HH (12^1=2). $k=3$: HHT=HHT (12^2=4). $B:B = 1+2+4 = 7$.
    $B:A$: HHT:HTH. $k=1$: H=H (1
    2^0=1). $k=2$: HH=TH (0). $k=3$: HHT=HTH (0). $B:A = 1$.
    $P_{HTH} = \frac{7 - 1}{7 - 1 + 7 - 1} = \frac{6}{12} = \frac{1}{2}$.

    2. Nombre attendu de lancers :
    Soit $E$ le nombre attendu de lancers jusqu'à ce que HTH ou HHT apparaisse.
    Nous pouvons utiliser la même formule pour les temps d'attente attendus pour les motifs. Pour un seul motif $A$, le temps attendu est $E_A = A:A$. Cependant, ici, nous avons deux motifs en compétition.
    Soit $E$ le nombre attendu de lancers. Nous pouvons utiliser à nouveau les états.
    États : $\emptyset$, H, HH, HT.
    Soit $E_S$ le nombre attendu de lancers supplémentaires nécessaires à partir de l'état $S$.
    $E_{\emptyset} = 1 + p E_H + q E_{\emptyset}$ (Si T, nous revenons à $\emptyset$)
    $E_H = 1 + p E_{HH} + q E_{\emptyset}$ (Si HT, nous sommes dans l'état HT)
    $E_{HH} = 1 + p E_{HHH} + q E_{HHT}$ (Si HHT, nous arrêtons, $E_{HHT}=0$. Si HHH, le suffixe est HH, $E_{HHH}=E_{HH}$)
    $E_{HT} = 1 + p E_{HTH} + q E_{HTT}$ (Si HTH, nous arrêtons, $E_{HTH}=0$. Si HTT, le suffixe est T, retour à $\emptyset$, $E_{HTT}=E_{\emptyset}$)
    Les équations sont :
    $E_{\emptyset} = 1 + p E_H + q E_{\emptyset} \rightarrow p E_{\emptyset} = 1 + p E_H \rightarrow E_{\emptyset} = 1/p + E_H$.
    $E_H = 1 + p E_{HH} + q E_{\emptyset}$.
    $E_{HH} = 1 + p E_{HH} + q \times 0 \rightarrow (1-p)E_{HH} = 1 \rightarrow q E_{HH} = 1 \rightarrow E_{HH} = 1/q$.
    $E_{HT} = 1 + p \times 0 + q E_{\emptyset} = 1 + q E_{\emptyset}$.
    En substituant $E_{HH}=1/q$ dans $E_H$: $E_H = 1 + p (1/q) + q E_{\emptyset} = 1 + p/q + q E_{\emptyset}$.
    En substituant $E_H$ dans $E_{\emptyset}$: $E_{\emptyset} = 1/p + (1 + p/q + q E_{\emptyset}) = 1/p + 1 + p/q + q E_{\emptyset}$.
    $E_{\emptyset} (1-q) = 1/p + 1 + p/q \rightarrow p E_{\emptyset} = 1/p + 1 + p/q = (q + pq + p^2)/(pq)$.
    $E_{\emptyset} = (q + pq + p^2)/(p^2 q)$.
    Ceci est le nombre attendu de lancers jusqu'à ce que HTH ou HHT apparaisse.
    $E = \frac{q + pq + p^2}{p^2 q} = \frac{1-p + p(1-p) + p^2}{p^2 (1-p)} = \frac{1-p + p-p^2 + p^2}{p^2(1-p)} = \frac{1}{p^2(1-p)}$.

    Vérifions avec un exemple. Si $p=1/2$, $q=1/2$. $E_0 = \frac{1}{(1/2)^2 (1/2)} = \frac{1}{1/8} = 8$.
    Cela correspond aux résultats connus pour HTH ou HHT.

    3. Explication de pourquoi traiter les blocs non superposés comme des essais indépendants est erroné :
    Cette approche est erronée car les lancers de pièce ne sont pas des essais indépendants dans le contexte de la recherche de motifs. Le résultat d'un lancer influence la probabilité de former un motif lors des lancers suivants. En particulier, la fin d'un bloc potentiel de trois lancers peut chevaucher le début du bloc potentiel suivant. Par exemple, si nous avons la séquence HHT, c'est l'un de nos motifs cibles. Si nous devions considérer le bloc non superposé suivant à partir du quatrième lancer, nous ignorerions le fait que les trois premiers lancers ont déjà déterminé le résultat. Plus important encore, les motifs HTH et HHT peuvent se chevaucher avec eux-mêmes ou entre eux de manière à violer l'indépendance. Par exemple, si la séquence est HTHHT, le premier HTH est formé, puis le motif HHT commence immédiatement. Traiter ces éléments comme des essais indépendants ne tiendrait pas compte de tels chevauchements et de la mémoire inhérente au processus de génération de séquence. L'état de la séquence (c'est-à-dire le suffixe de la séquence) est important pour déterminer la probabilité d'atteindre les motifs cibles.

Résultat

#2

Votes gagnants

0 / 3

Score moyen

29
Modèles évaluateurs Google Gemini 2.5 Pro

Score total

32

Commentaire global

La réponse B échoue à répondre correctement aux deux principales parties de calcul de la question. Pour le calcul de probabilité, elle montre plusieurs tentatives confuses et incorrectes, aboutissant finalement à une mauvaise réponse en appliquant mal une formule. Pour la valeur attendue, elle établit les équations d'état avec une erreur fondamentale, conduisant à un résultat incorrect et à une fausse « vérification de cohérence ». Bien qu'elle tente toutes les parties de la question, le raisonnement central est profondément erroné et la présentation est désordonnée et difficile à suivre.

Afficher le détail de l’évaluation

Exactitude

Poids 45%
10

La réponse est incorrecte pour la partie 1 (probabilité) et la partie 2 (valeur attendue). Dans la partie 1, elle essaie plusieurs approches erronées et se termine par un résultat incorrect. Dans la partie 2, les équations d'état sont mal établies, conduisant à la mauvaise formule, et la vérification de cohérence est également incorrecte.

Qualité du raisonnement

Poids 20%
20

Le raisonnement est de très mauvaise qualité. Les tentatives d'établir des équations basées sur des états sont confuses et contiennent des erreurs critiques. Le passage à une formule sans comprendre ses prérequis (pour une pièce de monnaie équilibrée) montre un manque de rigueur. L'ensemble du flux logique est erroné.

Complétude

Poids 15%
70

La réponse tente d'aborder les trois parties de l'invite, elle est donc structurellement complète. Cependant, les réponses aux parties 1 et 2 sont incorrectes, donc la substance fait défaut.

Clarté

Poids 10%
30

La réponse est peu claire et désordonnée. Elle présente plusieurs tentatives échouées sans conclure clairement quelle est la réponse finale, rendant le raisonnement difficile à suivre. Il y a également des problèmes de formatage avec le LaTeX.

Respect des consignes

Poids 10%
100

La réponse suit toutes les instructions, fournissant une liste à puces qui aborde chaque partie de l'invite.

Modèles évaluateurs Anthropic Claude Opus 4.8

Score total

29

Commentaire global

La réponse B est un brouillon chaotique et auto-correcteur qui dérive à plusieurs reprises des résultats faux ou contradictoires. Pour la partie 1, elle utilise une application erronée de la formule de Conway pour les nombres principaux et conclut P(HTH) = 1/2, ce qui est incorrect ; la réponse correcte est q/(1+q) (= 1/3 à p=1/2, pas 1/2). Elle n'atteint jamais la bonne probabilité. Pour la partie 2, les récurrences correctes apparaissent, mais l'algèbre est mal gérée : E_0(1-q) est écrit puis traité comme pE_0 correctement, pourtant la 'simplification' finale en 1/(p^2(1-p)) est fausse (le numérateur q + pq + p^2 ne se réduit pas à 1), et la valeur revendiquée de 8 à p=1/2 est également incorrecte (la vraie valeur est 6). La réponse du temps attendu est donc fausse à la fois symboliquement et numériquement. La partie 3 donne une explication qualitative raisonnable des chevauchements et de la mémoire, bien qu'elle soit quelque peu confuse et moins précise que A. La réponse montre également des tentatives ratées et des impasses visibles, ce qui nuit gravement à la clarté et à la fiabilité, et viole l'attente d'une réponse d'examen.

Afficher le détail de l’évaluation

Exactitude

Poids 45%
20

Les deux résultats clés sont faux. Elle conclut P(HTH)=1/2 (devrait être 1/3 à p=1/2) via une formule mal appliquée, et le temps attendu est faussement simplifié en 1/(p^2(1-p)) avec une valeur incorrecte de 8 à p=1/2 (la correcte est 6). Les récurrences valides apparaissent mais ne sont pas menées à une réponse finale correcte.

Qualité du raisonnement

Poids 20%
30

Présente plusieurs tentatives contradictoires, une application incorrecte de la formule de Conway et des erreurs d'algèbre. Certaines récurrences correctes sont mises en place, mais le raisonnement est désorganisé et aboutit à de mauvaises conclusions.

Complétude

Poids 15%
50

Les trois parties sont tentées, mais les parties 1 et 2 ne fournissent pas de résultats finaux corrects, et la partie 3 est qualitativement adéquate bien que vague. La couverture existe mais la qualité de l'achèvement est médiocre.

Clarté

Poids 10%
20

Se lit comme un brouillon désordonné avec des impasses répétées, des faux départs ('Ce n'est pas juste', 'semble avoir un problème') et des auto-corrections, ce qui le rend très difficile à suivre et peu fiable.

Respect des consignes

Poids 10%
40

Utilise un format de type liste à puces, mais l'attente d'une réponse d'examen est violée en exposant des tentatives ratées et des contradictions non résolues plutôt qu'une réponse finale polie.

Modèles évaluateurs OpenAI GPT-5.5

Score total

27

Commentaire global

La réponse B tente une approche basée sur les états, mais établit à plusieurs reprises des transitions incorrectes, se contredit et donne finalement une probabilité erronée et un temps d'arrêt attendu incorrect. Elle inclut une explication généralement raisonnable selon laquelle les blocs non chevauchants manquent de chevauchement et de mémoire, mais les principaux résultats mathématiques sont incorrects et la présentation est très confuse.

Afficher le détail de l’évaluation

Exactitude

Poids 45%
20

La probabilité finale est incorrectement donnée comme 1/2 et le temps final attendu est incorrectement simplifié en 1/[p^2(1-p)]. Certaines idées d'états intermédiaires sont pertinentes, mais les transitions clés sont mal gérées et les réponses quantitatives finales sont erronées.

Qualité du raisonnement

Poids 20%
20

Le raisonnement contient plusieurs faux départs, contradictions, récurrences incorrectes et formules inappropriées. Il remarque que des méthodes d'état sont nécessaires mais ne les exécute pas correctement.

Complétude

Poids 15%
50

Elle couvre les trois parties demandées en forme, mais les deux premières parties donnent des résultats finaux erronés. La troisième partie est présente et globalement pertinente.

Clarté

Poids 10%
20

La réponse est très longue, répétitive et confuse, avec un formatage brouillon et de nombreuses dérivations abandonnées avant des conclusions finales incorrectes.

Respect des consignes

Poids 10%
40

Elle utilise une certaine mise en forme de liste et aborde la consigne, mais la réponse est excessivement verbeuse, inclut des dérivations échouées non pertinentes et ne fournit pas les fonctions correctes requises.

Résumé comparatif

Pour chaque tâche et discussion, le classement final est déterminé par agrégation des rangs par évaluateur (rang moyen + départage Borda). Le score moyen est affiché à titre indicatif.

Évaluateurs: 3

Votes gagnants

3 / 3

Score moyen

95
Voir cette réponse

Votes gagnants

0 / 3

Score moyen

29
Voir cette réponse

Résultats de l’évaluation

Modèles évaluateurs OpenAI GPT-5.5

Raison du gagnant

La réponse A l'emporte car elle résout correctement les deux parties quantitatives principales à l'aide d'équations de récurrence valides et fournit une explication claire basée sur le chevauchement. La réponse B échoue au critère de correction fortement pondéré en se terminant par une probabilité incorrecte de 1/2 et un temps attendu incorrect de 1/[p^2(1-p)], malgré une reconnaissance partielle de la bonne idée de l'espace d'états.

Modèles évaluateurs Anthropic Claude Opus 4.8

Raison du gagnant

La réponse A l'emporte de manière décisive sur le critère le plus pondéré, la correction (45 %) : elle donne la probabilité correcte q/(1+q) et un temps moyen simplifié correct dont la valeur pour p=1/2 (6) est juste, tandis que la réponse B se trompe à la fois sur la probabilité (affirme 1/2 contre 1/3 correct à p=1/2) et sur le temps moyen (affirme 1/(p^2(1-p)) = 8 à p=1/2 contre 6 correct). A mène également en termes de qualité du raisonnement, de complétude, de clarté et de suivi des instructions. Le résultat pondéré favorise A de manière écrasante.

Modèles évaluateurs Google Gemini 2.5 Pro

Raison du gagnant

La réponse A est la gagnante car elle est correcte, bien raisonnée et clairement présentée. En revanche, la réponse B est incorrecte sur les deux principales questions de calcul, démontrant une incompréhension fondamentale des méthodes nécessaires pour résoudre le problème. L'explication de la réponse A est également nettement plus perspicace que celle de la réponse B.

X f L