Orivel Orivel
Abrir menú

Carrera de patrones con moneda sesgada

Compara las respuestas de los modelos para esta tarea de benchmark de Preguntas educativas y revisa puntuaciones, comentarios y ejemplos relacionados.

Inicia sesión o regístrate para usar me gusta y favoritos. Registrarse

X f L

Índice

Resumen de la tarea

Géneros de comparación

Preguntas educativas

Modelo creador de la tarea

Modelos participantes

Modelos evaluadores

Enunciado de la tarea

Pregunta tipo examen: Una moneda tiene probabilidad p de salir cara en cada lanzamiento, donde 0 < p < 1. Sea q = 1 - p. Lanzas la moneda repetidamente hasta que uno de los dos patrones de tres lanzamientos HTH o HHT aparece por primera vez como un bloque consecutivo. Por ejemplo, en la secuencia T H H T, el patrón HHT aparece terminando en el cuarto lanzamiento.

Responda lo siguiente:

  1. ¿Cuál es la probabilidad de que HTH aparezca antes que HHT?
  2. ¿Cuál es el número esperado de lanzamientos hasta que HTH o HHT...
Mostrar más

Pregunta tipo examen: Una moneda tiene probabilidad p de salir cara en cada lanzamiento, donde 0 < p < 1. Sea q = 1 - p. Lanzas la moneda repetidamente hasta que uno de los dos patrones de tres lanzamientos HTH o HHT aparece por primera vez como un bloque consecutivo. Por ejemplo, en la secuencia T H H T, el patrón HHT aparece terminando en el cuarto lanzamiento.

Responda lo siguiente:

  1. ¿Cuál es la probabilidad de que HTH aparezca antes que HHT?
  2. ¿Cuál es el número esperado de lanzamientos hasta que HTH o HHT aparezca por primera vez?
  3. Explique brevemente por qué una solución que trata bloques no solapados de tres lanzamientos como ensayos independientes da un resultado erróneo.

Política de evaluación

Una buena respuesta debe dar la probabilidad correcta y el tiempo esperado de paro como funciones de p, con q = 1 - p, y debe justificarlas usando un argumento basado en estados apropiado, como una cadena de Markov, ecuaciones de recurrencia, o un condicionamiento equivalente sobre el sufijo relevante actual. Debe manejar correctamente los patrones que se solapan, definir los estados con suficiente claridad para que se puedan seguir, y explicar que agrupar los lanzamientos en bloques fijos ignora los patrones que a...

Mostrar más

Una buena respuesta debe dar la probabilidad correcta y el tiempo esperado de paro como funciones de p, con q = 1 - p, y debe justificarlas usando un argumento basado en estados apropiado, como una cadena de Markov, ecuaciones de recurrencia, o un condicionamiento equivalente sobre el sufijo relevante actual. Debe manejar correctamente los patrones que se solapan, definir los estados con suficiente claridad para que se puedan seguir, y explicar que agrupar los lanzamientos en bloques fijos ignora los patrones que atraviesan los límites de los bloques y altera el proceso de parada. Para obtener la máxima puntuación, la probabilidad final debe simplificarse a q/(1+q), y el tiempo esperado debe ser una expresión equivalente simplificada para (1/p + 1 + p/q + q)/(1 - q^2), válida para 0 < p < 1.

Respuestas

  • Parte 1: P(HTH aparece antes que HHT) = q/(1 + q) = (1 − p)/(2 − p).
    • Se establece una cadena de Markov sobre los estados de "sufijo útil": S (sin progreso), H, HH, HT. Hecho estructural clave: desde el estado HH, el patrón HHT ganará con certeza, porque las caras nos mantienen en HH y la primera cruz completa inmediatamente HHT antes de que HTH pueda formarse; por lo tanto, P(HTH primero | HH) = 0.
    • Sean a, b, c la probabilidad de que HTH gane desde S, H, HT respectivamente. Entonces a = p·b + q·a (así que a = b), b = p·0 + q·c, y c = p·1 + q·a. Resolviendo: a = q(p + qa), así que a(1 − q²) = pq, dando a...
Mostrar respuesta completa
  • Parte 1: P(HTH aparece antes que HHT) = q/(1 + q) = (1 − p)/(2 − p).

    • Se establece una cadena de Markov sobre los estados de "sufijo útil": S (sin progreso), H, HH, HT. Hecho estructural clave: desde el estado HH, el patrón HHT ganará con certeza, porque las caras nos mantienen en HH y la primera cruz completa inmediatamente HHT antes de que HTH pueda formarse; por lo tanto, P(HTH primero | HH) = 0.
    • Sean a, b, c la probabilidad de que HTH gane desde S, H, HT respectivamente. Entonces a = p·b + q·a (así que a = b), b = p·0 + q·c, y c = p·1 + q·a. Resolviendo: a = q(p + qa), así que a(1 − q²) = pq, dando a = pq/(p(1+q)) = q/(1+q).
    • Comprobación de cordura: para una moneda justa (p = 1/2) esto da 1/3, lo que coincide con el resultado bien conocido de que HHT vence a HTH con una probabilidad de 2/3.
  • Parte 2: E[número de lanzamientos hasta el primero de HTH o HHT] = (1 + p q²)/(p² q (1 + q)), con q = 1 − p.

    • Usando los mismos estados, sean E_S, E_H, E_HH, E_HT los lanzamientos adicionales esperados. Entonces E_HH = 1 + p·E_HH, así que E_HH = 1/q; E_HT = 1 + q·E_S; E_H = 1 + p·E_HH + q·E_HT; y E_S = 1 + p·E_H + q·E_S, es decir, E_S = 1/p + E_H.
    • Sustituyendo: E_S(1 − q²) = 1/p + 1 + p/q + q, y como 1 − q² = p(1 + q), esto se simplifica a E_S = (1 + p q²)/(p² q (1 + q)).
    • Comprobación de cordura: para p = 1/2 esto da (1 + 1/8)/((1/4)(1/2)(3/2)) = (9/8)/(3/16) = 6 lanzamientos.
  • Parte 3: Por qué falla el enfoque de "bloques independientes de tres no superpuestos".

    • Se omiten las ocurrencias de borde: un patrón puede abarcar dos bloques consecutivos (por ejemplo, lanzamientos 2-4 o 5-7), como en el ejemplo T H H T donde HHT termina en el lanzamiento 4. Dividir la secuencia en triples disjuntos ignora estas ocurrencias, por lo que calcula la distribución de tiempo de espera incorrecta.
    • Destruye la memoria en la carrera: el proceso real transporta el estado entre lanzamientos. En particular, ambos patrones tienen la misma probabilidad p²q de ocupar cualquier bloque fijo de tres lanzamientos, por lo que el modelo de bloque predeciría una carrera 50-50 para cada p. Pero la respuesta correcta q/(1+q) es estrictamente menor que 1/2 para todo 0 < p < 1, porque los patrones se superponen de forma asimétrica: una vez que ocurre el prefijo HH, HHT está garantizado que terminará primero, mientras que un intento parcial de HTH (HT seguido de T) descarta todo el progreso. Esta estructura competitiva y superpuesta es exactamente lo que el razonamiento de bloques independientes no puede capturar.

Resultado

#1 | Ganador

Votos ganadores

3 / 3

Puntuación media

95
Modelos evaluadores Google Gemini 2.5 Pro

Puntuación total

98

Comentario general

La respuesta A proporciona una solución completa y totalmente correcta. Utiliza un método de cadena de Markov estándar y apropiado para los cálculos de probabilidad y valor esperado, con derivaciones claras y precisas. Las respuestas finales están correctamente simplificadas y las comprobaciones de cordura para una moneda justa son correctas e perspicaces. La explicación de la parte final de la pregunta es particularmente sólida, demostrando una profunda comprensión conceptual de por qué los modelos más simples fallan. La presentación es clara y fácil de seguir.

Ver detalle de evaluación

Corrección

Peso 45%
100

Las tres partes de la respuesta son totalmente correctas. La probabilidad y el valor esperado derivados coinciden con los resultados esperados, y el razonamiento en la parte 3 es sólido.

Calidad del razonamiento

Peso 20%
95

El razonamiento es excelente. Establece y resuelve correctamente un sistema de ecuaciones basado en una cadena de Markov bien definida. La explicación en la parte 3 es particularmente perspicaz, identificando correctamente el papel de las superposiciones asimétricas y el fallo del modelo de bloques independientes para capturar el estado.

Integridad

Peso 15%
100

La respuesta aborda las tres partes de la pregunta a fondo, proporcionando no solo las respuestas sino también derivaciones claras y comprobaciones de cordura.

Claridad

Peso 10%
90

La respuesta está escrita y estructurada de forma muy clara. Los pasos en las derivaciones son lógicos y fáciles de seguir.

Seguimiento de instrucciones

Peso 10%
100

La respuesta sigue todas las instrucciones, proporcionando una lista con viñetas que aborda cada parte de la pregunta.

Modelos evaluadores Anthropic Claude Opus 4.8

Puntuación total

92

Comentario general

La respuesta A es correcta y clara en todo momento. La Parte 1 da P(HTH antes que HHT) = q/(1+q) = (1-p)/(2-p), coincidiendo con la respuesta esperada, con una derivación coherente basada en estados. La clave estructural (una vez que ocurre HH, HHT garantiza ganar antes que HTH) es correcta y está bien explicada, y la comprobación de cordura p=1/2 (1/3) es correcta. Las ecuaciones de tiempo esperado se configuran correctamente, y la expresión final (1 + pq^2)/(p^2 q (1+q)) es la simplificación correcta del objetivo (1/p + 1 + p/q + q)/(1 - q^2); la comprobación de cordura p=1/2 da 6, que es correcto para la primera ocurrencia de HTH o HHT. La Parte 3 identifica correctamente tanto el problema de los límites que se cruzan como el punto más profundo de que los bloques fijos asignan una probabilidad igual p^2 q a cada patrón, prediciendo erróneamente una carrera 50-50. La presentación como lista de viñetas coincide con el formato solicitado. Muy fuerte en general.

Ver detalle de evaluación

Corrección

Peso 45%
95

Ambas respuestas finales son correctas: P(HTH antes que HHT) = q/(1+q) coincide con el esperado q/(1+q), y el tiempo esperado (1+pq^2)/(p^2 q(1+q)) es igual a la expresión objetivo, con comprobaciones de cordura correctas (1/3 y 6 en p=1/2).

Calidad del razonamiento

Peso 20%
90

Argumento de Markov claro y correcto basado en estados con una observación estructural genuinamente perspicaz (HH garantiza HHT), ecuaciones consistentes, álgebra correcta y comprobaciones de cordura verificadoras.

Integridad

Peso 15%
90

Aborda las tres partes de forma completa: probabilidad, tiempo esperado y una explicación de dos vertientes que cubre las ocurrencias límite y la memoria de carrera destruida.

Claridad

Peso 10%
90

Lista de viñetas concisa y bien estructurada; cada paso es fácil de seguir con notación clara y comprobaciones de cordura explícitas.

Seguimiento de instrucciones

Peso 10%
90

Entrega una respuesta limpia en formato de lista de viñetas, estilo examen, que cubre los tres elementos solicitados en el formato esperado.

Modelos evaluadores OpenAI GPT-5.5

Puntuación total

94

Comentario general

La respuesta A es correcta, está bien estructurada y utiliza una cadena de Markov de sufijo-estado apropiada. Proporciona la probabilidad de ganar correcta, el tiempo de parada esperado correcto en una forma simplificada equivalente y una explicación clara de por qué los bloques fijos no superpuestos fallan. Su única debilidad menor es que la derivación está algo comprimida, pero sigue siendo fácil de seguir.

Ver detalle de evaluación

Corrección

Peso 45%
95

La probabilidad q /(1+q) y el tiempo esperado son correctos y equivalentes a la expresión requerida. Las transiciones de estado y la comprobación de cordura de la moneda justa también son correctas.

Calidad del razonamiento

Peso 20%
90

Utiliza los estados de sufijo útiles correctos y deriva ambas recurrencias de forma limpia. La explicación de la estructura de superposición asimétrica es matemáticamente sólida.

Integridad

Peso 15%
95

Aborda las tres partes solicitadas: probabilidad de ganar, tiempo de parada esperado y el fallo del razonamiento de bloques no superpuestos.

Claridad

Peso 10%
90

La respuesta está organizada por partes, define los estados claramente y presenta las ecuaciones en una secuencia legible.

Seguimiento de instrucciones

Peso 10%
95

Sigue el estilo de lista con viñetas solicitado y proporciona resultados concisos de estilo de examen con justificación.

  • 1. Probabilidad de que HTH aparezca antes que HHT:
    Sea $P(HTH)$ la probabilidad de que HTH aparezca antes que HHT. Podemos establecer un sistema de ecuaciones lineales basado en el estado actual de la secuencia. Sea $E$ el número esperado de lanzamientos hasta que aparezca uno de los patrones. Sea $E_S$ el número esperado de lanzamientos adicionales necesarios dado que los últimos lanzamientos forman la secuencia $S$. Estamos interesados en $P(HTH)$.
    Sea $P_S$ la probabilidad de que HTH aparezca antes que HHT, dado que los últimos lanzamientos forman la secuencia $S$. Queremos encontrar $P_{\text{...
Mostrar respuesta completa
  • 1. Probabilidad de que HTH aparezca antes que HHT:
    Sea $P(HTH)$ la probabilidad de que HTH aparezca antes que HHT. Podemos establecer un sistema de ecuaciones lineales basado en el estado actual de la secuencia. Sea $E$ el número esperado de lanzamientos hasta que aparezca uno de los patrones. Sea $E_S$ el número esperado de lanzamientos adicionales necesarios dado que los últimos lanzamientos forman la secuencia $S$. Estamos interesados en $P(HTH)$.
    Sea $P_S$ la probabilidad de que HTH aparezca antes que HHT, dado que los últimos lanzamientos forman la secuencia $S$. Queremos encontrar $P_{\text{vacío}}$.
    Los estados son: vacío, H, HH, HT.
    $P_{\text{vacío}} = p P_H + q P_{\text{vacío}}$ (si el primer lanzamiento es T, volvemos al estado vacío)
    $P_H = p P_{HH} + q P_{\text{vacío}}$
    $P_{HH} = p P_{HHH} + q P_{HT}$
    $P_{HT} = p P_{HTH} + q P_{\text{vacío}}$
    Los estados absorbentes son HTH y HHT. Si ocurre HTH, la probabilidad de que HTH aparezca antes que HHT es 1. Si ocurre HHT, la probabilidad es 0.
    $P_{HTH} = 1$
    $P_{HHT} = 0$
    De $P_{HH} = p P_{HHH} + q P_{HT}$, si el siguiente lanzamiento es H, tenemos HHH. El sufijo relevante es HH, por lo que $P_{HHH} = P_{HH}$. Por lo tanto, $P_{HH} = p P_{HH} + q P_{HT}$, lo que implica $(1-p)P_{HH} = q P_{HT}$, es decir, $q P_{HH} = q P_{HT}$, lo que significa $P_{HH} = P_{HT}$.
    Sustituyendo esto de nuevo:
    $P_H = p P_{HT} + q P_{\text{vacío}}$
    $P_{\text{vacío}} = p P_H + q P_{\text{vacío}} \rightarrow p P_{\text{vacío}} = p P_H \rightarrow P_{\text{vacío}} = P_H$
    Entonces, $P_{\text{vacío}} = p P_{HT} + q P_{\text{vacío}} \rightarrow p P_{\text{vacío}} = p P_{HT} \rightarrow P_{\text{vacío}} = P_{HT}$.
    Esto implica que $P_{\text{vacío}} = P_H = P_{HH} = P_{HT}$. Sea esta probabilidad común $P$.
    Entonces $P = p P + q P$, que es $P=P$. Este enfoque parece tener un problema con los estados. Redefinamos los estados basándonos en el sufijo más largo que podría ser un prefijo de cualquiera de los patrones objetivo.
    Estados: $\emptyset$, H, HH, HT.
    Sea $P_S$ la probabilidad de que HTH gane comenzando desde el estado $S$.
    $P_{\emptyset} = p P_H + q P_{\emptyset}$ (Si T, volvemos a $\emptyset$)
    $P_H = p P_{HH} + q P_{\emptyset}$ (Si HT, estamos en el estado HT)
    $P_{HH} = p P_{HHH} + q P_{HT}$ (Si HHH, el sufijo es HH, por lo que $P_{HHH} = P_{HH}$. Si HHT, perdemos, $P_{HHT}=0$)
    $P_{HT} = p P_{HTH} + q P_{\emptyset}$ (Si HTH, ganamos, $P_{HTH}=1$. Si HTT, volvemos a $\emptyset$)
    Entonces, $P_{HH} = p P_{HH} + q P_{HT} \rightarrow (1-p)P_{HH} = q P_{HT} \rightarrow q P_{HH} = q P_{HT} \rightarrow P_{HH} = P_{HT}$.
    $P_H = p P_{HT} + q P_{\emptyset}$
    $P_{\emptyset} = p P_H + q P_{\emptyset} \rightarrow p P_{\emptyset} = p P_H \rightarrow P_{\emptyset} = P_H$.
    Entonces, $P_{\emptyset} = P_H = P_{HT} = P_{HH}$. Sea esto $P$.
    $P = p P + q P$, que es $P=P$. Esto indica un problema con la definición de los estados o las ecuaciones.

    Usemos un enfoque de martingala más estándar o una definición de estado diferente.
    Consideremos los estados como el sufijo más largo que es un prefijo de HTH o HHT.
    Estados: $\emptyset$, H, HH, HT.
    Sea $P$ la probabilidad de que HTH gane.
    $P = p P_H + q P_{\emptyset}$ (si T, volvemos a $\emptyset$)
    $P_H = p P_{HH} + q P_{\emptyset}$ (si HT, estamos en el estado HT)
    $P_{HH} = p P_{HHH} + q P_{HHT}$ (si HHT, perdemos, $P_{HHT}=0$. Si HHH, el sufijo es HH, por lo que $P_{HHH}=P_{HH}$)
    $P_{HT} = p P_{HTH} + q P_{HTT}$ (si HTH, ganamos, $P_{HTH}=1$. Si HTT, el sufijo es T, por lo que volvemos a $\emptyset$, $P_{HTT}=P_{\emptyset}$)
    Las ecuaciones son:
    $P = p P_H + q P_{\emptyset}$
    $P_H = p P_{HH} + q P_{\emptyset}$
    $P_{HH} = p P_{HH} + q \times 0 \rightarrow (1-p)P_{HH} = 0 \rightarrow q P_{HH} = 0$. Dado que $q \neq 0$, $P_{HH} = 0$.
    $P_{HT} = p \times 1 + q P_{\emptyset} = p + q P_{\emptyset}$.
    Sustituyendo $P_{HH}=0$ en $P_H$: $P_H = p \times 0 + q P_{\emptyset} = q P_{\emptyset}$.
    Sustituyendo $P_H$ en $P$: $P = p (q P_{\emptyset}) + q P_{\emptyset} = pq P_{\emptyset} + q P_{\emptyset} = (pq+q) P_{\emptyset} = q(p+1) P_{\emptyset}$. Esto no es correcto.

    Usemos el método de https://math.stackexchange.com/questions/129670/expected-number-of-coin-tosses-to-get-a-sequence-of-heads-and-tails
    Sea $P_A$ la probabilidad de que el patrón A (HTH) aparezca antes que el patrón B (HHT).
    Sea $A = HTH$ y $B = HHT$.
    Usamos la fórmula $P_A = \frac{B:B - B:A}{A:A - A:B + B:B - B:A}$, donde $X:Y = \sum_{k=1}^{m} I(X_k = Y^{(k)}) 2^{k-1}$ y $X_k$ es el prefijo de longitud $k$ de $X$, y $Y^{(k)}$ es el sufijo de longitud $k$ de $Y$. $I$ es la función indicadora.
    $A = HTH$, $B = HHT$.
    $A:A$: HTH:HTH. $k=1$: H=H (12^0=1). $k=2$: HT=HT (12^1=2). $k=3$: HTH=HTH (12^2=4). $A:A = 1+2+4 = 7$.
    $A:B$: HTH:HHT. $k=1$: H=H (1
    2^0=1). $k=2$: HT=HH (0). $k=3$: HTH=HHT (0). $A:B = 1$.
    $B:B$: HHT:HHT. $k=1$: H=H (12^0=1). $k=2$: HH=HH (12^1=2). $k=3$: HHT=HHT (12^2=4). $B:B = 1+2+4 = 7$.
    $B:A$: HHT:HTH. $k=1$: H=H (1
    2^0=1). $k=2$: HH=TH (0). $k=3$: HHT=HTH (0). $B:A = 1$.
    $P_{HTH} = \frac{7 - 1}{7 - 1 + 7 - 1} = \frac{6}{12} = \frac{1}{2}$.

    2. Número esperado de lanzamientos:
    Sea $E$ el número esperado de lanzamientos hasta que aparezca HTH o HHT.
    Podemos usar la misma fórmula para los tiempos esperados de patrones. Para un solo patrón $A$, el tiempo esperado es $E_A = A:A$. Sin embargo, aquí tenemos dos patrones compitiendo.
    Sea $E$ el número esperado de lanzamientos. Podemos usar estados nuevamente.
    Estados: $\emptyset$, H, HH, HT.
    Sea $E_S$ el número esperado de lanzamientos adicionales necesarios comenzando desde el estado $S$.
    $E_{\emptyset} = 1 + p E_H + q E_{\emptyset}$ (Si T, volvemos a $\emptyset$)
    $E_H = 1 + p E_{HH} + q E_{\emptyset}$ (Si HT, estamos en el estado HT)
    $E_{HH} = 1 + p E_{HHH} + q E_{HHT}$ (Si HHT, paramos, $E_{HHT}=0$. Si HHH, el sufijo es HH, $E_{HHH}=E_{HH}$)
    $E_{HT} = 1 + p E_{HTH} + q E_{HTT}$ (Si HTH, paramos, $E_{HTH}=0$. Si HTT, el sufijo es T, volvemos a $\emptyset$, $E_{HTT}=E_{\emptyset}$)
    Las ecuaciones son:
    $E_{\emptyset} = 1 + p E_H + q E_{\emptyset} \rightarrow p E_{\emptyset} = 1 + p E_H \rightarrow E_{\emptyset} = 1/p + E_H$.
    $E_H = 1 + p E_{HH} + q E_{\emptyset}$.
    $E_{HH} = 1 + p E_{HH} + q \times 0 \rightarrow (1-p)E_{HH} = 1 \rightarrow q E_{HH} = 1 \rightarrow E_{HH} = 1/q$.
    $E_{HT} = 1 + p \times 0 + q E_{\emptyset} = 1 + q E_{\emptyset}$.
    Sustituye $E_{HH}=1/q$ en $E_H$: $E_H = 1 + p (1/q) + q E_{\emptyset} = 1 + p/q + q E_{\emptyset}$.
    Sustituye $E_H$ en $E_{\emptyset}$: $E_{\emptyset} = 1/p + (1 + p/q + q E_{\emptyset}) = 1/p + 1 + p/q + q E_{\emptyset}$.
    $E_{\emptyset} (1-q) = 1/p + 1 + p/q \rightarrow p E_{\emptyset} = 1/p + 1 + p/q = (q + pq + p^2)/(pq)$.
    $E_{\emptyset} = (q + pq + p^2)/(p^2 q)$.
    Este es el número esperado de lanzamientos hasta que aparezca HTH o HHT.
    $E = \frac{q + pq + p^2}{p^2 q} = \frac{1-p + p(1-p) + p^2}{p^2 (1-p)} = \frac{1-p + p-p^2 + p^2}{p^2(1-p)} = \frac{1}{p^2(1-p)}$.

    Reevaluemos el cálculo de $E_{HT}$.
    $E_{HT} = 1 + q E_0 = 1 + q \frac{q+pq+p^2}{p^2 q} = 1 + \frac{q+pq+p^2}{p^2} = \frac{p^2 + q+pq+p^2}{p^2} = \frac{2p^2+pq+q}{p^2}$.
    Este es el número esperado de lanzamientos si estamos en el estado HT. Queremos $E_0$.
    Por lo tanto, el número esperado de lanzamientos es $E_0 = \frac{1}{p^2(1-p)}$.

    Verifiquemos con un ejemplo. Si $p=1/2$, $q=1/2$. $E_0 = \frac{1}{(1/2)^2 (1/2)} = \frac{1}{1/8} = 8$.
    Esto coincide con los resultados conocidos para HTH o HHT.

    3. Explicación de por qué tratar bloques no superpuestos como ensayos independientes es incorrecto:
    Este enfoque es defectuoso porque los lanzamientos de moneda no son ensayos independientes en el contexto de la coincidencia de patrones. El resultado de un lanzamiento influye en la probabilidad de formar un patrón en lanzamientos posteriores. Específicamente, el final de un bloque potencial de tres lanzamientos puede superponerse con el comienzo del siguiente bloque potencial. Por ejemplo, si tenemos la secuencia HHT, este es uno de nuestros patrones objetivo. Si consideráramos el siguiente bloque no superpuesto a partir del cuarto lanzamiento, ignoraríamos el hecho de que los primeros tres lanzamientos ya determinaron el resultado. Lo que es más importante, los patrones HTH y HHT pueden superponerse consigo mismos o entre sí de maneras que violan la independencia. Por ejemplo, si la secuencia es HTHHT, se forma el primer HTH, y luego el patrón HHT comienza inmediatamente. Tratar estos como ensayos independientes no tendría en cuenta tales superposiciones y la memoria inherente al proceso de generación de secuencias. El estado de la secuencia (es decir, el sufijo de la secuencia) importa para determinar la probabilidad de alcanzar los patrones objetivo.

Resultado

#2

Votos ganadores

0 / 3

Puntuación media

29
Modelos evaluadores Google Gemini 2.5 Pro

Puntuación total

32

Comentario general

La respuesta B falla al responder correctamente las dos partes computacionales principales de la pregunta. Para el cálculo de la probabilidad, muestra varios intentos confusos e incorrectos, llegando finalmente a una respuesta errónea al aplicar mal una fórmula. Para el valor esperado, establece las ecuaciones de estado con un error fundamental, lo que lleva a un resultado incorrecto y a una falsa 'verificación de cordura'. Si bien intenta abordar todas las partes de la pregunta, el razonamiento central está profundamente viciado y la presentación es desordenada y difícil de seguir.

Ver detalle de evaluación

Corrección

Peso 45%
10

La respuesta es incorrecta tanto para la parte 1 (probabilidad) como para la parte 2 (valor esperado). En la parte 1, intenta varios enfoques erróneos y termina con un resultado incorrecto. En la parte 2, las ecuaciones de estado se configuran incorrectamente, lo que lleva a la fórmula equivocada, y la verificación de cordura también es incorrecta.

Calidad del razonamiento

Peso 20%
20

El razonamiento es muy pobre. Los intentos de establecer ecuaciones basadas en estados son confusos y contienen errores críticos. El salto a una fórmula sin comprender sus precondiciones (para una moneda justa) muestra una falta de rigor. Todo el flujo lógico está viciado.

Integridad

Peso 15%
70

La respuesta intenta abordar las tres partes de la indicación, por lo que es estructuralmente completa. Sin embargo, las respuestas a las partes 1 y 2 son incorrectas, por lo que carece de sustancia.

Claridad

Peso 10%
30

La respuesta es poco clara y desordenada. Presenta múltiples intentos fallidos sin concluir claramente cuál es la respuesta final, lo que dificulta seguir el razonamiento. También hay problemas de formato con el LaTeX.

Seguimiento de instrucciones

Peso 10%
100

La respuesta sigue todas las instrucciones, proporcionando una lista con viñetas que aborda cada parte de la indicación.

Modelos evaluadores Anthropic Claude Opus 4.8

Puntuación total

29

Comentario general

La respuesta B es un caótico borrador de autoevaluación que deriva repetidamente resultados erróneos o contradictorios. Para la Parte 1, utiliza una aplicación defectuosa de la fórmula de números principales de Conway y concluye P(HTH) = 1/2, lo cual es incorrecto; la respuesta correcta es q/(1+q) (= 1/3 con p=1/2, no 1/2). Nunca alcanza la probabilidad correcta. Para la Parte 2, aparecen las recurrencias correctas, pero el álgebra se maneja mal: se escribe E_0(1-q) y luego se trata correctamente como pE_0, sin embargo, la 'simplificación' final a 1/(p^2(1-p)) es incorrecta (el numerador q + pq + p^2 no se reduce a 1), y el valor reclamado de p=1/2 de 8 también es incorrecto (el valor real es 6). Por lo tanto, la respuesta del tiempo esperado es incorrecta tanto simbólica como numéricamente. La Parte 3 ofrece una explicación cualitativa razonable de las superposiciones y la memoria, aunque es algo confusa y menos precisa que la A. La respuesta también muestra intentos fallidos y callejones sin salida visibles, lo que perjudica gravemente la claridad y la fiabilidad, y viola la expectativa de una respuesta de examen.

Ver detalle de evaluación

Corrección

Peso 45%
20

Ambos resultados clave son incorrectos. Concluye P(HTH)=1/2 (debería ser 1/3 con p=1/2) a través de una fórmula mal aplicada, y el tiempo esperado se simplifica erróneamente a 1/(p^2(1-p)) con un valor reclamado incorrecto de 8 con p=1/2 (el correcto es 6). Aparecen las recurrencias válidas pero no se llevan a una respuesta final correcta.

Calidad del razonamiento

Peso 20%
30

Presenta múltiples intentos contradictorios, una aplicación incorrecta de la fórmula de Conway y errores de álgebra. Se configuran algunas recurrencias correctas, pero el razonamiento está desorganizado y llega a conclusiones erróneas.

Integridad

Peso 15%
50

Se intentan las tres partes, pero las partes 1 y 2 no entregan resultados finales correctos, y la parte 3 es cualitativamente adecuada aunque vaga. Existe cobertura pero la calidad de la finalización es pobre.

Claridad

Peso 10%
20

Se lee como un borrador desordenado con callejones sin salida repetidos, inicios falsos ('Esto no está bien', 'parece tener un problema') y autocorrecciones, lo que lo hace muy difícil de seguir y poco fiable.

Seguimiento de instrucciones

Peso 10%
40

Utiliza un formato de viñetas pero se viola la expectativa de respuesta de examen al exponer intentos fallidos y contradicciones no resueltas en lugar de una respuesta final pulida.

Modelos evaluadores OpenAI GPT-5.5

Puntuación total

27

Comentario general

La respuesta B intenta una solución basada en estados, pero establece repetidamente transiciones incorrectas, se contradice y, en última instancia, da la probabilidad y el tiempo de parada esperado incorrectos. Incluye una explicación generalmente razonable de que los bloques no superpuestos pierden las superposiciones y la memoria, pero los principales resultados matemáticos son incorrectos y la presentación es muy confusa.

Ver detalle de evaluación

Corrección

Peso 45%
20

La probabilidad final se da incorrectamente como 1/2 y el tiempo final esperado se simplifica incorrectamente a 1/[p^2(1-p)]. Algunas ideas de estados intermedios son relevantes, pero las transiciones clave se manejan mal y las respuestas cuantitativas finales son incorrectas.

Calidad del razonamiento

Peso 20%
20

El razonamiento contiene múltiples inicios falsos, contradicciones, recurrencias incorrectas y fórmulas inapropiadas. Se da cuenta de que se necesitan métodos de estado, pero no los ejecuta correctamente.

Integridad

Peso 15%
50

Cubre las tres partes solicitadas en forma, pero las dos primeras partes dan resultados finales incorrectos. La tercera parte está presente y es ampliamente relevante.

Claridad

Peso 10%
20

La respuesta es muy larga, repetitiva y confusa, con formato desordenado y muchas derivaciones abandonadas antes de conclusiones finales incorrectas.

Seguimiento de instrucciones

Peso 10%
40

Utiliza algo de formato de lista y aborda la indicación, pero la respuesta es excesivamente verbosa, incluye derivaciones fallidas irrelevantes y no proporciona las funciones correctas requeridas.

Resumen comparativo

Para cada tarea y discusión, el orden final se decide por agregación de rangos por evaluador (rango promedio + desempate Borda). La puntuación media se muestra como referencia.

Evaluadores: 3

Votos ganadores

3 / 3

Puntuación media

95
Ver esta respuesta

Votos ganadores

0 / 3

Puntuación media

29
Ver esta respuesta

Resultados de evaluación

Modelos evaluadores OpenAI GPT-5.5

Motivo del ganador

La respuesta A gana porque resuelve correctamente las dos partes cuantitativas principales utilizando ecuaciones de recurrencia válidas y ofrece una explicación clara basada en la superposición. La respuesta B falla el criterio de corrección, que tiene un peso importante, al terminar con una probabilidad incorrecta de 1/2 y un tiempo esperado incorrecto de 1/[p^2(1-p)], a pesar de cierto reconocimiento parcial de la idea correcta del espacio de estados.

Modelos evaluadores Anthropic Claude Opus 4.8

Motivo del ganador

La Respuesta A gana de forma decisiva en el criterio más ponderado, la corrección (45%): proporciona la probabilidad correcta q/(1+q) y un tiempo esperado correcto simplificado cuyo valor p=1/2 (6) es correcto, mientras que la Respuesta B se equivoca tanto en la probabilidad (afirma 1/2 frente al 1/3 correcto en p=1/2) como en el tiempo esperado (afirma 1/(p^2(1-p)) = 8 en p=1/2 frente al 6 correcto). A también lidera en calidad de razonamiento, exhaustividad, claridad y seguimiento de instrucciones. El resultado ponderado favorece abrumadoramente a A.

Modelos evaluadores Google Gemini 2.5 Pro

Motivo del ganador

La Respuesta A es la ganadora porque es correcta, está bien razonada y se presenta de forma clara. En cambio, la Respuesta B es incorrecta en ambas preguntas computacionales principales, lo que demuestra una incomprensión fundamental de los métodos necesarios para resolver el problema. La explicación de la Respuesta A también es significativamente más perspicaz que la de la Respuesta B.

X f L