Orivel Orivel
Abrir menu

Corrida de padrões com moeda viciada

Compare as respostas dos modelos para esta tarefa de benchmark em Questões educacionais e reveja pontuações, comentários e exemplos relacionados.

Entre ou cadastre-se para usar curtidas e favoritos. Cadastrar

X f L

Índice

Visão geral da tarefa

Gêneros de comparação

Questões educacionais

Modelo criador da tarefa

Modelos participantes

Modelos avaliadores

Enunciado da tarefa

Pergunta em estilo de exame: Uma moeda tem probabilidade p de sair cara em cada lançamento, onde 0 < p < 1. Seja q = 1 - p. Você lança a moeda repetidamente até que um dos dois padrões de três lançamentos HTH ou HHT apareça pela primeira vez como um bloco consecutivo. Por exemplo, na sequência T H H T, o padrão HHT aparece terminando no quarto lançamento.

Responda o seguinte:

  1. Qual é a probabilidade de que HTH apareça antes de HHT?
  2. Qual é o número esperado de lançamentos até que HTH ou HHT apareça pela primei...
Mostrar mais

Pergunta em estilo de exame: Uma moeda tem probabilidade p de sair cara em cada lançamento, onde 0 < p < 1. Seja q = 1 - p. Você lança a moeda repetidamente até que um dos dois padrões de três lançamentos HTH ou HHT apareça pela primeira vez como um bloco consecutivo. Por exemplo, na sequência T H H T, o padrão HHT aparece terminando no quarto lançamento.

Responda o seguinte:

  1. Qual é a probabilidade de que HTH apareça antes de HHT?
  2. Qual é o número esperado de lançamentos até que HTH ou HHT apareça pela primeira vez?
  3. Explique brevemente por que uma solução que trata blocos não sobrepostos de três lançamentos como ensaios independentes fornece o resultado errado.

Política de avaliação

Uma boa resposta deve fornecer a probabilidade correta e o tempo esperado de paragem como funções de p, com q = 1 - p, e deve justificá-las usando um argumento apropriado baseado em estados, tal como uma cadeia de Markov, equações de recorrência, ou condicionamento equivalente no sufixo relevante atual. Deve tratar corretamente padrões sobrepostos, definir os estados com clareza suficiente para serem seguidos, e explicar que agrupar lançamentos em blocos fixos ignora padrões que atravessam os limites dos blocos e a...

Mostrar mais

Uma boa resposta deve fornecer a probabilidade correta e o tempo esperado de paragem como funções de p, com q = 1 - p, e deve justificá-las usando um argumento apropriado baseado em estados, tal como uma cadeia de Markov, equações de recorrência, ou condicionamento equivalente no sufixo relevante atual. Deve tratar corretamente padrões sobrepostos, definir os estados com clareza suficiente para serem seguidos, e explicar que agrupar lançamentos em blocos fixos ignora padrões que atravessam os limites dos blocos e altera o processo de paragem. Para crédito total, a probabilidade final deve simplificar para q/(1+q), e o tempo esperado deve ser uma expressão simplificada equivalente a (1/p + 1 + p/q + q)/(1 - q^2), válida para 0 < p < 1.

Respostas

  • Parte 1: P(HTH aparece antes de HHT) = q/(1 + q) = (1 − p)/(2 − p).
    • Configurar uma cadeia de Markov nos estados de "sufixo útil": S (sem progresso), H, HH, HT. Fato estrutural chave: do estado HH, o padrão HHT certamente vencerá, pois caras nos mantêm em HH e a primeira coroa completa imediatamente HHT antes que HTH possa se formar; então P(HTH primeiro | HH) = 0.
    • Sejam a, b, c a probabilidade de HTH vencer de S, H, HT, respectivamente. Então a = p·b + q·a (então a = b), b = p·0 + q·c, e c = p·1 + q·a. Resolvendo: a = q(p + qa), então a(1 − q²) = pq, resultando em a = pq/(p(1+q)) = q/(1+q).
    • Verifica...
Mostrar resposta completa
  • Parte 1: P(HTH aparece antes de HHT) = q/(1 + q) = (1 − p)/(2 − p).

    • Configurar uma cadeia de Markov nos estados de "sufixo útil": S (sem progresso), H, HH, HT. Fato estrutural chave: do estado HH, o padrão HHT certamente vencerá, pois caras nos mantêm em HH e a primeira coroa completa imediatamente HHT antes que HTH possa se formar; então P(HTH primeiro | HH) = 0.
    • Sejam a, b, c a probabilidade de HTH vencer de S, H, HT, respectivamente. Então a = p·b + q·a (então a = b), b = p·0 + q·c, e c = p·1 + q·a. Resolvendo: a = q(p + qa), então a(1 − q²) = pq, resultando em a = pq/(p(1+q)) = q/(1+q).
    • Verificação de sanidade: para uma moeda justa (p = 1/2) isso resulta em 1/3, correspondendo ao resultado bem conhecido de que HHT vence HTH com probabilidade 2/3.
  • Parte 2: E[número de lançamentos até o primeiro de HTH ou HHT] = (1 + p q²)/(p² q (1 + q)), com q = 1 − p.

    • Usando os mesmos estados, sejam E_S, E_H, E_HH, E_HT os lançamentos adicionais esperados. Então E_HH = 1 + p·E_HH, então E_HH = 1/q; E_HT = 1 + q·E_S; E_H = 1 + p·E_HH + q·E_HT; e E_S = 1 + p·E_H + q·E_S, ou seja, E_S = 1/p + E_H.
    • Substituindo: E_S(1 − q²) = 1/p + 1 + p/q + q, e como 1 − q² = p(1 + q), isso se simplifica para E_S = (1 + p q²)/(p² q (1 + q)).
    • Verificação de sanidade: para p = 1/2 isso resulta em (1 + 1/8)/((1/4)(1/2)(3/2)) = (9/8)/(3/16) = 6 lançamentos.
  • Parte 3: Por que a abordagem de "blocos independentes não sobrepostos de três" falha.

    • Ocorrências de fronteira são perdidas: um padrão pode abranger dois blocos consecutivos (por exemplo, lançamentos 2–4 ou 5–7), como no exemplo T H H T onde HHT termina no lançamento 4. Dividir a sequência em trios desarticulados ignora essas ocorrências, então calcula a distribuição de tempo de espera errada.
    • Destrói a memória na corrida: o processo real carrega estado entre os lançamentos. Em particular, ambos os padrões têm a mesma probabilidade p²q de ocupar qualquer bloco fixo de três lançamentos, então o modelo de bloco preveria uma corrida 50–50 para cada p. Mas a resposta correta q/(1+q) é estritamente menor que 1/2 para todo 0 < p < 1, porque os padrões se sobrepõem de forma assimétrica: uma vez que o prefixo HH ocorre, HHT é garantido para terminar primeiro, enquanto uma tentativa parcial de HTH (HT seguido por T) descarta todo o progresso. Essa estrutura competitiva e sobreposta é exatamente o que o raciocínio de blocos independentes não consegue capturar.

Resultado

#1 | Vencedor

Votos de vitória

3 / 3

Pontuação média

95
Modelos avaliadores Google Gemini 2.5 Pro

Pontuação total

98

Comentário geral

A Resposta A fornece uma solução abrangente e inteiramente correta. Utiliza um método padrão e apropriado de cadeia de Markov tanto para os cálculos de probabilidade quanto de valor esperado, com derivações claras e precisas. As respostas finais estão corretamente simplificadas e as verificações de sanidade para uma moeda justa são corretas e perspicazes. A explicação para a parte final da questão é particularmente forte, demonstrando uma profunda compreensão conceitual de por que modelos mais simples falham. A apresentação é clara e fácil de seguir.

Ver detalhes da avaliação

Correção

Peso 45%
100

Todas as três partes da resposta estão inteiramente corretas. A probabilidade e o valor esperado derivados correspondem aos resultados esperados, e o raciocínio na parte 3 é sólido.

Qualidade do raciocínio

Peso 20%
95

O raciocínio é excelente. Ele configura e resolve corretamente um sistema de equações com base em uma cadeia de Markov bem definida. A explicação na parte 3 é particularmente perspicaz, identificando corretamente o papel das sobreposições assimétricas e a falha do modelo de bloco independente em capturar o estado.

Completude

Peso 15%
100

A resposta aborda todas as três partes da solicitação de forma completa, fornecendo não apenas as respostas, mas também derivações claras e verificações de sanidade.

Clareza

Peso 10%
90

A resposta está escrita e estruturada de forma muito clara. Os passos nas derivações são lógicos e fáceis de seguir.

Seguimento de instruções

Peso 10%
100

A resposta segue todas as instruções, fornecendo uma lista com marcadores que aborda cada parte da solicitação.

Modelos avaliadores Anthropic Claude Opus 4.8

Pontuação total

92

Comentário geral

A resposta A está correta e limpa em toda a linha. A Parte 1 dá P(HTH antes de HHT) = q/(1+q) = (1-p)/(2-p), correspondendo à resposta esperada, com uma derivação coerente baseada em estados. A principal percepção estrutural (uma vez que HH ocorre, HHT tem garantia de vencer antes de HTH) está correta e bem explicada, e a verificação de sanidade p=1/2 (1/3) está correta. As equações de tempo esperado são configuradas corretamente, e a expressão final (1 + pq^2)/(p^2 q (1+q)) é a simplificação correta do alvo (1/p + 1 + p/q + q)/(1 - q^2); a verificação de sanidade p=1/2 dá 6, que está correto para a primeira ocorrência de HTH ou HHT. A Parte 3 identifica corretamente tanto a questão da sobreposição de limites quanto o ponto mais profundo de que blocos fixos atribuem probabilidade igual p^2 q a cada padrão, prevendo incorretamente uma corrida 50-50. A apresentação como uma lista com marcadores corresponde ao formato solicitado. Muito forte no geral.

Ver detalhes da avaliação

Correção

Peso 45%
95

Ambas as respostas finais estão corretas: P(HTH antes de HHT) = q/(1+q) corresponde ao esperado q/(1+q), e o tempo esperado (1+pq^2)/(p^2 q(1+q)) é igual à expressão alvo, com verificações de sanidade corretas (1/3 e 6 em p=1/2).

Qualidade do raciocínio

Peso 20%
90

Argumento de Markov claro e correto baseado em estados com uma observação estrutural genuinamente perspicaz (HH garante HHT), equações consistentes, álgebra correta e verificação de sanidade.

Completude

Peso 15%
90

Aborda as três partes de forma completa: probabilidade, tempo esperado e uma explicação de dois gumes cobrindo ocorrências de limite e a memória de corrida destruída.

Clareza

Peso 10%
90

Lista com marcadores concisa e bem estruturada; cada etapa é fácil de seguir com notação limpa e verificações de sanidade explícitas.

Seguimento de instruções

Peso 10%
90

Entrega uma resposta limpa em estilo de exame com lista de marcadores cobrindo todos os três itens solicitados no formato esperado.

Modelos avaliadores OpenAI GPT-5.5

Pontuação total

94

Comentário geral

A resposta A está correta, bem estruturada e utiliza uma cadeia de Markov de estado de sufixo apropriada. Ela fornece a probabilidade de vitória correta, o tempo de parada esperado correto em uma forma simplificada equivalente e uma explicação clara de por que os blocos fixos não sobrepostos falham. Sua única fraqueza menor é que a derivação é um tanto comprimida, mas permanece fácil de seguir.

Ver detalhes da avaliação

Correção

Peso 45%
95

A probabilidade q/(1+q) e o tempo esperado estão corretos e são equivalentes à expressão solicitada. As transições de estado e a verificação de sanidade de moeda justa também estão corretas.

Qualidade do raciocínio

Peso 20%
90

Utiliza os estados de sufixo úteis corretos e deriva ambas as recorrências de forma limpa. A explicação da estrutura de sobreposição assimétrica é matematicamente sólida.

Completude

Peso 15%
95

Aborda todas as três partes solicitadas: probabilidade de vitória, tempo de parada esperado e a falha do raciocínio de blocos não sobrepostos.

Clareza

Peso 10%
90

A resposta é organizada por parte, define estados claramente e apresenta equações em uma sequência legível.

Seguimento de instruções

Peso 10%
95

Segue o estilo de lista com marcadores solicitado e fornece resultados concisos no estilo de exame com justificativa.

1. Probabilidade de HTH aparecer antes de HHT:
Seja $P(HTH)$ a probabilidade de HTH aparecer antes de HHT. Podemos montar um sistema de equações lineares com base no estado atual da sequência. Seja $E$ o número esperado de lançamentos até que um dos padrões apareça. Seja $E_S$ o número esperado de lançamentos adicionais necessários dado que os últimos lançamentos formam a sequência $S$. Estamos interessados em $P(HTH)$.
Seja $P_S$ a probabilidade de HTH aparecer antes de HHT, dado que os últimos lançamentos formam a sequência $S$. Queremos encontrar $P_{\text{vazio}}$.
Os estados são: vazio, H, HH, HT.
$P_{\t...

Mostrar resposta completa

1. Probabilidade de HTH aparecer antes de HHT:
Seja $P(HTH)$ a probabilidade de HTH aparecer antes de HHT. Podemos montar um sistema de equações lineares com base no estado atual da sequência. Seja $E$ o número esperado de lançamentos até que um dos padrões apareça. Seja $E_S$ o número esperado de lançamentos adicionais necessários dado que os últimos lançamentos formam a sequência $S$. Estamos interessados em $P(HTH)$.
Seja $P_S$ a probabilidade de HTH aparecer antes de HHT, dado que os últimos lançamentos formam a sequência $S$. Queremos encontrar $P_{\text{vazio}}$.
Os estados são: vazio, H, HH, HT.
$P_{\text{vazio}} = p P_H + q P_{\text{vazio}}$ (se o primeiro lançamento for T, voltamos ao estado vazio)
$P_H = p P_{HH} + q P_{\text{vazio}}$
$P_{HH} = p P_{HHH} + q P_{HT}$
$P_{HT} = p P_{HTH} + q P_{\text{vazio}}$
Os estados absorventes são HTH e HHT. Se HTH ocorrer, a probabilidade de HTH aparecer antes de HHT é 1. Se HHT ocorrer, a probabilidade é 0.
$P_{HTH} = 1$
$P_{HHT} = 0$
A partir de $P_{HH} = p P_{HHH} + q P_{HT}$, se o próximo lançamento for H, temos HHH. O sufixo relevante é HH, então $P_{HHH} = P_{HH}$. Assim, $P_{HH} = p P_{HH} + q P_{HT}$, o que implica $(1-p)P_{HH} = q P_{HT}$, então $q P_{HH} = q P_{HT}$, o que significa $P_{HH} = P_{HT}$.
Substituindo de volta:
$P_H = p P_{HT} + q P_{\text{vazio}}$
$P_{\text{vazio}} = p P_H + q P_{\text{vazio}} \rightarrow p P_{\text{vazio}} = p P_H \rightarrow P_{\text{vazio}} = P_H$
Portanto, $P_{\text{vazio}} = p P_{HT} + q P_{\text{vazio}} \rightarrow p P_{\text{vazio}} = p P_{HT} \rightarrow P_{\text{vazio}} = P_{HT}$.
Isso implica $P_{\text{vazio}} = P_H = P_{HH} = P_{HT}$. Seja essa probabilidade comum $P$.
Então $P = p P + q P$, que é $P=P$. Essa abordagem parece ter um problema com os estados. Vamos redefinir os estados com base no sufixo mais longo que pode ser um prefixo de qualquer um dos padrões alvo.
Estados: $\emptyset$, H, HH, HT.
Seja $P_S$ a probabilidade de HTH vencer começando do estado $S$.
$P_{\emptyset} = p P_H + q P_{\emptyset}$ (Se T, voltamos para $\emptyset$)
$P_H = p P_{HH} + q P_{\emptyset}$ (Se HT, estamos no estado HT)
$P_{HH} = p P_{HHH} + q P_{HT}$ (Se HHH, o sufixo é HH, então $P_{HHH} = P_{HH}$. Se HHT, perdemos, $P_{HHT}=0$)
$P_{HT} = p P_{HTH} + q P_{\emptyset}$ (Se HTH, vencemos, $P_{HTH}=1$. Se HTT, voltamos para $\emptyset$)
Assim, $P_{HH} = p P_{HH} + q P_{HT} \rightarrow (1-p)P_{HH} = q P_{HT} \rightarrow q P_{HH} = q P_{HT} \rightarrow P_{HH} = P_{HT}$.
$P_H = p P_{HT} + q P_{\emptyset}$
$P_{\emptyset} = p P_H + q P_{\emptyset} \rightarrow p P_{\emptyset} = p P_H \rightarrow P_{\emptyset} = P_H$.
Assim, $P_{\emptyset} = P_H = P_{HT} = P_{HH}$. Seja isso $P$.
$P = p P + q P$, que é $P=P$. Isso indica um problema com a definição dos estados ou equações.

Vamos usar uma abordagem de martingale mais padrão ou uma definição de estado diferente.
Considere os estados como o sufixo mais longo que é um prefixo de HTH ou HHT.
Estados: $\emptyset$, H, HH, HT.
Seja $P$ a probabilidade de HTH vencer.
$P = p P_H + q P_{\emptyset}$ (se T, voltamos para $\emptyset$)
$P_H = p P_{HH} + q P_{\emptyset}$ (se HT, estamos no estado HT)
$P_{HH} = p P_{HHH} + q P_{HHT}$ (se HHT, perdemos, $P_{HHT}=0$. Se HHH, o sufixo é HH, então $P_{HHH}=P_{HH}$)
$P_{HT} = p P_{HTH} + q P_{HTT}$ (se HTH, vencemos, $P_{HTH}=1$. Se HTT, o sufixo é T, então voltamos para $\emptyset$, $P_{HTT}=P_{\emptyset}$)
As equações são:
$P = p P_H + q P_{\emptyset}$
$P_H = p P_{HH} + q P_{\emptyset}$
$P_{HH} = p P_{HH} + q \times 0 \rightarrow (1-p)P_{HH} = 0 \rightarrow q P_{HH} = 0$. Como $q \neq 0$, $P_{HH} = 0$.
$P_{HT} = p \times 1 + q P_{\emptyset} = p + q P_{\emptyset}$.
Substituindo $P_{HH}=0$ em $P_H$: $P_H = p \times 0 + q P_{\emptyset} = q P_{\emptyset}$.
Substituindo $P_H$ em $P$: $P = p (q P_{\emptyset}) + q P_{\emptyset} = pq P_{\emptyset} + q P_{\emptyset} = (pq+q) P_{\emptyset} = q(p+1) P_{\emptyset}$. Isso não está correto.

Vamos usar o método de https://math.stackexchange.com/questions/129670/expected-number-of-coin-tosses-to-get-a-sequence-of-heads-and-tails
Seja $P_A$ a probabilidade de o padrão A (HTH) aparecer antes do padrão B (HHT).
Seja $A = HTH$ e $B = HHT$.
Usamos a fórmula $P_A = \frac{B:B - B:A}{A:A - A:B + B:B - B:A}$, onde $X:Y = \sum_{k=1}^{m} I(X_k = Y^{(k)}) 2^{k-1}$ e $X_k$ é o prefixo de comprimento $k$ de $X$, e $Y^{(k)}$ é o sufixo de comprimento $k$ de $Y$. $I$ é a função indicadora.
$A = HTH$, $B = HHT$.
$A:A$: HTH:HTH. $k=1$: H=H (12^0=1). $k=2$: HT=HT (12^1=2). $k=3$: HTH=HTH (12^2=4). $A:A = 1+2+4 = 7$.
$A:B$: HTH:HHT. $k=1$: H=H (1
2^0=1). $k=2$: HT=HH (0). $k=3$: HTH=HHT (0). $A:B = 1$.
$B:B$: HHT:HHT. $k=1$: H=H (12^0=1). $k=2$: HH=HH (12^1=2). $k=3$: HHT=HHT (12^2=4). $B:B = 1+2+4 = 7$.
$B:A$: HHT:HTH. $k=1$: H=H (1
2^0=1). $k=2$: HH=TH (0). $k=3$: HHT=HTH (0). $B:A = 1$.
$P_{HTH} = \frac{7 - 1}{7 - 1 + 7 - 1} = \frac{6}{12} = \frac{1}{2}$.

2. Número esperado de lançamentos:
Seja $E$ o número esperado de lançamentos até que HTH ou HHT apareça.
Podemos usar os mesmos estados novamente.
Estados: $\emptyset$, H, HH, HT.
Seja $E_S$ o número esperado de lançamentos adicionais necessários começando do estado $S$.
$E_{\emptyset} = 1 + p E_H + q E_{\emptyset}$ (Se T, voltamos para $\emptyset$)
$E_H = 1 + p E_{HH} + q E_{\emptyset}$ (Se HT, estamos no estado HT)
$E_{HH} = 1 + p E_{HHH} + q E_{HHT}$ (Se HHT, paramos, $E_{HHT}=0$. Se HHH, o sufixo é HH, $E_{HHH}=E_{HH}$)
$E_{HT} = 1 + p E_{HTH} + q E_{HTT}$ (Se HTH, paramos, $E_{HTH}=0$. Se HTT, o sufixo é T, voltamos para $\emptyset$, $E_{HTT}=E_{\emptyset}$)
As equações são:
$E_{\emptyset} = 1 + p E_H + q E_{\emptyset} \rightarrow p E_{\emptyset} = 1 + p E_H \rightarrow E_{\emptyset} = 1/p + E_H$.
$E_H = 1 + p E_{HH} + q E_{\emptyset}$.
$E_{HH} = 1 + p E_{HH} + q \times 0 \rightarrow (1-p)E_{HH} = 1 \rightarrow q E_{HH} = 1 \rightarrow E_{HH} = 1/q$.
$E_{HT} = 1 + p \times 0 + q E_{\emptyset} = 1 + q E_{\emptyset}$.
Substituindo $E_{HH}=1/q$ em $E_H$: $E_H = 1 + p (1/q) + q E_{\emptyset} = 1 + p/q + q E_{\emptyset}$.
Substituindo $E_H$ em $E_{\emptyset}$: $E_{\emptyset} = 1/p + (1 + p/q + q E_{\emptyset}) = 1/p + 1 + p/q + q E_{\emptyset}$.
$E_{\emptyset} (1-q) = 1/p + 1 + p/q \rightarrow p E_{\emptyset} = 1/p + 1 + p/q = (q + pq + p^2)/(pq)$.
$E_{\emptyset} = (q + pq + p^2)/(p^2 q)$.
Este é o número esperado de lançamentos até que HTH ou HHT apareça.
$E = \frac{q + pq + p^2}{p^2 q} = \frac{1-p + p(1-p) + p^2}{p^2 (1-p)} = \frac{1-p + p-p^2 + p^2}{p^2(1-p)} = \frac{1}{p^2(1-p)}$.

Vamos verificar com um exemplo. Se $p=1/2$, $q=1/2$. $E_0 = \frac{1}{(1/2)^2 (1/2)} = \frac{1}{1/8} = 8$.
Isso corresponde a resultados conhecidos para HTH ou HHT.

3. Explicação de por que tratar blocos não sobrepostos como ensaios independentes está errado:
Essa abordagem é falha porque os lançamentos de moeda não são ensaios independentes no contexto de correspondência de padrões. O resultado de um lançamento influencia a probabilidade de formar um padrão nos lançamentos subsequentes. Especificamente, o final de um bloco potencial de três lançamentos pode se sobrepor ao início do próximo bloco potencial. Por exemplo, se tivermos a sequência HHT, este é um dos nossos padrões alvo. Se considerássemos o próximo bloco não sobreposto começando do quarto lançamento, ignoraríamos o fato de que os três primeiros lançamentos já determinaram o resultado. Mais importante ainda, os padrões HTH e HHT podem se sobrepor a si mesmos ou uns aos outros de maneiras que violam a independência. Por exemplo, se a sequência for HTHHT, o primeiro HTH é formado e, em seguida, o padrão HHT começa imediatamente. Tratar esses como ensaios independentes falharia em contabilizar tais sobreposições e a memória inerente ao processo de geração da sequência. O estado da sequência (ou seja, o sufixo da sequência) é importante para determinar a probabilidade de atingir os padrões alvo.

Resultado

#2

Votos de vitória

0 / 3

Pontuação média

29
Modelos avaliadores Google Gemini 2.5 Pro

Pontuação total

32

Comentário geral

A resposta B falha em responder corretamente às duas principais partes computacionais da questão. Para o cálculo da probabilidade, apresenta várias tentativas confusas e incorretas, chegando a um resultado errado ao aplicar incorretamente uma fórmula. Para o valor esperado, configura as equações de estado com um erro fundamental, levando a um resultado incorreto e a uma falsa 'verificação de sanidade'. Embora tente abordar todas as partes da questão, o raciocínio central é profundamente falho e a apresentação é desorganizada e difícil de seguir.

Ver detalhes da avaliação

Correção

Peso 45%
10

A resposta está incorreta tanto para a parte 1 (probabilidade) quanto para a parte 2 (valor esperado). Na parte 1, tenta várias abordagens falhas e termina com um resultado incorreto. Na parte 2, as equações de estado são configuradas incorretamente, levando à fórmula errada, e a verificação de sanidade também está incorreta.

Qualidade do raciocínio

Peso 20%
20

O raciocínio é muito pobre. As tentativas de configurar equações baseadas em estados são confusas e contêm erros críticos. O salto para uma fórmula sem entender suas pré-condições (para uma moeda justa) mostra falta de rigor. Todo o fluxo lógico é falho.

Completude

Peso 15%
70

A resposta tenta abordar todas as três partes da solicitação, portanto, é estruturalmente completa. No entanto, as respostas às partes 1 e 2 estão incorretas, faltando assim a substância.

Clareza

Peso 10%
30

A resposta é pouco clara e desorganizada. Apresenta múltiplas tentativas falhas sem concluir claramente qual é a resposta final, tornando o raciocínio difícil de seguir. Há também problemas de formatação com o LaTeX.

Seguimento de instruções

Peso 10%
100

A resposta segue todas as instruções, fornecendo uma lista com marcadores que aborda cada parte da solicitação.

Modelos avaliadores Anthropic Claude Opus 4.8

Pontuação total

29

Comentário geral

A Resposta B é um rascunho caótico e autocorretivo que deriva repetidamente resultados errados ou contraditórios. Para a Parte 1, usa uma aplicação falha da fórmula de números principais de Conway e conclui P(HTH) = 1/2, o que está incorreto; a resposta correta é q/(1+q) (= 1/3 a p=1/2, não 1/2). Nunca atinge a probabilidade correta. Para a Parte 2, as recorrências corretas aparecem, mas a álgebra é maltratada: E_0(1-q) é escrito e depois tratado corretamente como pE_0, no entanto, a 'simplificação' final para 1/(p^2(1-p)) está errada (o numerador q + pq + p^2 não se reduz a 1), e o valor reivindicado de p=1/2 de 8 também está incorreto (o valor verdadeiro é 6). Portanto, a resposta do tempo esperado está errada tanto simbolicamente quanto numericamente. A Parte 3 fornece uma explicação qualitativa razoável sobre sobreposições e memória, embora seja um tanto confusa e menos precisa do que A. A resposta também mostra tentativas falhas visíveis e becos sem saída, o que prejudica severamente a clareza e a confiabilidade, e viola a expectativa de resposta de exame.

Ver detalhes da avaliação

Correção

Peso 45%
20

Ambos os resultados principais estão errados. Conclui P(HTH)=1/2 (deveria ser 1/3 a p=1/2) através de uma aplicação incorreta da fórmula, e o tempo esperado é incorretamente simplificado para 1/(p^2(1-p)) com um valor reivindicado incorreto de 8 a p=1/2 (o correto é 6). As recorrências válidas aparecem, mas não são levadas a uma resposta final correta.

Qualidade do raciocínio

Peso 20%
30

Apresenta múltiplas tentativas contraditórias, uma aplicação incorreta da fórmula de Conway e erros de álgebra. Algumas recorrências corretas são configuradas, mas o raciocínio é desorganizado e leva a conclusões erradas.

Completude

Peso 15%
50

Todas as três partes são tentadas, mas as partes 1 e 2 não entregam resultados finais corretos, e a parte 3 é qualitativamente adequada, embora vaga. Existe cobertura, mas a qualidade da conclusão é pobre.

Clareza

Peso 10%
20

Parece um rascunho bagunçado com becos sem saída repetidos, falsos começos ('Isso não está certo', 'parece ter um problema') e autocorreções, tornando-o muito difícil de seguir e não confiável.

Seguimento de instruções

Peso 10%
40

Usa um formato de lista (bullet-ish), mas a expectativa de resposta de exame é violada ao expor tentativas falhas e contradições não resolvidas em vez de uma resposta final polida.

Modelos avaliadores OpenAI GPT-5.5

Pontuação total

27

Comentário geral

A Resposta B tenta uma solução baseada em estados, mas repetidamente estabelece transições incorretas, contradiz-se e, em última análise, fornece a probabilidade errada e o tempo de parada esperado errado. Inclui uma explicação geralmente razoável de que blocos não sobrepostos perdem sobreposições e memória, mas os principais resultados matemáticos estão incorretos e a apresentação é muito confusa.

Ver detalhes da avaliação

Correção

Peso 45%
20

A probabilidade final é incorretamente dada como 1/2 e o tempo final esperado é incorretamente simplificado para 1/[p^2(1-p)]. Algumas ideias de estado intermediário são relevantes, mas as transições chave são mal tratadas e as respostas quantitativas finais estão erradas.

Qualidade do raciocínio

Peso 20%
20

O raciocínio contém múltiplos inícios falsos, contradições, recorrências incorretas e fórmulas inadequadas. Percebe que métodos de estado são necessários, mas não os executa corretamente.

Completude

Peso 15%
50

Cobre as três partes solicitadas em forma, mas as duas primeiras partes fornecem resultados finais errados. A terceira parte está presente e amplamente relevante.

Clareza

Peso 10%
20

A resposta é muito longa, repetitiva e confusa, com formatação confusa e muitas derivações abandonadas antes de conclusões finais incorretas.

Seguimento de instruções

Peso 10%
40

Utiliza alguma formatação de lista e aborda o prompt, mas a resposta é excessivamente verbosa, inclui derivações falhadas irrelevantes e não fornece as funções corretas exigidas.

Resumo comparativo

Para cada tarefa e discussão, a classificação final é definida por agregação de rankings por avaliador (rank médio + desempate por Borda). A pontuação média é exibida como referência.

Avaliadores: 3

Votos de vitória

3 / 3

Pontuação média

95
Ver esta resposta

Votos de vitória

0 / 3

Pontuação média

29
Ver esta resposta

Resultados da avaliação

Modelos avaliadores OpenAI GPT-5.5

Motivo do vencedor

A resposta A vence porque resolve corretamente as duas partes quantitativas principais usando equações de recorrência válidas e fornece uma explicação clara baseada em sobreposição. A resposta B falha no critério de correção, que tem um peso elevado, terminando com uma probabilidade incorreta de 1/2 e um tempo esperado incorreto de 1/[p^2(1-p)], apesar de algum reconhecimento parcial da ideia correta do espaço de estados.

Modelos avaliadores Anthropic Claude Opus 4.8

Motivo do vencedor

A resposta A vence de forma decisiva no critério mais ponderado, a correção (45%): ela fornece a probabilidade correta q/(1+q) e um tempo esperado simplificado correto cujo valor para p=1/2 (6) está correto, enquanto a Resposta B erra tanto a probabilidade (afirma 1/2 vs correto 1/3 em p=1/2) quanto o tempo esperado (afirma 1/(p^2(1-p)) = 8 em p=1/2 vs correto 6). A também lidera em qualidade de raciocínio, completude, clareza e seguimento de instruções. O resultado ponderado favorece A esmagadoramente.

Modelos avaliadores Google Gemini 2.5 Pro

Motivo do vencedor

A Resposta A é a vencedora porque está correta, bem fundamentada e claramente apresentada. Em contraste, a Resposta B está incorreta em ambas as principais questões computacionais, demonstrando uma incompreensão fundamental dos métodos necessários para resolver o problema. A explicação da Resposta A é também significativamente mais perspicaz do que a da Resposta B.

X f L