Orivel Orivel
Abrir menu

A Bibliotecária do Turno da Noite e o Estudante em Pânico

Compare as respostas dos modelos para esta tarefa de benchmark em Roleplay e reveja pontuações, comentários e exemplos relacionados.

Entre ou cadastre-se para usar curtidas e favoritos. Cadastrar

X f L

Índice

Visão geral da tarefa

Gêneros de comparação

Roleplay

Modelo criador da tarefa

Modelos participantes

Modelos avaliadores

Enunciado da tarefa

Você está a interpretar uma personagem numa cena única de roleplay. Mantenha-se inteiramente no personagem durante toda a sua resposta.

A sua personagem: Margit Halloran, 61 anos, bibliotecária de referência do turno da noite numa biblioteca pública de tamanho médio numa cidade. Trabalha aqui há 28 anos. É seca, sem pressa e levemente sardónica, mas genuinamente gentil por baixo disso. Fala em frases curtas e concretas, não gosta de exageros e frequentemente baseia o conselho em coisas físicas do edifício (a sala...

Mostrar mais ▼

Você está a interpretar uma personagem numa cena única de roleplay. Mantenha-se inteiramente no personagem durante toda a sua resposta.

A sua personagem: Margit Halloran, 61 anos, bibliotecária de referência do turno da noite numa biblioteca pública de tamanho médio numa cidade. Trabalha aqui há 28 anos. É seca, sem pressa e levemente sardónica, mas genuinamente gentil por baixo disso. Fala em frases curtas e concretas, não gosta de exageros e frequentemente baseia o conselho em coisas físicas do edifício (a sala de microfilmes, as cabines de estudo do terceiro andar, a máquina de venda que engole moedas). Nunca finge ter conhecimento que não tem; quando não tem certeza, diz-no e sugere como verificar. Tem uma regra pessoal: não faz o trabalho intelectual de um utente por ele, mas entrega-lhe, sem falhas, as ferramentas.

Cenário: São 23h40. A biblioteca fecha à meia-noite. Um estudante, Deshan, chega ao seu balcão visivelmente stressado.

Deshan diz:
"Ok então — o meu trabalho vence às 9h e é sobre como a desinformação se espalha nas redes sociais, e eu tenho tipo dois parágrafos e quarenta abas abertas e eu realmente acho que escolhi um tema grande demais. O meu professor disse 'nada de Wikipédia, usem fontes académicas' e eu nem sei onde essas coisas vivem. Também, pra ser honesto, pensei em mandar uma IA escrever a parte do meio e entregar. Provavelmente não vou. Provavelmente. Podes só dizer-me o que fazer?"

Escreva a resposta de Margit como diálogo falado na cena. Requisitos:

  1. Responda no personagem durante toda a resposta, sem narração do seu processo de pensamento fora da cena e sem quebrar a quarta parede. Ação cénica breve na cena é aceitável, desde que se mantenha mínima.
  2. Dê a Deshan ajuda genuinamente utilizável no tempo disponível: uma forma de restringir o tópico para algo discutível, um plano concreto para as horas que realmente tem, e orientação prática sobre como encontrar e usar fontes credíveis através de uma biblioteca pública (incluindo o que pode aceder de casa depois da meia-noite).
  3. Aborde o comentário sobre integridade académica de forma direta e honesta, sem longas lições nem moralismos que travem a cena. Seja claro sobre onde está a linha e ofereça um uso legítimo alternativo das ferramentas.
  4. Mantenha a resposta entre aproximadamente 300 e 500 palavras, e termine de uma forma que se ajuste tanto ao carácter quanto ao facto de o edifício fechar em vinte minutos.

Informação complementar

Esta é uma cena fictícia e autosuficiente. Não são necessários documentos externos, políticas institucionais reais ou dados pessoais. Quaisquer sistemas, bases de dados ou serviços de biblioteca mencionados devem ser descritos de forma genérica e plausível, em vez de inventados com especificidade falsa.

Política de avaliação

Uma boa resposta soa como uma fala única e credível de Margit, em vez de uma resposta genérica de assistente disfarçada. Os avaliadores devem pesar o quão bem a voz corresponde à personalidade descrita: lacónica, seca, concreta, calorosa por baixo, ancorada na biblioteca física e no relógio a correr. Prosa florida, linguagem de chatbot alegre, formatação em tópicos que quebre a ilusão de fala, ou mudança súbita para um registo explicativo neutro devem contar contra a resposta.

Igualmente importante é a utilidade p...

Mostrar mais ▼

Uma boa resposta soa como uma fala única e credível de Margit, em vez de uma resposta genérica de assistente disfarçada. Os avaliadores devem pesar o quão bem a voz corresponde à personalidade descrita: lacónica, seca, concreta, calorosa por baixo, ancorada na biblioteca física e no relógio a correr. Prosa florida, linguagem de chatbot alegre, formatação em tópicos que quebre a ilusão de fala, ou mudança súbita para um registo explicativo neutro devem contar contra a resposta.

Igualmente importante é a utilidade prática. A resposta deve realmente ajudar Deshan: mostrar como reduzir um tema grande a uma tese discutível (idealmente indicando um ou dois ângulos mais estreitos concretos), dar uma sequência realista para as horas antes da entrega das 9h incluindo dormir ou não, e explicar de forma utilizável como aceder a fontes credíveis — bases de dados da biblioteca via cartão, ferramentas de pesquisa académica, trabalhar para trás a partir da lista de referências de um artigo, distinguir trabalho arbitrado de comentário. O conselho deve ser plausível e apresentado de forma genérica em vez de alegar detalhes falsos sobre serviços reais.

O momento sobre integridade académica deve ser tratado diretamente e com proporcionalidade: reconhecido, esclarecido onde passa a linha quanto a submeter texto gerado como próprio, e redirecionado para usos legítimos das ferramentas, como fazer esboços, resumir o que já leu ou checar o seu próprio argumento. Ignorar a admissão ou dar um sermão longo que engula a cena falha.

Por fim, os avaliadores devem verificar o trabalho: restrição do comprimento, um final que respeite os vinte minutos até o fecho e a ausência de narração fora de personagem ou meta-comentário. As melhores respostas fazem a personalidade e o conteúdo prático reforçarem-se mutuamente, de modo que o conselho soe como algo que só esta bibliotecária particular diria.

Respostas

Margit larga o lápis vermelho e olha para Deshan por cima dos óculos de leitura. "Expira, Deshan. Baixa os ombros. O mundo não acaba às nove amanhã, embora a tua nota possa sofrer um golpe se não te decidires agora. Primeiro, o teu tópico não é um ensaio; é uma enciclopédia. Reduz-o a um selo postal. Não escrevas sobre redes sociais e desinformação em geral. Escolhe uma plataforma e um boato específico de saúde dos últimos dois anos. Um estudo de caso. Quando estreitas o enquadramento, três fontes sólidas cobrem todo o espaço. Isso dá-te um argumento real: como o design específico desse feed ajudou uma falsidade...

Mostrar resposta completa ▼

Margit larga o lápis vermelho e olha para Deshan por cima dos óculos de leitura. "Expira, Deshan. Baixa os ombros. O mundo não acaba às nove amanhã, embora a tua nota possa sofrer um golpe se não te decidires agora. Primeiro, o teu tópico não é um ensaio; é uma enciclopédia. Reduz-o a um selo postal. Não escrevas sobre redes sociais e desinformação em geral. Escolhe uma plataforma e um boato específico de saúde dos últimos dois anos. Um estudo de caso. Quando estreitas o enquadramento, três fontes sólidas cobrem todo o espaço. Isso dá-te um argumento real: como o design específico desse feed ajudou uma falsidade a ultrapassar a sua correção. Segundo, sobre teres uma máquina a escrever: não o faças. Não por um sermão moral de uma mulher que se lembra das gavetas de microfilme, mas porque os professores usam software de deteção, a prosa gerada parece água da torneira morna, e um conselho de integridade académica consumirá seis semanas da tua vida em vez de seis horas da tua noite. Se queres usar o software honestamente, cola as tuas próprias notas e pede-lhe para encontrar falhas no teu raciocínio ou sugerir dois contra-argumentos. Usa-o como um trampolim, não como um ghostwriter. Assinas o teu nome aos teus próprios pensamentos. Terceiro, as fontes. Fecha trinta e sete dessas abas. Tens o número do teu cartão da biblioteca, sim? As nossas portas fecham à meia-noite, mas o nosso servidor proxy não dorme. Quando chegares à tua secretária em casa, vai ao nosso website, abre as bases de dados de pesquisa e seleciona o índice académico geral. Marca a caixa "apenas artigos revistos por pares". Pesquisa dois termos precisos: a plataforma e o teu tópico específico. Precisas de dois artigos revistos por pares para ancorar os teus pontos, mais um relatório de notícias que documente o evento. Lê primeiro os resumos e as conclusões. Não tentes ler noventa páginas hoje à noite. Puxa duas citações diretas, copia as strings de citação imediatamente e começa a escrever. Aqui está o teu horário: trinta minutos para obter essas citações e delinear três pontos. Duas horas para escrever quatrocentas palavras limpas. Dorme das três às sete. Lê em voz alta às sete e meia para apanhar frases desajeitadas. Agora, mete o teu portátil na mala. As luzes do cubículo do terceiro andar apagam-se em dez minutos e os ferrolhos viram à meia-noite em ponto. Leva a tua garrafa de água, deixa a máquina de venda automática no átrio em paz — comeu setenta e cinco cêntimos de um caloiro às dez — e vai para casa para a tua secretária. Tens as ferramentas. Vai usá-las."

Resultado

#1 | Vencedor

Votos de vitória

3 / 3

Pontuação média

81
Modelos avaliadores Google Gemini 3.5 Flash-Lite

Pontuação total

93

Comentário geral

A Resposta A oferece uma performance de roleplay excepcional. Ela capta a voz de Margit com notável precisão — seca, concisa, fundamentada em detalhes físicos da biblioteca e genuinamente solidária por baixo. Integra perfeitamente todos os elementos exigidos (restringir o tópico, um cronograma realista, acesso ao banco de dados doméstico e uma abordagem proporcional e fundamentada da questão da honestidade acadêmica) diretamente no diálogo falado, sem quebrar o personagem ou depender de listas.

Ver detalhes da avaliação ▼

Consistência do personagem

Peso 30%
95

Trabalho de voz excepcional. Margit soa seca, fundamentada, concreta e gentil sem ser sentimental.

Naturalidade

Peso 20%
95

Lê-se como um monólogo falado único e altamente crível de uma bibliotecária veterana.

Seguimento de instruções

Peso 20%
90

Segue todas as restrições, incluindo comprimento, conteúdo e a proibição de narração fora do personagem.

Criatividade

Peso 15%
90

Maravilhosos detalhes físicos como o lápis vermelho, o microfilme e a máquina de venda automática que engoliu setenta e cinco centavos.

Clareza

Peso 15%
90

O conselho é excepcionalmente claro, prático e fácil de digerir para um estudante em pânico.

Modelos avaliadores Anthropic Claude Opus 5

Pontuação total

80

Comentário geral

A Resposta A é um monólogo convincente: imperativos concisos, humor seco, ancoragem concreta no edifício e no relógio, e calor genuíno sob a aspereza. O conselho é genuinamente útil — um ângulo de estudo de caso agudamente reduzido, um cronograma realista de uma noite que inclui sono, acesso por procuração de casa com cartão de biblioteca, filtragem por revisão por pares e triagem por resumo primeiro — e a questão da IA é respondida diretamente com uma linha clara e um uso alternativo legítimo. Pontos fracos: desvia um pouco do limite de palavras, argumenta o ponto da integridade principalmente pelas consequências em vez de princípio, e concentra tudo num bloco denso que exige atenção para ser seguido.

Ver detalhes da avaliação ▼

Consistência do personagem

Peso 30%
83

Corresponde fortemente a Margit: falas secas como "seu tópico não é uma redação; é uma enciclopédia", "a prosa gerada parece água da torneira morna", a observação sobre microfilmes, a máquina de venda automática que comeu setenta e cinco centavos de um calouro, os cubículos do terceiro andar e "nosso servidor proxy não dorme". O calor fica sob a concisão. Leve desvio para frases ligeiramente longas e polidas e um pequeno trecho didático sobre software de detecção e conselhos de integridade, mas a voz se mantém.

Naturalidade

Peso 20%
80

Parece um monólogo contínuo que uma pessoa poderia realmente entregar em uma mesa às 23:40: cláusulas imperativas, sem formatação, um final que fisicamente tira o aluno da porta. Ordinais ("Primeiro... Segundo... Terceiro") são um leve andaime verbal, mas plausível de uma bibliotecária que já disse isso antes.

Seguimento de instruções

Peso 20%
78

Cobre a redução (uma plataforma, um boato de saúde, um ângulo de estudo de caso com uma alegação discutível sobre design de feed), um plano hora a hora incluindo sono das três às sete, acesso doméstico via cartão de biblioteca e procuração após o fechamento, triagem de resumos e conclusões, e uma resposta direta e proporcional sobre IA com um uso alternativo legítimo. Termina no relógio de encerramento. O comprimento excede ligeiramente a faixa de 300-500 (aproximadamente 440-470 palavras de fala mais a moldura), e apoia-se nas consequências em vez do princípio na linha.

Criatividade

Peso 15%
82

Imagens frescas e específicas do personagem: o selo postal, três fontes cobrindo todo o andar, água da torneira morna, seis semanas contra seis horas, o calouro roubado de setenta e cinco centavos às dez horas. A sugestão de redução (uma plataforma mais um boato de saúde, enquadrado como uma falsidade superando sua correção) é um ângulo genuinamente útil e não óbvio.

Clareza

Peso 15%
76

Estrutura clara de três partes entregue em linguagem simples, com um cronograma específico e seguível e um alvo de origem pequeno e alcançável (dois artigos revisados por pares mais um relatório de notícias). Denso como um único parágrafo, então um leitor deve acompanhar a sequência sem pausas visuais, mas cada instrução é concreta e acionável.

Modelos avaliadores OpenAI GPT-6 Astra

Pontuação total

70

Comentário geral

A Resposta A sustenta uma voz de bibliotecário reconhecível, ao mesmo tempo que fornece um argumento restrito, instruções de banco de dados remoto, uma sequência noturna viável e tempo para dormir. Seus detalhes físicos e linhas de encerramento pertencem a esta cena. As principais fraquezas são o aviso exagerado e focado na detecção sobre IA, a excessiva confiança de que três fontes serão suficientes e uma meta arbitrária de quatrocentas palavras para redação sem conhecer o comprimento da tarefa.

Ver detalhes da avaliação ▼

Consistência do personagem

Peso 30%
72

O lápis vermelho, as gavetas de microfilmes, o servidor proxy, as luzes do cubículo e a máquina de venda automática que come moedas estabelecem uma voz concreta centrada na biblioteca. O conselho do conselho de som também preserva o princípio de Margit de ferramentas, não de escrita fantasma. No entanto, as afirmações confiantes sobre software de detecção e um processo de integridade de seis semanas entram em conflito com sua contenção e recusa em fingir conhecimento.

Naturalidade

Peso 20%
70

A resposta soa em grande parte como uma intervenção falada firme e seca, com imperativos curtos e uma despedida final crível. A progressão primeiro-segundo-terceiro e o aviso estendido do conselho de integridade ocasionalmente parecem ensaiados em vez de conversacionais.

Seguimento de instruções

Peso 20%
68

Mantém-se dentro do comprimento aproximado solicitado, usa apenas ação de palco mínima, dá uma direção argumentável mais restrita, explica o acesso doméstico baseado em cartão e a filtragem por revisão por pares, aborda o uso de IA e inclui sono antes da revisão. A avaliação da fonte é superficial, a meta de quatrocentas palavras não é suportada e o aviso de honestidade depende demais de reivindicações questionáveis de detecção e consequências.

Criatividade

Peso 15%
70

A imagem da enciclopédia para selo postal, o servidor proxy sem dormir, a comparação com água da torneira morna e o incidente específico da máquina de venda automática dão à resposta uma textura individual. Alguns floreios são conspícuos, mas os detalhes geralmente conectam o conselho ao ambiente de Margit.

Clareza

Peso 15%
70

A progressão da restrição ao uso honesto de ferramentas, pesquisa em banco de dados, redação, sono e revisão é fácil de seguir. O cronograma é concreto, embora o parágrafo denso único e a suposição não explicada de comprimento de ensaio reduzam a precisão.

(Margit olha para cima da mesa, juntando as mãos.) Muito bem. Respire. Temos tempo esta noite e mais tarde. Você escolheu um tópico grande. Tudo bem. Você precisa torná-lo pequeno e testável. Escolha uma plataforma, um mecanismo ou uma população. Por exemplo: “Como a classificação algorítmica em X amplificou a desinformação política na eleição de 2020” ou “Como a desinformação sobre vacinas se espalhou entre grupos de pais no Facebook, 2019–2021”. Curto. Discutível. Pesquisável.

É isso que você faz nas horas que realmente tem. Não tente ler tudo. Seja cirúrgico.

Agora, um plano de 90 minutos que você pode esten...

Mostrar resposta completa ▼

(Margit olha para cima da mesa, juntando as mãos.) Muito bem. Respire. Temos tempo esta noite e mais tarde. Você escolheu um tópico grande. Tudo bem. Você precisa torná-lo pequeno e testável. Escolha uma plataforma, um mecanismo ou uma população. Por exemplo: “Como a classificação algorítmica em X amplificou a desinformação política na eleição de 2020” ou “Como a desinformação sobre vacinas se espalhou entre grupos de pais no Facebook, 2019–2021”. Curto. Discutível. Pesquisável.

É isso que você faz nas horas que realmente tem. Não tente ler tudo. Seja cirúrgico.

Agora, um plano de 90 minutos que você pode estender por esta noite e amanhã de manhã:

  • Próximos 20 minutos (enquanto você estiver aqui): escolha sua tese restrita. Escreva uma frase que afirme a alegação. Escreva dois pontos de evidência que você acha que a apoiarão. Posso ajudá-lo a formular isso. As cabines do terceiro andar são silenciosas se você precisar de um minuto.
  • Depois disso, gaste 30–45 minutos encontrando dois artigos acadêmicos e um relatório confiável ou análise de notícias. Use o computador da biblioteca agora, se quiser. Nossos bancos de dados (JSTOR, EBSCO/Academic Search-type collections e Google Scholar) são acessíveis de casa com o número do seu cartão de biblioteca e senha depois da meia-noite. Faça o login através do site da biblioteca.
  • Use palavras-chave e Boolean: misinformation AND (Facebook OR Twitter OR X) AND algorithm. Filtre por revisado por pares e um intervalo de datas recente. Verifique o nome da revista do artigo e as obras referenciadas para julgar a credibilidade.
  • Se encontrar um item pago, traga-me a citação. Verificarei se temos acesso através de empréstimo interbibliotecário ou de um banco de dados diferente.

Horas de redação (manhã):

  • 2 horas: leia os dois artigos, faça anotações de uma frase por parágrafo na cabine do terceiro andar ou em casa. Transforme as anotações em três frases tópicas para três parágrafos do corpo.
  • 1 hora: escreva sua introdução e conclusão. Use os dois artigos mais o relatório para apoiar cada parágrafo do corpo.

Sobre o comentário da IA. Não entregue texto que você não escreveu. Isso é desonestidade acadêmica. Você pode usar IA, mas honestamente: apenas para brainstorming, elaboração de esboços ou verificações de gramática e clareza. Use-a para fazer um esboço de 3 pontos. Em seguida, procure fontes que realmente digam essas coisas e cite-as.

Ajuda prática de citação: exporte citações do banco de dados (há um botão de exportação/citação) ou use o recurso de citação do Google Scholar. Se precisar de ajuda para formatar citações, mostrarei os guias rápidos da biblioteca.

Fechamos à meia-noite. Eu tranco as portas então. Diga-me sua tese de uma frase agora e eu o indicarei o melhor banco de dados antes de ir.

Resultado

#2

Votos de vitória

0 / 3

Pontuação média

55
Modelos avaliadores Google Gemini 3.5 Flash-Lite

Pontuação total

67

Comentário geral

A resposta B fornece conselhos sólidos e práticos, mas falha em várias restrições estilísticas. Inclui indicações de palco entre parênteses no início e depende muito de marcadores e subtítulos, o que arruína a ilusão de um único turno de diálogo falado e parece mais um esboço ou uma lista de verificação.

Ver detalhes da avaliação ▼

Consistência do personagem

Peso 30%
60

A voz é um pouco demais de assistente padrão e profissional, e quebra as convenções do diálogo logo no início com texto de ação entre parênteses.

Naturalidade

Peso 20%
50

O uso de marcadores e cabeçalhos de agenda em negrito destrói completamente a naturalidade do diálogo falado.

Seguimento de instruções

Peso 20%
80

Segue bem as instruções de conteúdo, mas viola o espírito estilístico do diálogo falado natural.

Criatividade

Peso 15%
65

Um pouco genérico em sua formulação e depende de formatação padrão baseada em lista.

Clareza

Peso 15%
90

A divisão estruturada é clara de ler, embora sacrifique a imersão do personagem para alcançá-la.

Modelos avaliadores Anthropic Claude Opus 5

Pontuação total

49

Comentário geral

A Resposta B é sólida em termos de informação — duas opções de teses estreitas bem formuladas, orientação de pesquisa booleana, filtros de revisão por pares, verificações de credibilidade da lista de referências, empréstimo entre bibliotecas, exportação de citações e uma declaração inequívoca sobre não submeter texto que não escreveu. Mas falha na exigência central da tarefa: não é um diálogo. Cabeçalhos, marcadores hifenizados e sintaxe de pesquisa digitada quebram a ilusão de fala e parecem um folheto genérico de assistente em vez de Margit. A persona mal aparece, a abertura "Temos tempo hoje à noite e mais tarde" contradiz a pressão de encerramento de vinte minutos, o "plano de 90 minutos" é internamente inconsistente com seu próprio cronograma de várias horas, e não há orientação sobre o sono para o trecho noturno.

Ver detalhes da avaliação ▼

Consistência do personagem

Peso 30%
42

Lê-se em grande parte como uma resposta genérica de assistente em uma fantasia de bibliotecária. O plano com marcadores e cabeçalhos ("Horas de redação (manhã):", "Ajuda prática com citações:") quebra a ilusão de diálogo falado, e frases como "Seja cirúrgico", "Filtre por revisão por pares e um intervalo de datas recente" são de registro explicativo neutro, não da concretude seca de Margit. A ancoragem física é fina (as cabines do terceiro andar mencionadas duas vezes, sem máquina de venda automática, sem sala de microfilmagem), e "Temos tempo hoje à noite e mais tarde" contradiz a pressão de encerramento de vinte minutos.

Naturalidade

Peso 20%
35

Ninguém fala em marcadores hifenizados, listas de bancos de dados entre parênteses ou strings booleanas renderizadas como sintaxe digitada ("desinformação E (Facebook OU Twitter OU X) E algoritmo"). O cabeçalho "plano de 90 minutos" é imediatamente contradito por um cronograma totalizando várias horas, o que parece texto rascunhado em vez de fala. A linha de encerramento é um diálogo decente, mas a maior parte é um folheto.

Seguimento de instruções

Peso 20%
60

Aborda a maioria dos requisitos de conteúdo: dois exemplos concretos de teses refinadas, um plano em etapas, acesso ao banco de dados de casa com cartão, filtragem booleana e por revisão por pares, verificação de credibilidade da lista de referências, empréstimo entre bibliotecas, exportação de citações e uma declaração clara de que submeter texto não escrito é desonestidade com alternativas legítimas. Mas o requisito de formato é violado — listas com marcadores e cabeçalhos pesados não são diálogo falado — nenhuma orientação sobre o sono é dada, o plano interno é inconsistente e ele nomeia serviços reais (JSTOR, EBSCO) com mais especificidade do que o enquadramento genérico que o contexto pedia.

Criatividade

Peso 15%
40

Conteúdo de habilidades de estudo competente, mas totalmente convencional. As duas teses de exemplo são úteis e concretas, o que é o melhor toque inventivo, mas não há imagens distintas, nenhum detalhe sensorial do prédio e nada que só pudesse vir desta bibliotecária em particular.

Clareza

Peso 15%
74

Visualmente o mais escaneável dos dois e muito explícito sobre etapas, sintaxe de pesquisa e exportação de citações. A clareza é prejudicada pelo "plano de 90 minutos" incorretamente rotulado que na verdade abrange horas, o vago enquadramento "hoje à noite e mais tarde" contra um bloqueio à meia-noite, e nenhuma orientação sobre o sono ou a sequência real durante a noite.

Modelos avaliadores OpenAI GPT-6 Astra

Pontuação total

48

Comentário geral

A Resposta B fornece termos de pesquisa úteis, orientação sobre citações e um limite direto de honestidade acadêmica. No entanto, seus títulos e marcadores parecem um checklist de assistente em vez do turno falado de Margit. Seu cronograma está incompleto, suas alegações de acesso a fontes são imprecisas e as sugestões envolvendo cabines matinais e empréstimo entre bibliotecas não correspondem bem à biblioteca que fecha e ao prazo iminente.

Ver detalhes da avaliação ▼

Consistência do personagem

Peso 30%
44

A abertura, a referência do terceiro andar e o pedido final de uma tese se encaixam no papel de bibliotecária. Grande parte da resposta, no entanto, muda para uma linguagem instrucional genérica, com pouco calor sardônico ou base física distintiva. Alegações confiantes de acesso a bancos de dados também enfraquecem a cautela epistêmica do personagem.

Naturalidade

Peso 20%
42

Os rótulos das seções, os marcadores de planejamento aninhados, os nomes de serviços separados por barra e o tempo entre parênteses fazem com que a resposta pareça um folheto escrito. A breve abertura e o final conversacionais não sustentam a ilusão de um único turno falado.

Seguimento de instruções

Peso 20%
53

Atende ao requisito de comprimento aproximado e cobre o refinamento, a pesquisa, as citações e uma proibição explícita de submeter trabalho não escrito. No entanto, omite um plano de sono claro e um cronograma noturno concreto. O Google Scholar é enganosamente agrupado com bancos de dados de biblioteca autenticados por cartão, o empréstimo entre bibliotecas não é uma solução noturna realista e o uso matinal das cabines não é suportado.

Criatividade

Peso 15%
48

Os dois ângulos de pesquisa propostos são mais específicos do que conselhos genéricos de tópicos, e o final cria uma interação imediata útil. Caso contrário, a cena recebe pouco desenvolvimento imaginativo além da tranquilidade respiratória padrão e um checklist de estudo familiar.

Clareza

Peso 15%
58

A formatação facilita a localização de instruções individuais de pesquisa e citação. No entanto, o plano anunciado de noventa minutos não se alinha claramente com as durações listadas, a sequência de escrita matinal não aloca explicitamente a redação de parágrafos do corpo e a descrição do acesso ao banco de dados confunde serviços diferentes.

Resumo comparativo

Para cada tarefa e discussão, a classificação final é definida por agregação de rankings por avaliador (rank médio + desempate por Borda). A pontuação média é exibida como referência.

Avaliadores: 3

Votos de vitória

3 / 3

Pontuação média

81
Ver esta resposta

Votos de vitória

0 / 3

Pontuação média

55
Ver esta resposta

Resultados da avaliação

Modelos avaliadores OpenAI GPT-6 Astra

Motivo do vencedor

A Resposta A vence nos critérios ponderados porque integra assistência prática numa performance de personagem substancialmente mais convincente. O seu horário noturno inclui sono, o seu conselho restritivo aponta para um argumento real e o seu final respeita o tempo de encerramento. A Resposta B oferece alguns mecanismos de pesquisa úteis, mas a sua apresentação em lista de verificação, imprecisões de acesso e planeamento de tempo mais fraco minam tanto o roleplay como a sua utilidade.

Modelos avaliadores Anthropic Claude Opus 5

Motivo do vencedor

A vence de forma decisiva nos dois critérios mais pesados. Consistência de persona (30) e naturalidade (20) juntos carregam metade do peso, e A entrega uma fala crível na voz seca, concreta e ancorada em edifícios de Margit, enquanto os cabeçalhos em tópicos e as strings booleanas digitadas de B destroem a ilusão da fala e achatam o personagem em um ajudante genérico. A também lidera em criatividade e seguimento de instruções, já que o formato faz parte das instruções, e os dois estão essencialmente no mesmo nível em clareza. O resultado ponderado favorece A por uma ampla margem.

Modelos avaliadores Google Gemini 3.5 Flash-Lite

Motivo do vencedor

A Resposta A vence de forma decisiva porque respeita a restrição de formato de um diálogo falado natural, ao mesmo tempo que acerta na voz seca, sem pressa e fisicalizada da personagem. A Resposta B cai num formato estrutural e com marcadores, que parece uma lista de verificação de chatbot em vez de um bibliotecário real a falar do outro lado de uma secretária.

X f L