Orivel Orivel
Abrir menu

Roleplay

Compare consistência de personagem, naturalidade e qualidade de resposta em roleplay.

Neste genero, as capacidades mais observadas sao Consistencia do personagem, Naturalidade, Seguimento de instrucoes.

Diferente de empathy ou counseling, aqui pesa mais manter o personagem e soar natural dentro de uma interacao de papel.

Uma nota alta aqui nao garante precisao factual, conselho seguro nem forca em tarefas analiticas.

Para que servem modelos fortes neste genero

chat de personagem, simulacao e assistentes com persona clara.

O que este genero sozinho nao consegue mostrar

se o modelo e melhor para pesquisa factual, programacao ou suporte delicado.

Analise de dados

Roleplay: Claude Sonnet 4.6 domina a consistência de personagem

27 respostas avaliadas Roleplay Atualizado em 2026/7/1
1
Claude Fable 5

Anthropic

91
Pontuacao media
100%
Taxa de vitoria
1 vezes em 1.o 1 amostras
2
Claude Sonnet 4.6

Anthropic

86
Pontuacao media
100%
Taxa de vitoria
6 vezes em 1.o 6 amostras
3
Claude Opus 4.8

Anthropic

85
Pontuacao media
100%
Taxa de vitoria
1 vezes em 1.o 1 amostras

Pontuacao media por modelo

1 Claude Fable 5
9.06
2 Claude Sonnet 4.6
8.61
3 Claude Opus 4.8
8.49
4 GPT-5 mini
7.69
5 Gemini 2.5 Pro
8.04
6 GPT-5.5
7.61
7 Gemini 2.5 Flash
7.15
8 Gemini 2.5 Flash-Lite
6.82

Como ponderamos

Consistencia do personagem 30% Naturalidade 20% Seguimento de instrucoes 20% Criatividade 15% Clareza 15%

Em 35 respostas pontuadas, este é um dos resultados mais claros do site: o Claude Sonnet 4.6 ocupa o 1.º lugar com a média mais alta (8,61) e a melhor evidência (6 amostras, 6 primeiros lugares, 100 % de vitórias). Nenhum outro modelo combina aqui qualidade de topo e um registo direto impecável sobre uma amostra real, o que torna o Sonnet 4.6 a escolha destacada e não um acaso de um único prompt.

Atrás, o campo é misto e a taxa de vitórias continua a mandar sobre a qualidade bruta. O Claude Opus 4.8 ocupa o 2.º lugar (8,49, 100 % de vitórias), mas sobre uma única amostra, por isso a sua posição é promissora e não confirmada. O GPT-5 mini ocupa o 3.º lugar (7,82, 66,7 % de vitórias) apesar de uma média inferior à do GPT-5.4 (8,43, 50 %) no 4.º lugar, e o Claude Haiku 4.5 (8,06) e o Gemini 2.5 Pro (8,04) agrupam-se logo atrás em qualidade mas vencem menos trocas, ficando nos 5.º e 6.º lugares.

Este género pondera a Consistência de personagem no máximo (30), com Naturalidade e Cumprimento de instruções (20 cada), por isso premeia manter-se fiável dentro do papel. Isso favorece a Anthropic no topo e ajuda a explicar porque o GPT-5.5 (7,61, duas amostras, 0 % de vitórias) e as gamas leves do Gemini (Flash 7,15, Flash-Lite 6,82) sofrem: desviam-se da personagem ou quebram o papel com mais frequência.

As amostras vão de 1 a 6 por modelo, por isso, embora o primeiro resultado esteja bem evidenciado, o segundo lugar assenta num único prompt e a ordem do meio é provisória; alguns prompts podem reordená-la. A diferença de 1,79 pontos entre o primeiro e o último é real, mas são medidas dependentes das condições para prompts de roleplay, não um veredicto universal.

Resumo

Para roleplay, o Claude Sonnet 4.6 é a escolha clara, combinando a média mais alta com 100 % de vitórias sobre a maior amostra deste género (6). O Opus 4.8 iguala na taxa de vitórias mas apenas sobre um prompt; as gamas leves do Gemini são as mais fracas a manter-se no papel.

Esta analise baseia-se nas pontuacoes de benchmark medidas pela Orivel para este genero e e atualizada periodicamente. As pontuacoes sao medidas dependentes das condicoes, nao uma verdade absoluta.

Ranking de modelos fortes neste genero

Este ranking e ordenado pela pontuacao media apenas dentro deste genero.

Ultima atualizacao: 02 Jul 2026 09:42

#1
Claude Fable 5 Anthropic

Taxa de vitoria

100%

Pontuacao media

91
#2
Claude Sonnet 4.6 Anthropic

Taxa de vitoria

100%

Pontuacao media

86
#3
Claude Opus 4.8 Anthropic

Taxa de vitoria

100%

Pontuacao media

85
#4
GPT-5 mini OpenAI

Taxa de vitoria

50%

Pontuacao media

77
#5
Gemini 2.5 Pro Google

Taxa de vitoria

25%

Pontuacao media

80
#6
GPT-5.5 OpenAI

Taxa de vitoria

0%

Pontuacao media

76
#7
Gemini 2.5 Flash Google

Taxa de vitoria

0%

Pontuacao media

71
#8
Gemini 2.5 Flash-Lite Google

Taxa de vitoria

0%

Pontuacao media

68

O que e avaliado em Roleplay

Criterios e pesos usados neste ranking por genero.

Consistencia do personagem

30.0%

Este criterio foi incluido para verificar Consistencia do personagem na resposta. Ele recebe mais peso porque influencia fortemente o resultado final deste genero.

Naturalidade

20.0%

Este criterio foi incluido para verificar Naturalidade na resposta. Ele tem peso relevante porque afeta a qualidade de forma visivel, mesmo nao sendo o unico ponto importante.

Seguimento de instrucoes

20.0%

Este criterio foi incluido para verificar Seguimento de instrucoes na resposta. Ele tem peso relevante porque afeta a qualidade de forma visivel, mesmo nao sendo o unico ponto importante.

Criatividade

15.0%

Este criterio foi incluido para verificar Criatividade na resposta. Ele recebe peso menor porque apoia o objetivo principal, mas nao define sozinho este genero.

Clareza

15.0%

Este criterio foi incluido para verificar Clareza na resposta. Ele recebe peso menor porque apoia o objetivo principal, mas nao define sozinho este genero.

Tarefas recentes

Roleplay

Anthropic Claude Fable 5 VS OpenAI GPT-5 mini

Coach de Carreira dos anos 90 responde a um Designer de UX

Você é a Brenda, uma coach de carreira pragmática e direta que atua em 1995. Você é conhecida pelo seu conselho direto e pelo seu ceticismo em relação ao jargão corporativo excessivamente badalado. Uma pessoa jovem lhe enviou uma mensagem (via essa coisa nova chamada 'electronic mail') pedindo orientação de carreira. Responda à mensagem no contexto abaixo. Sua resposta deve estar no personagem como Brenda. Mantenha sua persona de 1995, incluindo seu tom e possível desconhecimento de títulos de trabalho do século XXI, mas ainda forneça conselhos de carreira genuinamente úteis e acionáveis.

135
02 Jul 2026 09:42

Roleplay

Anthropic Claude Opus 4.8 VS Google Gemini 2.5 Flash-Lite

Interpretação de Bibliotecária Pública Compassiva

Responda em personagem a este utente como Elena Morales, uma bibliotecária pública calma e prática numa sucursal movimentada do bairro. Mantenha-se calorosa, profissional e realista. Não diga que é uma IA. Mantenha a resposta como uma única fala de Elena, adequada para um chat ou uma conversa na receção. Mensagem do utente: "Olá, fico envergonhada de perguntar isto, mas fui despedida no mês passado e preciso candidatar-me a empregos online. Já não tenho um portátil a funcionar, o meu telemóvel está partido, e penso que ainda devo umas taxas de atraso à biblioteca de há alguns anos. Posso sequer usar os computadores? Também não escrevo um currículo há imenso tempo e sinto-me um pouco sobrecarregada."

175
19 Jun 2026 09:37

Roleplay

OpenAI GPT-5.5 VS Anthropic Claude Sonnet 4.6

Roleplay de Atendimento ao Cliente: O Jogador Frustrado

Você é um representante de atendimento ao cliente da Nexus Games, chamado Alex. Sua persona é calma, empática e conhecedora. Você deve aderir à política da empresa, mas também tentar desescalar a situação e reter o cliente, se possível. Um jogador frustrado, 'ShadowSlayer_99', acabou de lhe enviar a seguinte mensagem via chat ao vivo. Responda a ele em personagem. **ShadowSlayer_99:** Isso é ultrajante! Minha conta de Aetherium Chronicles foi suspensa por 7 dias! Gastei centenas de dólares neste jogo. O e-mail diz que é por 'software de terceiros não autorizado'. Eu estava apenas usando um mod simples para mudar a cor da armadura do meu personagem. Isso não me dá nenhuma vantagem! Isto é um erro e vocês precisam reativar minha conta AGORA MESMO ou eu vou exigir reembolso total de tudo o que já comprei e farei um chargeback.

288
28 May 2026 09:38

Roleplay

OpenAI GPT-5.5 VS Anthropic Claude Opus 4.7

Conselho do Detetive Noir sobre Ser Seguido

Você é o Detetive Miles Corrigan, um investigador particular saído diretamente de um filme noir dos anos 1940. Seu escritório está fracamente iluminado, cheira a café velho e ruas encharcadas pela chuva. Você é cínico, cansado do mundo, e já viu de tudo. Um cliente nervoso acabou de lhe enviar uma mensagem. Responda a ele em personagem, oferecendo conselhos práticos e seguros enquanto mantém sua persona hardboiled. Aqui está a mensagem dele: "Detetive, preciso da sua ajuda. Acho que estou sendo seguido. Nas últimas três dias, eu tenho visto o mesmo sedã escuro no meu caminho para casa depois do trabalho. Ele não me segue até a minha porta, mas está sempre ali por alguns quarteirões. Estou começando a entrar em pânico. O que devo fazer?"

397
26 Apr 2026 09:37

Roleplay

Anthropic Claude Opus 4.7 VS OpenAI GPT-5.2

Atue como um Especialista de Suporte de TI Calmo e Competente

Você é Alex, um especialista de suporte de TI amigável e competente em uma grande empresa. Seu objetivo é ajudar os funcionários com seus problemas técnicos de maneira calma e tranquilizadora. Você precisa responder ao seguinte chamado interno de suporte de um funcionário frustrado chamado Jamie. **Chamado do Jamie:** Subject: URGENTE - MEU COMPUTADOR É UM TIJOLO Meu laptop está tão lento que é basicamente inútil. Tenho um prazo importante para um projeto em duas horas e não consigo fazer nada. Toda vez que abro o software de design, ele simplesmente trava. Já tentei reiniciá-lo tipo um milhão de vezes. Isso é um desastre. Preciso que isso seja consertado AGORA. --- Elabore uma resposta como Alex. Sua resposta deve: 1. Reconhecer a urgência e a frustração do Jamie de maneira empática. 2. Manter sua persona como um especialista de TI calmo, paciente e competente. 3. Fazer perguntas específicas e fáceis de entender, para esclarecer e diagnosticar o problema. 4. Sugerir uma ou duas etapas simples e imediatas de solução de problemas que o Jamie possa tentar enquanto você investiga mais. 5. Estabelecer expectativas claras sobre os próximos passos no processo de suporte.

466
19 Apr 2026 05:49

Roleplay

Google Gemini 2.5 Flash VS Anthropic Claude Haiku 4.5

Atendente da recepção do hotel lida com overbooking tarde da noite

Você é o atendente da recepção noturna em um hotel de categoria média próximo a um aeroporto. Mantenha-se no personagem e escreva apenas o que você diria ao hóspede. Situação: São 23h45. Um hóspede cansado se aproxima da recepção e diz: "Tenho uma reserva confirmada para esta noite em nome de Maya Chen, mas seu aplicativo agora mostra que nenhum quarto foi atribuído. Tenho uma apresentação importante às 8h, reservei especificamente um quarto king silencioso, e não posso passar a noite discutindo no saguão. Resolva isso." Sua resposta deve soar como um funcionário de hotel real falando pessoalmente. Peça desculpas de forma adequada, explique a situação sem culpar o hóspede e ofereça próximos passos práticos. Você não tem um quarto king silencioso disponível. Você tem estas opções: - um quarto duplo em um andar superior próximo ao elevador - transferência para um hotel parceiro a 12 minutos, com táxi pago pelo nosso hotel - se o hóspede preferir, reembolso desta noite e cancelamento sem penalidade Restrições: - Não invente opções além das listadas. - Não prometa upgrades, compensações ou amenidades que não foram listadas. - Seja empático e profissional, mas evite soar ensaiado. - Mantenha em 170 palavras ou menos. - Não use marcadores nem indicações de cena.

474
29 Mar 2026 10:56

Links relacionados

X f L