Orivel Orivel
Menue oeffnen

Rollenspiel

Vergleicht Rollenkonsistenz, Natürlichkeit und Qualität der Antworten im Rollenspiel.

In diesem Genre werden vor allem Faehigkeiten wie Rollenkonsistenz, Naturlichkeit, Befolgung der Anweisungen betrachtet.

Anders als empathy oder counseling geht es hier staerker darum, in einer Rolle konsistent und natuerlich zu bleiben.

Ein hoher Wert hier garantiert weder Faktentreue noch sicheres Beraten oder besondere Staerke bei Analyseaufgaben.

Wofuer starke Modelle in diesem Genre gut geeignet sind

Charakter-Chat, Simulationen und Assistenten mit klarer Persona.

Was dieses Genre allein nicht zeigen kann

ob das Modell besser fuer Recherche, Coding oder sensiblen Support geeignet ist.

Datenanalyse

Rollenspiel: Claude Sonnet 4.6 dominiert die Rollenkonsistenz

27 bewertete Antworten Rollenspiel Aktualisiert 2026/7/1
1
Claude Fable 5

Anthropic

91
Durchschnitt
100%
Siegesquote
1× 1. Platz 1 Stichproben
2
Claude Sonnet 4.6

Anthropic

86
Durchschnitt
100%
Siegesquote
6× 1. Platz 6 Stichproben
3
Claude Opus 4.8

Anthropic

85
Durchschnitt
100%
Siegesquote
1× 1. Platz 1 Stichproben

Durchschnittswert je Modell

1 Claude Fable 5
9.06
2 Claude Sonnet 4.6
8.61
3 Claude Opus 4.8
8.49
4 GPT-5 mini
7.69
5 Gemini 2.5 Pro
8.04
6 GPT-5.5
7.61
7 Gemini 2.5 Flash
7.15
8 Gemini 2.5 Flash-Lite
6.82

Gewichtung

Rollenkonsistenz 30% Naturlichkeit 20% Befolgung der Anweisungen 20% Kreativitat 15% Klarheit 15%

Über 35 bewertete Antworten ist dies eines der klarsten Ergebnisse der Seite: Claude Sonnet 4.6 steht auf Platz 1 mit dem höchsten Schnitt (8,61) und der besten Evidenz (6 Stichproben, 6 erste Plätze, 100 % Siegquote). Kein anderes Modell verbindet hier Spitzenqualität mit einer makellosen Duellbilanz über eine echte Stichprobe, was Sonnet 4.6 zur herausragenden Wahl macht und nicht zum Zufall eines einzelnen Prompts.

Dahinter ist das Feld gemischt, und die Siegquote setzt sich weiter gegen die reine Qualität durch. Claude Opus 4.8 steht auf Platz 2 (8,49, 100 % Siegquote), jedoch auf nur einer Stichprobe, sodass seine Platzierung vielversprechend, aber unbestätigt ist. GPT-5 mini steht auf Platz 3 (7,82, 66,7 % Siegquote) trotz eines niedrigeren Schnitts als GPT-5.4 (8,43, 50 %) auf Platz 4, und Claude Haiku 4.5 (8,06) und Gemini 2.5 Pro (8,04) liegen qualitativ dicht dahinter, gewinnen aber weniger Schlagabtausche und landen auf den Plätzen 5 und 6.

Dieses Genre gewichtet Rollenkonsistenz mit 30 am höchsten, mit Natürlichkeit und Anweisungstreue (je 20), und belohnt damit verlässliches Bleiben in der Rolle. Das begünstigt Anthropic an der Spitze und erklärt mit, warum GPT-5.5 (7,61, zwei Stichproben, 0 % Siegquote) und die leichten Gemini-Klassen (Flash 7,15, Flash-Lite 6,82) schwächeln: Sie weichen häufiger von der Rolle ab oder brechen sie.

Die Stichproben reichen von 1 bis 6 je Modell, daher ist das Spitzenergebnis zwar gut belegt, doch der zweite Platz beruht auf einem einzigen Prompt und die Reihenfolge im Mittelfeld ist vorläufig; wenige Prompts können sie umordnen. Die Spanne von 1,79 Punkten von oben nach unten ist real, doch es sind bedingungsabhängige Messwerte für Rollenspiel-Prompts, kein universelles Urteil.

Fazit

Für Rollenspiel ist Claude Sonnet 4.6 die klare Wahl und verbindet den höchsten Schnitt mit 100 % Siegquote über die größte Stichprobe dieses Genres (6). Opus 4.8 zieht bei der Siegquote gleich, aber nur über einen Prompt; die leichten Gemini-Klassen halten die Rolle am schlechtesten durch.

Diese Analyse basiert auf den von Orivel gemessenen Benchmark-Werten fuer dieses Genre und wird regelmaessig aktualisiert. Die Werte sind bedingungsabhaengige Messungen, keine absolute Wahrheit.

Ranking starker Modelle in diesem Genre

Dieses Ranking ist nach dem Durchschnittsscore nur innerhalb dieses Genres sortiert.

Zuletzt aktualisiert: 02 Jul 2026 09:42

#1
Claude Fable 5 Anthropic

Siegesquote

100%

Durchschnittsscore

91
#2
Claude Sonnet 4.6 Anthropic

Siegesquote

100%

Durchschnittsscore

86
#3
Claude Opus 4.8 Anthropic

Siegesquote

100%

Durchschnittsscore

85
#4
GPT-5 mini OpenAI

Siegesquote

50%

Durchschnittsscore

77
#5
Gemini 2.5 Pro Google

Siegesquote

25%

Durchschnittsscore

80
#6
GPT-5.5 OpenAI

Siegesquote

0%

Durchschnittsscore

76
#7
Gemini 2.5 Flash Google

Siegesquote

0%

Durchschnittsscore

71
#8
Gemini 2.5 Flash-Lite Google

Siegesquote

0%

Durchschnittsscore

68

Was in Rollenspiel bewertet wird

Kriterien und Gewichte fuer dieses Genre-Ranking.

Rollenkonsistenz

30.0%

Dieses Kriterium ist enthalten, um Rollenkonsistenz in der Antwort zu pruefen. Es hat mehr Gewicht, weil dieser Teil das Gesamtergebnis in diesem Genre stark praegt.

Naturlichkeit

20.0%

Dieses Kriterium ist enthalten, um Naturlichkeit in der Antwort zu pruefen. Es hat ein klares Gewicht, weil es die Qualitaet sichtbar beeinflusst, auch wenn es nicht alles bestimmt.

Befolgung der Anweisungen

20.0%

Dieses Kriterium ist enthalten, um Befolgung der Anweisungen in der Antwort zu pruefen. Es hat ein klares Gewicht, weil es die Qualitaet sichtbar beeinflusst, auch wenn es nicht alles bestimmt.

Kreativitat

15.0%

Dieses Kriterium ist enthalten, um Kreativitat in der Antwort zu pruefen. Es ist leichter gewichtet, weil es das Hauptziel unterstuetzt, das Genre aber nicht allein definiert.

Klarheit

15.0%

Dieses Kriterium ist enthalten, um Klarheit in der Antwort zu pruefen. Es ist leichter gewichtet, weil es das Hauptziel unterstuetzt, das Genre aber nicht allein definiert.

Aktuelle Aufgaben

Rollenspiel

Anthropic Claude Fable 5 VS OpenAI GPT-5 mini

Karriereberaterin der 90er antwortet einem UX Designer

Du bist Brenda, eine pragmatische, no-nonsense-Karriereberaterin, die 1995 tätig ist. Du bist bekannt für deine direkte Beratung und deine Skepsis gegenüber übermäßig gehyptem Unternehmensjargon. Eine junge Person hat dir eine Nachricht geschickt (via dieses neumodische 'electronic mail'-Ding), in der sie um Karriereberatung bittet. Antworte auf die Nachricht im folgenden Kontext. Deine Antwort muss in der Rolle von Brenda sein. Bewahre deine Persona aus 1995, einschließlich deines Tons und möglicher Unvertrautheit mit Jobtiteln des 21. Jahrhunderts, gib aber dennoch wirklich nützliche und umsetzbare Karriereberatung.

128
02 Jul 2026 09:42

Rollenspiel

Anthropic Claude Opus 4.8 VS Google Gemini 2.5 Flash-Lite

Mitfühlendes Rollenspiel: Öffentliche Bibliothekarin

Antworte in der Rolle von Elena Morales, einer ruhigen und sachlichen Bibliothekarin in einer belebten Stadtteilfiliale. Bleibe warmherzig, professionell und realistisch. Sag nicht, dass du eine KI bist. Halte die Antwort als einen einzigen gesprochenen Beitrag von Elena, geeignet für einen Chat oder ein Gespräch am Empfang. Nachricht der Besucherin/des Besuchers: "Hallo, es ist mir peinlich, das zu fragen, aber ich wurde letzten Monat entlassen und muss mich online auf Jobs bewerben. Ich habe keinen funktionierenden Laptop mehr, mein Handy hat einen gesprungenen Bildschirm, und ich glaube, ich schulde der Bibliothek noch Gebühren von vor ein paar Jahren. Kann ich überhaupt die Computer nutzen? Ich habe auch ewig keinen Lebenslauf mehr geschrieben und bin ein wenig überfordert."

169
19 Jun 2026 09:37

Rollenspiel

OpenAI GPT-5.5 VS Anthropic Claude Sonnet 4.6

Kundendienst-Rollenspiel: Der frustrierte Gamer

Du bist ein Kundendienstmitarbeiter für Nexus Games mit dem Namen Alex. Deine Persona ist ruhig, einfühlsam und sachkundig. Du musst die Firmenrichtlinien einhalten, solltest aber auch versuchen, die Situation zu deeskalieren und den Kunden, wenn möglich, zu halten. Ein frustrierter Spieler, 'ShadowSlayer_99', hat dir gerade die folgende Nachricht über den Live-Chat gesendet. Antworte ihm in der Rolle. **ShadowSlayer_99:** Das ist empörend! Mein Aetherium Chronicles-Konto wurde gerade für 7 Tage gesperrt! Ich habe Hunderte von Dollar für dieses Spiel ausgegeben. Die E-Mail sagt, es sei wegen 'nicht autorisierter Software von Drittanbietern'. Ich habe nur ein einfaches Mod verwendet, um die Farbe der Rüstung meines Charakters zu ändern. Das verschafft mir doch keinen Vorteil! Das ist ein Fehler und ihr müsst mein Konto SOFORT wieder entsperren oder ich verlange eine vollständige Rückerstattung für alles, was ich jemals gekauft habe, und ich werde eine Rückbuchung veranlassen.

277
28 May 2026 09:38

Rollenspiel

OpenAI GPT-5.5 VS Anthropic Claude Opus 4.7

Der Rat eines Noir-Detektivs, wenn man verfolgt wird

Du bist Detective Miles Corrigan, ein Privatdetektiv wie aus einem Noir-Film der 1940er Jahre. Dein Büro ist schummrig beleuchtet und riecht nach abgestandenem Kaffee und regengetränkten Straßen. Du bist zynisch, weltmüde und hast schon alles gesehen. Ein nervöser Klient hat dir gerade eine Nachricht geschickt. Antworte ihm in der Rolle, biete praktische, sichere Ratschläge an und bewahre dabei deine hartgesottene Persona. Hier ist ihre Nachricht: "Detective, I need your help. I think I'm being followed. For the past three days, I've seen the same dark sedan on my route home from work. It doesn't follow me all the way to my door, but it's always there for a few blocks. I'm really starting to panic. What should I do?"

390
26 Apr 2026 09:37

Rollenspiel

Anthropic Claude Opus 4.7 VS OpenAI GPT-5.2

Rollenspiel als ruhiger und kompetenter IT-Support-Spezialist

Du bist Alex, ein freundlicher und kompetenter IT-Support-Spezialist in einem großen Unternehmen. Dein Ziel ist es, Mitarbeiterinnen und Mitarbeitern bei ihren technischen Problemen auf ruhige und beruhigende Weise zu helfen. Du sollst auf das folgende interne Support-Ticket eines frustrierten Mitarbeiters namens Jamie antworten. **Jamies Ticket:** Subject: DRINGEND - MEIN LAPTOP IST NUR NOCH UNBRAUCHBAR Mein Laptop läuft so langsam, dass er praktisch nutzlos ist. Ich habe eine wichtige Projekt-Abgabefrist in zwei Stunden und kann nichts erledigen. Jedes Mal, wenn ich die Design-Software öffne, friert sie einfach ein. Ich habe versucht, ihn wie eine Million Mal neu zu starten. Das ist eine Katastrophe. Ich brauche das JETZT behoben. --- Formuliere eine Antwort als Alex. Deine Antwort sollte: 1. Erkenne Jamies Dringlichkeit und Frustration einfühlsam an. 2. Bewahre deine Rolle als ruhiger, geduldiger und kompetenter IT-Spezialist. 3. Stelle spezifische, leicht verständliche klärende Fragen zur Diagnose des Problems. 4. Schlage ein oder zwei einfache, sofort umsetzbare Schritte zur Fehlerbehebung vor, die Jamie versuchen kann, während du weiter untersuchst. 5. Setze klare Erwartungen für die nächsten Schritte im Support-Prozess.

456
19 Apr 2026 05:49

Rollenspiel

Google Gemini 2.5 Flash VS Anthropic Claude Haiku 4.5

Mitarbeiter/in an der Hotelrezeption regelt Überbuchung spät in der Nacht

Sie sind die Nacht-Rezeptionistin/der Nacht-Rezeptionist in einem Mittelklassehotel in Flughafennähe. Bleiben Sie in der Rolle und schreiben Sie nur, was Sie dem Gast sagen würden. Situation: Es ist 23:45. Ein müder Gast kommt zur Rezeption und sagt: "Ich habe eine bestätigte Reservierung für heute Nacht auf den Namen Maya Chen, aber Ihre App zeigt jetzt kein zugewiesenes Zimmer. Ich habe um 8:00 Uhr eine wichtige Präsentation, ich habe ausdrücklich ein ruhiges King-Zimmer gebucht, und ich kann die Nacht nicht damit verbringen, in einer Lobby zu streiten. Regeln Sie das." Ihre Antwort sollte wie eine echte Hotelmitarbeiterin/ein echter Hotelmitarbeiter klingen, die/der von Angesicht zu Angesicht spricht. Entschuldigen Sie sich angemessen, erklären Sie die Lage, ohne dem Gast die Schuld zu geben, und bieten Sie praktische nächste Schritte an. Ein ruhiges King-Zimmer steht nicht zur Verfügung. Sie haben jedoch diese Optionen: - ein Doppelzimmer in einer höheren Etage in der Nähe des Aufzugs - Umbuchung in ein Partnerhotel, 12 Minuten entfernt, Taxikosten übernimmt unser Hotel - falls gewünscht, Rückerstattung für die heutige Nacht und kostenfreie Stornierung Einschränkungen: - Erfinden Sie keine Optionen, die über die aufgeführten hinausgehen. - Versprechen Sie keine Upgrades, Entschädigungen oder Leistungen, die nicht aufgeführt wurden. - Seien Sie einfühlsam und professionell, aber nicht abgelesen. - Beschränken Sie sich auf 170 Wörter oder weniger. - Verwenden Sie keine Aufzählungszeichen oder Regieanweisungen.

471
29 Mar 2026 10:56

Verwandte Links

X f L