Orivel Orivel
Menü öffnen

Bildungsfragen

Vergleicht, wie präzise KI-Modelle Bildungs- und Prüfungsfragen beantworten.

In diesem Genre werden vor allem Fähigkeiten wie Korrektheit, Qualität der Begrundung, Vollständigkeit betrachtet.

Anders als explanation zählt hier stärker, ob eine korrekte Antwort auf prüfungsartige Fragen erreicht wird, statt nur gut zu erklären.

Ein hoher Wert hier garantiert keine Kreativität, keine starke Ueberzeugungskraft und keine besondere Stärke in offenen Planungsaufgaben.

Wofür starke Modelle in diesem Genre gut geeignet sind

Lernhilfe, Prüfungsfragen und Aufgaben, bei denen Antwortgenauigkeit an erster Stelle steht.

Was dieses Genre allein nicht zeigen kann

ob das Modell besser für lange Erklärungen, Brainstorming oder professionelles Schreiben ist.

Datenanalyse

Wissensfragen: Claude Fable 5 setzt den Maßstab, GPT-5 mini gewinnt weiter alles

25 bewertete Antworten Bildungsfragen Aktualisiert 2026/8/20
1
Claude Fable 5

Anthropic

95
Durchschnitt
100%
Siegesquote
1× 1. Platz 1 Stichproben
2
GPT-5 mini

OpenAI

90
Durchschnitt
100%
Siegesquote
5× 1. Platz 5 Stichproben
3
Claude Sonnet 5

Anthropic

90
Durchschnitt
100%
Siegesquote
1× 1. Platz 1 Stichproben

Durchschnittswert je Modell

1 Claude Fable 5
9.46
2 GPT-5 mini
9.01
3 Claude Sonnet 5
9.00
4 GPT-5.5
9.01
5 Gemini 2.5 Flash
6.26
6 Gemini 2.5 Flash-Lite
7.21
7 Gemini 2.5 Pro
8.41

Gewichtung

Korrektheit 45% Qualität der Begrundung 20% Vollständigkeit 15% Klarheit 10% Befolgung der Anweisungen 10%

Claude Fable 5 eröffnete sein Konto hier mit dem stärksten Einzelauftritt des Genres, und auch Claude Sonnet 5 gewann sein Debüt. Das Rückgrat dieser Tabelle ist jedoch GPT-5 mini: Es hat mehr bewertete Fragen beantwortet als jeder der Führenden und noch kein Duell verloren. In einem Genre, in dem es um die richtige Antwort geht, ist eine ungeschlagene Bilanz über wiederholte Einsätze genau die Art von Beleg, die zählt.

Die Korrektheit trägt hier mit Abstand das höchste Gewicht der gesamten Seite, gefolgt von der Qualität der Begründung. Das prägt den Rest der Tabelle auf besondere Weise: Gemini 2.5 Pro schreibt oft Antworten, deren Durchschnitt völlig gesund aussieht, hat aber kein einziges Duell für sich entschieden — denn eine fast richtige Antwort verliert gegen eine richtige. Die leichteren Gemini-Klassen stehlen gelegentlich einen Sieg, und GPT-5.5 hat seine Einsätze geteilt.

Der übliche Vorbehalt wirkt hier in beide Richtungen. Die makellosen Starts der neuen Claude-Modelle beruhen auf sehr wenigen Fragen; die Bilanz von GPT-5 mini auf mehr. Prüfungsfragen decken zudem völlig unterschiedliche Fächer ab, sodass sich die Platzierung eines Modells mit wachsender Themenmischung verschieben kann. Es sind Messungen unter Orivels Bedingungen, keine Gesamtnote in jedem Fach.

Fazit

Für Q&A mit Genauigkeit an erster Stelle ist GPT-5 mini die bewährte Wahl und bemerkenswert preiswert; Claude Fable 5s Debüt deutet auf eine neue Obergrenze für das Genre. Gemini 2.5 Pros gesunde Durchschnitte ohne Siege zeigen, wie unerbittlich ein korrektheitsgewichtetes Genre ist.

Diese Analyse basiert auf den von Orivel gemessenen Benchmark-Werten für dieses Genre und wird regelmäßig aktualisiert. Die Werte sind bedingungsabhängige Messungen, keine absolute Wahrheit.

Ranking starker Modelle in diesem Genre

Dieses Ranking ist nach dem Durchschnittsscore nur innerhalb dieses Genres sortiert.

Zuletzt aktualisiert: 09 Aug 2026 09:46

#1
Claude Fable 5 Anthropic

Siegesquote

100%

Durchschnittsscore

95
#2
GPT-5 mini OpenAI

Siegesquote

100%

Durchschnittsscore

90
#3
Claude Sonnet 5 Anthropic

Siegesquote

100%

Durchschnittsscore

90
#4
GPT-5.5 OpenAI

Siegesquote

50%

Durchschnittsscore

90
#5
Gemini 2.5 Flash Google

Siegesquote

20%

Durchschnittsscore

63
#6
Gemini 2.5 Flash-Lite Google

Siegesquote

14%

Durchschnittsscore

72
#7
Gemini 2.5 Pro Google

Siegesquote

0%

Durchschnittsscore

84

Was in Bildungsfragen bewertet wird

Kriterien und Gewichte für dieses Genre-Ranking.

Korrektheit

45.0%

Dieses Kriterium ist enthalten, um Korrektheit in der Antwort zu prüfen. Es hat mehr Gewicht, weil dieser Teil das Gesamtergebnis in diesem Genre stark prägt.

Qualität der Begrundung

20.0%

Dieses Kriterium ist enthalten, um Qualität der Begrundung in der Antwort zu prüfen. Es hat ein klares Gewicht, weil es die Qualität sichtbar beeinflusst, auch wenn es nicht alles bestimmt.

Vollständigkeit

15.0%

Dieses Kriterium ist enthalten, um Vollständigkeit in der Antwort zu prüfen. Es ist leichter gewichtet, weil es das Hauptziel unterstützt, das Genre aber nicht allein definiert.

Klarheit

10.0%

Dieses Kriterium ist enthalten, um Klarheit in der Antwort zu prüfen. Es ist leichter gewichtet, weil es das Hauptziel unterstützt, das Genre aber nicht allein definiert.

Befolgung der Anweisungen

10.0%

Dieses Kriterium ist enthalten, um Befolgung der Anweisungen in der Antwort zu prüfen. Es ist leichter gewichtet, weil es das Hauptziel unterstützt, das Genre aber nicht allein definiert.

Aktuelle Aufgaben

Bildungsfragen

Anthropic Claude Sonnet 5 VS Google Gemini 2.5 Flash

Adjazenz in einem zufällig gewählten Derangement

Eine Permutation π von {1,2,3,4,5,6,7,8} wird als Folge π(1),π(2),…,π(8) geschrieben. Ein Derangement ist eine Permutation, die für jedes i die Bedingung π(i) ≠ i erfüllt (also fixpunktfrei ist). Wähle gleichverteilt zufällig aus allen Derangements dieser acht Zahlen. Bestimmen Sie die exakte Wahrscheinlichkeit, dass die Werte 1 und 2 in benachbarten Positionen auftreten, in beliebiger Reihenfolge. Ihre Lösung muss sowohl die Gesamtanzahl der Derangements als auch die Anzahl der Derangements, die die Adjazenzbedingung erfüllen, mithilfe eines gültigen Abzählarguments wie dem Inklusions–Exklusionsprinzip herleiten; ein unbegründetes numerisches Ergebnis ist nicht ausreichend. Berechnen Sie dann die entsprechende Wahrscheinlichkeit für eine uneingeschränkt gleichverteilte zufällige Permutation der acht Zahlen, und geben Sie an, ob die Bedingung, ein Derangement zu sein, die Wahrscheinlichkeit für Adjazenz erhöht oder verringert.

160
09 Aug 2026 09:46

Bildungsfragen

Anthropic Claude Fable 5 VS Google Gemini 2.5 Flash-Lite

Musterwettlauf mit einer verzerrten Münze

Prüfungsfrage: Eine Münze landet bei jedem Wurf mit Wahrscheinlichkeit p auf Kopf, wobei 0 < p < 1 gilt. Sei q = 1 - p. Du wirfst die Münze wiederholt, bis eines der beiden drei-Wurf-Muster HTH oder HHT zum ersten Mal als aufeinanderfolgender Block erscheint. Zum Beispiel erscheint in der Folge T H H T das Muster HHT, das am vierten Wurf endet. Beantworte Folgendes: Wie groß ist die Wahrscheinlichkeit, dass HTH vor HHT erscheint? Wie groß ist die erwartete Anzahl an Würfen, bis entweder HTH oder HHT zum ersten Mal erscheint? Erkläre kurz, warum eine Lösung, die nicht überlappende Blöcke von drei Würfen als unabhängige Versuche behandelt, das falsche Ergebnis liefert.

298
07 Jul 2026 09:43

Bildungsfragen

Anthropic Claude Opus 4.8 VS OpenAI GPT-5.5

Physikaufgabe: Die Zeitverzerrung der Standuhr

Eine Standuhr verwendet ein Pendel aus Messing zur Zeitmessung und ist so kalibriert, dass sie bei einer Raumtemperatur von 20,0 °C vollkommen genau geht. Während einer sommerlichen Hitzewelle steigt die durchschnittliche Raumtemperatur auf 35,0 °C. Beantworte auf Grundlage des bereitgestellten Kontexts Folgendes: Berechne die neue Länge des Messingpendels. Gehe davon aus, dass seine ursprüngliche Länge (bei 20,0 °C) genau 1,000 Meter betrug. Berechne die neue Periode des Pendels bei 35,0 °C. Bestimme, wie viele Sekunden die Uhr in einem Zeitraum von 24 Stunden (das sind 86.400 Sekunden) vor- oder nachgeht. Gib eine klare Schritt-für-Schritt-Erklärung der physikalischen Prinzipien, die zu deinem Ergebnis führen, und erläutere dabei im Detail, wie sich die Temperatur auf die Genauigkeit der Uhr auswirkt.

280
28 Jun 2026 09:40

Bildungsfragen

Anthropic Claude Opus 4.8 VS OpenAI GPT-5 mini

Hormonelle Kontrolle des Menstruationszyklus

Bei einer Patientin wurde eine seltene genetische Erkrankung diagnostiziert, die dazu führt, dass ihre Hypophyse vollständig unfähig ist, Luteinisierendes Hormon (LH) zu produzieren, während die Produktion von Follikelstimulierendem Hormon (FSH) normal bleibt. Erläutern Sie die kaskadierenden physiologischen Auswirkungen, die dieser spezifische Mangel auf den Menstruationszyklus der Patientin hätte. Ihre Erklärung sollte die zu erwartenden Veränderungen in der Follikelphase, der Ovulation, der Lutealphase und der Gebärmutterschleimhaut während eines typischen Zyklus detailliert beschreiben. Gehen Sie davon aus, dass die Patientin im reproduktionsfähigen Alter und ansonsten gesund ist.

440
04 Jun 2026 09:39

Bildungsfragen

OpenAI GPT-5.5 VS Google Gemini 2.5 Flash-Lite

Erkläre, warum Eis schwimmt: Eine schwierige Frage für eine Chemieprüfung

Festes Wasser (Eis) ist in der Nähe von 0 °C weniger dicht als flüssiges Wasser, was im Vergleich zu den meisten Stoffen ungewöhnlich ist, deren feste Phasen dichter sind als ihre flüssigen Phasen. Verfasse eine prüfungsähnliche Essay-Antwort (ungefähr 350–550 Wörter), die ALLE der folgenden Punkte behandelt: Gib die ungefähren Dichten von Eis bei 0 °C und von flüssigem Wasser bei 0 °C und bei 4 °C an, und benenne die Temperatur, bei der flüssiges Wasser seine maximale Dichte erreicht. Erkläre auf molekularer Ebene, warum Eis eine geringere Dichte als flüssiges Wasser hat. Deine Erklärung muss sich beziehen auf: Wasserstoffbrücken (hydrogen bonding), die tetraedrische Koordination der Wassermoleküle im hexagonalen Eis (Ih) und die offene Gitterstruktur mit Hohlräumen. Erkläre, warum flüssiges Wasser nahe 0 °C dichter ist als Eis, aber dennoch weniger dicht als Wasser bei 4 °C. Beschreibe den Wettbewerb zwischen zwei Effekten, wenn die Temperatur von 0 °C auf 4 °C ansteigt: den partiellen Zusammenbruch residualer eisähnlicher, durch Wasserstoffbrücken verbundener Cluster (was die Dichte erhöht) und die normale thermische Ausdehnung (die die Dichte vermindert). Nenne zumindest zwei wichtige ökologische oder geophysikalische Folgen dieser Anomalie (zum Beispiel Schichtung von Seen im Winter, Überleben aquatischer Lebewesen oder das Verhalten von Meereis). Vergleiche kurz Wasser mit einem anderen kleinen Molekül (z. B. H2S, NH3 oder CH4), um zu zeigen, warum speziell Wasserstoffbrücken — und nicht nur Molekülgröße oder Polarität — für die Anomalie verantwortlich sind. Sei präzise mit der Terminologie (z. B. „Wasserstoffbrücke“ vs. „kovalente Bindung“, „Dichte“ vs. „spezifisches Volumen“). Wenn du numerische Werte angibst, nenne sie mit geeigneten Einheiten und vernünftigen signifikanten Stellen.

583
28 Apr 2026 09:37

Bildungsfragen

Anthropic Claude Opus 4.7 VS Google Gemini 2.5 Flash-Lite

Analysiere, warum ein Produkt kein Polynom ist

Ein Schüler behauptet, dass, weil f(x) = (x^2 - 1)/(x - 1) sich für x ≠ 1 zu x + 1 vereinfacht, die Funktion g(x) = ((x^2 - 1)/(x - 1)) · |x - 1| ein Polynom sei und gleich (x + 1)|x - 1| sei. Beurteile diese Behauptung. Beantworte alle Teile: Vereinfache g(x) so weit wie möglich für x ≠ 1. Bestimme, ob g(x) zu einem Polynom auf ganz ℝ fortgesetzt werden kann. Begründe deine Schlussfolgerung. Gib an, ob g an x = 1 differenzierbar ist, und zeige die entscheidende Rechnung, die deine Antwort stützt. Erkläre kurz den konzeptionellen Fehler in der Argumentation des Schülers. Deine Antwort soll mathematisch streng, aber für einen leistungsstarken Oberstufenschüler verständlich sein.

650
24 Apr 2026 09:37

Verwandte Links

X f L