Bildungsfragen
Vergleicht, wie präzise KI-Modelle Bildungs- und Prüfungsfragen beantworten.
In diesem Genre werden vor allem Faehigkeiten wie Korrektheit, Qualitat der Begrundung, Vollstandigkeit betrachtet.
Anders als explanation zaehlt hier staerker, ob eine korrekte Antwort auf pruefungsartige Fragen erreicht wird, statt nur gut zu erklaeren.
Ein hoher Wert hier garantiert keine Kreativitaet, keine starke Ueberzeugungskraft und keine besondere Staerke in offenen Planungsaufgaben.
Wofuer starke Modelle in diesem Genre gut geeignet sind
Lernhilfe, Pruefungsfragen und Aufgaben, bei denen Antwortgenauigkeit an erster Stelle steht.
Was dieses Genre allein nicht zeigen kann
ob das Modell besser fuer lange Erklaerungen, Brainstorming oder professionelles Schreiben ist.
Wissensfragen: ein auf Korrektheit ausgerichtetes Genre, in dem GPT-5 mini nach Bilanz führt
Anthropic
OpenAI
Anthropic
Durchschnittswert je Modell
Gewichtung
Über 34 bewertete Antworten ist dies das strengste Genre für faktische Genauigkeit: Korrektheit allein trägt 45 Gewicht, mehr als in jedem anderen Genre. GPT-5 mini belegt Platz 1 mit der stärksten Evidenz des Felds: 5 Stichproben, 5 erste Plätze und 100 % Siegquote. Sein Schnitt von 9,01 ist allerdings nicht der höchste, und genau darin liegt der Kern dieses Genres.
Der Rang richtet sich hier nach der Siegquote, nicht nach dem Schnitt, und beide driften auseinander. Claude Sonnet 4.6 erzielt den höchsten Schnitt des gesamten Felds (9,29), steht aber mit 75 % Siegquote auf Platz 2, der Schnitt des Spitzenreiters liegt somit 0,28 unter dem des Zweiten. Am Tabellenende kehrt sich die Lücke ebenso um: Gemini 2.5 Pro erreicht respektable 8,41, mehr als mehrere Modelle darüber, bildet aber das Schlusslicht, weil es keines seiner 4 Duelle gewann.
Die deutlichste Schwachstelle sind die leichteren Gemini- und Claude-Klassen bei den schwereren Fragen: Claude Haiku 4.5 (7,78) und Gemini 2.5 Flash (6,77) liegen weit unter den 9-Punkte-Spitzenreitern. Da Korrektheit die Bewertung dominiert, spiegeln diese Abstände sachliche Fehler bei schwierigen Prompts wider – genau dort, wo ein Wissens-Benchmark Modelle trennen sollte. Dennoch umfasst das gesamte Feld nur 0,6 Punkte vom höchsten bis zum niedrigsten Schnitt.
Die meisten Modelle beruhen auf nur 2 bis 6 Stichproben, daher ist die Feinordnung vorläufig und Schwankungen durch kleine Stichproben sind wahrscheinlich, besonders bei den Zwei-Stichproben-Einträgen in der Tabellenmitte. Die Rangfolge nach Siegquote ist real, doch es bleiben bedingungsabhängige Messwerte, kein allgemeines Wissensranking.
Fazit
Für faktische Fragen ist GPT-5 mini die am besten begründbare Wahl (5 Stichproben, 100 % Siegquote, zu Kosten der leichten Klasse), während Claude Sonnet 4.6 den höchsten Einzelschnitt hat (9,29), wenn du reine Korrektheit über direkte Siege stellst. Die leichteren Gemini-Klassen sind hier am schwächsten.
Diese Analyse basiert auf den von Orivel gemessenen Benchmark-Werten fuer dieses Genre und wird regelmaessig aktualisiert. Die Werte sind bedingungsabhaengige Messungen, keine absolute Wahrheit.
Ranking starker Modelle in diesem Genre
Dieses Ranking ist nach dem Durchschnittsscore nur innerhalb dieses Genres sortiert.
Zuletzt aktualisiert: 07 Jul 2026 09:43
Siegesquote
Durchschnittsscore
Siegesquote
Durchschnittsscore
Siegesquote
Durchschnittsscore
Siegesquote
Durchschnittsscore
Siegesquote
Durchschnittsscore
Siegesquote
Durchschnittsscore
Siegesquote
Durchschnittsscore
Siegesquote
Durchschnittsscore
| Gerankte Modelle |
|
|
Detail | ||||
|---|---|---|---|---|---|---|---|
| #1 | Claude Fable 5 | Anthropic |
100%
|
95
|
1 | 1 | Bewertung und Punktzahl von Claude Fable 5 ansehen |
| #2 | GPT-5 mini | OpenAI |
100%
|
90
|
5 | 5 | Bewertung und Punktzahl von GPT-5 mini ansehen |
| #3 | Claude Sonnet 4.6 | Anthropic |
75%
|
93
|
3 | 4 | Bewertung und Punktzahl von Claude Sonnet 4.6 ansehen |
| #4 | GPT-5.5 | OpenAI |
50%
|
90
|
1 | 2 | Bewertung und Punktzahl von GPT-5.5 ansehen |
| #5 | Claude Opus 4.8 | Anthropic |
50%
|
89
|
1 | 2 | Bewertung und Punktzahl von Claude Opus 4.8 ansehen |
| #6 | Gemini 2.5 Flash |
25%
|
68
|
1 | 4 | Bewertung und Punktzahl von Gemini 2.5 Flash ansehen | |
| #7 | Gemini 2.5 Flash-Lite |
14%
|
72
|
1 | 7 | Bewertung und Punktzahl von Gemini 2.5 Flash-Lite ansehen | |
| #8 | Gemini 2.5 Pro |
0%
|
84
|
0 | 4 | Bewertung und Punktzahl von Gemini 2.5 Pro ansehen |
Was in Bildungsfragen bewertet wird
Kriterien und Gewichte fuer dieses Genre-Ranking.
Korrektheit
45.0%
Dieses Kriterium ist enthalten, um Korrektheit in der Antwort zu pruefen. Es hat mehr Gewicht, weil dieser Teil das Gesamtergebnis in diesem Genre stark praegt.
Qualitat der Begrundung
20.0%
Dieses Kriterium ist enthalten, um Qualitat der Begrundung in der Antwort zu pruefen. Es hat ein klares Gewicht, weil es die Qualitaet sichtbar beeinflusst, auch wenn es nicht alles bestimmt.
Vollstandigkeit
15.0%
Dieses Kriterium ist enthalten, um Vollstandigkeit in der Antwort zu pruefen. Es ist leichter gewichtet, weil es das Hauptziel unterstuetzt, das Genre aber nicht allein definiert.
Klarheit
10.0%
Dieses Kriterium ist enthalten, um Klarheit in der Antwort zu pruefen. Es ist leichter gewichtet, weil es das Hauptziel unterstuetzt, das Genre aber nicht allein definiert.
Befolgung der Anweisungen
10.0%
Dieses Kriterium ist enthalten, um Befolgung der Anweisungen in der Antwort zu pruefen. Es ist leichter gewichtet, weil es das Hauptziel unterstuetzt, das Genre aber nicht allein definiert.
Aktuelle Aufgaben
Bildungsfragen
Musterwettlauf mit einer verzerrten Münze
Prüfungsfrage: Eine Münze landet bei jedem Wurf mit Wahrscheinlichkeit p auf Kopf, wobei 0 < p < 1 gilt. Sei q = 1 - p. Du wirfst die Münze wiederholt, bis eines der beiden drei-Wurf-Muster HTH oder HHT zum ersten Mal als aufeinanderfolgender Block erscheint. Zum Beispiel erscheint in der Folge T H H T das Muster HHT, das am vierten Wurf endet. Beantworte Folgendes: 1. Wie groß ist die Wahrscheinlichkeit, dass HTH vor HHT erscheint? 2. Wie groß ist die erwartete Anzahl an Würfen, bis entweder HTH oder HHT zum ersten Mal erscheint? 3. Erkläre kurz, warum eine Lösung, die nicht überlappende Blöcke von drei Würfen als unabhängige Versuche behandelt, das falsche Ergebnis liefert.
Bildungsfragen
Physikaufgabe: Die Zeitverzerrung der Standuhr
Eine Standuhr verwendet ein Pendel aus Messing zur Zeitmessung und ist so kalibriert, dass sie bei einer Raumtemperatur von 20,0 °C vollkommen genau geht. Während einer sommerlichen Hitzewelle steigt die durchschnittliche Raumtemperatur auf 35,0 °C. Beantworte auf Grundlage des bereitgestellten Kontexts Folgendes: 1. Berechne die neue Länge des Messingpendels. Gehe davon aus, dass seine ursprüngliche Länge (bei 20,0 °C) genau 1,000 Meter betrug. 2. Berechne die neue Periode des Pendels bei 35,0 °C. 3. Bestimme, wie viele Sekunden die Uhr in einem Zeitraum von 24 Stunden (das sind 86.400 Sekunden) vor- oder nachgeht. 4. Gib eine klare Schritt-für-Schritt-Erklärung der physikalischen Prinzipien, die zu deinem Ergebnis führen, und erläutere dabei im Detail, wie sich die Temperatur auf die Genauigkeit der Uhr auswirkt.
Bildungsfragen
Hormonelle Kontrolle des Menstruationszyklus
Bei einer Patientin wurde eine seltene genetische Erkrankung diagnostiziert, die dazu führt, dass ihre Hypophyse vollständig unfähig ist, Luteinisierendes Hormon (LH) zu produzieren, während die Produktion von Follikelstimulierendem Hormon (FSH) normal bleibt. Erläutern Sie die kaskadierenden physiologischen Auswirkungen, die dieser spezifische Mangel auf den Menstruationszyklus der Patientin hätte. Ihre Erklärung sollte die zu erwartenden Veränderungen in der Follikelphase, der Ovulation, der Lutealphase und der Gebärmutterschleimhaut während eines typischen Zyklus detailliert beschreiben. Gehen Sie davon aus, dass die Patientin im reproduktionsfähigen Alter und ansonsten gesund ist.
Bildungsfragen
Erkläre, warum Eis schwimmt: Eine schwierige Frage für eine Chemieprüfung
Festes Wasser (Eis) ist in der Nähe von 0 °C weniger dicht als flüssiges Wasser, was im Vergleich zu den meisten Stoffen ungewöhnlich ist, deren feste Phasen dichter sind als ihre flüssigen Phasen. Verfasse eine prüfungsähnliche Essay-Antwort (ungefähr 350–550 Wörter), die ALLE der folgenden Punkte behandelt: 1. Gib die ungefähren Dichten von Eis bei 0 °C und von flüssigem Wasser bei 0 °C und bei 4 °C an, und benenne die Temperatur, bei der flüssiges Wasser seine maximale Dichte erreicht. 2. Erkläre auf molekularer Ebene, warum Eis eine geringere Dichte als flüssiges Wasser hat. Deine Erklärung muss sich beziehen auf: Wasserstoffbrücken (hydrogen bonding), die tetraedrische Koordination der Wassermoleküle im hexagonalen Eis (Ih) und die offene Gitterstruktur mit Hohlräumen. 3. Erkläre, warum flüssiges Wasser nahe 0 °C dichter ist als Eis, aber dennoch weniger dicht als Wasser bei 4 °C. Beschreibe den Wettbewerb zwischen zwei Effekten, wenn die Temperatur von 0 °C auf 4 °C ansteigt: den partiellen Zusammenbruch residualer eisähnlicher, durch Wasserstoffbrücken verbundener Cluster (was die Dichte erhöht) und die normale thermische Ausdehnung (die die Dichte vermindert). 4. Nenne zumindest zwei wichtige ökologische oder geophysikalische Folgen dieser Anomalie (zum Beispiel Schichtung von Seen im Winter, Überleben aquatischer Lebewesen oder das Verhalten von Meereis). 5. Vergleiche kurz Wasser mit einem anderen kleinen Molekül (z. B. H2S, NH3 oder CH4), um zu zeigen, warum speziell Wasserstoffbrücken — und nicht nur Molekülgröße oder Polarität — für die Anomalie verantwortlich sind. Sei präzise mit der Terminologie (z. B. „Wasserstoffbrücke“ vs. „kovalente Bindung“, „Dichte“ vs. „spezifisches Volumen“). Wenn du numerische Werte angibst, nenne sie mit geeigneten Einheiten und vernünftigen signifikanten Stellen.
Bildungsfragen
Analysiere, warum ein Produkt kein Polynom ist
Ein Schüler behauptet, dass, weil f(x) = (x^2 - 1)/(x - 1) sich für x ≠ 1 zu x + 1 vereinfacht, die Funktion g(x) = ((x^2 - 1)/(x - 1)) · |x - 1| ein Polynom sei und gleich (x + 1)|x - 1| sei. Beurteile diese Behauptung. Beantworte alle Teile: 1. Vereinfache g(x) so weit wie möglich für x ≠ 1. 2. Bestimme, ob g(x) zu einem Polynom auf ganz ℝ fortgesetzt werden kann. Begründe deine Schlussfolgerung. 3. Gib an, ob g an x = 1 differenzierbar ist, und zeige die entscheidende Rechnung, die deine Antwort stützt. 4. Erkläre kurz den konzeptionellen Fehler in der Argumentation des Schülers. Deine Antwort soll mathematisch streng, aber für einen leistungsstarken Oberstufenschüler verständlich sein.
Bildungsfragen
Hormonelle Rückkopplungsschleifen im menschlichen Menstruationszyklus
Erklären Sie die hormonelle Steuerung des menschlichen Menstruationszyklus, mit Schwerpunkt auf der Follikelphase und der Lutealphase. Ihre Erklärung muss die Rollen von Gonadotropin-Releasing-Hormon (GnRH), Luteinisierendem Hormon (LH), Follikelstimulierendem Hormon (FSH), Östrogen und Progesteron detailliert darlegen. Beschreiben Sie insbesondere die positiven und negativen Rückkopplungsmechanismen, die den Zyklus regulieren, einschließlich des Ereignisses, das die Ovulation auslöst.