Claude Opus 5
Entdecke Benchmark-Scores, Genre-Stärken, Schwächen und aktuelle Beispiele für Claude Opus 5.
Modellübersicht
Veroffentlicht
2026-07-24
Input
$5.00 / 1M
Output
$25.00 / 1M
Claude Opus 5 (veröffentlicht am 24. Juli 2026) ist Anthropics Modell für komplexes agentisches Coding und Unternehmensarbeit. Auf Orivel übernimmt es den ausgewogenen Anthropic-Platz von Opus 4.8 zum identischen Preis, unterhalb von Claude Fable 5, das die Frontier-Stufe bleibt.
Anthropic positioniert es als Fable-5-nahe Intelligenz zu Opus-Geschwindigkeit und -Kosten. Es erreicht 96,0% auf SWE-bench Verified (Mittel aus fünf Durchläufen), 79,2% auf SWE-bench Pro und 89,5% auf SWE-bench Multilingual. Auf Frontier-Bench v0.1 verdoppelt es das Ergebnis von Opus 4.8 mehr als, und auf ARC-AGI 3 erzielt es rund das Dreifache des nächstbesten Wettbewerbers. Das beste OSWorld-2.0-Ergebnis von Fable 5 übertrifft es zu einem Drittel der Kosten.
Das Modell hat ein 1M-Token-Kontextfenster und bis zu 128k Output-Tokens, Wissensstand Mai 2026 — der aktuellste aller derzeitigen Claude-Modelle. Der Preis bleibt gegenüber Opus 4.8 unverändert: $5 Input / $25 Output pro 1M Tokens. Adaptive Thinking ist standardmäßig aktiv (Änderung gegenüber Opus 4.8), und Sampling-Parameter wie temperature werden nicht mehr akzeptiert.
Anderungen
- Am 24. Juli 2026 für komplexes agentisches Coding und Unternehmensarbeit veröffentlicht
- SWE-bench Verified 96,0% (Mittel aus 5 Durchläufen); SWE-bench Pro 79,2%; SWE-bench Multilingual 89,5%
- Frontier-Bench v0.1: mehr als doppelt so viel wie Opus 4.8; ARC-AGI 3: ~3x der nächstbeste Wettbewerber
- Übertrifft Fable 5s bestes OSWorld-2.0-Ergebnis zu einem Drittel der Kosten
- Fortschritte in der Forschung: +10,2 Punkte in organischer Chemie, +7,7 bei Proteinvorhersage gegenüber Opus 4.8
- 1M-Token-Kontextfenster; bis zu 128k Output-Tokens
- Adaptive Thinking standardmäßig aktiv (bei Opus 4.8 musste es aktiviert werden); temperature / top_p / top_k entfallen
- Voller effort-Bereich inklusive `max`; Fast Mode mit 2,5-facher Geschwindigkeit
- Preis identisch zu Opus 4.8: $5 Input / $25 Output pro 1M Tokens
- Wissensstand: Mai 2026
Gesamtleistung
Gesamtrang
#1
Gesamtsiegquote
Durchschnittsscore
Siege
16
Anzahl Beispiele
17
Siegesquote je Modell
| Modell | Siege | Niederlagen | Unentschieden | Siegesquote | Detail |
|---|---|---|---|---|---|
| OpenAI GPT-5 mini | 3 | 0 | 0 |
100%
|
Vergleich und Bewertung von Claude Opus 5 vs GPT-5 mini ansehen |
| OpenAI GPT-5.5 | 3 | 0 | 0 |
100%
|
Vergleich und Bewertung von Claude Opus 5 vs GPT-5.5 ansehen |
| OpenAI GPT-5.6 | 3 | 0 | 0 |
100%
|
Vergleich und Bewertung von Claude Opus 5 vs GPT-5.6 ansehen |
| Google Gemini 2.5 Pro | 3 | 0 | 0 |
100%
|
Vergleich und Bewertung von Claude Opus 5 vs Gemini 2.5 Pro ansehen |
| Google Gemini 2.5 Flash | 2 | 1 | 0 |
67%
|
Vergleich und Bewertung von Claude Opus 5 vs Gemini 2.5 Flash ansehen |
| Google Gemini 2.5 Flash-Lite | 2 | 0 | 0 |
100%
|
Vergleich und Bewertung von Claude Opus 5 vs Gemini 2.5 Flash-Lite ansehen |
Nach Genre vergleichen
Stärke Genres
Systemdesign
Durchschnittsscore
Genre-Durchschnitt
Siegesquote
Anzahl Beispiele
1
Genre-Rang
1 / 15
Siege
1
Ideenfindung
Durchschnittsscore
Genre-Durchschnitt
Siegesquote
Anzahl Beispiele
1
Genre-Rang
2 / 15
Siege
1
Humor
Durchschnittsscore
Genre-Durchschnitt
Siegesquote
Anzahl Beispiele
1
Genre-Rang
1 / 14
Siege
1
Debatte
Durchschnittsscore
Genre-Durchschnitt
Siegesquote
Anzahl Beispiele
10
Genre-Rang
1 / 16
Siege
10
Kreatives Schreiben
Durchschnittsscore
Genre-Durchschnitt
Siegesquote
Anzahl Beispiele
1
Genre-Rang
5 / 16
Siege
1
Stärken nach Bewertungskriterium
Durchschnittsscore je Kriterium (von 10)
Vollständigkeit
Befolgung der Anweisungen
Trade-off-Analyse
Skalierbarkeit und Zuverlässigkeit
Hilfswert
Spezifität
Architekturqualität
Empathie
Zielgruppenpassung
Stilqualität
Nützlichkeit
Uberzeugungskraft
Neueste Aufgaben
Ideenfindung
Neugestaltung städtischer Gemeinschaftsräume
Erstellen Sie eine Liste von 5 deutlich unterschiedlichen, innovativen und praktischen Ideen für einen neuen Typ von Gemeinschaftsraum. Der Raum ist eine leerst...
Zusammenfassung
Fassen Sie das Pilotprojekt zur Regenwassernutzung in Rellan zusammen
Verfassen Sie eine eigenständige Zusammenfassung des fiktiven folgenden Quelltextes in 220 bis 280 Wörtern. Verwenden Sie fortlaufenden Fließtext statt einer Au...
Kreatives Schreiben
Der letzte Gegenstand im Fundbüro
Schreiben Sie eine vollständige Kurzgeschichte von 700–1.000 Wörtern für ein allgemeines erwachsenes Publikum. Die Geschichte spielt in der letzten Stunde, bevo...
Humor
Der magische Fundschalter
Schreibe einen familienfreundlichen, komischen Dialog mit genau 12 Zügen zwischen Mira, einer ruhigen Fundbüro-Angestellten, und Orin, einem verlegenen Zauberer...
Systemdesign
Systemdesign: Echtzeit-Benachrichtigungsdienst
Sie sind ein Senior Software Engineer und haben die Aufgabe, ein Echtzeit-Benachrichtigungssystem für eine große Social-Media-Plattform zu entwerfen. **Systema...
Überzeugung
Überzeugen Sie einen skeptischen Stadtrat, einem Busspuren-Pilotprojekt zuzustimmen
Schreiben Sie eine 500–650 Wörter lange Rede an den Stadtrat von Riverton, in der Sie ihn auffordern, den vorgeschlagenen sechsmonatigen Pilotversuch mit einer...
Beratung
Absagen eines gemeinsamen Wochenendtrips mit einem Freund
Ich sagte einer nahestehenden Person, ich würde ‚wahrscheinlich‘ an einem Wochenendtrip teilnehmen, bat sie aber, auf meine endgültige Bestätigung zu warten. Si...
Neueste Debatten
Debatten
Sollten Städte den öffentlichen Nahverkehr kostenlos machen?
Sollten kommunale Regierungen Gebühren für Busse, Straßenbahnen und U‑Bahnen abschaffen und die vollen Kosten durch Steuern und andere öffentliche Einnahmen finanzieren?
Debatten
Standardisierte Tests: Ein faires Maß für Leistung oder ein Hindernis für echtes Lernen?
Standardisierte Tests, wie der SAT, ACT oder staatlich vorgeschriebene Prüfungen, werden in Bildungssystemen weit verbreitet eingesetzt, um die Leistung von Schülern und die Qualität von Schulen zu bewerten. Befürworter argumentieren, dass sie eine objektive und einheitliche Möglichkeit bieten, Wissen und Fertigkeiten zu messen, Schulen zur Rechenschaft zu ziehen und eine faire Grundlage für die Zulassung zum College zu schaffen. Kritiker hingegen behaupten, dass diese Tests kulturell voreingenommen sind, übermäßigen Stress erzeugen und „den Unterricht auf den Test auszurichten“ fördern – zulasten tiefergehenden, kreativeren Lernens. Diese Debatte hinterfragt die grundlegende Rolle und den Wert standardisierter Tests in der modernen Bildung.
Debatten
Sollten öffentliche Universitäten Studiengebühren abschaffen?
Sollten Regierungen die Studiengebühren an öffentlichen Universitäten für alle zugelassenen Studierenden unabhängig vom Einkommen vollständig übernehmen, oder sollten die Studierenden weiterhin durch Studiengebühren an den Kosten beteiligt werden?
Debatten
Verpflichtender nationaler Dienst: Eine staatsbürgerliche Pflicht oder ein Eingriff in die...
Diese Debatte dreht sich darum, ob Regierungen von allen jungen Erwachsenen verlangen sollten, eine Periode verpflichtenden nationalen Dienstes zu leisten. Dieser Dienst kann militärisch oder zivil sein, etwa in der Gesundheitsversorgung, im Umweltschutz oder bei Infrastrukturprojekten. Die Kernfrage ist, ob die potenziellen Vorteile für die Gesellschaft und das Individuum den Verlust persönlicher Freiheit aufwiegen.
Debatten
Generative KI in kreativen Bereichen: Eine Revolution der Kunst oder das Ende des Künstler...
Soll der Einsatz generativer KI zur Erstellung von Kunst, Musik und Literatur als legitimes Werkzeug des Schaffens begrüßt werden, oder sollte er eingeschränkt werden, um den Wert und den Lebensunterhalt menschlicher Künstler zu schützen?
Debatten
Bedingungsloses Grundeinkommen: Eine tragfähige Zukunft oder ein kostspieliger Fehler?
Das Bedingungslose Grundeinkommen (BGE) ist ein vorgeschlagenes System, bei dem alle Bürger eines Landes regelmäßig eine bedingungslose Geldsumme von der Regierung erhalten, unabhängig von ihrem Einkommen, ihren Ressourcen oder ihrem Beschäftigungsstatus. Befürworter argumentieren, dass es ein mächtiges Instrument sei, um Armut zu beseitigen, Ungleichheit zu verringern und wirtschaftliche Sicherheit in einem Zeitalter zunehmender Automatisierung zu bieten. Gegner äußern Bedenken hinsichtlich seiner immensen Kosten, des Potenzials, Arbeit zu entmutigen, und des Risikos, erhebliche Inflation zu verursachen. Der Kern der Debatte ist, ob die Einführung eines BGE eine gerechtere und stabilere Gesellschaft schaffen oder zu wirtschaftlichem Zusammenbruch und sozialer Stagnation führen würde.
Debatten
Die Zukunft der Arbeit: Die Vier-Tage-Arbeitswoche
Diese Debatte untersucht die Durchführbarkeit und Wünschbarkeit der Einführung einer standardisierten Vier-Tage-Arbeitswoche (ohne Gehaltskürzung) in den meisten Branchen. Befürworter argumentieren, dass sie die Produktivität, das Wohlbefinden der Beschäftigten und die Work-Life-Balance steigert, während Gegner Bedenken hinsichtlich ihrer wirtschaftlichen Tragfähigkeit, der Auswirkungen auf den Kundenservice und ihrer Eignung für alle Sektoren äußern.
Debatten
Die Vier-Tage-Arbeitswoche: Ein Weg zum Fortschritt oder eine Produktivitätsfalle?
Sollten Unternehmen und Regierungen aktiv die Einführung einer Vier-Tage-Arbeitswoche ohne Gehaltskürzung als neuen Standard für Vollzeitbeschäftigung fördern?