Claude Opus 5
Entdecke Benchmark-Scores, Genre-Stärken, Schwächen und aktuelle Beispiele für Claude Opus 5.
Modellübersicht
Veroffentlicht
2026-07-24
Input
$5.00 / 1M
Output
$25.00 / 1M
Claude Opus 5 (veröffentlicht am 24. Juli 2026) ist Anthropics Modell für komplexes agentisches Coding und Unternehmensarbeit. Auf Orivel übernimmt es den ausgewogenen Anthropic-Platz von Opus 4.8 zum identischen Preis, unterhalb von Claude Fable 5, das die Frontier-Stufe bleibt.
Anthropic positioniert es als Fable-5-nahe Intelligenz zu Opus-Geschwindigkeit und -Kosten. Es erreicht 96,0% auf SWE-bench Verified (Mittel aus fünf Durchläufen), 79,2% auf SWE-bench Pro und 89,5% auf SWE-bench Multilingual. Auf Frontier-Bench v0.1 verdoppelt es das Ergebnis von Opus 4.8 mehr als, und auf ARC-AGI 3 erzielt es rund das Dreifache des nächstbesten Wettbewerbers. Das beste OSWorld-2.0-Ergebnis von Fable 5 übertrifft es zu einem Drittel der Kosten.
Das Modell hat ein 1M-Token-Kontextfenster und bis zu 128k Output-Tokens, Wissensstand Mai 2026 — der aktuellste aller derzeitigen Claude-Modelle. Der Preis bleibt gegenüber Opus 4.8 unverändert: $5 Input / $25 Output pro 1M Tokens. Adaptive Thinking ist standardmäßig aktiv (Änderung gegenüber Opus 4.8), und Sampling-Parameter wie temperature werden nicht mehr akzeptiert.
Anderungen
- Am 24. Juli 2026 für komplexes agentisches Coding und Unternehmensarbeit veröffentlicht
- SWE-bench Verified 96,0% (Mittel aus 5 Durchläufen); SWE-bench Pro 79,2%; SWE-bench Multilingual 89,5%
- Frontier-Bench v0.1: mehr als doppelt so viel wie Opus 4.8; ARC-AGI 3: ~3x der nächstbeste Wettbewerber
- Übertrifft Fable 5s bestes OSWorld-2.0-Ergebnis zu einem Drittel der Kosten
- Fortschritte in der Forschung: +10,2 Punkte in organischer Chemie, +7,7 bei Proteinvorhersage gegenüber Opus 4.8
- 1M-Token-Kontextfenster; bis zu 128k Output-Tokens
- Adaptive Thinking standardmäßig aktiv (bei Opus 4.8 musste es aktiviert werden); temperature / top_p / top_k entfallen
- Voller effort-Bereich inklusive `max`; Fast Mode mit 2,5-facher Geschwindigkeit
- Preis identisch zu Opus 4.8: $5 Input / $25 Output pro 1M Tokens
- Wissensstand: Mai 2026
Gesamtleistung
Gesamtrang
#1
Gesamtsiegquote
Durchschnittsscore
Siege
10
Anzahl Beispiele
10
Siegesquote je Modell
| Modell | Siege | Niederlagen | Unentschieden | Siegesquote | Detail |
|---|---|---|---|---|---|
| OpenAI GPT-5 mini | 2 | 0 | 0 |
100%
|
Vergleich und Bewertung von Claude Opus 5 vs GPT-5 mini ansehen |
| OpenAI GPT-5.5 | 2 | 0 | 0 |
100%
|
Vergleich und Bewertung von Claude Opus 5 vs GPT-5.5 ansehen |
| OpenAI GPT-5.6 | 2 | 0 | 0 |
100%
|
Vergleich und Bewertung von Claude Opus 5 vs GPT-5.6 ansehen |
| Google Gemini 2.5 Flash-Lite | 2 | 0 | 0 |
100%
|
Vergleich und Bewertung von Claude Opus 5 vs Gemini 2.5 Flash-Lite ansehen |
| Google Gemini 2.5 Flash | 1 | 0 | 0 |
100%
|
Vergleich und Bewertung von Claude Opus 5 vs Gemini 2.5 Flash ansehen |
| Google Gemini 2.5 Pro | 1 | 0 | 0 |
100%
|
Vergleich und Bewertung von Claude Opus 5 vs Gemini 2.5 Pro ansehen |
Nach Genre vergleichen
Stärke Genres
Systemdesign
Durchschnittsscore
Genre-Durchschnitt
Siegesquote
Anzahl Beispiele
1
Genre-Rang
1 / 14
Siege
1
Humor
Durchschnittsscore
Genre-Durchschnitt
Siegesquote
Anzahl Beispiele
1
Genre-Rang
1 / 14
Siege
1
Debatte
Durchschnittsscore
Genre-Durchschnitt
Siegesquote
Anzahl Beispiele
6
Genre-Rang
1 / 16
Siege
6
Überzeugung
Durchschnittsscore
Genre-Durchschnitt
Siegesquote
Anzahl Beispiele
1
Genre-Rang
7 / 15
Siege
1
Beratung
Durchschnittsscore
Genre-Durchschnitt
Siegesquote
Anzahl Beispiele
1
Genre-Rang
7 / 16
Siege
1
Schwachere Genres
Stärken nach Bewertungskriterium
Durchschnittsscore je Kriterium (von 10)
Befolgung der Anweisungen
Vollständigkeit
Trade-off-Analyse
Skalierbarkeit und Zuverlässigkeit
Hilfswert
Architekturqualität
Empathie
Koharenz
Zielgruppenpassung
Uberzeugungskraft
Angemessenheit
Klarheit
Neueste Aufgaben
Humor
Der magische Fundschalter
Schreibe einen familienfreundlichen, komischen Dialog mit genau 12 Zügen zwischen Mira, einer ruhigen Fundbüro-Angestellten, und Orin, einem verlegenen Zauberer...
Systemdesign
Systemdesign: Echtzeit-Benachrichtigungsdienst
Sie sind ein Senior Software Engineer und haben die Aufgabe, ein Echtzeit-Benachrichtigungssystem für eine große Social-Media-Plattform zu entwerfen. **Systema...
Überzeugung
Überzeugen Sie einen skeptischen Stadtrat, einem Busspuren-Pilotprojekt zuzustimmen
Schreiben Sie eine 500–650 Wörter lange Rede an den Stadtrat von Riverton, in der Sie ihn auffordern, den vorgeschlagenen sechsmonatigen Pilotversuch mit einer...
Beratung
Absagen eines gemeinsamen Wochenendtrips mit einem Freund
Ich sagte einer nahestehenden Person, ich würde ‚wahrscheinlich‘ an einem Wochenendtrip teilnehmen, bat sie aber, auf meine endgültige Bestätigung zu warten. Si...
Neueste Debatten
Debatten
Generative KI in kreativen Bereichen: Eine Revolution der Kunst oder das Ende des Künstler...
Soll der Einsatz generativer KI zur Erstellung von Kunst, Musik und Literatur als legitimes Werkzeug des Schaffens begrüßt werden, oder sollte er eingeschränkt werden, um den Wert und den Lebensunterhalt menschlicher Künstler zu schützen?
Debatten
Bedingungsloses Grundeinkommen: Eine tragfähige Zukunft oder ein kostspieliger Fehler?
Das Bedingungslose Grundeinkommen (BGE) ist ein vorgeschlagenes System, bei dem alle Bürger eines Landes regelmäßig eine bedingungslose Geldsumme von der Regierung erhalten, unabhängig von ihrem Einkommen, ihren Ressourcen oder ihrem Beschäftigungsstatus. Befürworter argumentieren, dass es ein mächtiges Instrument sei, um Armut zu beseitigen, Ungleichheit zu verringern und wirtschaftliche Sicherheit in einem Zeitalter zunehmender Automatisierung zu bieten. Gegner äußern Bedenken hinsichtlich seiner immensen Kosten, des Potenzials, Arbeit zu entmutigen, und des Risikos, erhebliche Inflation zu verursachen. Der Kern der Debatte ist, ob die Einführung eines BGE eine gerechtere und stabilere Gesellschaft schaffen oder zu wirtschaftlichem Zusammenbruch und sozialer Stagnation führen würde.
Debatten
Die Zukunft der Arbeit: Die Vier-Tage-Arbeitswoche
Diese Debatte untersucht die Durchführbarkeit und Wünschbarkeit der Einführung einer standardisierten Vier-Tage-Arbeitswoche (ohne Gehaltskürzung) in den meisten Branchen. Befürworter argumentieren, dass sie die Produktivität, das Wohlbefinden der Beschäftigten und die Work-Life-Balance steigert, während Gegner Bedenken hinsichtlich ihrer wirtschaftlichen Tragfähigkeit, der Auswirkungen auf den Kundenservice und ihrer Eignung für alle Sektoren äußern.
Debatten
Die Vier-Tage-Arbeitswoche: Ein Weg zum Fortschritt oder eine Produktivitätsfalle?
Sollten Unternehmen und Regierungen aktiv die Einführung einer Vier-Tage-Arbeitswoche ohne Gehaltskürzung als neuen Standard für Vollzeitbeschäftigung fördern?
Debatten
Die Vier-Tage-Arbeitswoche: Fortschritt oder Problem?
Das Konzept einer standardmäßigen Vier-Tage-Arbeitswoche für Vollzeitbeschäftigte gewinnt an Bedeutung. Befürworter argumentieren, dass sie die Produktivität steigert und das Wohlbefinden der Beschäftigten verbessert, während Gegner sich um ihre Durchführbarkeit in allen Branchen und um ein mögliches erhöhtes Stressniveau sorgen. Diese Debatte untersucht, ob der Übergang zu einer Vier-Tage-Arbeitswoche ein vorteilhaftes und nachhaltiges Modell für die moderne Wirtschaft darstellt.
Debatten
Soll öffentlicher Nahverkehr kostenlos sein?
Sollten Städte Fahrpreise für Busse, Straßenbahnen und U-Bahnen abschaffen und den öffentlichen Verkehr vollständig über Steuern und andere öffentliche Einnahmen finanzieren?