Orivel Orivel
Menue oeffnen

GPT-5.5

Entdecke Benchmark-Scores, Genre-Stärken, Schwächen und aktuelle Beispiele für GPT-5.5.

Modellubersicht

Anbieter: OpenAI · gpt-5.5

Veroffentlicht

2026-04-23

Kontext

1M Tokens

Input

$5.00 / 1M

Output

$30.00 / 1M

Am 23. April 2026 veröffentlicht, war GPT-5.5 OpenAIs Flaggschiff, bis GPT-5.6 (Sol) am 9. Juli 2026 übernahm; auf Orivel ist es nun die ausgewogene OpenAI-Option. GPT-5.5 ist auf agentische Arbeit zugeschnitten: langlaufendes Coding, Computer-Nutzung, Web-Recherche und Tool-übergreifende Task-Ausführung stehen im Fokus.

Gegenüber GPT-5.4 sind die Verbesserungen in Software-Engineering (SWE-Bench Pro 58.6% end-to-end in einem Durchgang, Expert-SWE 73.1% bei ~20-Stunden-Tasks) und in der Bedienung realer Software (Terminal-Bench 2.0 82.7%, OSWorld-Verified 78.7%) sichtbar. Tau2-bench Telecom erreicht 98.0% ohne Prompt-Tuning.

Das Modell bringt 1M-Token-Kontext in den Responses- und Chat-Completions-APIs mit, 128k maximale Ausgabe, und eine Preisgestaltung, die den Output-Tarif von 5.4 verdoppelt ($5 Input / $30 Output pro 1M Tokens). Eine höher genaue `gpt-5.5-pro`-Variante existiert separat zu Premium-Preisen; Orivel nutzt nur das Standard-`gpt-5.5`.

Anderungen

  • Veröffentlicht am 23. April 2026 als Nachfolger von GPT-5.4
  • Fokus: agentisches Coding und langlaufende Task-Ausführung
  • SWE-Bench Pro 58.6% — mehr Tasks end-to-end in einem Durchgang gelöst
  • Expert-SWE 73.1% bei Aufgaben mit ~20 Stunden menschlicher Bearbeitungszeit
  • Terminal-Bench 2.0 82.7%, OSWorld-Verified 78.7%, Tau2-bench Telecom 98.0%, GDPval 84.9%
  • 1M-Token-Kontext in der API (400K in Codex); 128k maximale Ausgabe
  • Preis: $5 Input / $30 Output pro 1M Tokens — ca. 2× der Output-Tarif von GPT-5.4
  • Batch/Flex zu 50% des Standards; Priority zu 2,5× des Standards
  • Wissensstand unverändert gegenüber GPT-5.4
Offizielle Ankundigung

Gesamtleistung

Gesamtrang

#5

Gesamtsiegquote

62%

Durchschnittsscore

85

Siege

32

Anzahl Beispiele

52

Siegesquote je Modell

Nach Genre vergleichen

Starken nach Bewertungskriterium

Durchschnittsscore je Kriterium (von 10)

Menge

94 9 Stichproben

Sicherheit

92 9 Stichproben

Korrektheit

91 21 Stichproben

Tiefe

91 3 Stichproben

Architekturqualitat

91 3 Stichproben

Befolgung der Anweisungen

90 24 Stichproben

Skalierbarkeit und Zuverlassigkeit

90 3 Stichproben

Stilqualitat

90 3 Stichproben

Empathie

90 9 Stichproben

Vollstandigkeit

90 30 Stichproben

Vielfalt

89 12 Stichproben

Hilfswert

89 9 Stichproben

Neueste Aufgaben

Brainstorming

OpenAI GPT-5.5 VS Anthropic Claude Fable 5

Brainstorming nachhaltiger Initiativen für urbane Landwirtschaft

Erstellen Sie eine Liste von mindestens 10 innovativen und praxisnahen Initiativen zur Förderung nachhaltiger urbaner Landwirtschaft in einer mittelgroßen Stadt...

121
08 Jul 2026 09:39

Geschäftstexte

OpenAI GPT-5.5 VS Anthropic Claude Fable 5

Internes Memo: Ankündigung der neuen hybriden Arbeitsregelung

Sie sind Manager der Marketingabteilung eines Technologieunternehmens namens 'Innovate Inc.'. Ihr Unternehmen stellt das bisherige vollständig remote basierte A...

126
05 Jul 2026 09:38

Planung

OpenAI GPT-5.5 VS Anthropic Claude Fable 5

Eine Gartenparty im Gemeinschaftsgarten planen

Sie sind die leitende Organisatorin/der leitende Organisator für eine Gartenparty im Gemeinschaftsgarten. Ihr Ziel ist es, in genau vier Wochen eine erfolgreich...

119
04 Jul 2026 09:41

Erklärung

Google Gemini 2.5 Flash-Lite VS OpenAI GPT-5.5

Erkläre einem neugierigen 12-Jährigen, warum Impfungen Fieber verursachen können

Schreibe eine Erklärung, die sich an ein neugieriges 12-jähriges Kind richtet, das gerade eine Impfung bekommen hat und verwirrt ist, warum es sich jetzt fiebri...

131
01 Jul 2026 09:41

Bildungsfragen

OpenAI GPT-5.5 VS Anthropic Claude Opus 4.8

Physikaufgabe: Die Zeitverzerrung der Standuhr

Eine Standuhr verwendet ein Pendel aus Messing zur Zeitmessung und ist so kalibriert, dass sie bei einer Raumtemperatur von 20,0 °C vollkommen genau geht. Währe...

147
28 Jun 2026 09:40

Brainstorming

OpenAI GPT-5.5 VS Anthropic Claude Opus 4.8

Nachhaltiger Pendelverkehrsplan für eine mittelgroße Stadt

Erarbeiten Sie eine umfassende Liste innovativer und praktischer Lösungen zur Verbesserung umweltfreundlicher Pendelmöglichkeiten in einer mittelgroßen Stadt. I...

137
21 Jun 2026 09:39

Planung

OpenAI GPT-5.5 VS Anthropic Claude Opus 4.8

Aktionsplan für den Gemeindereinigungstag

Sie sind die Hauptorganisatorin/der Hauptorganisator der 'Greenwood Neighborhood Association'. Ihre Aufgabe ist es, einen detaillierten Aktionsplan für eine Ver...

175
17 Jun 2026 09:42

Programmierung

OpenAI GPT-5.5 VS Anthropic Claude Fable 5

Implementieren Sie einen auf Abhängigkeiten basierenden Aufgabenplaner in Python

Schreiben Sie eine Python-Funktion oder -Klasse, die eine Liste von Aufgaben basierend auf ihren Abhängigkeiten plant. Der Scheduler soll die Reihenfolge bestim...

194
12 Jun 2026 09:39

Neueste Debatten

Debatten

OpenAI GPT-5.5 VS Anthropic Claude Opus 4.8

Kernenergie: Eine saubere Energielösung oder ein radioaktives Glücksspiel?

Während die Welt mit der dringenden Notwendigkeit kämpft, sich von fossilen Brennstoffen zu verabschieden, um den Klimawandel zu bekämpfen, wird die Kernenergie oft als leistungsfähige, CO₂-freie Alternative dargestellt. Diese Debatte wägt die Vorteile der Kernenergie als zuverlässige, leistungsstarke Energiequelle gegen die erheblichen Risiken ab, einschließlich der langfristigen Lagerung radioaktiver Abfälle, des Potenzials für katastrophale Unfälle wie Tschernobyl und Fukushima sowie der Bedenken hinsichtlich der Weiterverbreitung von Kerntechnologie.

146
01 Jul 2026 14:41

Debatten

Anthropic Claude Opus 4.8 VS OpenAI GPT-5.5

Das Recht auf Reparatur: Verbraucher stärken oder Innovation untergraben?

Die Bewegung "Recht auf Reparatur" setzt sich für Gesetze ein, die Hersteller verpflichten, Verbrauchern und unabhängigen Reparaturwerkstätten die Teile, Werkzeuge und Informationen zur Verfügung zu stellen, die nötig sind, um ihre eigenen elektronischen Geräte zu reparieren. Befürworter argumentieren, dass dies den Elektroschrott reduziert, Verbrauchern Geld spart und eine nachhaltigere Wirtschaft fördert. Gegner, hauptsächlich Hersteller, behaupten, dass dies die Sicherheit der Geräte, die Datensicherheit und ihr geistiges Eigentum gefährden und möglicherweise Innovationen ersticken könnte.

162
25 Jun 2026 14:49

Debatten

Anthropic Claude Opus 4.8 VS OpenAI GPT-5.5

Mars-Kolonisierung: Der nächste gewaltige Sprung der Menschheit oder die größte Ablenkung...

Diese Diskussion untersucht, ob die Menschheit erhebliche Ressourcen in die Errichtung einer dauerhaften, sich selbst erhaltenden Kolonie auf dem Mars investieren sollte. Die Debatte wägt die potenziellen langfristigen Überlebensvorteile für die Menschheit gegen die unmittelbaren und drängenden Probleme auf der Erde ab, die mit denselben Ressourcen angegangen werden könnten.

194
15 Jun 2026 14:38

Debatten

Anthropic Claude Opus 4.8 VS OpenAI GPT-5.5

Standardisierte Tests in Schulen: Ein faires Maß für Leistung oder ein veraltetes Hinderni...

Standardisierte Tests, wie der SAT, ACT und verschiedene landesweite Prüfungen, sind seit langem ein Grundpfeiler des Bildungssystems und werden zur Beurteilung von Schülerinnen und Schülern, zur Evaluation von Schulen und für die Zulassung zu Hochschulen verwendet. Befürworter argumentieren, dass sie einen objektiven Maßstab zur Messung akademischer Leistungen über unterschiedliche Bevölkerungsgruppen hinweg bieten. Kritiker hingegen behaupten, dass diese Tests kulturell voreingenommen sind, Studierende aus privilegierten Verhältnissen begünstigen und die wahren Fähigkeiten oder das Potenzial eines Schülers nicht erfassen, was Forderungen nach ihrer Abschaffung zugunsten ganzheitlicherer Bewertungsmethoden ausgelöst hat. Die Debatte dreht sich darum, ob standardisierte Tests ein unverzichtbares Instrument für Rechenschaftspflicht und Meritokratie sind oder ein diskriminierendes System, das Ungleichheit fortschreibt.

274
03 Jun 2026 14:38

Debatten

Anthropic Claude Opus 4.8 VS OpenAI GPT-5.5

Die Vier-Tage-Arbeitswoche: Eine Revolution für die Work-Life-Balance oder ein logistische...

Das Konzept einer standardmäßigen Vier-Tage-Arbeitswoche, ohne Gehaltskürzung, gewinnt weltweit an Bedeutung als Mittel zur Verbesserung des Wohlbefindens der Mitarbeitenden und der Produktivität. Die Debatte fragt, ob dieses Modell eine nachhaltige und vorteilhafte Weiterentwicklung des modernen Arbeitsplatzes ist oder ein unpraktischer Idealismus, der für Unternehmen und die Wirtschaft mehr Probleme schafft, als er löst.

288
31 May 2026 14:38

Debatten

Anthropic Claude Opus 4.8 VS OpenAI GPT-5.5

Universelles Grundeinkommen: Ein Weg zum Wohlstand oder zum wirtschaftlichen Ruin?

Sollten Regierungen ein Universelles Grundeinkommen (UBI) einführen, das jedem erwachsenen Bürger eine regelmäßige, bedingungslose Zahlung gewährt, die ausreicht, um die grundlegenden Lebenshaltungskosten zu decken, unabhängig von seinem Beschäftigungsstatus?

297
29 May 2026 00:05

Debatten

OpenAI GPT-5.5 VS Anthropic Claude Haiku 4.5

Die Einführung ganzjähriger Schulkalender

Diese Debatte betrifft, ob K-12-Schulbezirke vom traditionellen neunmonatigen Schuljahr mit einer langen Sommerferienzeit auf ein ganzjähriges Modell umstellen sollten. Ganzjähriger Schulbetrieb beinhaltet die gleiche Anzahl an Unterrichtstagen, verteilt über das gesamte Jahr mit kürzeren, dafür häufigeren Pausen. Befürworter glauben, dass dieses System das 'summer slide' — den Lernverlust, den Schüler während der langen Sommerferien erleben — verhindert und eine kontinuierlichere Unterrichtsfolge ermöglicht. Gegner argumentieren, dass es das Familienleben stört, die Kinderbetreuung komplizierter macht, die Möglichkeiten für Sommerfreizeiten und -jobs einschränkt und zu Burnout bei Lehrkräften und Schülern führen kann.

280
26 May 2026 14:38

Debatten

Anthropic Claude Opus 4.7 VS OpenAI GPT-5.5

KI als primäres Einstellungsinstrument

Sollten Unternehmen erlaubt sein, Algorithmen der künstlichen Intelligenz (KI) als primäres Instrument zur Vorauswahl, Shortlist-Erstellung und Auswahl von Bewerberinnen und Bewerbern für eine Anstellung zu verwenden?

342
25 May 2026 14:38

Verwandte Links

X f L