Claude Opus 5
Explorez les scores de benchmark, points forts par genre, limites et exemples récents de Claude Opus 5.
Aperçu du modèle
Publié
2026-07-24
Entrée
$5.00 / 1M
Sortie
$25.00 / 1M
Claude Opus 5, publié le 24 juillet 2026, est le modèle d'Anthropic pour le codage agentique complexe et le travail en entreprise. Sur Orivel, il reprend la place équilibrée d'Anthropic occupée par Opus 4.8, au même tarif, sous Claude Fable 5 qui reste le palier frontière.
Anthropic le positionne comme une intelligence proche de Fable 5 à la vitesse et au coût d'Opus. Il obtient 96,0% sur SWE-bench Verified (moyenne sur cinq essais), 79,2% sur SWE-bench Pro et 89,5% sur SWE-bench Multilingual. Sur Frontier-Bench v0.1 il fait plus du double du score d'Opus 4.8, et sur ARC-AGI 3 environ trois fois celui du concurrent suivant. Il dépasse le meilleur résultat de Fable 5 sur OSWorld 2.0 pour un tiers du coût.
Le modèle offre un contexte de 1M tokens et jusqu'à 128k tokens de sortie, avec une date de coupe des connaissances en mai 2026 — la plus récente des modèles Claude actuels. Le tarif est inchangé par rapport à Opus 4.8 : $5 entrée / $25 sortie par 1M tokens. L'adaptive thinking est actif par défaut (changement par rapport à Opus 4.8) et les paramètres d'échantillonnage comme temperature ne sont plus acceptés.
Changements
- Publié le 24 juillet 2026 pour le codage agentique complexe et le travail en entreprise
- SWE-bench Verified 96,0% (moyenne sur 5 essais) ; SWE-bench Pro 79,2% ; SWE-bench Multilingual 89,5%
- Frontier-Bench v0.1 : plus du double d'Opus 4.8 ; ARC-AGI 3 : ~3x le concurrent suivant
- Dépasse le meilleur résultat de Fable 5 sur OSWorld 2.0 pour un tiers du coût
- Gains en recherche scientifique : +10,2 points en chimie organique, +7,7 en prédiction de protéines face à Opus 4.8
- Contexte 1M tokens ; jusqu'à 128k tokens de sortie
- Adaptive thinking actif par défaut (Opus 4.8 exigeait de l'activer) ; temperature / top_p / top_k ne sont plus acceptés
- Gamme complète d'effort jusqu'à `max` ; fast mode à 2,5x la vitesse
- Tarif identique à Opus 4.8 : $5 entrée / $25 sortie par 1M tokens
- Date de coupe des connaissances : mai 2026
Performance globale
Classement général
#1
Taux de victoire global
Score moyen
Victoires
10
Nombre d’exemples
10
Taux de victoire par modèle
| Modèle | Victoires | Défaites | Nuls | Taux de victoire | Détail |
|---|---|---|---|---|---|
| OpenAI GPT-5 mini | 2 | 0 | 0 |
100%
|
Voir la comparaison et l’évaluation de Claude Opus 5 vs GPT-5 mini |
| OpenAI GPT-5.5 | 2 | 0 | 0 |
100%
|
Voir la comparaison et l’évaluation de Claude Opus 5 vs GPT-5.5 |
| OpenAI GPT-5.6 | 2 | 0 | 0 |
100%
|
Voir la comparaison et l’évaluation de Claude Opus 5 vs GPT-5.6 |
| Google Gemini 2.5 Flash-Lite | 2 | 0 | 0 |
100%
|
Voir la comparaison et l’évaluation de Claude Opus 5 vs Gemini 2.5 Flash-Lite |
| Google Gemini 2.5 Flash | 1 | 0 | 0 |
100%
|
Voir la comparaison et l’évaluation de Claude Opus 5 vs Gemini 2.5 Flash |
| Google Gemini 2.5 Pro | 1 | 0 | 0 |
100%
|
Voir la comparaison et l’évaluation de Claude Opus 5 vs Gemini 2.5 Pro |
Comparer par genre
Genres forts
Conception de systèmes
Score moyen
Moyenne du genre
Taux de victoire
Nombre d’exemples
1
Classement par genre
1 / 14
Victoires
1
Humour
Score moyen
Moyenne du genre
Taux de victoire
Nombre d’exemples
1
Classement par genre
1 / 14
Victoires
1
Débat
Score moyen
Moyenne du genre
Taux de victoire
Nombre d’exemples
6
Classement par genre
1 / 16
Victoires
6
Persuasion
Score moyen
Moyenne du genre
Taux de victoire
Nombre d’exemples
1
Classement par genre
7 / 15
Victoires
1
Accompagnement
Score moyen
Moyenne du genre
Taux de victoire
Nombre d’exemples
1
Classement par genre
7 / 16
Victoires
1
Genres plus faibles
Forces par critère d’évaluation
Score moyen par critère (sur 10)
Respect des consignes
Complétude
Analyse des compromis
Scalabilité et fiabilité
Utilité
Qualité de l’architecture
Empathie
Cohérence
Adéquation au public
Force de persuasion
Pertinence
Clarté
Tâches récentes
Humour
Le bureau des objets trouvés magiques
Écrivez un dialogue comique adapté à la famille de exactement 12 répliques entre Mira, une commise des objets trouvés calme, et Orin, un sorcier paniqué. Orin t...
Conception de systèmes
Conception du système : Service de notifications en temps réel
Vous êtes un ingénieur logiciel senior chargé de concevoir un système de notifications en temps réel pour une grande plateforme de médias sociaux. **Exigences...
Persuasion
Persuader un conseil municipal sceptique d'approuver un projet pilote de voie réservée aux bus
Rédigez un discours de 500–650 mots au conseil municipal de Riverton pour l'inciter à approuver le projet pilote proposé de voie réservée aux bus d'une durée de...
Accompagnement
Se désister d'un week-end entre amis
J'ai dit à un(e) ami(e) proche que je « probablement » participerais à un week-end, mais je lui ai demandé d'attendre ma confirmation finale. Ils ont quand même...
Débats récents
Débats
IA générative dans les domaines créatifs : une révolution artistique ou la fin de l'artist...
L'utilisation de l'IA générative pour créer de l'art, de la musique et de la littérature doit-elle être adoptée comme un outil légitime de création, ou doit-elle être restreinte pour protéger la valeur et les moyens de subsistance des artistes humains ?
Débats
Revenu de base universel : un avenir viable ou une erreur coûteuse ?
Le Revenu de base universel (UBI) est un système proposé dans lequel tous les citoyens d'un pays reçoivent régulièrement une somme d'argent inconditionnelle de la part du gouvernement, indépendamment de leurs revenus, de leurs ressources ou de leur statut professionnel. Ses partisans soutiennent que c'est un outil puissant pour éliminer la pauvreté, réduire les inégalités et assurer une sécurité économique à l'ère d'une automatisation croissante. Les opposants soulèvent des inquiétudes concernant son coût immense, son potentiel à décourager le travail et le risque d'entraîner une inflation significative. Le débat central porte sur la question de savoir si la mise en œuvre d'un UBI créerait une société plus équitable et stable ou conduirait à l'effondrement économique et à la stagnation sociale.
Débats
L'avenir du travail : la semaine de travail de quatre jours
Ce débat explore la faisabilité et la désirabilité de la mise en place d'une semaine de travail standardisée de quatre jours (sans réduction de salaire) dans la plupart des industries. Les partisans soutiennent que cela augmente la productivité, le bien-être des employés et l'équilibre vie professionnelle/vie privée, tandis que les opposants soulèvent des inquiétudes quant à sa viabilité économique, son impact sur le service client et son adéquation à tous les secteurs.
Débats
La semaine de travail de quatre jours : une voie vers le progrès ou un piège pour la produ...
Les entreprises et les gouvernements devraient-ils promouvoir activement l'adoption d'une semaine de travail de quatre jours, sans réduction de salaire, comme nouvelle norme pour l'emploi à temps plein ?
Débats
La semaine de travail de quatre jours : progrès ou problème ?
Le concept d'une semaine de travail standard de quatre jours pour les employés à temps plein gagne du terrain. Les partisans soutiennent qu'elle augmente la productivité et améliore le bien-être des employés, tandis que les opposants s'inquiètent de sa faisabilité dans tous les secteurs et de son potentiel à accroître le stress. Ce débat explore si la transition vers une semaine de travail de quatre jours est un modèle bénéfique et durable pour l'économie moderne.
Débats
Les transports publics devraient-ils être gratuits ?
Les villes devraient-elles supprimer les tarifs des bus, trams et métros, finançant les transports publics entièrement par les impôts et autres recettes publiques ?