Orivel Orivel
Ouvrir le menu

Programmation

Compare la justesse, la qualité et l’utilité pratique du code généré.

Dans ce genre, les capacités surtout observées sont Exactitude, Complétude, Qualité du code.

Contrairement à system design, ce genre regarde davantage si le code fonctionne réellement que les choix d’architecture de haut niveau.

Un score élevé ici ne garantit ni meilleur jugement produit, ni meilleure architecture, ni meilleures explications pour débutants.

Usages adaptés aux modèles forts dans ce genre

implémentation, débogage, refactorisation et aide pratique à la programmation.

Ce que ce genre ne permet pas de juger à lui seul

si le modèle est meilleur pour l’architecture, les documents pour parties prenantes ou l’idéation ouverte.

Analyse des données

Programmation : Claude Fable 5 débute au sommet, GPT-5 mini reste le choix le plus défendable

24 réponses évaluées Programmation Mis à jour le 2026/8/20
1
Claude Fable 5

Anthropic

91
Score moyen
100%
Taux de victoire
1 fois 1er 1 échantillons
2
GPT-5.6

OpenAI

86
Score moyen
100%
Taux de victoire
2 fois 1er 2 échantillons
3
GPT-5 mini

OpenAI

82
Score moyen
100%
Taux de victoire
5 fois 1er 5 échantillons

Score moyen par modèle

1 Claude Fable 5
9.06
2 GPT-5.6
8.63
3 GPT-5 mini
8.22
4 GPT-5.5
8.90
5 Claude Sonnet 5
8.29
6 Gemini 2.5 Pro
7.35
7 Gemini 2.5 Flash-Lite
7.17
8 Gemini 2.5 Flash
6.84

Notre pondération

Exactitude 35% Complétude 20% Qualité du code 20% Valeur pratique 15% Respect des consignes 10%

Claude Fable 5 est arrivé dans ce genre et a immédiatement pris la première place, remportant son duel inaugural avec la meilleure prestation du tableau. GPT-5.6 a lui aussi gagné tout ce qu’il a disputé jusqu’ici. Ces deux bilans sont à la fois impressionnants et minces : un début victorieux prouve qu’un modèle peut gagner ici, pas qu’il continuera. L’ordre exact tout en haut doit se lire comme un signal précoce.

Le bilan le plus défendable du genre appartient à GPT-5 mini : il a affronté plus de sujets de programmation que n’importe lequel des leaders et n’en a perdu aucun. Pour un modèle de gamme légère, une série sans défaite face à des adversaires de pointe est la meilleure histoire de rapport qualité-prix de ce tableau. GPT-5.5, à l’inverse, affiche l’une des meilleures moyennes du genre mais a partagé ses duels — du bon code qui n’a pas toujours battu le code d’en face. Claude Sonnet 5 a signé une moyenne solide pour sa première sortie et l’a pourtant perdue : son classement sous-estime pour l’instant la qualité de sa production.

La justesse domine l’évaluation, suivie de la complétude et de la qualité du code — le classement sanctionne les bugs discrets plus durement que le style. La famille Gemini n’a encore converti aucun duel dans ce genre et ferme aussi la marche en moyenne. Tout cela reflète les tâches et juges propres à Orivel : la programmation va des algorithmes au design d’API, et une poignée de sujets ne peut couvrir cet espace.

En bref

GPT-5 mini est le choix défendable aujourd’hui — invaincu sur le plus grand nombre de duels, au coût d’une gamme légère. Claude Fable 5 et GPT-5.6 semblent encore plus forts, mais sur des preuves précoces. À suivre : GPT-5.5 transformera-t-il ses réponses de qualité en victoires ?

Cette analyse s’appuie sur les scores de benchmark mesurés par Orivel pour ce genre et est mise à jour périodiquement. Les scores sont des mesures dépendantes des conditions, pas une vérité absolue.

Classement des modèles forts dans ce genre

Ce classement est trié par score moyen uniquement dans ce genre.

Dernière mise à jour: 25 Jul 2026 01:19

#1
Claude Fable 5 Anthropic

Taux de victoire

100%

Score moyen

91
#2
GPT-5.6 OpenAI

Taux de victoire

100%

Score moyen

86
#3
GPT-5 mini OpenAI

Taux de victoire

100%

Score moyen

82
#4
GPT-5.5 OpenAI

Taux de victoire

50%

Score moyen

89
#5
Claude Sonnet 5 Anthropic

Taux de victoire

0%

Score moyen

83
#6
Gemini 2.5 Pro Google

Taux de victoire

0%

Score moyen

74
#7
Gemini 2.5 Flash-Lite Google

Taux de victoire

0%

Score moyen

72
#8
Gemini 2.5 Flash Google

Taux de victoire

0%

Score moyen

68

Ce qui est évalué dans Programmation

Critères et poids utilisés pour ce classement par genre.

Exactitude

35.0%

Ce critère est présent pour vérifier Exactitude dans la réponse. Il a plus de poids parce que cet aspect influence fortement le résultat global de ce genre.

Complétude

20.0%

Ce critère est présent pour vérifier Complétude dans la réponse. Il garde un poids important parce qu’il change visiblement la qualité, même si ce n’est pas le seul élément qui compte.

Qualité du code

20.0%

Ce critère est présent pour vérifier Qualité du code dans la réponse. Il garde un poids important parce qu’il change visiblement la qualité, même si ce n’est pas le seul élément qui compte.

Valeur pratique

15.0%

Ce critère est présent pour vérifier Valeur pratique dans la réponse. Il est plus légèrement pondéré parce qu’il soutient l’objectif principal sans définir à lui seul le genre.

Respect des consignes

10.0%

Ce critère est présent pour vérifier Respect des consignes dans la réponse. Il est plus légèrement pondéré parce qu’il soutient l’objectif principal sans définir à lui seul le genre.

Tâches récentes

Programmation

Anthropic Claude Sonnet 5 VS OpenAI GPT-5.6

Analyseur de journaux de serveur Web

Écrivez une fonction Python analyze_logs(log_data) qui prend une chaîne multilignes contenant des entrées de journaux (logs) de serveur Web. La fonction doit analyser ces journaux, effectuer une analyse et renvoyer un dictionnaire résumant les résultats. Chaque ligne de journal valide suit ce format : [TIMESTAMP] LEVEL IP_ADDRESS "REQUEST_METHOD /path" RESPONSE_CODE BYTES_SENT Exemple d'une ligne valide : [2023-10-27T10:00:00Z] INFO 192.168.1.1 "GET /index.html" 200 1543 Votre fonction doit : Analyser uniquement les lignes de journal valides, en ignorant proprement toute ligne malformée ou vide. Calculer les métriques suivantes : total_requests : le nombre total d'entrées de journal valides. error_rate : le pourcentage de requêtes dont le LEVEL est ERROR, arrondi à deux décimales. top_3_ips : une liste de tuples, chaque tuple contenant une adresse IP et son nombre de requêtes, pour les 3 adresses IP les plus fréquentes. La liste doit être triée par ordre décroissant du nombre de requêtes. busiest_hour : l'heure de la journée (un entier de 0 à 23) qui a enregistré le plus de requêtes. Le timestamp est au format ISO 8601 (UTC). Renvoyer un dictionnaire avec les clés total_requests, error_rate, top_3_ips et busiest_hour contenant les valeurs calculées. Traitez les cas limites suivants : Si la chaîne d'entrée log_data est vide, renvoyer un dictionnaire avec des valeurs mises à zéro ou vides selon le cas (par ex., total_requests: 0, top_3_ips: []). S'il y a moins de 3 adresses IP uniques, la liste top_3_ips doit contenir toutes les IPs uniques, triées par nombre de requêtes. S'il y a égalité pour l'heure la plus chargée, il est acceptable de renvoyer n'importe laquelle des heures à égalité.

262
25 Jul 2026 01:19

Programmation

OpenAI GPT-5.6 VS Google Gemini 2.5 Pro

Limiteur de débit avec fenêtre glissante et quotas multi‑locataires équitables

Implémentez une bibliothèque de limitation de débit réutilisable dans un langage de votre choix (Python, Go, TypeScript, Java ou Rust) qui applique des quotas de requêtes par client en utilisant un algorithme à fenêtre glissante, ainsi qu'une politique de partage équitable entre plusieurs locataires. Exigences fonctionnelles: Fournir une classe ou un module avec une méthode telle que allow(tenant_id, client_id, now_ms) qui retourne si une requête est autorisée et, lorsqu'elle est refusée, combien de millisecondes il reste avant que la prochaine requête soit autorisée (retry_after_ms). Chaque client est limité à un nombre maximal de requêtes dans une fenêtre temporelle roulante (par exemple, 100 requêtes par 60,000 ms). La configuration doit être ajustable par locataire. Implémenter une véritable fenêtre glissante (pondérée ou basée sur un log), pas une fenêtre par buckets calendaire fixe, de sorte que les rafales traversant les frontières de buckets soient traitées correctement. Ajouter un plafond global par locataire de sorte que tous les clients d'un locataire combinés ne puissent pas dépasser un plafond au niveau du locataire, et lorsque le locataire est saturé, la capacité restante soit partagée équitablement entre les clients actifs plutôt que monopolisée par un seul client. Le limiteur doit être sûr en cas d'accès concurrent depuis plusieurs threads ou tâches asynchrones. La mémoire ne doit pas croître de façon illimitée : l'état des clients obsolètes doit être évincé ou compacté au fil du temps. Livrables: L'implémentation complète avec une API publique claire et une documentation inline des décisions clés. Une brève explication (en commentaires ou une courte section en prose) de l'algorithme à fenêtre glissante que vous avez choisi et ses compromis précision/mémoire. Une suite de tests couvrant les principaux cas limites décrits ci-dessous. Cas limites à traiter explicitement dans le code et les tests: Requêtes exactement à la frontière de la fenêtre. Un client qui devient inactif puis revient après que la fenêtre ait entièrement expiré. Requêtes concurrentes qui se font concurrence sur le même compteur client. Horloge qui recule ou timestamps dupliqués. Saturation du locataire et redistribution équitable entre clients concurrents. Éviction de l'état client obsolète sans supprimer les clients actifs. Indiquez toutes les hypothèses que vous faites (processus unique vs distribué, disponibilité d'une horloge monotone, etc.). Si vous supposez un processus unique, décrivez brièvement comment le design s'étendrait à un déploiement distribué.

269
16 Jul 2026 09:49

Programmation

Anthropic Claude Opus 4.8 VS Google Gemini 2.5 Flash

Implémenter un simulateur déterministe de carnet d'ordres limite

Écrivez une solution Python 3.11 en un seul fichier implémentant la fonction process_events(events: list[dict]) -> dict. N'utilisez pas de paquets externes. La fonction doit simuler le carnet d'ordres limite d'une petite bourse pour un seul instrument. Elle reçoit une liste de dictionnaires d'événements dans l'ordre d'entrée et retourne un dictionnaire contenant exactement ces clés : trades, rejected, book. Types d'événements : Événement nouvel ordre : Champs requis : type="new", id, side, order_type, qty. side est "buy" ou "sell". order_type est "limit" ou "market". qty est un entier positif. Un ordre limite requiert également price, un nombre entier positif de cents. Champ optionnel tif est le time-in-force : "GTC", "IOC" ou "FOK". S'il est absent, utilisez "GTC" pour les ordres limit et "IOC" pour les ordres market. Les ordres market ne peuvent pas avoir tif="GTC" et ne peuvent pas rester sur le livre. Événement d'annulation : Champs requis : type="cancel", id. Il annule la quantité restante d'un ordre actuellement en attente sur le livre ayant cet id. Règles d'appariement : Le livre contient bids et asks. Les ordres buy limit en attente sont des bids ; les ordres sell limit en attente sont des asks. La priorité prix-temps est obligatoire : meilleur prix d'abord ; pour un même prix, l'ordre en attente accepté plus tôt passe en premier. Un ordre buy s'apparie aux asks en attente tant qu'il peut croiser : un market buy croise n'importe quel ask ; un limit buy croise les asks dont le prix ask <= prix limite buy. Un ordre sell s'apparie aux bids en attente tant qu'il peut croiser : un market sell croise n'importe quel bid ; un limit sell croise les bids dont le prix bid >= prix limite sell. La quantité de chaque trade est min(quantité restante de l'ordre entrant, quantité restante de l'ordre en attente). Le prix du trade est toujours le prix limite de l'ordre maker en attente, jamais le prix de l'ordre entrant. Un enregistrement de trade doit être ajouté immédiatement lorsqu'il se produit, avec exactement ces clés : buy_id, sell_id, price, qty, taker_id, maker_id. Les ordres en attente partiellement exécutés conservent leur priorité d'origine avec la quantité restante. Les ordres entièrement exécutés quittent le livre. Comportement du time-in-force : Les ordres limit GTC restent, pour tout reste non exécuté, sur le livre. Les ordres IOC s'exécutent autant que possible immédiatement, puis annulent tout reste. Les ordres FOK doivent être entièrement exécutables immédiatement selon le livre courant et les règles de croisement. Sinon, ils ne produisent aucun trade et ne changent pas le livre. S'ils sont entièrement exécutables, exécutez-les normalement. Les ordres FOK ne restent jamais sur le livre. Règles de validation et de rejet : Si un événement est mal formé, rejetez-le sans modifier le livre. Ajoutez un enregistrement de rejet à rejected avec les clés input_index, event, reason. La raison peut être une courte chaîne lisible par un humain. Rejetez un nouvel ordre si son id est déjà utilisé par un nouvel ordre précédemment accepté, même si cet ordre antérieur a depuis été exécuté ou annulé. Rejetez les événements cancel pour des ids inconnus ou des ids qui ne sont plus en attente. Rejetez les qty et price non entiers, nuls ou négatifs. En Python, bool ne doit pas être accepté comme entier pour ces champs. Ignorez les champs supplémentaires sur des événements autrement valides. Format de retour : trades : liste d'enregistrements de trade dans l'ordre d'exécution. rejected : liste d'enregistrements de rejet dans l'ordre d'entrée. book : un dictionnaire avec les clés bids et asks. book["bids"] doit lister tous les bids en attente triés par prix décroissant, puis par temps d'attente original, chacun sous la forme {"id": id, "price": price, "qty": remaining_qty}. book["asks"] doit lister tous les asks en attente triés par prix croissant, puis par temps d'attente original, chacun sous la forme {"id": id, "price": price, "qty": remaining_qty}. Votre réponse doit être un code Python exécutable complet définissant process_events. Vous pouvez inclure des classes/fonctions helper et une petite section d'auto-test protégée par if name == "main":, mais la fonction principale ne doit pas lire depuis stdin ni écrire sur stdout.

294
29 Jun 2026 09:44

Programmation

Anthropic Claude Opus 4.8 VS Google Gemini 2.5 Pro

Implémenter l'application atomique d'un JSON Patch en Python

Écrivez une implémentation Python 3.11 d'une fonction nommée apply_json_patch(document, patch) qui applique une séquence d'opérations de type JSON Patch à une valeur compatible JSON et retourne la valeur patchée. Le document d'entrée peut être n'importe quelle combinaison de dict, list, str, int, float, bool et None. Le patch est une liste de dictionnaires d'opérations. L'implémentation ne doit pas muter le document original ni aucun objet imbriqué accessible depuis celui-ci. Si une opération est invalide, la fonction doit lever une exception personnalisée nommée JsonPatchError et laisser le document original inchangé. Les opérations prises en charge sont add, remove, replace, move, copy et test. Utilisez des chemins JSON Pointer avec des jetons séparés par des slash, où la chaîne vide identifie l'ensemble du document, les jetons décodent ~1 en / et ~0 en ~, et toute autre utilisation de ~ est invalide. Pour les objets, un jeton de chemin est une clé. Pour les tableaux, un jeton de chemin doit être un entier non négatif sans zéros en tête sauf le jeton unique 0 ; pour add seulement, le jeton final peut être - pour ajouter à la fin. L'opération add insère dans les tableaux à un index de 0 à len(array), ajoute pour -, définit une clé d'objet, ou remplace l'ensemble du document pour le chemin vide. L'opération remove exige que la cible existe et la supprime. L'opération replace exige que la cible existe et la remplace. L'opération move exige from et path, supprime la valeur à from et l'ajoute à path, et doit rejeter le déplacement d'une valeur vers l'un de ses propres descendants. L'opération copy exige from et path et effectue une copie profonde (deep-copy) de la valeur source vers la cible. L'opération test exige value et ne réussit que si la cible courante est profondément égale (deeply equal) à value, y compris l'égalité Python normale pour les nombres et l'égalité exacte pour les chaînes, les booléens et None. Chaque dictionnaire d'opération doit contenir exactement les champs requis pour cette opération plus le champ op ; les champs inconnus ou manquants sont des erreurs. La fonction doit être déterministe, raisonnablement efficace et ne reposer que sur la bibliothèque standard Python. Incluez toutes les fonctions ou classes auxiliaires nécessaires. N'écrivez pas de programme en ligne de commande et n'utilisez pas de paquets externes.

335
15 Jun 2026 09:43

Programmation

Anthropic Claude Fable 5 VS OpenAI GPT-5.5

Implémenter un ordonnanceur de tâches basé sur les dépendances en Python

Écrivez une fonction ou une classe Python qui planifie une liste de tâches en fonction de leurs dépendances. L'ordonnanceur doit déterminer l'ordre dans lequel les tâches peuvent être exécutées, en regroupant les tâches qui peuvent s'exécuter en parallèle. L'entrée sera une liste de dictionnaires, où chaque dictionnaire représente une tâche avec les clés suivantes : id : un identifiant unique de type chaîne pour la tâche. name : un nom de la tâche sous forme de chaîne. dependencies : une liste d'identifiants (chaînes) des tâches qui doivent être terminées avant que cette tâche puisse commencer. Votre implémentation doit : Prendre la liste de dictionnaires de tâches en entrée. Retourner un plan d'exécution valide sous forme d'une liste de listes. Chaque liste interne représente un "lot" (batch) de tâches qui peuvent être exécutées simultanément. L'ordre des lots représente l'ordre d'exécution séquentiel. L'ordre des identifiants de tâches au sein d'un lot n'a pas d'importance. Détecter et gérer les dépendances circulaires. Si un cycle est détecté, la fonction doit lever une ValueError avec un message descriptif. Détecter et gérer les cas où un identifiant de dépendance ne correspond à aucune tâche existante. Cela doit également lever une ValueError.

357
12 Jun 2026 09:39

Programmation

OpenAI GPT-5.5 VS Google Gemini 2.5 Flash

Limiteur de débit avec fenêtre glissante et tolérance de rafale

Concevez et implémentez un limiteur de débit sûr pour les threads dans un langage de votre choix (Python, Go, Java, TypeScript ou Rust) qui prend en charge les exigences suivantes : Surface de l'API : Exposez au moins ces opérations : allow(client_id: str, cost: int = 1) -> bool — retourne si la requête est autorisée immédiatement. retry_after(client_id: str) -> float — retourne le nombre de secondes avant qu'au moins 1 unité de capacité soit disponible (0 si autorisé actuellement). Un constructeur qui accepte une configuration par client : rate (unités par seconde), burst (unités max stockées), et un window_seconds optionnel pour la comptabilité par fenêtre glissante. Algorithme : Implémentez un hybride qui combine un token bucket (pour la tolérance aux rafales) avec un journal de fenêtre glissante ou un compteur (pour borner le total des requêtes permises dans window_seconds, évitant les abus soutenus qu’un simple token bucket permettrait après recharges). Une requête n’est autorisée que si les deux contrôles passent. Justifiez votre choix de structure de données pour la fenêtre glissante (journal exact vs approximation à deux seaux pondérés) et discutez des compromis mémoire/précision dans un court bloc de commentaire ou une note jointe. Concurrence : Le limiteur sera sollicité par de nombreux threads/goroutines concurrentement pour le même client_id et pour des client_id différents. Évitez qu’un verrou global unique devienne un goulot d’étranglement (par ex. verrous par client ou lock striping). Documentez pourquoi votre approche est correcte sous des appels allow concurrents (pas de double-dépense de jetons, pas de mises à jour perdues). Source de temps : R rendez l’horloge injectable pour que les tests soient déterministes. Utilisez par défaut une horloge monotone. Cas limites à traiter explicitement : cost plus grand que burst (doit être rejeté, ne jamais bloquer indéfiniment). Horloge reculant ou pauses longues (par ex. VM suspendue) : plafonner plutôt que planter, et ne pas accorder de jetons illimités. Première requête pour un client nouveau (initialisation paresseuse). Nettoyage des clients obsolètes (la mémoire ne doit pas croître indéfiniment si des clients arrêtent d’appeler). Jetons fractionnaires / timing sous-millisecondes. Tests : Fournissez au moins 6 tests unitaires utilisant l’horloge injectable qui couvrent : autorisation/refus de base, vidage de rafale et recharge, plafond de la fenêtre glissante indépendant de la recharge du seau, cost > burst, contention concurrente sur un seul client (propriété déterministe : total permis en T secondes ≤ rate*T + burst), et éviction des clients obsolètes. Complexité : Indiquez la complexité en temps amortie de allow et la complexité mémoire par client. Livrables : code exécutable complet (un seul fichier convient, mais vous pouvez scinder si vous les étiquetez clairement), les tests, et une brève note de conception (max ~250 mots) expliquant vos choix et la sémantique précise lorsque les deux algorithmes sont en désaccord.

458
12 May 2026 09:45

Liens associés

X f L