Anthropic a lancé Opus 5 le 24 juillet 2026. Selon l’entreprise, le modèle s’approche de l’intelligence de frontière de Claude Fable 5 à la moitié du prix. Pour ceux qui écrivent du code, toutefois, la donnée la plus pertinente apparaît ailleurs. En effet, le coût par token est resté identique à celui d’Opus 4.8. Autrement dit, le même budget permet désormais d’obtenir bien plus de capacités.
Opus 5 double les performances de son prédécesseur en ingénierie logicielle
Dans Frontier-Bench v0.1, le modèle a surclassé tous les concurrents évalués. De plus, il a plus que doublé le score d’Opus 4.8 tout en coûtant moins cher par tâche. Sur CursorBench 3.2, à effort maximal, l’écart par rapport au pic de Fable 5 est tombé à 0,5 %. Parallèlement, le coût par tâche a été réduit de moitié. Dans ARC-AGI 3, axé sur des problèmes inédits, le score est monté au triple de celui du deuxième placé. Puis, dans OSWorld 2.0, benchmark d’utilisation informatique, le modèle a dépassé le meilleur résultat du Fable 5. Et cela pour un peu plus d’un tiers du coût.
La molette d’effort transforme le coût en variable de projet
À présent, le modèle intègre un contrôle d’effort ajustable. En pratique, vous choisissez entre plus d’intelligence ou moins de tokens. Ainsi, une routine de triage peut s’exécuter avec un effort faible. Pendant ce temps, une refactorisation critique passe au niveau d’effort maximal. Cet ajustement agit directement sur la prévisibilité de la facture. Harvey, par exemple, a rapporté des performances équivalentes à celles de l’Opus 4.8 en raisonnement maximal. De plus, il a généré en moyenne 26 % de tokens en moins. La Fundamental Research Lab a mesuré un gain moyen de neuf points de pourcentage en modélisation financière. En même temps, la consommation a diminué d’un tiers lors des sessions et des appels d’outils. Le temps total, pour sa part, a diminué de 60 %.
Opus 5 vérifie son propre travail avant de rendre la tâche
Lors d’une tâche du Frontier-Bench, le modèle a reçu le dessin d’une pièce mécanique. Puis il devait reconstruire la pièce sous forme de modèle 3D dans FreeCAD. Or, la configuration bloquait toute visualisation directe du dessin. Le modèle a donc écrit son propre pipeline de vision par ordinateur. Ensuite, il a extrait la géométrie à partir des pixels bruts et reconstruit l’intégralité de la pièce. Et pourtant, aucun concurrent n’a résolu le même défi en cinq tentatives. Un autre cas concernait un bug réel dans un gestionnaire de paquets open source populaire. Dans ce cas, le modèle a trouvé la cause racine et a couvert un edge case que le patch de la communauté avait laissé passer. Par conséquent, pour ceux qui réviser les PR d’autrui, ce comportement pèse plus lourd que n’importe quel benchmark.
Ce qui change dans le flux de travail des équipes produit
Plusieurs équipes en accès anticipé ont souligné la cohérence plutôt que des pics de performance. Lovable, par exemple, a mesuré une hausse de 22 % par rapport à Opus 4.7 dans des tâches similaires et difficiles. Outre cette montée, la variabilité entre les exécutions a fortement diminué. Zapier, pour sa part, a rapporté 100 % d’approbation dans l’AutomationBench. Auparavant, aucun modèle ne passait ce jeu de tests. Sur le front-end, une équipe a remarqué que le modèle ouvrait les pages dans le navigateur. Puis elle a testé les largeurs d’écran desktop et mobile. Ainsi, elle a repéré un bouton de paiement hors écran et l’a corrigé avant la livraison.
Opus 5 repère des vulnérabilités, même s’il trébuche dans l’exploitation
Voici la partie qui intéresse ceux qui travaillent dans la sécurité. Anthropic a évité d’entraîner Opus 5 sur des tâches liées au cyber, tout comme pour Opus 4.8. Néanmoins, le modèle a énormément progressé dans ce domaine grâce à une amélioration générale de ses capacités. Dans OSS-Fuzz, il se rapproche de Mythos 5 dans l’identification des vulnérabilités. Cependant, il est bien loin en matière de génération d’exploits. Les classificateurs permettent la recherche de failles dans le code source. En revanche, ils bloquent les balayages binaires, les tests d’intrusion (pentest) et la création d’exploits. Selon l’entreprise, ces classificateurs devraient déclencher environ 85 % de moins que dans Fable 5. De plus, ceux qui ont besoin de moins de restrictions peuvent recourir au Cyber Verification Program.
Deux changements d’API qui méritent une attention immédiate
Tout d’abord, regardez les outils au sein d’une même conversation. Il est désormais possible de modifier les outils auxquels Claude a accès sans invalider le cache du prompt. Par conséquent, les agents de longue durée gagnent en flexibilité sans perdre l’économie de contexte. La deuxième nouveauté couvre les retours automatiques. Lorsqu’un classificateur de sécurité signale la requête, elle est routée vers un autre modèle. De cette façon, l’appel renvoie une réponse valide. Les deux fonctionnalités sont en bêta.
Comment commencer à utiliser Opus 5 dès aujourd’hui
Le modèle est déjà disponible sur toutes les plateformes d’Anthropic. Concrètement, l’identifiant API est claude-opus-5. Le tarif est fixé à 5 USD par million de tokens d’entrée. La sortie coûte quant à elle 25 USD par million de tokens. Il existe aussi le mode Fast, environ 2,5 fois plus rapide que le mode standard. Ce mode coûte le double du tarif de base sur la Claude Platform. Par ailleurs, sur Claude Max Opus 5 est devenu le modèle par défaut. Pendant ce temps, sur Claude Pro il est devenu l’option la plus robuste disponible. Enfin, il est conseillé de lire le guide de prompt spécifique au modèle avant de migrer des workloads.
Opus 5 déplace la compétition vers le coût par tâche
La lecture la plus utile de ce lancement réside dans l’économie. Pendant deux ans, le marché a comparé les modèles par pic de capacité. Désormais, la comparaison pertinente porte sur les performances dans le cadre d’un budget. Par conséquent, le critère de choix évolue pour les équipes d’ingénierie. En résumé, la question est désormais de savoir combien d’intelligence peut rentrer dans votre budget par tâche. Testez avec vos propres cas avant de standardiser. Après tout, les benchmarks publics reproduisent rarement la réalité de votre code.
Acompañe nosso perfil no Instagram!




