Lundi 28 septembre, Anthropic a sorti Claude Sonnet 5.5 avec une promesse qui a de quoi séduire : un modèle plus de 30 % plus rapide que son prédécesseur, et jusqu’à 30 % moins cher par tâche. Sans toucher au tarif : toujours 2 dollars le million de tokens en entrée, 10 dollars en sortie. Le même jour, Artificial Analysis, l’un des rares laboratoires indépendants à mesurer les modèles sur une batterie de tests commune, publiait un chiffre qui semble dire l’inverse : réglé au maximum, Sonnet 5.5 coûte environ 7,60 dollars par tâche, soit à peu près 50 % de plus que Sonnet 5.
Qui a raison ? Les deux, et c’est justement ce qui rend cette sortie intéressante. Elle montre que le prix affiché d’une IA, celui que tout le monde compare, ne dit presque rien de ce qu’on paiera vraiment.
Le token, une unité qui ne mesure pas le travail
Les modèles de langage se facturent au token, ce morceau de mot qui sert d’unité de compte : on paie ce qu’on envoie au modèle et ce qu’il écrit en retour. C’est l’unité que publient tous les éditeurs, celle des comparatifs, celle aussi de notre radar des modèles, faute de mieux.
Le problème, c’est que personne n’achète des tokens pour eux-mêmes. On achète un résumé, une correction de code, un tableau rempli, un ticket client traité. Et pour une même tâche, deux modèles peuvent consommer des quantités de tokens très différentes : l’un répond du premier coup, l’autre « réfléchit » longuement avant d’écrire (ces tokens de raisonnement sont facturés comme du texte produit), appelle trois fois un outil, se trompe, recommence. Le prix d’une tâche, c’est le prix du token multiplié par tout ce que le modèle a dépensé pour y arriver. La première moitié de l’équation est affichée partout ; la seconde, presque nulle part.
Ce que promet Anthropic : moins de tokens, pas un prix plus bas
Toute la promesse de Sonnet 5.5 repose sur cette seconde moitié. Anthropic ne baisse pas ses tarifs : il affirme que son modèle arrive au résultat en dépensant moins. Les exemples mis en avant dans l’annonce viennent de clients choisis par l’éditeur, il faut le garder en tête, mais ils vont tous dans ce sens. Le fonds d’investissement Balyasny aurait vu la consommation passer d’environ 497 000 tokens par réponse avec Sonnet 5 à 121 000 avec la nouvelle version. Lovable, qui génère des applications, compte un tiers d’appels d’outils en moins et environ moitié moins de commandes exécutées. Slack mesure 14 % de tokens produits en moins, Box 12 % au total.
Côté performances, le modèle se hisse presque au niveau d’Opus 5.5, le haut de gamme sorti une semaine plus tôt : 1 844 points contre 1 846 sur GDPval-AA, un test fondé sur des tâches de bureau réelles, et 80,1 % contre 81,8 % sur OSWorld, qui évalue la conduite d’un ordinateur. Pour un tarif deux fois plus bas, puisqu’Opus 5.5 est facturé 4 et 20 dollars.
Ce que constate une mesure indépendante
Artificial Analysis confirme le bond en qualité : avec l’effort de réflexion poussé au maximum, Sonnet 5.5 obtient 56 points sur son indice d’intelligence, 18 de plus que Sonnet 5, deux de moins qu’Opus 5.5, et prend la deuxième place du classement. Mais pour y parvenir, il a produit en moyenne quelque 193 000 tokens par tâche. C’est la consommation la plus élevée que le laboratoire ait jamais relevée : environ 60 % de plus qu’Opus 5.5 ou Sonnet 5 au même réglage, et près de sept fois plus que GPT-6 Astra d’OpenAI. D’où ces 7,60 dollars par tâche.
La contradiction n’est qu’apparente. Anthropic prévient lui-même que ses niveaux d’effort ont été recalibrés : un réglage donné ne produit plus la même quantité de réflexion qu’avec Sonnet 5. Selon l’éditeur, Sonnet 5.5 réglé en effort faible ou moyen fait mieux que Sonnet 5 à son maximum, pour environ un dixième du coût par tâche. Les 30 % d’économie existent donc, à condition de baisser le curseur. Laissé au maximum, le modèle réfléchit plus longtemps, obtient de meilleurs résultats, et coûte plus cher.
Autrement dit, le vrai prix de Sonnet 5.5 n’est pas une donnée : c’est un réglage. Et ce réglage, beaucoup d’utilisateurs ne le choisissent pas eux-mêmes. Il dépend de l’outil qui appelle le modèle, de sa configuration par défaut, parfois d’un prestataire qui refacture le service.
Et les modèles ouverts, vraiment moins chers ?
Sur le papier, l’écart est vertigineux. D’après les tarifs relevés dans notre radar, DeepSeek V4.1 Flash coûte 0,30 dollar en entrée et 1,20 en sortie, MiMo-V2.6-Flash de Xiaomi 0,14 et 0,28, sa version Pro 0,435 et 0,87. Soit un token de sortie huit à trente-cinq fois moins cher que celui de Sonnet 5.5, avec des poids téléchargeables sous licence MIT.
La leçon de Sonnet 5.5 vaut aussi pour eux : un modèle bon marché mais bavard, ou qui doit s’y reprendre à plusieurs fois, peut perdre une partie de son avance. Avec de tels écarts de tarif, il faudrait une consommation extravagante pour inverser le rapport ; mais la comparaison honnête reste celle du coût par tâche réussie, à qualité égale, et elle n’est pas disponible pour tous les modèles dans des conditions identiques. Les modèles ouverts ont en outre un argument qu’aucun tarif ne résume : on peut les faire tourner chez soi. Le coût devient alors celui du matériel et de l’électricité, et les données ne quittent pas la maison.
Moins de calcul par tâche, plus de calcul au total ?
Qu’un modèle arrive au même résultat en dépensant quatre fois moins de tokens, c’est une bonne nouvelle au-delà de la facture : chaque token correspond à du calcul, donc à de l’électricité dans un centre de données. Un modèle plus sobre par tâche, c’est moins d’énergie pour chaque réponse.
Mais l’histoire de l’énergie connaît bien le piège : c’est l’effet rebond, décrit dès le XIXe siècle par l’économiste William Stanley Jevons à propos du charbon. Quand une ressource devient plus efficace, donc moins chère à l’usage, on s’en sert davantage, et la consommation totale peut augmenter. Un agent 30 % moins cher par tâche, c’est un agent qu’on laissera tourner plus longtemps, sur plus de tâches, en continu. Et le réglage maximal, le plus gourmand jamais mesuré, reste à portée de clic pour quiconque veut « le meilleur ».
La sobriété, ici, ne se décrète pas chez l’éditeur : elle se règle chez l’utilisateur. Choisir un effort adapté à la tâche plutôt que le maximum par principe, c’est à la fois économiser et consommer moins. Nous avions esquissé cette idée d’un usage mesuré dans notre édito sur le changement de ton autour de l’IA ; Sonnet 5.5 en donne une illustration très concrète.
Sécurité : un modèle qui peut passer la main
L’autre nouveauté de Sonnet 5.5 passe plus inaperçue. C’est le premier modèle de la gamme Sonnet livré avec les protections qu’Anthropic réservait jusqu’ici à ses modèles les plus puissants. La raison avancée : ses capacités en cybersécurité sont désormais comparables à celles d’Opus 5.
Concrètement, des classificateurs examinent les demandes. Si l’une d’elles ressemble à du travail offensif à risque (écrire un exploit, mener un test d’intrusion) ou au développement de modèles d’IA de pointe, elle est confiée à Sonnet 5, l’ancienne version. Le changement est affiché : un avertissement apparaît, la réponse porte le nom du modèle qui l’a produite, et la conversation reste sur Sonnet 5. Ces réponses sont facturées au tarif de Sonnet 5. On peut désactiver cette bascule dans les réglages ; la conversation se met alors en pause au lieu de changer de modèle. Les demandes liées à la biologie à risque, elles, sont bloquées sans alternative. Anthropic dit aussi proposer un programme de vérification aux équipes de défense qui ont besoin de ces capacités.
Autre garde-fou : des classificateurs chargés d’empêcher l’extraction du raisonnement du modèle. Ils visent la « distillation », cette pratique qui consiste à interroger un modèle à très grande échelle, souvent au moyen de milliers de comptes, pour recopier ses capacités dans un autre.
En pratique, la bascule reste rare : Artificial Analysis l’a observée sur environ 0,1 % des tâches de son indice, principalement sur des tests de ligne de commande. Anthropic reconnaît que le filtre bloque parfois des demandes légitimes et dit l’affiner. Le site The Next Web relève une tension dans le discours de l’éditeur : Sonnet 5.5 ne ferait pas « avancer la frontière », ce qui justifie un examen de sécurité allégé, mais son saut en cybersécurité serait assez important pour mériter des protections de modèle de pointe.
Le choix de la transparence mérite d’être salué : mieux vaut un modèle qui annonce qu’il passe la main qu’un modèle qui dégrade ses réponses en silence. Mais il ajoute une variable de plus à l’équation du prix : le modèle que l’on paie n’est pas toujours celui qui répond.
Ce qu’il faudrait afficher
Le prix au million de tokens est un prix de vitrine. Ce que coûte réellement une IA dépend de sa sobriété, du réglage choisi et, désormais, du modèle qui répond vraiment. Pour une entreprise, une collectivité ou une association qui s’équipe, le conseil est simple et un peu ingrat : tester sur ses propres tâches, mesurer, ajuster le niveau d’effort, avant de se fier au tarif ou aux pourcentages des communiqués.
Reste une question que ce lancement pose en creux. On sait afficher la consommation d’un lave-linge par cycle ou d’une voiture aux cent kilomètres. Pourquoi les éditeurs d’IA ne publieraient-ils pas un coût, et une consommation, par tâche type, mesurés dans des conditions communes ? Ce serait moins flatteur que « 30 % moins cher ». Ce serait surtout beaucoup plus utile.
Sources
- Anthropic — Introducing Claude Sonnet 5.5
- Artificial Analysis — Claude Sonnet 5.5 reaches #2 on the Intelligence Index
- VentureBeat — Anthropic launches Claude Sonnet 5.5 with 30% cost reduction per task
- SiliconANGLE — Anthropic debuts Claude Sonnet 5.5
- OrcaRouter — The 30% cost claim vs $7.60 per task
- Claude Help Center — Why Claude switched models in your conversation
- The Next Web — Sonnet 5.5 ships with the cyber limits reserved for its best models
- alsace.ai — le radar des modèles (prix au million de tokens)


