Poser une question en français à une intelligence artificielle coûte plus cher que la poser en anglais. Pas parce que les éditeurs pratiquent un tarif différent selon la langue, mais parce que leurs modèles ne lisent pas des mots : ils lisent des « tokens », ces fragments de texte qui servent d’unité de facturation. Et le français, découpé par des outils conçus d’abord pour l’anglais, en consomme davantage. Une étude publiée le 30 septembre sur la plateforme scientifique arXiv chiffre cette « taxe invisible » : selon les modèles, le même texte demande de 31 % à 58 % de tokens de plus en français qu’en anglais.
Ce que mesure l’étude
Son auteur, Thomas Serval, a passé les mêmes textes, traduits professionnellement dans plus de cent langues, dans les « tokenizers » de sept familles de modèles : ceux d’OpenAI, de Meta, d’Alibaba, de DeepSeek, de Google, de Mistral et d’Anthropic. Il a ensuite comparé le nombre de tokens obtenus avec celui de l’original anglais. Sur un corpus d’articles d’actualité, Mistral est le plus économe pour le français, avec 31 % de tokens supplémentaires. Viennent ensuite OpenAI (+36 %), Google (+41 %) et Anthropic (+45 %), puis DeepSeek, Alibaba et Meta, entre +55 % et +58 %.
Le français est loin d’être le plus mal loti : l’espagnol ou l’allemand paient un surcoût comparable, et la langue médiane parmi les 124 étudiées paie près de 70 % à plus du double. Plus surprenant, le chinois revient souvent moins cher que le français. Comme le résume l’auteur, l’écart « n’est pas une propriété de la langue seule » : il dépend de la façon dont chaque outil a été construit, et pour quel public.
Les langues régionales paient le double
L’étude s’intéresse aussi aux langues de France, à partir de la Déclaration universelle des droits de l’homme, disponible dans des centaines de langues. Là, les surcoûts s’envolent : environ 1,7 fois l’anglais pour l’occitan, près de 2 pour le basque et le corse, plus de 2 pour le breton, et plus de 3 pour le tahitien, pénalisé par un signe d’écriture que les outils découpent mal. L’auteur précise qu’il s’agit d’ordres de grandeur, établis sur un seul texte par langue. L’alsacien, lui, ne figure pas dans l’étude, faute de corpus comparable. On peut raisonnablement supposer qu’il serait logé à la même enseigne, sans que l’étude permette de le chiffrer : une langue peu présente dans les données d’entraînement est mal découpée, donc plus chère, et plus vite à l’étroit dans la mémoire du modèle.
Pourquoi l’écart grossit avec les agents
Pour une question isolée, 40 % de plus reste une somme modeste. Mais les usages changent. Un agent qui travaille longtemps renvoie au modèle tout l’historique de la conversation à chaque étape : le coût cumulé grimpe beaucoup plus vite que le nombre d’étapes, et l’écart entre langues avec lui. Certains tarifs augmentent par ailleurs au-delà d’une certaine longueur de contexte, un seuil que le français atteint plus tôt. Dans la simulation de l’étude, une conversation en français franchit ce palier au 29e échange, contre le 41e en anglais ; entre les deux, chaque échange coûte près de trois fois plus cher en français. Et une fenêtre de mémoire donnée contient, en français, un quart à un tiers de texte en moins.
L’étude livre aussi une leçon pratique, qui rejoint ce que nous écrivions sur le vrai prix d’une IA. Les tokenizers ne découpent pas tous aussi finement : pour un même texte, celui d’Anthropic produit nettement plus de tokens que celui de Mistral, en français comme en anglais. Comparer les prix au million de tokens d’un fournisseur à l’autre n’a donc guère de sens. Il faut, dit l’auteur, comparer le prix « par document, pas par token ».
Les précautions qui s’imposent
Cette étude est une prépublication : elle n’a pas encore été relue par d’autres chercheurs. Elle est signée d’un seul auteur, Thomas Serval, patron de l’entreprise française Baracoda, connue pour ses objets de santé connectés, qui présente au passage un prototype de découpage optimisé pour le français. L’auteur indique aussi avoir travaillé avec l’aide d’une IA. Surtout, elle mesure des tokens, pas des factures ni la qualité des réponses : elle ne dit pas si une IA répond moins bien en français. Ses résultats rejoignent toutefois des travaux antérieurs reconnus. En 2023, des chercheurs d’Oxford mesuraient déjà un surcoût de 60 % pour le français avec l’outil utilisé alors par ChatGPT, et une équipe de l’université de Washington montrait que certaines langues paient jusqu’à cinq fois plus, en obtenant souvent de moins bons résultats.
Une question de souveraineté
Le détail technique dit quelque chose de plus large. Les outils qui découpent nos phrases ont été conçus d’abord pour l’anglais, sur des données majoritairement anglophones. Écrire en français, en breton ou en alsacien, c’est payer un peu plus, et disposer d’un peu moins de mémoire, pour le même service. Ce n’est pas une fatalité : le meilleur résultat pour le français vient d’un acteur français, Mistral, et l’étude montre qu’un outil conçu avec suffisamment de français réduit nettement l’écart. Pour une entreprise ou une administration qui travaille en français, le choix d’un modèle n’est donc pas qu’une affaire de performance. C’est aussi, très concrètement, une affaire de langue.
Sources
- Thomas Serval — The Invisible Language Tax: Token Premiums of French and Regional Languages in 2026 LLM Tokenizers (arXiv, 2026)
- GitHub — Baracoda-ai-labs/baracoda-fr (code et données de l’étude)
- Petrov et al. — Language Model Tokenizers Introduce Unfairness Between Languages (NeurIPS 2023)
- Ahia et al. — Do All Languages Cost the Same? (EMNLP 2023)

