Le coût écologique d'un token : inférence cloud vs. votre ordinateur
Chaque requête que vous envoyez porte une facture invisible. Pas celle que vous payez en euros — celle que la planète paie en électricité, en eau et en matières premières. Quand un grand modèle de langage génère un token dans un data center, toute une chaîne de coûts physiques se déclenche : le GPU consomme du courant, ce courant a dû être produit, le bâtiment a dû être refroidi et le matériel lui-même a dû être fabriqué. Rien de tout cela n'apparaît sur la page tarifaire de l'API. Tout cela a un impact écologique impactant.
La question naturelle pour quiconque fait tourner une IA locale est donc : comment un token généré sur mon portable se compare-t-il au même token généré dans le cloud ? Nous avons regardé les différentes recherches existantes sur le sujet et nous avons construit un calculateur interactif pour que vous puissiez estimer votre propre empreinte.
Les chiffres ci-dessous sont des ordres de grandeur, pas des factures précises. L'empreinte réelle varie avec la taille du modèle, la technologie de refroidissement du data center, le mix électrique local et le taux d'utilisation du matériel. Utilisez-les pour comparer des échelles, pas pour auditer un fournisseur précis.
1. Ce que coûte réellement un token en électricité
La référence la plus citée vient de l'étude du MIT Lincoln Laboratory « From Words to Watts », qui a mesuré l'inférence LLM sur des GPU de serveur et rapporté des coûts énergétiques de l'ordre de 0,3 à 3 wattheures pour 1 000 tokens, selon la taille du modèle et le matériel (pour un modèle de 70 milliards de paramètres sur des GPU NVIDIA A100, la génération se situe autour de 1–2 Wh pour 1 000 tokens).
L'inférence cloud ne s'arrête jamais à la consommation du GPU seul. Les autres composants du serveur, les pertes d'alimentation, le réseau et surtout le surcoût du data center (climatisation, distribution électrique, éclairage) multiplient la consommation de la puce. L'industrie mesure cela avec le PUE (Power Usage Effectiveness) : une installation moderne tourne à un PUE d'environ 1,1–1,2, soit environ 10 à 20 % d'énergie en plus de la charge informatique — et les installations plus anciennes ou situées dans des régions chaudes peuvent faire bien pire. La climatisation y occupe une place à part. Évacuer la chaleur des GPU consomme de l'électricité pour les pompes et les ventilateurs, et c'est précisément ce poste que le PUE capture.
Il y a aussi une nuance liée au traitement par lots : un GPU de data center sert plein d'utilisateurs à la fois, ce qui répartit sa consommation au repos, mais un modèle de frontière de plusieurs centaines de milliards de paramètres brûle de toute façon bien plus de joules par token qu'un modèle local de 7B.
Sur votre portable, le tableau est plus simple et plus rude à la fois. Le GPU ou NPU du portable consomme sa pleine puissance pour chaque token, sans traitement par lots pour l'amortir, mais le modèle est aussi typiquement 10 à 50 fois plus petit qu'un modèle cloud de frontière. Mesuré sur du matériel réel (Apple Silicon M-series et équivalents), un modèle quantifié de 7–8B générant à 20–40 tokens par seconde consomme de l'ordre de 0,3 à 0,8 Wh pour 1 000 tokens, machine entière comprise.
Par token, un petit modèle local sur un portable est dans la même gamme que l'inférence cloud — parfois meilleur, parfois pire. L'avantage du local ne se joue pas sur les joules brutes d'un token isolé, mais sur tout ce qui accompagne ces joules. C'est là que la différence se creuse : à ces joules s'ajoutent, côté cloud, l'eau évaporée pour refroidir les serveurs, le surplus d'énergie du data center (distribution, refroidissement, éclairage), la fabrication et le renouvellement fréquent d'accélérateurs dédiés, ainsi que les minéraux critiques et les déchets électroniques qu'ils génèrent. Sur votre portable, ces coûts annexes n'existent pas ou sont déjà amortis.
2. L'eau : l'empreinte que personne ne facture
L'électricité n'est que la partie visible de la facture. Une étude de référence de l'UC Riverside, « Making AI Less Thirsty » (publiée dans Communications of the ACM), estime que l'entraînement de GPT-3 dans les data centers américains de Microsoft a directement évaporé environ 700 000 litres d'eau potable — et que la demande mondiale d'IA pourrait prélever 4,2 à 6,6 milliards de mètres cubes d'eau par an d'ici 2027, soit plus que le prélèvement annuel total de quatre à six Danemarks.
L'eau entre dans l'équation à deux endroits :
- Sur site, les tours de refroidissement à évaporation rejettent la chaleur produite par les GPU. Le chiffre approximatif de l'industrie est de 1 à 2 litres évaporés par kWh de chaleur évacuée et le World Economic Forum rapporte qu'un data center de 1 mégawatt peut consommer jusqu'à 25,5 millions de litres d'eau par an rien que pour le refroidissement.
- Hors site, la production thermoélectrique est elle-même gourmande en eau — environ 1 à 2 litres consommés par kWh produit, avant même que l'électricité n'atteigne le data center.
En combinant les deux, une estimation souvent citée pour l'inférence à la GPT-3 donne environ 500 mL d'eau au total pour 1 000 tokens dans des régions américaines en stress hydrique, avec de fortes variations. Le rapport de l'UNU-INWEH « Environmental Cost of AI's Energy Use » (2026) confirme l'ampleur : l'empreinte en eau associée à l'électricité d'une image générée par IA est d'environ 29 mL, et celle d'une courte vidéo IA complexe d'environ 4,1 litres — près de deux jours d'eau de boisson pour une personne.
Et votre portable ? Zéro litre d'eau de refroidissement. Un portable est refroidi passivement ou par air : pas de tour de refroidissement, pas d'évaporation, pas de prélèvement sur un réseau municipal dans une région en sécheresse. Le coût en eau hors site de la production de votre électricité domestique s'applique toujours aux deux scénarios — mais tout le fardeau du refroidissement cloud disparaît simplement sur votre bureau.
Une ombre moins connue plane toutefois sur le refroidissement des data centers : les PFAS. Pour économiser l'eau, une partie de l'industrie se tourne vers le refroidissement liquide à deux phases, qui n'utilise plus d'eau mais un fluide fluoré — donc des PFAS, ces « polluants éternels » qui ne se dégradent pas et s'accumulent dans l'environnement et dans le corps humain. Le rapport de ChemSec publié en septembre 2026 montre que la plupart des dix plus grands producteurs mondiaux de PFAS augmentent leur capacité, en partie sous l'effet de la demande des data centers et des semi-conducteurs. En juillet 2026, 17 organisations environnementales ont demandé à l'EPA américaine de refuser l'homologation accélérée d'Opteon 2P50, un nouveau PFAS destiné au refroidissement des data centers, jugeant l'évaluation toxicologique insuffisante. Ces systèmes sont présentés comme bouclés, mais les fuites (« émissions fugitives ») et la fin de vie des fluides libèrent ces composés, qui se transforment dans l'air en TFA, classé substance dangereuse par l'Agence européenne des produits chimiques. Selon ChemSec, le coût sociétal des PFAS atteindrait 440 milliards d'euros en Europe, et une étude de la Commission européenne chiffre à elles seules les dépenses de santé annuelles liées aux PFAS à 39,5 milliards d'euros. La contamination est déjà générale : selon les données NHANES, 97 % des Américains ont des PFAS dans le sang. Le refroidissement sans eau n'est donc pas un refroidissement sans pollution.
3. Ressources naturelles : minéraux, terres et déchets électroniques
La troisième empreinte est la moins discutée et celle dont les effets mettent le plus de temps à se faire sentir. Le matériel IA est construit à partir de minéraux critiques — cobalt, tungstène, tantale, terres rares — souvent extraits dans des régions à faible surveillance environnementale. Le rapport de l'UNU-INWEH projette que l'infrastructure IA pourrait générer jusqu'à 2,5 millions de tonnes de déchets électroniques par an d'ici 2030, dont une grande partie traitée dans des pays à revenus faibles avec peu de garanties. Le même rapport estime l'empreinte en terres de la consommation électrique de l'IA en 2030 à plus de 14 500 kilomètres carrés — deux fois l'agglomération de Jakarta — et son empreinte carbone à 399 millions de tonnes de CO2, qu'il faudrait 6,7 milliards d'arbres pendant dix ans pour compenser.
Ici, l'histoire du local est nuancée. Votre portable a aussi été fabriqué avec des minéraux critiques et les émissions de fabrication sont bien réelles : selon la plupart des analyses de cycle de vie, 70 à 85 % de l'empreinte carbone d'un ordinateur sur sa durée de vie est déjà dépensée avant son premier démarrage. Mais il y a une différence décisive d'amortissement : les accélérateurs d'un data center suivent un cycle de renouvellement de deux à cinq ans, parce que les gains d'efficacité de chaque génération sont des armes concurrentielles brutales. Votre portable tourne cinq à dix ans et chaque heure d'inférence dessus ne coûte aucune fabrication supplémentaire — le matériel existe déjà et serait allumé de toute façon.
Le token le plus vert est celui généré sur du matériel que vous possédez déjà, avec un modèle assez petit pour la tâche. Tirer 5 millions de tokens de votre portable existant au lieu d'un modèle cloud de 70B évite le fardeau en eau et en réseau du data center de quelqu'un d'autre, sans ajouter aucun matériel neuf à la planète.
4. Le problème d'échelle : l'inférence domine
Le débat public se focalise volontiers sur les entraînements spectaculaires — les 1,3 GWh de GPT-3, les 50 à 70 GWh estimés de GPT-4. Mais le rapport de l'UNU-INWEH confirme ce que les opérateurs savaient déjà : une fois le modèle déployé, l'inférence représente 80 à 90 % de sa consommation énergétique totale. ChatGPT à lui seul traiterait environ 2,5 milliards de requêtes par jour — soit environ 383 GWh d'électricité par an pour un seul produit.
C'est là que votre arithmétique personnelle compte. L'AIE estime que les data centers mondiaux ont consommé environ 448 TWh en 2025 (plus que la plupart des pays) et projette 945 TWh d'ici 2030. Vous ne pouvez pas changer où les fournisseurs implantent leurs data centers, mais vous choisissez où vos tokens sont générés. Déplacer votre charge de travail routinière — le résumé, la rédaction, l'aide au code quotidienne — vers un modèle local suffisant à la tâche retire votre part de cette courbe. Notre comparatif des coûts a montré le seuil de rentabilité financier ; la logique écologique suit la même pente, avec l'eau et les minéraux en plus.
5. Essayez par vous-même
Nous avons transformé ces chiffres publiés en outil interactif : entrez combien de tokens vous utilisez (ou prévoyez d'utiliser), choisissez une taille de modèle cloud, une machine locale et un mix électrique et le calculateur estime l'empreinte de tout le cycle de vie — fabrication et utilisation — des deux chemins côte à côte : électricité, carbone, eau et épuisement des ressources minérales.
Le modèle applique un PUE de 1,2 à l'énergie opérationnelle du cloud, ajoute une part de fabrication d'environ 25 % (LLMCarbon), puis convertit cette électricité de cycle de vie en carbone selon le mix électrique sélectionné. L'eau suit Li et al. : 0,5 L par kWh de refroidissement sur site plus 1,5 L par kWh de production hors site pour le cloud, et seulement la part hors site pour une machine locale refroidie à air. L'épuisement des minéraux est amorti à partir de la fabrication des GPU, en milligrammes d'équivalent antimoine, exprimé par token servi (Morand et al.). Une machine locale que vous possédez déjà n'entraîne aucune fabrication supplémentaire — seulement l'électricité qu'elle consomme.
Sources
- From Words to Watts: Benchmarking the Energy Costs of Large Language Model Inference — Samsi et al., MIT Lincoln Laboratory (arXiv:2310.03003)
- Making AI Less "Thirsty": Uncovering and Addressing the Secret Water Footprint of AI Models — Li, Yang, Islam, Ren, UC Riverside, Communications of the ACM (arXiv:2304.03271)
- LLMCarbon: Modeling the end-to-end Carbon Footprint of Large Language Models — Faiz et al., ICLR 2024 (arXiv:2309.14393, modélisation du carbone incorporé et du PUE)
- The Rising Unsustainability of AI Graphics Cards Production — Morand, Névéol, Ligozat, LIMITS 2026 (arXiv:2607.01258, épuisement abiotique de la production des GPU)
- Environmental Cost of AI's Energy Use: Carbon, Water and Land Footprints — Aczel et al., UNU-INWEH, Université des Nations Unies, 2026
- How to make AI data centres more sustainable — Note technique du PNUE, 2026 (estimation 415 TWh pour 2024, doublement d'ici 2030)
- AI's environmental costs threaten water, land and climate — ONU Actualités, juin 2026
- UNEP releases guidelines to curb the environmental impact of data centres — PNUE, juin 2025 (chiffre de refroidissement du World Economic Forum)
- Energy and AI — Rapport phare de l'AIE, avril 2025
- LLMCO2: Advancing Accurate Carbon Footprint Prediction for LLM Inferences — Fu et al. (arXiv:2410.02950)
- The world's top 10 PFAS producers — most are expanding production — ChemSec (International Chemical Secretariat), septembre 2026 (coût sociétal de 440 milliards d'euros en Europe)
- US environmental groups urge EPA to reject new PFAS to cool datacenters — The Guardian, juillet 2026 (commentaires d'Earthjustice auprès de l'EPA sur l'Opteon 2P50)
- The cost of PFAS pollution for our society — Commission européenne, DG Environnement, 2026 (39,5 milliards d'euros de coûts de santé annuels)