Le vrai coût des API cloud vs. auto-hébergement Ollama (avec chiffres)
Quand on débute avec l'IA, les API commerciales semblent incroyablement bon marché. Des fractions de centime par 1 000 tokens donnent l'impression que l'auto-hébergement est un luxe inutile. Mais dès que vous construisez des pipelines continus, déployez des agents autonomes ou codez avec des complétions IDE locales, vos compteurs de tokens grimpent de façon exponentielle. Et quand la facture tombe à zéro sur les offres gratuites, souvenez-vous qui paie à votre place : les annonceurs, alimentés par le profilage de chacune de vos requêtes — une raison de plus de préférer un modèle local qui n'affiche aucune pub et ne garde aucune donnée de traçage.
Regardons les données réelles : comment la consommation électrique locale et l'investissement matériel GPU se comparent-ils aux abonnements ou à la facturation des API sur une période de 24 mois ?
1. Suivi de la consommation de tokens
Si vous utilisez un assistant de codage IA (comme Copilot ou un LLM de code local), le système n'envoie pas seulement la ligne que vous avez tapée. Il envoie vos tampons de fichier, les invites système et les définitions de classe comme contexte. Voici quelques profils d'utilisation typiques :
- Développeur Occasionnel : 200 requêtes/jour. Contexte moyen 1 200 tokens. Total : 240K tokens/jour.
- Développeur Intensif / Petit Agent : 2 000 requêtes/jour. Contexte moyen 2 500 tokens. Total : 5 000 000 tokens/jour.
- Boucle d'Agent Entreprise : 20 000 requêtes/jour. Contexte moyen 4 000 tokens. Total : 80 000 000 tokens/jour.
2. Calcul des coûts des API cloud
En supposant un taux mixte de 2,30 € par million de tokens (mélange d'entrées bon marché et de sorties coûteuses sur des modèles de milieu de gamme), calculons le coût annuel des API cloud :
- Développeur Occasionnel : 240 000 * 365 * 0,0000023 € = 202 € / an
- Développeur Intensif : 5 000 000 * 365 * 0,0000023 € = 4 198 € / an
- Agent Entreprise : 80 000 000 * 365 * 0,0000023 € = 67 160 € / an
3. Calcul des coûts de l'auto-hébergement local
L'auto-hébergement repose sur un choix matériel : acheter une machine dédiée à l'IA locale ou adapter une machine existante. Le coût est dominé par ce choix — l'électricité devient presque négligeable avec une machine moderne à faible consommation.
Machine de référence : Framework Desktop 128 Go
Nous prenons pour référence le Framework Desktop 128 Go, basé sur le SoC AMD Ryzen AI Max+ 395 (Strix Halo). Son GPU est intégré au SoC : pas de carte graphique dédiée, et la consommation totale sous charge d'inférence avoisine 120 W (contre 350 W pour un PC équipé d'un GPU discret). À 0,15 €/kWh, l'électricité devient un poste mineur. La machine démarre à environ 1 840 € (configuration 128 Go) et ses 128 Go de mémoire unifiée permettent de charger des modèles bien plus grands que les 16 Go de VRAM d'une carte grand public.
Adapter une machine existante
Si vous disposez déjà d'un PC, l'ajout d'un GPU (ex. RTX 4070 Ti Super 16 Go à 782 €) et/ou de RAM suffit. Le coût marginal est bien plus faible, mais la consommation grimpe à ~350 W sous charge (GPU 250 W + système 100 W), et la mémoire vidéo reste limitée à la capacité de la carte.
Calculons la consommation pour le Développeur Intensif (2 000 requêtes/jour, 15 s par requête = 8,33 h de calcul/jour) :
# Framework Desktop (120 W) :
Énergie = 8,33 h * 0,120 kW = 1,0 kWh/jour.
Coût = 1,0 * 0,15 € = 0,15 €/jour → 55 €/an.
# GPU ajouté à un PC existant (350 W) :
Énergie = 8,33 h * 0,350 kW = 2,91 kWh/jour.
Coût = 2,91 * 0,15 € = 0,44 €/jour → 160 €/an.
Sur 2 ans, l'électricité représente 110 € (Framework) ou 320 € (GPU) — négligeable face au coût des API cloud. Le vrai poste de dépense est le choix de la machine.
4. Comparaison des trois profils (sur 2 ans)
Le tableau ci-dessous compare le coût total sur 2 ans pour chaque profil, selon les deux chemins locaux. Le profil Entreprise, avec 20 000 requêtes/jour, représente environ 83 heures de calcul par jour — soit plus que les 24 heures disponibles, ce qui exige ~4 unités fonctionnant en parallèle.
| Profil | API Cloud (2 ans) | Framework Desktop 128 Go (2 ans) | GPU ajouté à un PC (2 ans) |
|---|---|---|---|
| Développeur Occasionnel | 404 € | 1 851 € (1 840 € + 11 € électricité) | 814 € (782 € + 32 € électricité) |
| Développeur Intensif | 8 396 € | 1 950 € (1 840 € + 110 € électricité) | 1 102 € (782 € + 320 € électricité) |
| Boucle d'Agent Entreprise (×4) | 134 320 € | 8 460 € (7 360 € + 1 100 € électricité) | 6 328 € (3 128 € + 3 200 € électricité) |
Comme le montre le tableau, l'auto-hébergement ne devient avantageux qu'à partir du profil Développeur Intensif. En dessous, la facture API cloud reste suffisamment modeste pour que l'investissement matériel ne soit pas rentabilisé sur 2 ans. En revanche, dès que le volume de requêtes grimpe, l'écart se creuse dramatiquement en faveur du local : sur la charge Entreprise, l'auto-hébergement coûte jusqu'à 21 fois moins cher que l'API cloud.
Entre les deux chemins locaux, le GPU ajouté est moins cher — mais limité à 16 Go de VRAM. Le Framework Desktop coûte plus cher à l'achat, mais ses 128 Go de mémoire unifiée ouvrent l'accès à des modèles bien plus grands : le surcoût achète de la capacité, pas seulement du débit.
Le seuil de rentabilité
Pour un utilisateur intensif, le matériel local est rentabilisé en moins de 3 mois. Une fois ce cap franchi, chaque token généré sur votre matériel local est essentiellement gratuit. Construire des systèmes d'IA avec une intelligence locale n'est pas seulement une victoire pour la vie privée ; c'est un gain massif pour votre budget opérationnel.
Si vous cherchez une machine pré-assemblée plutôt qu'un GPU à monter soi-même, notre comparatif des machines dédiées à l'IA locale liste les petits PC pensés pour faire tourner des modèles chez vous, avec mémoire maximale et prix indicatifs.