Gemma 4 sur Apple Silicon : exécutez les derniers modèles ouverts de Google avec MLX et Ollama
La famille Gemma 4 de Google — publiée sous licence Apache 2.0 en avril 2026 — offre une intelligence de pointe en cinq tailles : E2B (2,3B effectifs), E4B (4,5B effectifs), 12B, 26B MoE (3,8B actifs) et 31B Dense. Si ces modèles fonctionnent partout, des Raspberry Pi aux GPU serveurs, les utilisateurs Apple Silicon disposent d'un avantage unique : MLX, le framework array open-source d'Apple conçu spécifiquement pour l'architecture mémoire unifiée du Mac.
Depuis juin 2026, Ollama propose des variantes Gemma 4 optimisées pour MLX (gemma4:e2b-mlx, gemma4:12b-mlx, gemma4:26b-mlx, etc.) et avec Ollama 0.31+, la prédiction multi-token (MTP) offre près de 90% de génération plus rapide sur Apple Silicon.
Qu'est-ce que MLX ?
MLX est un framework array open-source pour l'apprentissage automatique sur Apple Silicon, développé par l'équipe de recherche ML d'Apple. Contrairement aux frameworks généralistes, MLX est conçu pour exploiter les forces des puces Apple M-series :
- Architecture Mémoire Unifiée — Le CPU et le GPU partagent un seul pool de mémoire, éliminant les copies coûteuses entre les périphériques. Les opérations déclarent simplement leur périphérique cible et le framework s'occupe du reste.
- Calcul Paresseux (Lazy Computation) — MLX construit un graphe de calcul qui s'exécute seulement quand un résultat est nécessaire, permettant l'optimisation automatique de l'ordonnancement et de la fusion des opérations.
- Transformations de Fonctions — La différentiation automatique (autograd), la compilation et l'optimisation de graphe sont appliquées comme des transformations de fonctions, simplifiant l'expérimentation avec des techniques basées sur le gradient.
- Accélération GPU Metal — Tous les calculs sont accélérés via le framework Metal d'Apple et sur les puces M5, MLX exploite les Neural Accelerators via les Tensor Operations de Metal 4 pour un temps jusqu'à 4x plus rapide pour le premier token comparé au M4.
L'écosystème MLX comprend :
- MLX — Framework array central (API Python, Swift, C++, C)
- MLX-LM — Package haut niveau pour charger, exécuter, quantifier et affiner les modèles de langage
- MLX-VLM — Support des modèles vision-langage (utilisé par les capacités multimodales de Gemma 4)
- MLX-LM Server — Serveur HTTP compatible OpenAI pour l'inférence locale
Performances MLX sur Gemma 4
La combinaison de l'architecture efficace de Gemma 4 et de l'optimisation Apple Silicon de MLX donne des résultats impressionnants :
- Variantes E2B / E4B fonctionnent confortablement sur tout Mac M-series avec 8 Go+ de mémoire unifiée, atteignant 30-50 tok/s sur M4.
- Modèle 12B fonctionne sur les machines M-series 16 Go à ~25 tok/s avec quantification 4-bit.
- 26B MoE — malgré 25B de paramètres totaux, seulement 3,8B sont actifs par token, le rendant viable sur les Mac 24 Go avec un excellent rapport qualité/Go.
- 31B Dense nécessite 32 Go+ mais se classe #3 sur LMArena parmi tous les modèles ouverts.
Le noyau MLX contribué par Ollama pour la spéculation par lots lit et décompresse chaque bloc de poids une seule fois, les réutilisant sur l'ensemble du lot MTP plutôt que de relire les poids pour chaque token. Sur M5 Max avec nvfp4, cela rend les multiplications matricielles les plus grandes de Gemma 4 2× à 2,5× plus rapides.
Exécuter Gemma 4 avec Ollama sur macOS
1. Installer Ollama 0.31+
Assurez-vous d'avoir la dernière version d'Ollama :
ollama --version
Si inférieur à 0.31, téléchargez la dernière version depuis ollama.com.
2. Télécharger une variante Gemma 4 optimisée MLX
# Recommandé pour la plupart des Mac M-series (12B, équilibre qualité/vitesse)
ollama pull gemma4:12b-mlx
# Modèle léger (fonctionne sur les Mac 8 Go)
ollama pull gemma4:e2b-mlx
# Modèle MoE — haute qualité, mémoire modérée
ollama pull gemma4:26b-mlx
# Qualité maximale (nécessite 32 Go+)
ollama pull gemma4:31b-mlx
3. Lancer l'inférence
# Invite texte
ollama run gemma4:12b-mlx "Explique comment MLX exploite la mémoire unifiée."
# Avec une image (Gemma 4 est nativement multimodal)
ollama run gemma4:12b-mlx "Décris ce schéma." /chemin/vers/schema.png
4. Utiliser l'API compatible OpenAI
Ollama lance automatiquement un serveur local sur le port 11434 :
curl http://localhost:11434/api/generate \
-d '{"model": "gemma4:12b-mlx", "prompt": "Qu'est-ce que MLX ?"}'
Ou utilisez n'importe quel SDK OpenAI en pointant l'URL de base vers http://localhost:11434/v1.
5. Lancer un agent de codage avec les accélérations MTP
Ollama 0.31+ active la prédiction multi-token par défaut. Pour utiliser Gemma 4 comme agent de codage :
ollama launch claude --model gemma4:12b-mlx
Le modèle draft MTP s'exécute parallèlement au modèle principal, proposant plusieurs tokens à la fois. Le modèle principal vérifie l'ensemble de la proposition en un seul passage — aucune configuration nécessaire.
Utiliser MLX directement (sans Ollama)
Pour les développeurs qui veulent un contrôle précis, MLX-LM fournit un accès Python direct :
pip install mlx mlx-lm mlx-vlm
from mlx_lm import generate, load
model, tokenizer = load("mlx-community/gemma-4-e2b-it-4bit")
response = generate(model, tokenizer, "Qu'est-ce que MLX ?", verbose=True)
Ou démarrez un serveur compatible OpenAI :
mlx_lm.server --model mlx-community/gemma-4-e2b-it-4bit --port 8080
Le modèle est alors disponible à http://localhost:8080/v1, compatible avec toute bibliothèque cliente OpenAI.
Choisir la bonne variante
| Tag | Disque | RAM Nécessaire | Idéal Pour |
|---|---|---|---|
gemma4:e2b-mlx |
6.5 Go | 8 Go | Macs d'entrée/anciens |
gemma4:e4b-mlx |
8.8 Go | 12 Go | La plupart des MacBooks |
gemma4:12b-mlx |
7.7 Go | 16 Go | Meilleur équilibre (contexte 256K) |
gemma4:26b-mlx |
18 Go | 24 Go | Haute qualité, efficacité MoE |
gemma4:31b-mlx |
19 Go | 32 Go | Puissance de raisonnement maximale |
Si vous avez téléchargé une variante Gemma 4 MLX avant Ollama 0.31, re-téléchargez-la avec ollama pull gemma4:12b-mlx pour obtenir la version avec le support de la prédiction multi-token. L'accélération (jusqu'à 90% sur les benchmarks de codage) est automatique — aucun drapeau ou configuration nécessaire.
Avec MLX, Gemma 4 transforme les Mac Apple Silicon en postes de travail IA locaux de première classe. Que vous utilisiez la commodité d'Ollama ou la flexibilité de MLX-LM, vous obtenez toute la puissance des modèles ouverts les plus capables de Google — complètement privés, hors ligne et fonctionnant à la vitesse native de Metal.