Mode réflexion ou pas : ce qui change réellement dans un modèle d'IA
On imagine volontiers qu'un modèle doté d'un mode réflexion est simplement plus intelligent que celui qui en est dépourvu. La réalité est plus prosaïque et plus intéressante : la différence ne tient pas à l'intelligence du modèle mais à la quantité de calcul qu'il accepte de dépenser avant de s'engager sur une réponse.
Les deux modèles restent des prédicteurs de token suivant. Ni l'un ni l'autre ne comprend, ne planifie ou ne réfléchit au sens humain. Ce qu'un mode réflexion change, c'est la quantité et la structure du texte intermédiaire que le modèle est autorisé à produire avant le token que vous lisez réellement. Ce seul choix de conception se répercute sur tout le reste : la précision sur les problèmes difficiles, la latence, le coût en tokens et le moment où l'ensemble vaut la peine d'être utilisé.
Les modes réflexion ne sont pas réservés aux modèles cloud. Les modèles ouverts exécutés sur Ollama exposent les mêmes contrôles et nous couvrons comment les activer et les désactiver dans notre guide pour désactiver le mode réflexion.
1. Ce que fait réellement un modèle sans mode réflexion
Retirez le langage et un grand modèle de langage de base ne fait qu'une chose : étant donné une séquence de tokens il prédit le token suivant le plus plausible, l'ajoute et recommence. Il n'y a pas d'étape de délibération cachée ni de brouillon interne. Le seul endroit où le raisonnement peut se produire est le texte généré lui-même.
Ce n'est pas aussi limitant que cela en a l'air. Un modèle entraîné uniquement à la prédiction du token suivant a déjà absorbé une énorme quantité de raisonnement implicite pendant l'entraînement, il peut donc répondre correctement à de nombreuses questions en une seule passe. Demandez-lui de traduire une phrase, de résumer un document ou de poursuivre un motif familier et aucune délibération n'est nécessaire.
Là où cela casse, c'est quand la bonne réponse dépend d'une chaîne d'étapes qui doivent toutes être justes. Une multiplication à plusieurs chiffres, un casse-tête logique ou un bug délicat exigent de retenir des résultats intermédiaires et un modèle qui n'a pas de place pour les écrire doit deviner la réponse directement. Il se trompe souvent, avec assurance et fluidité en même temps.
2. Ce qu'ajoute un mode réflexion
Un modèle de raisonnement a été entraîné à produire d'abord une longue portion de texte intermédiaire — la chaîne de pensée — et seulement ensuite la réponse finale. Ces tokens intermédiaires servent de brouillon : le modèle peut énoncer un sous-objectif, calculer un résultat partiel, remarquer qu'il contredit une ligne précédente et corriger le tir avant que l'utilisateur ne voie la réponse.
C'est l'idée clé derrière toute l'approche, formalisée pour la première fois dans Chain-of-Thought Prompting Elicits Reasoning in Large Language Models de Wei et al. Demander à un modèle ordinaire de « réfléchir étape par étape » améliore déjà le raisonnement, mais le gain est fragile. Les modèles de raisonnement intègrent ce comportement dans l'entraînement pour que le modèle produise spontanément une chaîne de pensée, de façon fiable et bien plus longue.
Le mécanisme est le calcul à l'inférence. Un modèle classique dépense environ une passe avant par token de sortie. Un modèle de raisonnement dépense ces mêmes passes sur des tokens que vous ne lirez peut-être jamais, puis quelques passes de plus sur la réponse. Pour un problème difficile, lancer du calcul séquentiel sur la question est souvent plus efficace qu'agrandir le modèle, comme le montre Scaling LLM Test-Time Compute Optimally Can Be More Effective Than Scaling Model Parameters de Snell et al.
3. D'abord un entraînement, ensuite un interrupteur
La présentation populaire d'un « bouton mode réflexion » est légèrement trompeuse. Dans la plupart des cas vous ne basculez pas un module à l'intérieur d'un cerveau figé. Un modèle de raisonnement est généralement la même architecture de base entraînée différemment, par apprentissage par renforcement sur des problèmes à réponses vérifiables ou par distillation depuis un raisonneur plus fort. DeepSeek-R1 l'a rendu concret : la capacité de raisonnement a largement émergé de l'apprentissage par renforcement plutôt que d'exemples supervisés de bon raisonnement.
C'est pourquoi désactiver la réflexion ne transforme pas un modèle de raisonnement en un modèle réellement différent. Cela éteint la longue délibération et demande de répondre directement, ce qui le rend généralement plus rapide mais plus faible sur tout ce qui avait besoin du brouillon. Certaines familles masquent même la trace de raisonnement par défaut et n'exposent que la réponse finale, tout en générant ces tokens en interne.
Il existe aussi un entre-deux. s1: Simple Test-Time Scaling a montré que contrôler la durée de réflexion autorisée — un budget de raisonnement — permet d'arbitrer entre précision et calcul. C'est exactement ce que font les niveaux d'effort des modèles modernes.
4. Le vrai coût de la réflexion
La réflexion n'est pas gratuite et la facture arrive à trois endroits.
- Les tokens. Chaque token de raisonnement est généré, stocké et souvent facturé. Une question qu'une réponse directe traite en 200 tokens peut en consommer des milliers une fois le modèle en pleine délibération.
- La latence. Plus de tokens signifie plus de temps avant une réponse utile. Sur un GPU local avec un seul utilisateur il n'y a pas de traitement par lots pour le masquer, donc un modèle de raisonnement paraît nettement plus lent.
- Le contexte. La trace de raisonnement occupe la fenêtre de contexte. Si elle n'est pas tronquée, elle chasse la conversation qui vous importe réellement et gonfle le cache KV en mémoire.
Il existe aussi un mode d'échec dans l'autre sens. Les modèles de raisonnement peuvent trop réfléchir sur une question triviale — « quelle est la capitale de la France ? » — en brûlant une page de délibération pour produire une réponse d'un mot. Un modèle sans mode réflexion répond simplement et passe à la suite.
5. Lequel exécuter
Les deux ne sont pas tant des concurrents que des outils aux coûts différents. Le tableau ci-dessous cartographie honnêtement les compromis.
| Propriété | Sans mode réflexion | Avec mode réflexion |
|---|---|---|
| Mécanisme | Une passe avant par token de sortie | Longue chaîne de tokens intermédiaires avant la réponse |
| Meilleur pour | Chat, traduction, résumé, rédaction, recherches simples | Maths, logique, code multi-étapes, débogage, planification |
| Latence | Faible et prévisible | Plus élevée, proportionnelle au budget de raisonnement |
| Coût en tokens | Faible | Souvent plusieurs fois supérieur |
| Profil d'erreur | Réponses plausibles mais fausses sur les tâches multi-étapes | Moins d'erreurs de logique, mais peut encore halluciner et trop réfléchir |
| Pression sur le contexte | Minime | La trace consomme la fenêtre et la mémoire |
Pour un usage local quotidien la règle est simple. Utilisez le mode direct pour la conversation et tout ce dont vous connaissez déjà la forme. Activez la réflexion quand la tâche a une réponse vérifiable et qu'une étape fausse ruinerait tout en gardant le niveau d'effort aussi bas que la tâche le permet. Le budget de raisonnement est un curseur, pas un binaire et la compétence consiste à l'ajuster au problème.
6. Des modèles concrets à télécharger dès maintenant
La théorie est facile à vérifier : Ollama embarque les deux types de modèles et plusieurs familles de raisonnement permettent d'activer ou de désactiver le mode réflexion. Voici des exemples représentatifs.
Modèles dotés d'un mode réflexion
| Modèle | Commande Ollama | Remarques |
|---|---|---|
| DeepSeek-R1 | ollama pull deepseek-r1 |
Le raisonneur ouvert de référence. Longue chaîne de pensée par défaut ; des distillations existent en 7B, 14B et 32B pour les petites machines. |
| DeepSeek V4 Flash | ollama pull deepseek-v4-flash |
Modèle général doté d'un mode raisonnement désactivable pour les requêtes simples. |
| Qwen 3.6 | ollama pull qwen3.6 |
Expose un comportement réflexion et non-réflexion dans les mêmes poids ; l'effort varie selon la tâche. |
| Gemma 4 31B | ollama pull gemma4:31b |
Le modèle phare de Google gère un mode réflexion ; la version 12B est le compromis plus léger. |
| Muse Glimmer 30B | ollama pull muse-glimmer:30b |
Le modèle agent de Meta avec effort contrôlable (low, medium, high, xhigh). |
| GLM-5.3 | ollama pull glm-5.3 |
Modèle général capable de raisonnement, aussi disponible en tag cloud. |
| GPT-OSS | ollama pull gpt-oss |
Les poids ouverts d'OpenAI avec des traces de raisonnement affichables ou masquables. |
Modèles conçus sans mode réflexion
| Modèle | Commande Ollama | Remarques |
|---|---|---|
| Llama 3.x | ollama pull llama3.2 |
Modèles instruct classiques : réponses directes, pas d'étape de délibération. |
| Mistral | ollama pull mistral |
Génération de texte rapide et légère, sans trace de raisonnement. |
| Qwen 2.5 | ollama pull qwen2.5 |
La génération précédant la lignée raisonnement 3.x ; répond directement. |
| Gemma 3 | ollama pull gemma3 |
Génération Gemma antérieure, orientée chat et vision plutôt que raisonnement. |
| Phi-4 | ollama pull phi4 |
Modèle compact réglé pour des réponses rapides et directes. |
La frontière n'est pas toujours nette : un modèle de raisonnement exécuté avec la réflexion désactivée se comporte comme la seconde table pour cette requête et certains modèles généraux ne produisent un raisonnement que sur invite explicite. Les tags et les noms évoluent aussi au fil des familles, donc vérifiez ollama show <modèle> après le téléchargement pour voir quels paramètres un build expose réellement.
Les versions récentes l'exposent directement : ollama run --think true|false ou high|medium|low selon le modèle, --hidethinking pour masquer la trace et /set nothink dans une session. Voir le guide dédié pour les commandes exactes.
Conclusion
L'écart entre un modèle doté d'un mode réflexion et un modèle qui en est dépourvu n'est pas un écart de conscience ou de compréhension. Les deux sont des prédicteurs de motifs. Le modèle de raisonnement est simplement autorisé et entraîné à écrire son travail avant de répondre et ce calcul supplémentaire achète de la fiabilité sur les problèmes où une seule supposition ne suffit pas. Savoir quand payer pour cela est la vraie compétence.
Sources
- Chain-of-Thought Prompting Elicits Reasoning in Large Language Models — Wei et al. (arXiv:2201.11903)
- Scaling LLM Test-Time Compute Optimally Can Be More Effective Than Scaling Model Parameters — Snell et al. (arXiv:2408.03314)
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning — DeepSeek-AI (arXiv:2501.12948)
- s1: Simple Test-Time Scaling — Muennighoff et al. (arXiv:2501.19393)