Paramètres IA décryptés : Température, Tokens, Top-P et plus encore (Glossaire 2026)
Guides

Paramètres IA décryptés : Température, Tokens, Top-P et plus encore (Glossaire 2026)

Si vous avez passé un peu de temps avec des outils IA — surtout côté API — vous avez forcément buté sur des termes comme temperature, top-p, tokens, context window, RLHF, et une dizaine d'autres. La plupart des documentations les expliquent en supposant que vous les connaissez déjà à moitié. Ce glossaire est la version que j'aurais voulu avoir quand j'ai commencé : des définitions en langage courant, pourquoi chaque terme compte, et dans quels cas vous seriez amené à le toucher.

Il est organisé en cinq rubriques — choisissez celle dont vous avez besoin ou lisez-le de bout en bout comme une introduction.

1. Tokens & contexte

Avant de parler de paramètres, il faut maîtriser le vocabulaire de ce que le modèle consomme et produit réellement.

Visualisation d'un texte découpé en blocs de tokens colorés

Token

L'unité de base qu'un modèle de langage lit et écrit. Un token correspond généralement à quelques caractères — parfois un mot court entier (« chat »), parfois un fragment (« tion », « ment »), parfois un seul caractère. En règle générale pour le français, 1 token ≈ 4 caractères ≈ ¾ d'un mot, donc 1 000 tokens représentent environ 750 mots. La tarification est presque toujours au token (entrée et sortie comptées séparément).

Tokenizer

La fonction qui transforme du texte en tokens avant que le modèle ne le traite. Différentes familles de modèles utilisent des tokenizers différents, ce qui explique pourquoi un même paragraphe peut consommer un nombre de tokens légèrement différent selon les plateformes.

Fenêtre de contexte (context window ou context length)

Le nombre maximum de tokens que le modèle peut garder « en mémoire » à un instant donné — votre prompt, les instructions système, la conversation précédente et la réponse en cours de génération compris. Les grands modèles modernes offrent des fenêtres de 200 K à 1 M de tokens ; les modèles plus anciens ou moins coûteux proposent 8 K à 32 K. Si vous dépassez la limite, le contenu le plus ancien est écarté ou votre requête échoue.

Tokens d'entrée vs tokens de sortie

Les tokens d'entrée sont ce que vous envoyez (prompt, message système, historique, documents joints). Les tokens de sortie sont ce que le modèle génère en retour. Les tokens de sortie sont généralement 3 à 5 fois plus chers que les tokens d'entrée, car générer est plus exigeant que lire.

Max tokens (max_output_tokens)

Un plafond par requête sur le nombre de tokens que le modèle est autorisé à générer avant de s'arrêter. Définissez-le pour contrôler le coût et la latence. Beaucoup d'API ont une valeur par défaut de quelques milliers ; augmentez-la pour des sorties longues, réduisez-la pour des réponses concises.

2. Les curseurs d'échantillonnage

Quand un modèle choisit le prochain token, il dispose en réalité d'une distribution de probabilités sur tous les tokens possibles. Les curseurs d'échantillonnage façonnent la façon dont cette distribution se traduit en un choix unique. Ce sont les leviers que la plupart des gens actionnent via l'API.

Diagramme de distribution des probabilités montrant comment la température, le top-p et le top-k influencent chacun le choix du prochain token par le modèle

Température

Contrôle le degré d'aléatoire global. Une température basse (0–0,3) pousse le modèle à choisir presque systématiquement le token le plus probable — déterministe, répétitif, « sans risque ». Une température haute (1,0+) aplatit la distribution de probabilités, rendant des tokens moins probables viables — plus créatif, plus surprenant, plus susceptible d'erreurs. Une bonne valeur de départ pour la plupart des cas de chat est 0,7. Descendez à 0,0–0,2 pour le code, les maths ou l'extraction de faits. Montez à 1,0+ pour l'écriture créative ou le brainstorming.

Top-P (échantillonnage par noyau)

Plutôt que de considérer tous les tokens, le top-p dit : « ne prends en compte que le plus petit ensemble de tokens dont la probabilité cumulée atteint au moins P. » Ainsi, avec top-p = 0,9, le modèle échantillonne parmi les tokens qui couvrent ensemble 90 % de la masse de probabilité — ignorant la longue traîne. C'est une alternative plus intelligente et dynamique au top-k. Valeur courante par défaut : 0,9 ou 1,0 (désactivé).

Top-K

Ne considère que les K tokens suivants les plus probables, puis échantillonne parmi eux. Top-k = 1 correspond au décodage glouton (on choisit toujours le token le plus probable) ; top-k = 40 conserve les 40 meilleurs candidats. Les API modernes (OpenAI, Anthropic) n'exposent souvent pas le top-k directement car le top-p se comporte généralement mieux, mais il est standard dans les modèles open source.

Pénalité de fréquence

Pénalise les tokens qui ont déjà été générés dans la réponse, proportionnellement à leur nombre d'apparitions. Utile pour réduire les répétitions littérales. Plage typique : -2,0 à +2,0 ; valeur par défaut : 0.

Pénalité de présence

Similaire à la pénalité de fréquence, mais binaire : pénalise les tokens qui sont apparus ne serait-ce qu'une fois, quel que soit leur nombre d'occurrences. Encourage le modèle à introduire de nouveaux sujets ou mots. Même plage, même valeur par défaut.

Séquences d'arrêt

Des chaînes de caractères qui forcent le modèle à interrompre la génération dès qu'il les produit. Utiles pour les sorties structurées (« arrête-toi quand tu génères ### ») ou pour garder les réponses dans un format précis.

Seed (graine)

Un entier qui fixe le générateur de nombres aléatoires. Le même prompt + la même seed + la même version de modèle produisent généralement le même résultat — ce qui est essentiel pour la reproductibilité, les évaluations et le débogage. À noter : la plupart des fournisseurs qualifient cela de « meilleur effort » — le déterminisme parfait n'est pas garanti sur toute l'infrastructure.

Comparaison rapide : température vs top-p vs top-k

[table caption="Les trois curseurs d'échantillonnage côte à côte"] | Curseur | Ce qu'il fait | Plage typique | Augmenter | Diminuer | | Température | Accentue ou aplatit toute la courbe de probabilité | 0,0 – 2,0 (défaut ~0,7) | Plus créatif, plus aléatoire | Plus déterministe, plus répétitif | | Top-P | Ne conserve que les tokens couvrant P% de la masse de probabilité | 0,0 – 1,0 (défaut 0,9 – 1,0) | Plus de variété dans le choix des mots | Sorties plus resserrées et plus sûres | | Top-K | Ne conserve que les K tokens les plus probables | 1 – ∞ (souvent désactivé dans les API modernes) | Plus de variété | Plus resserré ; K=1 = glouton | [/table]

Erreur fréquente : modifier les trois à la fois. Choisissez-en un — généralement la température pour le contrôle de la créativité, ou le top-p pour régler la diversité — et laissez les autres à leurs valeurs par défaut. Empiler des pénalités sur une température basse est la principale source des rapports de « sorties bizarres ».

3. Comment les modèles raisonnent

Inutile d'être ingénieur en ML pour utiliser des outils IA, mais quelques termes d'architecture reviennent constamment dans les comparatifs de produits.

Paramètres

Les nombres internes au modèle, ajustés pendant l'entraînement. Un « modèle 70B » en possède 70 milliards. Plus grand rime généralement avec plus intelligent et plus coûteux, mais la relation est devenue moins linéaire à mesure que les architectures se sont améliorées — un modèle plus petit bien entraîné peut surpasser un modèle plus grand mais plus ancien.

Embedding (représentation vectorielle)

Un vecteur (une liste de nombres) qui représente le sens d'un texte dans un espace à haute dimension. Les textes de sens proche se retrouvent proches dans cet espace. Les embeddings sont au cœur de la recherche sémantique, du RAG, de la déduplication, de la classification et de la recommandation. À distinguer des modèles de chat — les modèles d'embedding sont plus petits et spécialisés.

Attention

Le mécanisme qui permet à un modèle de décider, lors de la génération de chaque nouveau token, quels tokens précédents « regarder » en priorité. C'est l'innovation centrale des transformers. Vous n'y touchez pratiquement jamais directement, mais c'est pourquoi les fenêtres de contexte ont autant d'importance.

Transformer

L'architecture de réseau de neurones qui est à la base de pratiquement tous les grands modèles de langage modernes depuis 2017. Quand on parle d'un « LLM », on parle presque toujours d'un transformer.

Mixture of Experts (MoE)

Une architecture où le modèle est divisé en de nombreux sous-réseaux « experts » et où seule une partie d'entre eux s'active pour chaque token. Ainsi, un modèle peut disposer de 400 milliards de paramètres au total mais n'en utiliser que 30 milliards par token — obtenant la connaissance d'un grand modèle à la vitesse d'un petit. Plusieurs modèles de pointe utilisent le MoE sous le capot.

Modèle de raisonnement

Un modèle entraîné à consacrer du calcul supplémentaire à « réfléchir » — en générant des étapes de raisonnement intermédiaires — avant de produire sa réponse finale. Cela améliore considérablement les performances en mathématiques, en programmation et dans les tâches de raisonnement complexe, mais augmente la latence et le coût en tokens. Les modèles de raisonnement sont la catégorie dominante au sommet du classement en 2026.

Chaîne de pensée (Chain-of-Thought, CoT)

Soit une technique de prompting (« réfléchis étape par étape »), soit un comportement intégré aux modèles de raisonnement, où le modèle génère des étapes de raisonnement intermédiaires avant sa réponse finale. Ces étapes sont parfois masquées pour l'utilisateur ; avec les modèles de raisonnement, vous les payez généralement en tokens de sortie, qu'elles soient visibles ou non.

Quantification

Réduction de la précision numérique des paramètres d'un modèle (par ex. de flottants 16 bits à des entiers 4 bits) pour le rendre plus compact et plus rapide, généralement au prix d'une légère perte de qualité. Très répandue dans le monde open source ; moins visible lorsqu'on utilise des modèles via des API propriétaires.

4. Entraînement & alignement

Comment un immense corpus de texte devient un modèle qui répond poliment à vos questions.

Pré-entraînement

La première et la plus coûteuse phase d'entraînement, durant laquelle le modèle acquiert une connaissance générale du langage et du monde en prédisant le token suivant sur d'énormes quantités de texte. C'est là que naît l'essentiel de l'« intelligence ».

Ajustement fin (Fine-tuning)

Une deuxième phase d'entraînement qui adapte un modèle pré-entraîné à une tâche ou un style plus ciblé, à partir d'un jeu de données bien plus réduit. Utilisé pour la spécialisation métier (médical, juridique, code) ou pour aligner le ton et le comportement à une marque spécifique.

RLHF (Apprentissage par renforcement à partir du retour humain)

La technique d'alignement qui a transformé des modèles de langage bruts en assistants utiles. Des humains évaluent les sorties du modèle ; un modèle de récompense est entraîné sur ces évaluations ; puis le modèle de langage est affiné par apprentissage par renforcement pour produire les sorties préférées par ce modèle de récompense. Le RLHF est ce qui permet à ChatGPT et à Claude de refuser les requêtes nuisibles, de suivre les instructions poliment et de rester dans le sujet. Le RLAIF (avec retour d'une IA) est une technique voisine désormais utilisée à grande échelle.

Prompt système

L'instruction de premier niveau qui définit le rôle, le ton, les contraintes et la persona du modèle pour toute une conversation. Traité avec une priorité plus haute que les messages utilisateur par la plupart des fournisseurs. C'est ici que vous dites au modèle ce qu'il est, avant toute tâche spécifique.

Hallucination

Quand le modèle produit une réponse qui semble assurée mais est factuellement fausse ou inventée. Causée par un mélange de lacunes dans les données d'entraînement, la tendance du modèle à générer du texte qui sonne plausible plutôt qu'à vérifier, et une formulation trop confiante. Contre-mesures : baisser la température, utiliser le RAG (lui donner de vraies sources), des instructions explicites du type « dis que tu ne sais pas », et vérifier tout ce qui est important.

Ingénierie de prompt (Prompt engineering)

L'art d'écrire des prompts qui produisent de manière fiable le résultat souhaité. Cela inclut la définition d'un rôle (« tu es un... »), des exemples few-shot, des déclencheurs de chaîne de pensée et des instructions de sortie structurée. À mesure que les modèles ont progressé dans le suivi des instructions, l'ingénierie de prompt est passée de tours de passe-passe obscurs à une écriture claire et précise.

5. Mettre les modèles au travail

Les termes que vous entendrez dans les discussions produit et ingénierie, pas en entraînement.

Inférence

L'acte d'exécuter un modèle entraîné — c'est-à-dire générer une sortie pour une entrée donnée. Distinct de l'entraînement. Le coût de l'inférence est la base de la tarification des API, et la latence d'inférence est ce que les utilisateurs ressentent.

RAG (Génération augmentée par récupération)

Avant de répondre, récupérer des documents pertinents depuis une base de connaissances distincte (généralement via une recherche par similarité d'embeddings) et les injecter dans le prompt comme contexte. Le RAG permet à un modèle petit ou généraliste de répondre avec précision sur vos documents privés, l'actualité ou tout sujet extérieur à ses données d'entraînement. Le schéma dominant pour « une IA qui connaît mes données ».

Utilisation d'outils / appel de fonctions

Permettre au modèle d'invoquer des fonctions ou des API externes dans le cadre de sa réponse — par ex. « consulter la météo », « interroger une base de données », « envoyer un e-mail ». Le modèle émet une requête structurée, votre code l'exécute, vous lui renvoyez le résultat. C'est ce qui transforme un LLM en quelque chose qui peut agir, pas seulement parler.

Agent

Une boucle dans laquelle un modèle utilise des outils et prend ses propres décisions sur plusieurs étapes pour accomplir un objectif — par exemple, naviguer sur le web, modifier des fichiers ou exécuter un flux de travail en plusieurs étapes. Les agents modernes sont essentiellement « modèle de raisonnement + outils + boucle d'itération ». Un terme flou qui désigne aussi bien un bot de support client qu'un assistant de code autonome.

Multimodal

Un modèle qui gère plus que du texte — le plus souvent images et texte ensemble (vision), de plus en plus audio et vidéo aussi. « Multimodal » désigne généralement un seul modèle qui comprend nativement plusieurs modalités, et non un pipeline de modèles distincts.

Vision (ou VLM — modèle vision-langage)

Un cas particulier de multimodal : le modèle peut prendre des images en entrée en parallèle du texte. Utilisé pour l'OCR, la compréhension de diagrammes, le débogage de captures d'écran, l'analyse de documents et tout ce où « montrer plutôt que dire » est primordial.

Streaming

Le modèle envoie sa réponse token par token au fur et à mesure de la génération, plutôt que d'attendre que la réponse entière soit prête. Essentiel pour l'expérience utilisateur en chat — les utilisateurs voient la réponse se dérouler au lieu de fixer un indicateur de chargement. Implémenté sous forme d'événements envoyés par le serveur (server-sent events) sur la plupart des API.

Temps jusqu'au premier token (TTFT)

Le temps écoulé entre l'envoi d'une requête et la réception du premier token de la réponse. C'est la latence que l'utilisateur ressent vraiment. Les modèles de raisonnement ont un TTFT plus élevé car ils réfléchissent avant de parler ; les modèles non-raisonnants diffusent leur premier token en une fraction de seconde.

Tokens par seconde

Le débit une fois la génération lancée. Un modèle rapide moderne peut produire 80 à 200+ tokens par seconde ; les modèles de raisonnement tournent souvent plus lentement car ils génèrent (et paient) des tokens de raisonnement cachés.

L'antisèche la plus courte possible

Si vous ne retenez qu'une chose :

  • Token = ¾ d'un mot. La tarification est au token.
  • Fenêtre de contexte = la quantité de texte que le modèle peut voir à la fois.
  • Température = le curseur de créativité. Basse pour les faits/le code, haute pour les idées.
  • Top-P = une alternative moderne et plus intelligente au top-k. Laissez-le par défaut sauf raison précise.
  • Prompt système = la persona et les règles pour toute la conversation.
  • RAG = comment rendre un modèle compétent sur vos données privées.
  • Modèle de raisonnement = plus lent, plus coûteux, bien plus performant sur les problèmes difficiles.
  • Hallucination = une réponse fausse mais assurée. Vérifiez toujours.

Voilà l'essentiel de ce que vous croiserez au quotidien. Le reste de ce glossaire est là pour quand l'un de ces termes surgit dans une documentation, un tweet ou une fiche de modèle et que vous avez besoin d'un repère rapide.

Alek Blom

Alek Blom is a developer and entrepreneur building web apps, games, and AI tools. He is the founder of Generor, D1rectory, and a portfolio of products spanning AI, finance, and gaming.

Claude Opus 4.7

Claude Opus 4.7 is an AI model by Anthropic. Articles by Opus are AI-generated, editorially reviewed, and published under human oversight by the Generor team.