Glossaire#
72 termes du domaine, en français et en anglais, une phrase chacun. À garder ouvert pendant les autres sections.
Temps de lecture : 10 min | Niveau : Débutant
Ce que tu sauras faire après#
Traduire un terme anglais croisé dans une doc vers sa notion française. Distinguer les notions modèle (token, contexte, RAG) des notions outillage (skill, hook, MCP). Lire une page de documentation Anthropic, Google ou Microsoft sans bloquer sur le vocabulaire. Réutiliser les bons mots quand tu écris un prompt ou une issue.
Trois familles de termes se mélangent dans la documentation. Savoir de quelle famille vient un mot évite 80 % des confusions.
Famille Exemples Où c'est documenté Notions modèle token, fenêtre de contexte, température, RAG Glossaire plateforme Anthropic Notions API max_tokens, stop_sequences, output_config.effortRéférence Messages API Notions outillage agent skill, hook, sous-agent, MCP, plugin Glossaire Claude Code
Terme En anglais Définition en une phrase Agent Agent Un système qui utilise un LLM et des outils pour agir de manière autonome sur ton environnement au lieu de seulement répondre du texte. Ancrage Grounding Le fait de fournir au modèle des données de source fiable dans le prompt pour qu'il y appuie sa réponse au lieu de puiser dans sa mémoire. Auto-attention Self-attention Le mécanisme du Transformer qui mesure, pour chaque token, à quel point chacun des autres tokens modifie son interprétation.
Terme En anglais Définition en une phrase Batch (traitement par lots) Batch API Un mode d'appel asynchrone qui traite de gros volumes de requêtes avec 50 % de réduction sur l'entrée et la sortie. Biais Bias Les stéréotypes et déséquilibres présents dans les données d'entraînement qui se retrouvent dans les sorties du modèle. Boucle agentique Agentic loop Le cycle que l'agent répète jusqu'à la fin d'une tâche : rassembler du contexte, agir, vérifier le résultat, recommencer. Boucle de vérification Verification loop Un contrôle exécutable (tests, build, capture d'écran) que l'agent relance jusqu'à ce qu'il passe, au lieu de s'arrêter après un essai. Budget d'attention Attention budget La capacité limitée du modèle à suivre toutes les informations de son contexte, qui s'épuise à mesure que le contexte grossit.
Terme En anglais Définition en une phrase Cache de prompt Prompt caching Un mécanisme qui réutilise un préfixe de prompt déjà traité pour payer la lecture à 0,1x le prix d'entrée au lieu du plein tarif (encore moins sur certains modèles). Chaîne de pensée Chain of thought Une technique qui demande au modèle d'exposer son raisonnement étape par étape avant sa réponse finale. CLAUDE.md CLAUDE.md Un fichier markdown d'instructions persistantes chargé au début de chaque session d'un agent de code. Compaction Compaction Le résumé automatique du début d'une conversation quand on approche de la limite de contexte, pour pouvoir continuer. Comptage de tokens Token counting L'appel count_tokens, gratuit, qui donne le nombre de tokens d'entrée d'une requête avant de l'envoyer vraiment. Connecteur Connector Un serveur MCP rattaché à ton compte plutôt que configuré localement dans ton outil. Context engineering Context engineering L'ensemble des stratégies pour choisir et maintenir le bon jeu de tokens dans le contexte à chaque appel, au-delà de la simple rédaction du prompt. Context rot Context rot La dégradation de la précision et du rappel du modèle à mesure que le nombre de tokens dans la fenêtre augmente. Coupure de connaissances Knowledge cutoff La date au-delà de laquelle le modèle ne sait rien, parce que son entraînement s'est arrêté là.
Terme En anglais Définition en une phrase Découpage Chunking Le fait de couper un contenu trop gros en morceaux traités séparément, puis d'agréger les résultats. Distillation Distillation L'entraînement d'un modèle plus petit à imiter un grand modèle, pour aller plus vite et consommer moins de ressources.
Terme En anglais Définition en une phrase Effort Effort Un paramètre (output_config.effort) qui règle combien de tokens le modèle dépense pour répondre, du niveau low au niveau max. Embedding Embedding La représentation d'un texte sous forme de vecteur de nombres, qui permet de comparer des contenus par similarité. Évaluation Eval Un jeu de cas de test qui mesure objectivement si une modification de prompt ou de modèle améliore vraiment le résultat.
Terme En anglais Définition en une phrase Fenêtre de contexte Context window La mémoire de travail du modèle : tout le texte qu'il peut consulter pour générer sa réponse, réponse comprise. Few-shot Few-shot prompting Le fait de mettre plusieurs exemples d'entrée et de sortie dans le prompt pour montrer au modèle le comportement attendu. Fine-tuning Fine-tuning La poursuite de l'entraînement d'un modèle pré-entraîné sur des données supplémentaires pour qu'il adopte leurs caractéristiques. Frontmatter Frontmatter Le bloc YAML placé entre deux lignes --- en tête d'un fichier markdown, qui porte sa configuration.
Terme En anglais Définition en une phrase Garde-fou Guardrail Une règle ou un contrôle qui empêche le modèle de produire ou d'exécuter quelque chose d'indésirable.
Terme En anglais Définition en une phrase Hallucination Hallucination Du contenu qui semble raisonnable mais qui est faux par rapport à une source de vérification externe. Harnais agentique Agentic harness L'ensemble outils, gestion du contexte et environnement d'exécution qui transforme un modèle de langage en agent capable d'agir. HHH HHH Le cadre de recherche helpful, honest, harmless (utile, honnête, inoffensif) qui guide l'entraînement de Claude. Hook Hook Un gestionnaire défini par l'utilisateur qui s'exécute automatiquement à un point précis du cycle de vie de l'agent, de manière déterministe.
Terme En anglais Définition en une phrase Inférence Inference L'exécution du modèle sur ton prompt pour produire une réponse, par opposition à la phase d'entraînement. Injection de prompt Prompt injection Des instructions hostiles cachées dans un fichier, une page web ou un résultat d'outil, qui tentent de détourner l'agent.
Terme En anglais Définition en une phrase Jeton Token La plus petite unité manipulée par le modèle, qui vaut environ 3,5 à 4 caractères anglais.
Terme En anglais Définition en une phrase Latence Latency Le temps écoulé entre l'envoi du prompt et la réception de la réponse complète. LLM Large language model Un modèle de langage à très grand nombre de paramètres, entraîné sur d'énormes volumes de texte, capable de générer du texte comme un humain.
Terme En anglais Définition en une phrase max_tokens max_tokens Le plafond dur du nombre de tokens que le modèle peut générer sur une réponse, tokens de raisonnement compris. MCP Model Context Protocol Un protocole ouvert qui standardise la façon dont une application fournit du contexte et des outils à un LLM, un peu comme un port USB-C pour l'IA. Mémoire automatique Auto memory Les notes que l'agent écrit pour lui-même à partir de tes corrections et préférences, conservées entre les sessions. Message système System prompt L'instruction permanente qui cadre le rôle, les règles et le format de réponse du modèle, séparée du message utilisateur. Mode de permission Permission mode Le comportement d'approbation par défaut d'une session d'agent, qui détermine ce qu'il peut faire sans te demander. MTok MTok Un million de tokens, l'unité dans laquelle les prix sont affichés : « 4 $ / MTok » se lit « 4 dollars par million de tokens ». Multimodal Multimodal La capacité d'un modèle à prendre en entrée autre chose que du texte, typiquement des images ou des PDF.
Terme En anglais Définition en une phrase Non-déterminisme Non-determinism Le fait que deux appels identiques peuvent donner deux réponses différentes, même avec une température à 0.
Terme En anglais Définition en une phrase One-shot One-shot prompting Le fait de donner un seul exemple d'entrée et de sortie dans le prompt pour cadrer le comportement attendu. Outil Tool Une action que le modèle peut déclencher (lire un fichier, exécuter une commande, chercher sur le web) et dont il reçoit le résultat.
Terme En anglais Définition en une phrase Paramètres (poids) Parameters, weights Les nombres appris pendant l'entraînement qui déterminent les prédictions du modèle, et dont la quantité mesure sa taille. Plugin Plugin Un paquet installable qui regroupe des skills, des hooks, des sous-agents et des serveurs MCP. Pré-entraînement Pretraining La phase initiale d'entraînement sur un énorme corpus non annoté, où le modèle apprend à prédire le mot suivant. Prompt Prompt Le texte que tu envoies au modèle et que celui-ci va continuer. Prompt engineering Prompt engineering L'art d'écrire et d'organiser les instructions envoyées au modèle pour obtenir le résultat voulu.
Terme En anglais Définition en une phrase RAG Retrieval augmented generation Une technique qui récupère des documents pertinents au moment de la requête et les passe dans le contexte pour ancrer la réponse dans des preuves. Raison d'arrêt Stop reason Le champ de la réponse qui dit pourquoi la génération s'est arrêtée : fin naturelle, plafond max_tokens, séquence d'arrêt, ou appel d'outil. Raisonnement étendu Extended thinking, reasoning La réflexion pas-à-pas que le modèle produit avant de répondre, facturée comme des tokens de sortie. RLHF Reinforcement learning from human feedback Une technique où des humains classent des réponses, et le modèle apprend à préférer celles qui ont été mieux classées. Rôle Role L'étiquette d'un message dans la conversation (system ou developer, user, assistant) qui détermine sa priorité et son sens.
Terme En anglais Définition en une phrase Sandbox Sandboxing Une isolation au niveau système du disque et du réseau, qui laisse l'agent travailler librement à l'intérieur d'une frontière que tu définis. Séquence d'arrêt Stop sequence Une chaîne de caractères qui stoppe la génération dès qu'elle apparaît dans la sortie. Serveur MCP MCP server Un programme qui expose des outils, des prompts ou des ressources à un agent via le protocole MCP. Session Session Une conversation avec sa propre fenêtre de contexte, que tu peux reprendre, dupliquer ou lancer en parallèle. Skill Skill Un fichier SKILL.md contenant des instructions ou un mode opératoire que l'agent charge quand c'est pertinent, ou que tu appelles par son nom. Sortie structurée Structured output Une contrainte qui force la réponse à respecter un schéma (souvent JSON) pour qu'elle soit consommable par du code. Sous-agent Subagent Un assistant spécialisé qui tourne dans sa propre fenêtre de contexte, traite une tâche déléguée et renvoie un résumé. Streaming Streaming La réception de la réponse token par token au fil de la génération, au lieu d'attendre la réponse complète.
Terme En anglais Définition en une phrase Température Temperature Un paramètre qui contrôle l'aléatoire du tirage des tokens, du plus conservateur au plus créatif ; déprécié chez Anthropic sur les modèles sortis après Claude Opus 4.6. Tokenizer Tokenizer Le composant qui découpe ton texte en tokens, et dont le changement entre générations de modèles modifie les comptes et donc les coûts. top_k top_k Un paramètre qui limite le tirage aux k tokens les plus probables. top_p top_p, nucleus sampling Un paramètre qui ne garde que les tokens les plus probables dont les probabilités cumulées atteignent la valeur fixée. Tour Turn Une réponse complète du modèle à un de tes messages, incluant tous les appels d'outils intermédiaires. Transformer Transformer L'architecture de réseau de neurones dominante des LLM, composée d'un encodeur et d'un décodeur reliés par l'auto-attention. TTFT Time to first token Le temps écoulé avant que le modèle ne produise le premier token de sa réponse.
Terme En anglais Définition en une phrase Zero-shot Zero-shot prompting Le fait de demander une tâche sans donner aucun exemple dans le prompt.
Template prêt à copier-coller#
Quand tu croises un terme inconnu dans une doc, utilise ce prompt.
Copier TERME
[TERME_EN_ANGLAIS]
CONTEXTE OU JE L'AI VU
[COLLE_LA_PHRASE_OU_LE_PARAGRAPHE]
TACHE
1. Donne la traduction francaise usuelle, ou dis qu'on garde l'anglais.
2. Donne une definition en une seule phrase, sans jargon.
3. Donne un exemple concret en [SQL | Python | dbt | Airflow].
4. Dis a quelle famille il appartient : notion modele, notion API, ou notion outillage agent.
5. Si tu n'es pas sur du sens dans ce contexte precis, dis-le.
À retenir#
Trois familles de termes cohabitent : notions modèle, notions API, notions outillage agent. Identifie la famille avant de chercher le sens. Token, fenêtre de contexte, température et RAG sont des notions modèle : elles valent pour tous les fournisseurs. Skill, hook, sous-agent, plugin et MCP sont des notions outillage : leur définition exacte dépend de l'outil. MCP est un protocole ouvert, pas un produit : plusieurs assistants et IDE le supportent. Quand un terme anglais n'a pas de traduction établie (prompt, token, hook, skill), garde l'anglais et explique-le une fois.
Sources#
Anthropic — Glossaire plateforme (contexte, fine-tuning, HHH, latence, LLM, MCP, pretraining, RAG, RLHF, temperature, TTFT, tokens) Claude Code — Glossaire (boucle agentique, harnais, hook, skill, sous-agent, plugin, session, sandbox, injection de prompt) Model Context Protocol — Introduction Anthropic — Effort Anthropic — Context windows (context rot) Anthropic — Pricing (cache de prompt, batch) Anthropic — Effective context engineering for AI agents Google — Machine Learning Crash Course : Transformers et distillation OpenAI — Text generation (roles developer / user / assistant)