IAMaîtriser l'IA générative Plan du corpus
Accueil/Fondamentaux des LLM

01 — Fondamentaux des LLM

Comprendre ce qu'il y a sous le capot, juste assez pour prompter intelligemment. Pas de maths, pas de théorie inutile.

Temps de lecture : 5 min (ce sommaire) | Niveau : Débutant

Ce que tu sauras faire après

  • Expliquer en une phrase ce que fait un LLM quand tu lui envoies un prompt.
  • Estimer le coût et la faisabilité d'une tâche avant de la lancer.
  • Choisir les bons réglages selon que tu extrais des données ou que tu explores.
  • Repérer une hallucination avant qu'elle n'atterrisse dans un pipeline.
  • Lire une documentation officielle sans bloquer sur le vocabulaire.

Pourquoi cette section

Tu n'as pas besoin de savoir construire un Transformer. Tu as besoin de savoir pourquoi ton prompt donne un résultat différent quand tu changes trois mots, et pourquoi le modèle t'invente une colonne qui n'existe pas.

Cette section répond à ces deux questions, et uniquement à ces deux questions. Tout ce qui est ici sert directement à écrire de meilleurs prompts dans ton travail de développement, de data engineering et de data analytics.


Les fichiers de la section

OrdreFichierCe que ça couvreDurée
101-comment-fonctionne-un-llm.mdLa prédiction du token suivant, les trois étapes d'entraînement (pre-training, fine-tuning, RLHF), pourquoi le modèle est probabiliste, et pourquoi la formulation change tout.12 min
202-tokens-contexte-fenetre.mdCe qu'est un token, les ordres de grandeur, la fenêtre de contexte, ce qui tient dans 200k et 1M tokens, le coût, la latence, et quoi faire quand un fichier est trop gros.14 min
303-parametres-du-modele.mdtemperature, top_p, max_tokens, stop sequences, system prompt, effort de raisonnement : à quoi ça sert, ce qui est déprécié, quand y toucher, exemples d'appel API Python.15 min
404-limites-hallucinations-biais.mdPourquoi les hallucinations arrivent, la date de coupure des connaissances, le calcul mental, les biais, les risques sur les données d'entreprise, et les parades avec les prompts exacts.14 min
505-glossaire.md72 termes FR/EN du domaine en tableau, du token au serveur MCP, avec une définition en une phrase chacun.10 min

Temps total : environ 65 minutes de lecture active.


Ordre de lecture conseillé

Si tu lis tout d'une traite

Suis l'ordre 1, 2, 3, 4, 5. Chaque fichier s'appuie sur le précédent :

  1. 01 pose le mécanisme (prédiction du token suivant).
  2. 02 en tire les conséquences pratiques (compter, budgéter, découper).
  3. 03 te donne les boutons à régler.
  4. 04 te dit où ça casse et comment s'en prémunir.
  5. 05 reste ouvert à côté, comme dictionnaire.

Si tu as 20 minutes

Lis 01 puis 04. Ce sont les deux fichiers qui changent immédiatement la qualité de tes prompts.

Si tu es déjà à l'aise

Va directement à 03 pour les paramètres et à 02 section 5 pour les stratégies quand un fichier est trop gros.

Si tu bloques sur un mot

Ouvre 05 et reviens. Le glossaire est conçu pour être consulté, pas lu en entier.


Ce que tu repères tout de suite dans chaque fichier

Chaque fichier contient au moins un template prêt à copier-coller, avec des [CHAMPS_A_REMPLIR] en majuscules entre crochets. Tu n'as rien à formuler toi-même : tu remplaces les crochets et tu envoies.

Les templates les plus utiles de la section :

  • Fichier 01 : le gabarit de prompt structuré (ROLE / CONTEXTE / TACHE / CONTRAINTES / FORMAT / RAPPEL).
  • Fichier 02 : le prompt pour faire analyser un gros fichier sans l'envoyer.
  • Fichier 03 : le gabarit d'appel API déterministe pour la data.
  • Fichier 04 : le bloc anti-hallucination, à coller au-dessus de toute demande technique.
  • Fichier 05 : le prompt pour faire expliquer un terme technique inconnu.

Le template de cette page : se faire interroger sur ce qu'on vient de lire

Colle ce prompt après avoir lu un fichier. Il te fait réviser sans que tu aies à formuler quoi que ce soit.

ROLE
Tu es formateur en IA generative. Tu t'adresses a un developpeur et data engineer francophone.

CE QUE JE VIENS DE LIRE
[COLLE_ICI_LA_SECTION_A_RETENIR_DU_FICHIER]

TACHE
1. Pose-moi 5 questions courtes sur ce contenu, une par une, en attendant ma reponse.
2. Apres chaque reponse, dis si c'est juste, et corrige en une phrase.
3. A la fin, donne-moi un exercice concret a faire dans mon travail de [SQL | Python | dbt | Airflow].

CONTRAINTE
Ne sors pas du contenu que je t'ai colle. Si une question demande une information absente, dis-le.

Avant de commencer

Deux précisions honnêtes sur ce corpus :

  • Les chiffres bougent. Les tailles de contexte, les prix et les dates de coupure cités viennent des pages officielles consultées en septembre 2026. Vérifie sur la page source avant de t'appuyer dessus pour un budget.
  • Quand une information n'est pas vérifiable, c'est écrit. Tu verras des encadrés du type "point d'honnêteté" ou "précision de méthode" (fichiers 02, 03 et 04). Ce ne sont pas des oublis : c'est la limite de ce que les documentations publient réellement.

À retenir

  • Cette section sert à une chose : rendre tes prompts plus prévisibles.
  • Le mécanisme de base (prédiction du token suivant) explique 90 % des comportements qui te surprennent.
  • Le token est l'unité de coût, de vitesse et de limite : apprends à le compter.
  • Chaque fichier se termine par un template à copier-coller, pour ne jamais avoir à inventer une formulation.
  • Le glossaire (fichier 05) est un outil de consultation, garde-le ouvert.

Dépôts GitHub à explorer

Ces dépôts te font voir de tes yeux ce que la section décrit : le découpage en tokens, le code complet d'un modèle de langage, les paramètres d'appel, et la mesure d'une hallucination. Tous se clonent et tournent sur ton poste dans la journée.

DépôtCe qu'on y trouvePar où commencer
openai/tiktokenLe tokenizer BPE d'OpenAI. Tu comptes tes tokens en local, gratuitement, sans appel API.tiktoken/_educational.py : la fonction visualise_tokens() colorie chaque token dans ton terminal.
karpathy/minbpeL'algorithme BPE en quelques centaines de lignes de Python lisible. Tu comprends enfin pourquoi un mot rare coûte plus de tokens qu'un mot courant.lecture.md à la racine, puis minbpe/basic.py.
rasbt/LLMs-from-scratchLe code du livre Build a Large Language Model (From Scratch), chapitre par chapitre, en PyTorch.ch02/01_main-chapter-code/ch02.ipynb : tokenisation, fenêtre glissante, embeddings.
karpathy/nanoGPTUn GPT entier, entraînement compris, tenu dans une poignée de fichiers.model.py : toute l'architecture Transformer dans un seul fichier court.
anthropics/coursesLes notebooks pédagogiques d'Anthropic. Dépôt archivé le 15 septembre 2026 : lecture seule, mais le code tourne toujours.anthropic_api_fundamentals/04_parameters.ipynb : temperature, max_tokens, stop sequences en direct.
confident-ai/deepevalUn framework de test pour LLM, dans l'esprit de pytest. Il embarque une métrique Hallucination prête à l'emploi.deepeval/metrics/hallucination/hallucination.py, puis le dossier examples/.

Clone celui-là en premier : openai/tiktoken. C'est le seul qui répond à une question que tu te poses dès aujourd'hui : combien de tokens fait ce fichier, et donc combien il va me coûter. Un pip install tiktoken suffit, pas de GPU, pas de clé API. Ensuite seulement, va lire karpathy/minbpe pour comprendre ce qui se passe dessous.

Sources

Corpus personnel de formation · genere le 26/09/2026 · source : README.md