Vous avez peut-être vécu cette scène. Le matin, Claude vous aide à préparer la fiche conseil d'un atelier, puis vous continuez dans la même conversation pour le programme, puis pour le mail d'invitation. Vers midi, un message vous annonce que vous avez atteint votre limite. Vous n'avez pourtant envoyé qu'une vingtaine de messages, pas plus longs que ceux d'hier. Ce qui a changé, ce n'est pas ce que vous avez demandé. C'est tout ce que Claude a dû relire pour vous répondre.
Cet article explique ce mécanisme simplement, avec une image de cabinet, puis les leviers qui en découlent : d'abord ceux de claude.ai, accessibles à tous, ensuite ceux que j'ai mesurés dans Claude Code, la version de Claude qui travaille depuis le terminal, cette fenêtre où l'on tape des commandes.
Mes chiffres viennent d'un audit de mes 34 derniers jours de Claude Code, mené le 20 septembre. Il m'a rendu deux nombres : 111 922 appels au modèle, et 326 885 jetons de contexte relus en moyenne à chaque appel. Multipliés, ils font 36,6 milliards, dont 35,5 milliards lus depuis le cache. Pas écrits, pas produits : relus. L'histoire de cet audit, la session restée ouverte 5 jours et les fausses pistes, est racontée dans un autre article. Ici, je m'en tiens au mécanisme et aux leviers.
Deux mots avant de commencer
Claude ne compte pas en mots mais en jetons, des fragments de mots qui servent d'unité de mesure au texte. Le contexte, c'est tout ce que Claude a sous les yeux au moment de répondre : vos messages, ses propres réponses, les documents collés, les résultats de ce qu'il a consulté. Un tour, c'est un aller-retour : vous envoyez, il répond.
Pourquoi une conversation coûte au carré
Commençons par une image. Imaginez qu'avant chaque séance avec un client, vous deviez relire à voix haute tout son dossier, depuis la toute première consultation. À la première séance, une page. À la dixième, dix pages. Aucune séance n'est plus longue que les autres, et pourtant la lecture préalable s'allonge à chaque fois.
Additionnez maintenant ce que vous avez relu en tout. Après 10 séances : 1 + 2 + 3, jusqu'à 10, soit 55 pages. Après 20 séances : 210 pages. Deux fois plus de séances, presque quatre fois plus de lecture. C'est exactement ce qui se passe dans une conversation avec Claude.
Un modèle ne se souvient de rien entre deux requêtes. Pour qu'il ait l'air de suivre, Claude Code renvoie la conversation entière à chaque fois : votre premier message, sa première réponse, le fichier lu au tour 3, l'erreur du tour 7. Et chaque fois que Claude lance un outil, une nouvelle requête repart avec tout ce bloc. Le dixième message fait donc relire dix fois plus que le premier.
Prenez 5 000 jetons ajoutés à chaque tour. Le tour 1 en relit 5 000, le tour 10 en relit 50 000, le tour 100 en relit 500 000. Additionnés, ils dessinent un triangle, et la surface d'un triangle croît avec le carré de son côté. Une session deux fois plus longue ne coûte pas deux fois plus : elle coûte presque quatre fois plus.
Jetons relus à chaque tour, avec 5 000 jetons ajoutés par tour
Tours 1 à 10 : 275 000 jetons relus au total
Tours 11 à 20 : 775 000 de plus, pour 10 tours de plus
Calcul, pas une mesure. Total relu sur n tours = 5 000 x n x (n + 1) / 2. Rapports : 1 050 000 / 275 000 = 3,8 et 25 250 000 / 275 000 = 91,8. Ils tendent vers 4 et 100 quand la session s'allonge.
Sur mes 34 jours, ce triangle expliquait l'essentiel de la note : mes sessions les plus longues pesaient à elles seules une part écrasante du budget, comme je le raconte dans l'histoire de la session de 5 jours. La règle qui en découle est la première de toutes : garder le triangle petit. Tout le reste de cet article porte sur ce qu'on met dedans.
Le cache adoucit la note, il ne l'efface pas
Il existe un amortisseur : le cache. Ce qui a déjà été envoyé tel quel est gardé de côté quelque temps, et sa relecture coûte moins cher qu'un contenu neuf. Sur l'API, où l'on paie au jeton, une lecture de cache coûte 10 % du prix d'entrée sur la plupart des modèles, et 5 % sur Opus 5.5, soit 0,20 $ le million de jetons contre 4 $ en entrée normale.
Réduit, pas zéro. Multipliez 5 % par des centaines de tours et par un demi-million de jetons, et le rabais devient une grosse somme. Sur un abonnement, la relecture use la même limite, découpée en une fenêtre de 5 heures et une fenêtre hebdomadaire.
Et le cache a une durée de vie. Dans Claude Code, la documentation la donne à une heure sur un abonnement : le premier message après une pause plus longue relit tout le contexte au prix fort. Sur claude.ai, le centre d'aide dit la même chose des documents d'un Projet : le cache expire après une période d'inactivité, et le premier message après une longue pause recompte ces documents en entier. Une conversation énorme qu'on rouvre le lundi matin coûte donc doublement : elle est longue, et elle n'est plus en cache.
Sur claude.ai : ce qui grossit le triangle, et comment le garder petit
Sur claude.ai, vous ne voyez pas de jetons, mais le mécanisme est le même. Le centre d'aide de Claude liste ce qui pèse sur vos limites : la longueur de vos messages, la taille des fichiers joints, la longueur de la conversation en cours, les outils utilisés, le modèle et le niveau d'effort. Il précise que les conversations longues, celles où Claude doit résumer les premiers échanges pour continuer, consomment davantage de votre limite. Votre usage de claude.ai, de l'application de bureau et de Claude Code se partage d'ailleurs la même limite.
Avec l'image du dossier relu à voix haute, chaque levier devient évident.
Une conversation par sujet remet le triangle à zéro. Nouveau sujet, nouveau dossier : on ne relit pas les notes de l'atelier sommeil pour écrire le mail de relance d'une facture. C'est le levier le plus puissant, parce qu'il agit sur la longueur, donc sur le carré.
Un court résumé remplace l'historique. Quand un travail doit continuer, ouvrez une nouvelle conversation et mettez en premier message dix lignes qui résument où vous en êtes. Le nouveau triangle part d'une base de dix lignes au lieu de trois semaines d'échanges. Le centre d'aide le conseille d'ailleurs en toutes lettres : si vous approchez de votre limite dans une longue conversation, ouvrez-en une nouvelle.
Recoller un document le fait relire à chaque tour suivant. Coller votre charte de 20 pages au message 3, puis de nouveau au message 15 « pour être sûre », c'est ajouter deux fois 20 pages au dossier, relues à chaque échange jusqu'à la fin. Une fois suffit, et une fois dans un Projet vaut mieux.
Un Projet range vos documents de référence à part. Un Projet regroupe des conversations autour d'un sujet, avec ses propres instructions et ses fichiers. Ses documents sont mis en cache et comptent moins quand vous vous en resservez. Les Projets utilisent aussi une méthode de recherche qui ne charge que les passages utiles au lieu de tout faire lire.
Des réponses courtes grossissent moins le dossier. Ce que Claude écrit reste dans la conversation et sera relu à chaque tour suivant. Une réponse de trois paragraphes quand vous en vouliez un, c'est deux paragraphes relus pour rien jusqu'à la fin. Demandez la longueur que vous voulez, une fois, dans les instructions de votre Projet.
Ce qui est branché pèse aussi. Le centre d'aide rappelle que les outils et les connecteurs, ces branchements vers votre messagerie, votre agenda ou vos documents, consomment beaucoup. Il conseille de couper ceux dont la conversation n'a pas besoin, de demander à Claude de ne pas chercher sur le web quand l'actualité n'importe pas, et de baisser le niveau d'effort, la quantité de réflexion que Claude s'autorise, pour les tâches de routine.
Dans un cabinet : le référentiel recollé à chaque fiche
Exemple inventé, pour illustrer le mécanisme. Nadia est diététicienne à Bordeaux. Après chaque première consultation, elle remet une fiche conseil générique : équilibre du petit-déjeuner, collations, hydratation. Pour que Claude respecte ses habitudes, elle a rédigé un référentiel de 30 pages : ses repères, ses formulations, ce qu'elle ne recommande jamais.
Sa façon de faire actuelle : une seule conversation « Fiches », dans laquelle elle recolle son référentiel à chaque nouvelle fiche, « pour que Claude ne l'oublie pas ». Au bout de six fiches, la conversation contient six fois 30 pages, et chaque nouvelle demande les relit toutes. Elle n'a jamais changé sa façon de demander, et pourtant chaque fiche lui coûte plus que la précédente.
Étape 1 : un Projet, un seul exemplaire du référentiel
Nadia crée un Projet « Fiches conseil ». Elle y dépose son référentiel, une fois, et deux fiches qu'elle aime bien comme modèles. Dans les instructions du Projet, quelques lignes :
Tu m'aides à rédiger des fiches conseil génériques pour mon cabinet de diététique.
Appuie-toi sur le référentiel et les fiches modèles de ce Projet.
Vouvoie le lecteur. Une page maximum. Réponses courtes, sans introduction.
Pas de diagnostic, pas de dosage individuel : la fiche est générale,
l'adaptation se fait en consultation.
Si une information te manque, écris [à compléter] au lieu d'inventer.
Étape 2 : une conversation par fiche
Pour chaque fiche, une conversation neuve dans le Projet :
Nouvelle fiche : les collations de l'après-midi pour quelqu'un qui travaille
en horaires décalés. Trois repères concrets, un exemple de journée type,
et une ligne finale qui renvoie vers la consultation pour l'adaptation.
Le référentiel est lu une fois par conversation, pas six fois. Et chaque conversation reste courte, donc son triangle reste petit.
Étape 3 : quand une fiche demande plusieurs allers-retours
Si une fiche traîne sur quinze échanges, Nadia ne continue pas indéfiniment. Elle demande un résumé et repart d'une conversation neuve :
Résume en 8 lignes où nous en sommes sur cette fiche : ce qui est validé,
ce qui reste à reprendre, et les formulations que je t'ai demandé de changer.
Elle colle ce résumé en premier message d'une nouvelle conversation du Projet, et continue.
Le garde-fou : générique d'un côté, personnel de l'autre
La fiche conseil est générique. Tout ce qui est personnel reste hors de Claude, ou n'y entre qu'anonymisé. Ce qui touche à la santé d'une personne est une donnée sensible au sens de l'article 9 du RGPD, et relève du secret professionnel pour les professions concernées. Si Nadia veut adapter une fiche à un cas, elle retire nom, date de naissance, coordonnées, et tout ce qui relierait un trouble à une personne reconnaissable. Elle écrit « une cliente de 40 ans qui travaille de nuit », pas un prénom et une pathologie. Et elle relit chaque fiche avant de la remettre : Claude ne pose pas de diagnostic, il met en forme ce qu'elle a décidé.
Pour aller plus loin, si vous utilisez Claude Code
Ce qui suit concerne ceux qui travaillent avec Claude Code dans le terminal : les leviers que j'ai mesurés sur mes propres sessions, chacun avec son pourcentage. Si vous n'utilisez que claude.ai, vous pouvez sauter jusqu'à « Ce que vous pouvez faire lundi ».
Ce que Claude écrit, je le repaie
Le 23 septembre, j'ai mesuré de quoi était fait mon contexte. Les réponses de l'assistant en représentaient 31,3 %. Près d'un tiers de ce que Claude relisait à chaque tour, c'était lui-même.
De quoi était fait mon contexte
Calcul, pas une mesure
Si ces réponses étaient deux fois plus courtes : 31,3 / 2 = 15,65 % de contexte en moins, à chaque appel qui suit.
Relevé du 23 septembre 2026 sur mes transcripts. Le détail du reste n'a pas été mesuré poste par poste.
Une réponse verbeuse ne coûte pas sa longueur. Elle coûte sa longueur multipliée par le nombre de tours qui suivront. Le paragraphe de politesse du tour 5 est encore là au tour 60. J'ai donc écrit dans mes instructions globales, le fichier CLAUDE.md que Claude Code relit à chaque session, une consigne de trois mots : réponses courtes, pas de blabla. La part après ce changement n'est pas encore mesurée. C'est le même geste que les instructions du Projet de Nadia.
Ce qui est chargé avant la première phrase
Avant même votre premier message, Claude Code charge un socle : prompt système, outils, fichiers CLAUDE.md, mémoire, description des skills, ces fiches d'instructions que Claude va lire quand une tâche leur correspond. Chez moi, la médiane était de 76 079 jetons. Dans une session à 500 000 jetons, ce socle ne pèse que 15 % de chaque appel. Dans une session courte, il devient le premier poste. Raccourcir ses sessions rend donc le socle plus visible, pas moins.
Le plus gros fichier de mon socle était mon index de mémoire. 352 entrées, chacune suivie de deux lignes d'annotation. J'ai d'abord cherché les liens morts : zéro sur 352. Le poids n'était pas dans les liens, il était dans le commentaire autour. J'ai tout réécrit en gardant chaque lien et en réduisant chaque annotation à quelques mots.
Mon index de mémoire, chargé à chaque session
Avant, le 23 septembre24 633 octets
352 liens, 0 lien mort
Après réécriture22 442 octets
406 liens, dont 54 fichiers enfin indexés
Plancher20 300 octets
406 liens x 50 octets
Tailles relevées avec wc -c le 23 septembre 2026. Le plancher est un calcul : 352 + 54 = 406 liens, à environ 50 octets le lien.
Le fichier est passé de 24 633 à 22 442 octets, soit 8,9 % de moins, alors qu'il indexe désormais 54 fichiers de plus, qui existaient sur le disque sans que rien ne pointe vers eux. Et il y a un plancher : 406 liens à 50 octets pièce, environ 20 300 octets. En dessous, réduire veut dire supprimer des entrées, donc accepter d'oublier. C'est un arbitrage, plus une optimisation.
L'équivalent sur claude.ai, ce sont les instructions de vos Projets. Le centre d'aide conseille de les garder courtes et centrées sur l'essentiel, et de retirer les fichiers dont vous ne vous servez plus.
Trois gestes qui gardent le triangle petit, et leurs limites
Grouper les commandes. Claude Code agit sur l'ordinateur en lançant des commandes, via un outil appelé Bash. Sur 34 jours, ces commandes shell faisaient 72,6 % de mes appels d'outils. Chaque appel est un aller-retour qui relit le contexte entier, même quand son résultat tient en quelques lignes. Au contexte moyen de mon audit, 100 appels de moins font 100 x 326 885 = 32,7 millions de jetons relus en moins. Un seul appel avec des chemins absolus, l'adresse complète du dossier, vaut mieux que trois dont deux ne font que se déplacer avec cd. Le cas le plus caricatural de mon mois, une session qui entrait des milliers de fois dans le même dossier, est détaillé dans l'histoire de l'audit.
Compacter en cours de route. /compact ne jette pas seulement les résultats d'outils, comme je le croyais. Il remplace tout l'historique par un résumé. Le socle se recharge, et Claude Code relit jusqu'à 5 fichiers de la session, les plus récemment modifiés. Le reste des lectures disparaît : le fichier de 800 lignes lu au tour 4, dont trois lignes comptaient, cesse d'être relu à chaque tour. La limite : pour résumer, /compact lit toute la conversation, c'est donc lui-même une grosse requête. Vous pouvez l'orienter : /compact garde les décisions et les fichiers modifiés. C'est l'étape 3 de Nadia, en une commande.
Déléguer la lecture. Quand une question demande de parcourir 40 fichiers, je peux les faire lire dans ma conversation, et je les relis alors à chaque tour restant. Ou je peux envoyer un sous-agent, un assistant secondaire que Claude Code lance avec sa propre fenêtre de contexte, les lire à ma place. Seule sa conclusion revient chez moi.
Claude lit dans ma conversation
Les 40 fichiers entrent dans mon contexte. Je les relis à chaque tour restant, jusqu'à la fin de la session.
Un sous-agent lit à ma place
Les fichiers restent dans sa fenêtre, qui ne touche pas la mienne. Il ne me rend que sa conclusion.
La limite, mesurée chez moi : les sous-agents pèsent 27 % de mon budget, pour 49 752 appels. Chacun repart de zéro avec son propre socle.
Schéma de principe, pas une mesure. Mécanisme : code.claude.com/docs/en/context-window. Les 27 % viennent de l'audit du 20 septembre 2026.
Ce levier a un prix que j'ai mesuré : 27 % de mon budget passait en sous-agents, et chacun repart avec son propre socle. Je le réserve aux lectures larges, pas aux recherches d'un fichier.
Reste un faux coupable : les serveurs MCP, ces branchements qui donnent à Claude Code l'accès à un autre outil, l'équivalent des connecteurs de claude.ai. Par défaut, Claude Code ne charge que le nom des outils et les instructions du serveur, et va chercher le détail d'un outil au moment où il sert. Chez moi, ils pesaient presque rien. Seule exception à surveiller : l'option alwaysLoad, qui charge tous les outils d'un serveur dès le démarrage.
Ce que vous pouvez faire lundi
Les 10 sessions les plus longues44,7 % du budget
mesuré
Réponses de l’assistant31,3 % du contexte
mesuré
Sous-agents27 % du budget
mesuré
Index de mémoire, réécrit- 8,9 % de sa taille
calcul : 2 191 / 24 633
Appels shell pour un cd6,9 % des appels shell
calcul : 3 124 / 45 008
Serveurs MCP appelés< 0,1 % du budget
mesuré
Audit du 18 août au 20 septembre 2026 (887 transcripts, 111 922 appels) et relevé du 23 septembre. Budget = jetons pondérés, cache lu x 0,1 et sortie x 5, pas des euros.
Sans rien installer, sur claude.ai ou dans l'application :
- Cherchez le document que vous recollez le plus souvent, charte, référentiel, trame d'atelier, et mettez-le dans un Projet. À partir de là, ne le collez plus jamais dans une conversation.
- Demandez des réponses courtes, une fois pour toutes, dans les instructions de ce Projet. Et quand une conversation dépasse une quinzaine d'échanges, faites-la résumer en quelques lignes et repartez d'une conversation neuve.
Si vous utilisez Claude Code :
- Tapez
/contextau milieu d'une session longue. Il montre ce qui occupe la fenêtre, poste par poste. Repérez la ligne des messages : c'est elle qui grossit au carré. - Demandez des réponses courtes dans votre fichier CLAUDE.md. Chaque paragraphe évité est retiré de tous les tours suivants.
- Mesurez votre socle :
wc -c ~/.claude/CLAUDE.mdet vos fichiers de mémoire. Un fichier chargé à chaque session doit être un index, un lien et trois mots pour savoir quand l'ouvrir, pas un récit. - Groupez vos commandes dans un seul appel, chemins absolus, sans
cdisolé. - Envoyez un sous-agent quand une question demande de lire beaucoup de fichiers, et gardez
/compactpour le milieu d'un sujet long.
Je ne cherche plus à économiser sur ce que je demande. J'économise sur ce que je laisse traîner dans la conversation, parce que tout ce qui reste se repaie.
Si vous voulez que je regarde votre cas, prenons 30 minutes.

