Skip to content

This content is still in French

The page itself is translated, but its detailed content is not yet. Hardware sheets, guides and catalogues are still shown in French: we would rather give you the original than a rough machine translation. View the French site

Le cache d'attention, le coût qu'on oublie

À côté du modèle, le moteur garde en mémoire un cache proportionnel à la fenêtre de contexte : plus vous autorisez de tokens, plus il grossit. C'est très souvent lui qui fait déborder une petite machine.

ContexteOrdre de grandeur du cacheUsage typique
2 048 tokensquelques centaines de MoQuestions-réponses courtes
4 096 tokensle double du précédentConversation suivie
8 192 tokensle quadrupleAnalyse de document
32 768 tokensplusieurs GoCorpus long — hors de portée d'une SBC

Le cache dépend aussi de l'architecture du modèle : deux modèles de même taille peuvent avoir des besoins très différents. La règle pratique reste la même : ne réservez jamais plus de contexte que ce dont vous vous servez.