This content is still in French
The page itself is translated, but its detailed content is not yet. Hardware sheets, guides and catalogues are still shown in French: we would rather give you the original than a rough machine translation. View the French site
Quel modèle pour quelle machine : dimensionner sa RAM
Étape 2 sur 6
Le cache d'attention, le coût qu'on oublie
À côté du modèle, le moteur garde en mémoire un cache proportionnel à la fenêtre de contexte : plus vous autorisez de tokens, plus il grossit. C'est très souvent lui qui fait déborder une petite machine.
| Contexte | Ordre de grandeur du cache | Usage typique |
|---|---|---|
| 2 048 tokens | quelques centaines de Mo | Questions-réponses courtes |
| 4 096 tokens | le double du précédent | Conversation suivie |
| 8 192 tokens | le quadruple | Analyse de document |
| 32 768 tokens | plusieurs Go | Corpus long — hors de portée d'une SBC |
Le cache dépend aussi de l'architecture du modèle : deux modèles de même taille peuvent avoir des besoins très différents. La règle pratique reste la même : ne réservez jamais plus de contexte que ce dont vous vous servez.