この内容はまだフランス語です
ページ自体は翻訳済みですが、詳細な内容はまだです。機器の解説、ガイド、カタログはフランス語のまま表示されます。粗い機械翻訳よりも原文をお見せするほうがよいと考えました。 フランス語版を見る
Quel modèle pour quelle machine : dimensionner sa RAM
Étape 2 sur 6
Le cache d'attention, le coût qu'on oublie
À côté du modèle, le moteur garde en mémoire un cache proportionnel à la fenêtre de contexte : plus vous autorisez de tokens, plus il grossit. C'est très souvent lui qui fait déborder une petite machine.
| Contexte | Ordre de grandeur du cache | Usage typique |
|---|---|---|
| 2 048 tokens | quelques centaines de Mo | Questions-réponses courtes |
| 4 096 tokens | le double du précédent | Conversation suivie |
| 8 192 tokens | le quadruple | Analyse de document |
| 32 768 tokens | plusieurs Go | Corpus long — hors de portée d'une SBC |
Le cache dépend aussi de l'architecture du modèle : deux modèles de même taille peuvent avoir des besoins très différents. La règle pratique reste la même : ne réservez jamais plus de contexte que ce dont vous vous servez.