本文へ移動

この内容はまだフランス語です

ページ自体は翻訳済みですが、詳細な内容はまだです。機器の解説、ガイド、カタログはフランス語のまま表示されます。粗い機械翻訳よりも原文をお見せするほうがよいと考えました。 フランス語版を見る

Le cache d'attention, le coût qu'on oublie

À côté du modèle, le moteur garde en mémoire un cache proportionnel à la fenêtre de contexte : plus vous autorisez de tokens, plus il grossit. C'est très souvent lui qui fait déborder une petite machine.

ContexteOrdre de grandeur du cacheUsage typique
2 048 tokensquelques centaines de MoQuestions-réponses courtes
4 096 tokensle double du précédentConversation suivie
8 192 tokensle quadrupleAnalyse de document
32 768 tokensplusieurs GoCorpus long — hors de portée d'une SBC

Le cache dépend aussi de l'architecture du modèle : deux modèles de même taille peuvent avoir des besoins très différents. La règle pratique reste la même : ne réservez jamais plus de contexte que ce dont vous vous servez.