Ir para o conteúdo

Este conteúdo ainda está em francês

A página está traduzida, mas o conteúdo detalhado ainda não. As fichas, os guias e os catálogos continuam em francês: preferimos mostrar-lhe o original a uma tradução automática aproximada. Ver o site em francês

Le cache d'attention, le coût qu'on oublie

À côté du modèle, le moteur garde en mémoire un cache proportionnel à la fenêtre de contexte : plus vous autorisez de tokens, plus il grossit. C'est très souvent lui qui fait déborder une petite machine.

ContexteOrdre de grandeur du cacheUsage typique
2 048 tokensquelques centaines de MoQuestions-réponses courtes
4 096 tokensle double du précédentConversation suivie
8 192 tokensle quadrupleAnalyse de document
32 768 tokensplusieurs GoCorpus long — hors de portée d'une SBC

Le cache dépend aussi de l'architecture du modèle : deux modèles de même taille peuvent avoir des besoins très différents. La règle pratique reste la même : ne réservez jamais plus de contexte que ce dont vous vous servez.