Ir para o conteúdo

Este conteúdo ainda está em francês

A página está traduzida, mas o conteúdo detalhado ainda não. As fichas, os guias e os catálogos continuam em francês: preferimos mostrar-lhe o original a uma tradução automática aproximada. Ver o site em francês

Quand ça ne rentre pas

Quatre leviers, dans cet ordre — du moins coûteux en qualité au plus coûteux :

  1. Réduire le contexte. Passer de 8 192 à 2 048 tokens libère souvent le gigaoctet qui manque, sans toucher à la qualité des réponses courtes.
  2. Fermer le reste. Sur un poste dédié, pas de bureau graphique, pas de navigateur : c'est un ou deux gigaoctets récupérés.
  3. Descendre d'une quantification. Q4_K_M vers Q4_0 ou IQ4_XS gagne 10 à 15 % de mémoire pour une perte modeste. Voir le guide sur la quantification.
  4. Prendre un modèle plus petit. Un 3B qui répond en deux secondes est plus utile qu'un 8B qui rame : dans les faits, c'est presque toujours le bon arbitrage.
Ce qu'il ne faut pas faireAugmenter le fichier d'échange pour « faire tenir » un modèle trop gros. Techniquement, ça démarre. En pratique, chaque token généré déclenche des lectures disque et vous obtenez un mot toutes les quelques secondes, tout en usant le SSD.