本文へ移動

この内容はまだフランス語です

ページ自体は翻訳済みですが、詳細な内容はまだです。機器の解説、ガイド、カタログはフランス語のまま表示されます。粗い機械翻訳よりも原文をお見せするほうがよいと考えました。 フランス語版を見る

Quand ça ne rentre pas

Quatre leviers, dans cet ordre — du moins coûteux en qualité au plus coûteux :

  1. Réduire le contexte. Passer de 8 192 à 2 048 tokens libère souvent le gigaoctet qui manque, sans toucher à la qualité des réponses courtes.
  2. Fermer le reste. Sur un poste dédié, pas de bureau graphique, pas de navigateur : c'est un ou deux gigaoctets récupérés.
  3. Descendre d'une quantification. Q4_K_M vers Q4_0 ou IQ4_XS gagne 10 à 15 % de mémoire pour une perte modeste. Voir le guide sur la quantification.
  4. Prendre un modèle plus petit. Un 3B qui répond en deux secondes est plus utile qu'un 8B qui rame : dans les faits, c'est presque toujours le bon arbitrage.
Ce qu'il ne faut pas faireAugmenter le fichier d'échange pour « faire tenir » un modèle trop gros. Techniquement, ça démarre. En pratique, chaque token généré déclenche des lectures disque et vous obtenez un mot toutes les quelques secondes, tout en usant le SSD.