この内容はまだフランス語です
ページ自体は翻訳済みですが、詳細な内容はまだです。機器の解説、ガイド、カタログはフランス語のまま表示されます。粗い機械翻訳よりも原文をお見せするほうがよいと考えました。 フランス語版を見る
Compiler llama.cpp pour tirer le maximum du processeur
Étape 1 sur 7
Avant de commencer
- Être à l'aise avec le terminal
- Environ 5 Go d'espace disque libre
- Un modèle GGUF déjà téléchargé, ou de quoi le récupérer
Pourquoi compiler
Un binaire distribué doit tourner partout : il n'active que les instructions présentes sur toutes les machines de la famille. Compilé sur place, le moteur utilise les extensions vectorielles réellement disponibles.
- Sur ARM : les instructions
dotprodeti8mmquand le cœur les possède - Sur x86 : AVX2, AVX-512 et les extensions VNNI selon le processeur
- Contrôle direct du nombre de threads, du contexte et de l'attention rapide
- Accès à
llama-bench, l'outil de mesure de référence
Quand ça n'en vaut pas la peineSi Ollama vous donne déjà un débit confortable, gardez-le. Cette étape s'adresse aux machines contraintes où chaque token par seconde compte, ou aux plateformes qu'Ollama ne couvre pas.