Compiler llama.cpp pour tirer le maximum du processeur
Étape 7 sur 7
Installer en service
Pour que le serveur redémarre avec la machine :
shell
sudo tee /etc/systemd/system/llama.service >/dev/null <<'EOF'
[Unit]
Description=llama.cpp server
After=network.target
[Service]
User=pi
WorkingDirectory=/home/pi/llama.cpp
ExecStart=/home/pi/llama.cpp/build/bin/llama-server -m /home/pi/modeles/Qwen3-4B-Q4_K_M.gguf -c 4096 -t 4 --host 0.0.0.0 --port 8080
Restart=always
RestartSec=5
[Install]
WantedBy=multi-user.target
EOF
sudo systemctl daemon-reload
sudo systemctl enable --now llama
systemctl status llama
Adaptez User et les chemins à votre installation.