Basculer le menu
Changer de menu des préférences
Basculer le menu personnel
Non connecté(e)
Votre adresse IP sera visible au public si vous faites des modifications.

« Beellama.cpp » : différence entre les versions

De Le Wiki de Lug
Aucun résumé des modifications
Ligne 12 : Ligne 12 :
  # cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA=ON -DCMAKE_BUILD_TYPE=Release -DGGML_LTO=ON -DGGML_CUDA_FA_ALL_QUANTS=ON <font color = green>-DLLAMA_OPENSSL=ON</font> -DLLAMA_BUILD_TESTS=OFF
  # cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA=ON -DCMAKE_BUILD_TYPE=Release -DGGML_LTO=ON -DGGML_CUDA_FA_ALL_QUANTS=ON <font color = green>-DLLAMA_OPENSSL=ON</font> -DLLAMA_BUILD_TESTS=OFF
  # cmake --build build --config Release -j$(nproc)
  # cmake --build build --config Release -j$(nproc)
== Tests en vrac==
=== Qwen 3.6 27b Q4 MTP kvarn 5 kvarn 5 ===


Pour référence uniquement : kvarn et tail-tokens ne fonctionne pas avec sm tensor...
{{Méta bandeau
# vi /etc/systemd/system/beellama-server.service
  | niveau = information
  | icône = loupe
  | texte  =
Lors des tests réalisés avec <code>BeeLlama.cpp 0.4.1</code>, l'utilisation du cache KV <code>KVarN</code>, notamment avec une zone de haute précision de <code>1024</code> ou <code>2048</code> tokens, ne fonctionnait pas avec le mode de répartition multi-GPU <code>-sm tensor</code>. Il fallait utiliser <code>-sm layer</code>, sensiblement moins performant avec plusieurs GPU de faible puissance.


[Unit]
Cette limitation réduit donc fortement l'intérêt pratique de KVarN sur une configuration multi-GPU comme deux RTX 3060 : le gain de mémoire offert par le cache quantifié est obtenu au prix d'une baisse importante des performances. Une prise en charge correcte avec <code>-sm tensor</code> nécessiterait vraisemblablement des modifications du backend hérité de llama.cpp principal.
Description=llama.cpp Qwen3.6-27B MTP server (KVarN5 test)
}}
After=network-online.target
Wants=network-online.target
[Service]
Type=simple
User=root
WorkingDirectory=/opt/beellama.cpp
ExecStart=/opt/beellama.cpp/build/bin/llama-server \
  -m /opt/models/Qwen3.6-27B-MTP-GGUF/UD-Q4_K_XL/Qwen3.6-27B-UD-Q4_K_XL.gguf \
  --mmproj /opt/models/Qwen3.6-27B-MTP-GGUF/UD-Q4_K_XL/mmproj-BF16.gguf \
  --no-mmproj-offload \
  --image-min-tokens 1024 \
  -ngl 999 \
  -sm tensor \
  -ts 1/1 \
  -t 4 \
  -tb 4 \
  -b 1024 \
  -ub 1024 \
  -c 98304 \
  -np 1 \
  -fa on \
  --load-mode none \
  --cache-type-k kvarn5 \
  --cache-type-v kvarn5 \
  --kv-tail-tokens 1024 \
  --spec-type draft-mtp \
  --spec-draft-n-max 3 \
  --spec-draft-n-min 0 \
  --spec-draft-p-min 0.75 \
  --reasoning on \
  --reasoning-preserve \
  --jinja \
  --chat-template-file /opt/models/Qwen-Fixed-Chat-Templates/chat_template.jinja \
  --chat-template-kwargs '{"preserve_thinking": true}' \
  --reasoning-format none \
  --reasoning-budget 16192 \
  --reasoning-budget-message "D'accord, assez réfléchi, plus d'attente. Passons à l'action." \
  --temp 0.6 \
  --top-k 20 \
  --top-p 0.95 \
  --min-p 0.0 \
  --presence-penalty 0.0 \
  --repeat-penalty 1.0 \
  --host 0.0.0.0 \
  --port 8080 \
  --api-key-file /etc/ai/ssl/api-keys.txt \
  --ssl-key-file /etc/ai/ssl/server.key \
  --ssl-cert-file /etc/ai/ssl/server.crt
Restart=on-failure
RestartSec=5
[Install]
WantedBy=multi-user.target

Version du 27 juillet 2026 à 15:13

Source

Installation

NVIDIA

On récupère le projet :

# cd /opt/
# git clone https://github.com/Anbeeld/beellama.cpp.git
# cd beellama.cpp

On passe à la compilation :

# export CUDACXX=/usr/local/cuda-13.3/bin/nvcc
# cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA=ON -DCMAKE_BUILD_TYPE=Release -DGGML_LTO=ON -DGGML_CUDA_FA_ALL_QUANTS=ON -DLLAMA_OPENSSL=ON -DLLAMA_BUILD_TESTS=OFF
# cmake --build build --config Release -j$(nproc)
Sommaire