« Beellama.cpp » : différence entre les versions
De Le Wiki de Lug
Autres actions
Aucun résumé des modifications |
|||
| Ligne 12 : | Ligne 12 : | ||
# cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA=ON -DCMAKE_BUILD_TYPE=Release -DGGML_LTO=ON -DGGML_CUDA_FA_ALL_QUANTS=ON <font color = green>-DLLAMA_OPENSSL=ON</font> -DLLAMA_BUILD_TESTS=OFF | # cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA=ON -DCMAKE_BUILD_TYPE=Release -DGGML_LTO=ON -DGGML_CUDA_FA_ALL_QUANTS=ON <font color = green>-DLLAMA_OPENSSL=ON</font> -DLLAMA_BUILD_TESTS=OFF | ||
# cmake --build build --config Release -j$(nproc) | # cmake --build build --config Release -j$(nproc) | ||
{{Méta bandeau | |||
| niveau = information | |||
| icône = loupe | |||
| texte = | |||
Lors des tests réalisés avec <code>BeeLlama.cpp 0.4.1</code>, l'utilisation du cache KV <code>KVarN</code>, notamment avec une zone de haute précision de <code>1024</code> ou <code>2048</code> tokens, ne fonctionnait pas avec le mode de répartition multi-GPU <code>-sm tensor</code>. Il fallait utiliser <code>-sm layer</code>, sensiblement moins performant avec plusieurs GPU de faible puissance. | |||
Cette limitation réduit donc fortement l'intérêt pratique de KVarN sur une configuration multi-GPU comme deux RTX 3060 : le gain de mémoire offert par le cache quantifié est obtenu au prix d'une baisse importante des performances. Une prise en charge correcte avec <code>-sm tensor</code> nécessiterait vraisemblablement des modifications du backend hérité de llama.cpp principal. | |||
}} | |||
Version du 27 juillet 2026 à 15:13
Installation
NVIDIA
- Prérequis : avoir installé le cuda-toolkit
On récupère le projet :
# cd /opt/ # git clone https://github.com/Anbeeld/beellama.cpp.git # cd beellama.cpp
On passe à la compilation :
# export CUDACXX=/usr/local/cuda-13.3/bin/nvcc # cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA=ON -DCMAKE_BUILD_TYPE=Release -DGGML_LTO=ON -DGGML_CUDA_FA_ALL_QUANTS=ON -DLLAMA_OPENSSL=ON -DLLAMA_BUILD_TESTS=OFF # cmake --build build --config Release -j$(nproc)