« Beellama.cpp » : différence entre les versions
De Le Wiki de Lug
Autres actions
| Ligne 18 : | Ligne 18 : | ||
| texte = | | texte = | ||
L'utilisation de KVarN avec le mode multi-GPU <code>-sm tensor</code> nécessite au minimum <code>BeeLlama.cpp 0.4.2</code>. Avec les versions antérieures, il faut utiliser <code>-sm layer</code>, moins performant. La branche <code>v0.4.2</code> n'est pas encore une release officielle. | L'utilisation de KVarN avec le mode multi-GPU <code>-sm tensor</code> nécessite au minimum <code>BeeLlama.cpp 0.4.2</code>. Avec les versions antérieures, il faut utiliser <code>-sm layer</code>, moins performant. La branche <code>v0.4.2</code> n'est pas encore une release officielle. | ||
En attendant la | En attendant la sortie officielle : | ||
<pre> | <pre> | ||
# cd /opt/beellama.cpp | # cd /opt/beellama.cpp | ||
Version du 28 juillet 2026 à 07:38
Installation
NVIDIA
- Prérequis : avoir installé le cuda-toolkit
On récupère le projet :
# cd /opt/ # git clone https://github.com/Anbeeld/beellama.cpp.git # cd beellama.cpp
On passe à la compilation :
# export CUDACXX=/usr/local/cuda-13.3/bin/nvcc # cmake -B build -DGGML_CUDA=ON -DGGML_NATIVE=ON -DGGML_CUDA_FA=ON -DCMAKE_BUILD_TYPE=Release -DGGML_LTO=ON -DGGML_CUDA_FA_ALL_QUANTS=ON -DLLAMA_OPENSSL=ON -DLLAMA_BUILD_TESTS=OFF # cmake --build build --config Release -j$(nproc)