Basculer le menu
Changer de menu des préférences
Basculer le menu personnel
Non connecté(e)
Votre adresse IP sera visible au public si vous faites des modifications.

« Page IA » : différence entre les versions

De Le Wiki de Lug
Aucun résumé des modifications
Aucun résumé des modifications
 
(7 versions intermédiaires par le même utilisateur non affichées)
Ligne 1 : Ligne 1 :
<div style="width:100%; box-sizing:border-box; border:1px solid #a2a9b1; background:#eaecf0; padding:0.15em 0.5em; font-weight:bold;">
Gestion des moteurs d’inférence locaux :
</div>
* [[llama-swap|llama-swap]] : Exécutez plusieurs modèles d’IA générative sur votre machine et passez de l’un à l’autre à la demande, sans interruption
<div style="width:100%; box-sizing:border-box; border:1px solid #a2a9b1; background:#eaecf0; padding:0.15em 0.5em; font-weight:bold;">
<div style="width:100%; box-sizing:border-box; border:1px solid #a2a9b1; background:#eaecf0; padding:0.15em 0.5em; font-weight:bold;">
Moteurs d’inférence locaux pour usage personnel :
Moteurs d’inférence locaux pour usage personnel :
Ligne 10 : Ligne 14 :
</div>
</div>
* [[vLLM|Serveur IA vLLM]] : Moteur d’inférence haute performance orienté serveur, optimisé pour la gestion concurrente et le débit. Les modèles restent chargés en mémoire en permanence, sans déchargement automatique. Il est particulièrement adapté aux API, applications web et services nécessitant de servir plusieurs utilisateurs simultanément. Plus gourmand en VRAM que les solutions basées sur GGUF (llama.cpp / Ollama), notamment en raison de l’utilisation de formats FP16/BF16 ou AWQ/GPTQ. ('''Non testé''' à ce jour dans cet environnement pour cette raison.)
* [[vLLM|Serveur IA vLLM]] : Moteur d’inférence haute performance orienté serveur, optimisé pour la gestion concurrente et le débit. Les modèles restent chargés en mémoire en permanence, sans déchargement automatique. Il est particulièrement adapté aux API, applications web et services nécessitant de servir plusieurs utilisateurs simultanément. Plus gourmand en VRAM que les solutions basées sur GGUF (llama.cpp / Ollama), notamment en raison de l’utilisation de formats FP16/BF16 ou AWQ/GPTQ. ('''Non testé''' à ce jour dans cet environnement pour cette raison.)
* [[KVarN|KVarN]] : fork de vLLM intégrant nativement un backend de quantification du cache KV normalisé par la variance.
<div style="width:100%; box-sizing:border-box; border:1px solid #a2a9b1; background:#eaecf0; padding:0.15em 0.5em; font-weight:bold;">
<div style="width:100%; box-sizing:border-box; border:1px solid #a2a9b1; background:#eaecf0; padding:0.15em 0.5em; font-weight:bold;">
Moteurs d’inférence pour la reconnaissance et la synthèse vocales
Moteurs d’inférence pour la reconnaissance et la synthèse vocales
Ligne 15 : Ligne 20 :
* [[CrispASR|CrispASR]]: moteur audio unifié dérivé de whisper.cpp. Il prend en charge plusieurs architectures ASR et TTS open source au moyen d’un seul binaire, d’une interface en ligne de commande commune et de modèles GGUF détectés automatiquement ou sélectionnés manuellement.
* [[CrispASR|CrispASR]]: moteur audio unifié dérivé de whisper.cpp. Il prend en charge plusieurs architectures ASR et TTS open source au moyen d’un seul binaire, d’une interface en ligne de commande commune et de modèles GGUF détectés automatiquement ou sélectionnés manuellement.
* [[Chatterbox-TTS-Server|Chatterbox TTS Server]]: API compatible OpenAI avec interface web, prise en charge des textes longs et voix intégrées.
* [[Chatterbox-TTS-Server|Chatterbox TTS Server]]: API compatible OpenAI avec interface web, prise en charge des textes longs et voix intégrées.
<div style="width:100%; box-sizing:border-box; border:1px solid #a2a9b1; background:#eaecf0; padding:0.15em 0.5em; font-weight:bold;">
Outils d’entraînement et de fine-tuning des modèles :
</div>
* [[Llama-Factory|Llama-Factory]] : Framework complet pour l’entraînement et le fine-tuning de modèles de langage, avec prise en charge notamment de LoRA, QLoRA, SFT, DPO et de nombreux modèles Hugging Face.
<div style="width:100%; box-sizing:border-box; border:1px solid #a2a9b1; background:#eaecf0; padding:0.15em 0.5em; font-weight:bold;">
<div style="width:100%; box-sizing:border-box; border:1px solid #a2a9b1; background:#eaecf0; padding:0.15em 0.5em; font-weight:bold;">
Orchestrateurs d'agents IA :
Orchestrateurs d'agents IA :
Ligne 23 : Ligne 32 :
* [[Open_WebUI|Open WebUI]] : L’interface d’IA auto-hébergée
* [[Open_WebUI|Open WebUI]] : L’interface d’IA auto-hébergée
* [[Client_Hugging_Face|Client Hugging Face]] : outil en ligne de commande permettant de télécharger et gérer des modèles hébergés sur Hugging Face.
* [[Client_Hugging_Face|Client Hugging Face]] : outil en ligne de commande permettant de télécharger et gérer des modèles hébergés sur Hugging Face.
* [[Vhost_IA|Vhost IA]] : exemple de virtual host Nginx pour exposer un serveur LLM derrière un proxy inverse HTTPS.
* [[open-gpu-kernel-modules|open-gpu-kernel-modules]] : active le P2P sur les GPU NVIDIA grand public. Aucun paramètre du noyau n’est requis pour le fonctionnement par défaut.
-----
-----
* [[IA_MCP|Model Context Protocol (MCP) servers]] : services permettant à une IA d’accéder à des outils externes (API, fichiers, web, etc.) de manière standardisée et sécurisée.
* [[IA_MCP|Model Context Protocol (MCP) servers]] : services permettant à une IA d’accéder à des outils externes (API, fichiers, web, etc.) de manière standardisée et sécurisée.
* [[RAGFlow|RAGFlow]] : plateforme open source de RAG orientée documents, permettant de créer des bases de connaissances interrogeables par des LLM locaux ou distants. Elle sert surtout à construire des assistants capables de répondre à partir de fichiers internes grâce au parsing, au chunking et à la recherche vectorielle.
* [[RAGFlow|RAGFlow]] : plateforme open source de RAG orientée documents, permettant de créer des bases de connaissances interrogeables par des LLM locaux ou distants. Elle sert surtout à construire des assistants capables de répondre à partir de fichiers internes grâce au parsing, au chunking et à la recherche vectorielle.

Dernière version du 25 août 2026 à 14:33

Gestion des moteurs d’inférence locaux :

  • llama-swap : Exécutez plusieurs modèles d’IA générative sur votre machine et passez de l’un à l’autre à la demande, sans interruption

Moteurs d’inférence locaux pour usage personnel :

  • Serveur IA Ollama : Ollama est un outil qui s’appuie sur llama.cpp afin d’en simplifier l’utilisation, au prix d’un léger surcoût en performances et d’un contrôle réduit. Il gère automatiquement le chargement et le déchargement des modèles en mémoire (RAM/VRAM) après une période d’inactivité.
  • Serveur IA llama.cpp : Moteur d’inférence léger et très performant, optimisé pour une exécution locale avec un contrôle fin des paramètres. Il utilise principalement des modèles au format GGUF, permettant une forte réduction de la consommation de VRAM grâce à la quantization (Q4, Q5, etc.). Particulièrement adapté à un usage personnel ou en homelab, il offre souvent de meilleures performances brutes qu’Ollama, au prix d’une configuration plus technique et moins automatisée. Ne gère pas nativement le chargement/déchargement automatique des modèles, qui restent en mémoire tant que le serveur est actif.
  • Serveur IA ik_llama.cpp : Fork avancé de llama.cpp orienté performance, avec un accent marqué sur CUDA, le multi-GPU et l’inférence hybride GPU/CPU. Plus technique et expérimental que llama.cpp standard, il vise surtout les utilisateurs qui veulent optimiser finement leur serveur local.
  • Serveur IA BeeLlama.cpp : fork de llama.cpp axé sur les performances, conçu pour améliorer la vitesse et augmenter la longueur de contexte lors de l’inférence locale avec des modèles GGUF. Il ajoute notamment la quantification du cache KV normalisée par la variance (KVarN), ainsi qu’une zone de précision accrue pour les jetons les plus récents du cache KV.

Moteurs d’inférence pour API, serveur et production :

  • Serveur IA vLLM : Moteur d’inférence haute performance orienté serveur, optimisé pour la gestion concurrente et le débit. Les modèles restent chargés en mémoire en permanence, sans déchargement automatique. Il est particulièrement adapté aux API, applications web et services nécessitant de servir plusieurs utilisateurs simultanément. Plus gourmand en VRAM que les solutions basées sur GGUF (llama.cpp / Ollama), notamment en raison de l’utilisation de formats FP16/BF16 ou AWQ/GPTQ. (Non testé à ce jour dans cet environnement pour cette raison.)
  • KVarN : fork de vLLM intégrant nativement un backend de quantification du cache KV normalisé par la variance.

Moteurs d’inférence pour la reconnaissance et la synthèse vocales

  • CrispASR: moteur audio unifié dérivé de whisper.cpp. Il prend en charge plusieurs architectures ASR et TTS open source au moyen d’un seul binaire, d’une interface en ligne de commande commune et de modèles GGUF détectés automatiquement ou sélectionnés manuellement.
  • Chatterbox TTS Server: API compatible OpenAI avec interface web, prise en charge des textes longs et voix intégrées.

Outils d’entraînement et de fine-tuning des modèles :

  • Llama-Factory : Framework complet pour l’entraînement et le fine-tuning de modèles de langage, avec prise en charge notamment de LoRA, QLoRA, SFT, DPO et de nombreux modèles Hugging Face.

Orchestrateurs d'agents IA :

  • Hermes : assistant IA open source orienté serveur, compatible avec des modèles locaux ou distants et capable d’exécuter des outils
  • OpenClaw : assistant personnel IA open source fondé sur une approche agentique et l’automatisation de tâches

  • Open WebUI : L’interface d’IA auto-hébergée
  • Client Hugging Face : outil en ligne de commande permettant de télécharger et gérer des modèles hébergés sur Hugging Face.
  • Vhost IA : exemple de virtual host Nginx pour exposer un serveur LLM derrière un proxy inverse HTTPS.
  • open-gpu-kernel-modules : active le P2P sur les GPU NVIDIA grand public. Aucun paramètre du noyau n’est requis pour le fonctionnement par défaut.

  • Model Context Protocol (MCP) servers : services permettant à une IA d’accéder à des outils externes (API, fichiers, web, etc.) de manière standardisée et sécurisée.
  • RAGFlow : plateforme open source de RAG orientée documents, permettant de créer des bases de connaissances interrogeables par des LLM locaux ou distants. Elle sert surtout à construire des assistants capables de répondre à partir de fichiers internes grâce au parsing, au chunking et à la recherche vectorielle.