Comparaison des runtimes d’IA locale
Réponse rapide
Ceci compare 16 runtimes d'inférence IA locale — le logiciel avec lequel vous exécutez des LLM à poids ouverts sur votre propre matériel, sans API cloud. Pour chacun, on liste la catégorie (moteur, application de bureau, serveur ou frontal), la façon d'interagir avec, quels formats de modèle il charge, s'il expose une API compatible OpenAI (14 le font, pour pointer des applications existantes vers votre propre machine), le support GPU, la licence et le système d'exploitation.
Il n'y a pas de meilleur runtime unique : choisissez selon votre interface (CLI vs interface de bureau vs serveur), votre matériel (NVIDIA vs Apple Silicon vs CPU) et vos besoins de licence. Beaucoup enveloppent llama.cpp en interne, donc le GGUF est le format de modèle commun. Une API compatible OpenAI est la clé de la souveraineté — elle permet de remplacer un point de terminaison cloud par le vôtre sans réécrire vos applications. D-Central est un nœud dans cet écosystème ; vérifiez les détails actuels dans chaque dépôt de projet. CSV/JSON gratuits sous CC BY 4.0.
Télécharger le CSV Télécharger le JSON API REST →
| Runtime | Catégorie | Interface | Formats | API OpenAI | GPU | Licence |
|---|---|---|---|---|---|---|
| Ollama simplest local model runner | engine | CLI + server | GGUF (can import safetensors) | Oui | NVIDIA (CUDA), AMD (ROCm), Apple (Metal) | MIT |
| llama.cpp underlying GGUF inference engine many tools wrap | engine | CLI + server (also a C/C++ library) | GGUF | Oui | NVIDIA (CUDA), AMD (ROCm), Apple (Metal), Vulkan, CPU | MIT |
| LM Studio non-technical desktop users | app | Desktop GUI (+ local server, CLI 'lms') | GGUF, MLX | Oui | NVIDIA (CUDA), AMD (ROCm/Vulkan), Apple (Metal) | Closed (proprietary); free for personal use |
| vLLM max-throughput GPU serving | server | Server (API) + Python library | HF safetensors, GPTQ, AWQ | Oui | NVIDIA (CUDA) first, AMD (ROCm) | Apache-2.0 |
| text-generation-webui (oobabooga) power users wanting many backends and quant formats | app | Web UI (+ API) | GGUF, EXL2, GPTQ, AWQ, HF safetensors | Oui | NVIDIA (CUDA), AMD (ROCm), Apple (Metal), CPU | AGPL-3.0 |
| Jan open-source offline desktop ChatGPT alternative | app | Desktop GUI (+ local server) | GGUF (llama.cpp engine) | Oui | NVIDIA (CUDA), AMD (Vulkan), Apple (Metal) | Apache-2.0 |
| GPT4All privacy-focused desktop chat with local documents | app | Desktop GUI (+ local API server) | GGUF | Oui | NVIDIA/AMD (Vulkan), Apple (Metal), CPU | MIT |
| KoboldCpp single-binary story writing and roleplay | app | GUI launcher + Web UI + Server (API) | GGUF | Oui | NVIDIA (CUDA), AMD (Vulkan), Apple (Metal), CPU | AGPL-3.0 |
| LocalAI self-hosted drop-in OpenAI API replacement | server | Server (API) | GGUF (plus multimodal/whisper/diffusers backends) | Oui | NVIDIA (CUDA), AMD (ROCm), Apple (Metal), CPU | MIT |
| Llamafile single portable file that runs across OSes | engine | CLI + server (single-file executable) | GGUF | Oui | NVIDIA (CUDA), AMD (ROCm), Apple (Metal), CPU | Apache-2.0 |
| Open WebUI self-hosted chat UI in front of Ollama or OpenAI-compatible APIs | frontend | Web UI | N/A (uses a backend) | No | N/A (backend-dependent) | BSD-3-Clause (v0.6.6+ adds a branding clause + CLA) |
| MLX / mlx-lm Apple Silicon native inference | library | Python library + CLI | MLX (converts from HF safetensors) | Oui | Apple (Metal) only | MIT |
| Hugging Face TGI production serving of Hugging Face models | server | Server (API) | HF safetensors, GPTQ, AWQ | Oui | NVIDIA (CUDA) first, AMD (ROCm), Intel Gaudi | Apache-2.0 |
| ExLlamaV2 / TabbyAPI fast EXL2 quantized inference on NVIDIA GPUs | engine | Python library + Server (API via TabbyAPI) | EXL2, GPTQ | Oui | NVIDIA (CUDA) | MIT (ExLlamaV2); AGPL-3.0 (TabbyAPI) |
| SGLang high-throughput structured/agentic GPU serving | server | Server (API) + Python library | HF safetensors, GPTQ, AWQ, FP8 | Oui | NVIDIA (CUDA) first, AMD (ROCm) | Apache-2.0 |
| AnythingLLM all-in-one local RAG desktop app | app | Desktop GUI + Web UI (Docker) | GGUF (built-in engine; also connects to external providers) | No | NVIDIA (CUDA), Apple (Metal), CPU | MIT |
Source : le dépôt et la documentation de chaque projet. Se marie avec le calculateur de VRAM pour LLM local, le hub d'auto-hébergement et le catalogue d'auto-hébergement souverain. Pour la couche de récupération RAG, voir la comparaison des modèles d'embedding locaux. L'outillage d'IA locale évolue vite — confirmez les détails dans le dépôt du projet.
Produits, réparations et guides connexes
- comment D-Central diagnostique les réparations ASIC
- bibliothèque de dépannage ASIC
- manuels ASIC et guides de réparation
- hashboards de remplacement
- cartes de contrôle ASIC
- blocs d’alimentation ASIC
- hashboard de remplacement pour la famille S19
- carte de contrôle de remplacement C52
- bloc d’alimentation APW12 pour S19
- hub du refroidissement par immersion
- guide du refroidissement par immersion à la maison
- mineurs ASIC pour planifier l’immersion
- pièces de refroidissement ASIC
- conduit de ventilation avant l’immersion
- comparer les specs des mineurs dans la base de données
- soutien en réparation ASIC
Dernière révision: 27 juillet 2026.
