Comparaison des runtimes d’IA locale
Réponse rapide
Ceci compare 16 runtimes d'inférence IA locale — le logiciel avec lequel vous exécutez des LLM à poids ouverts sur votre propre matériel, sans API cloud. Pour chacun, on liste la catégorie (moteur, application de bureau, serveur ou frontal), la façon d'interagir avec, quels formats de modèle il charge, s'il expose une API compatible OpenAI (14 le font, pour pointer des applications existantes vers votre propre machine), le support GPU, la licence et le système d'exploitation.
Il n'y a pas de meilleur runtime unique : choisissez selon votre interface (CLI vs interface de bureau vs serveur), votre matériel (NVIDIA vs Apple Silicon vs CPU) et vos besoins de licence. Beaucoup enveloppent llama.cpp en interne, donc le GGUF est le format de modèle commun. Une API compatible OpenAI est la clé de la souveraineté — elle permet de remplacer un point de terminaison cloud par le vôtre sans réécrire vos applications. D-Central est un nœud dans cet écosystème ; vérifiez les détails actuels dans chaque dépôt de projet. CSV/JSON gratuits sous CC BY 4.0.
Télécharger le CSV Télécharger le JSON API REST →
| Runtime | Catégorie | Interface | Formats | API OpenAI | GPU | Licence |
|---|---|---|---|---|---|---|
| Ollama simplest local model runner | engine | CLI + server | GGUF (can import safetensors) | Oui | NVIDIA (CUDA), AMD (ROCm), Apple (Metal) | MIT |
| llama.cpp underlying GGUF inference engine many tools wrap | engine | CLI + server (also a C/C++ library) | GGUF | Oui | NVIDIA (CUDA), AMD (ROCm), Apple (Metal), Vulkan, CPU | MIT |
| LM Studio non-technical desktop users | app | Desktop GUI (+ local server, CLI 'lms') | GGUF, MLX | Oui | NVIDIA (CUDA), AMD (ROCm/Vulkan), Apple (Metal) | Closed (proprietary); free for personal use |
| vLLM max-throughput GPU serving | server | Server (API) + Python library | HF safetensors, GPTQ, AWQ | Oui | NVIDIA (CUDA) first, AMD (ROCm) | Apache-2.0 |
| text-generation-webui (oobabooga) power users wanting many backends and quant formats | app | Web UI (+ API) | GGUF, EXL2, GPTQ, AWQ, HF safetensors | Oui | NVIDIA (CUDA), AMD (ROCm), Apple (Metal), CPU | AGPL-3.0 |
| Jan open-source offline desktop ChatGPT alternative | app | Desktop GUI (+ local server) | GGUF (llama.cpp engine) | Oui | NVIDIA (CUDA), AMD (Vulkan), Apple (Metal) | Apache-2.0 |
| GPT4All privacy-focused desktop chat with local documents | app | Desktop GUI (+ local API server) | GGUF | Oui | NVIDIA/AMD (Vulkan), Apple (Metal), CPU | MIT |
| KoboldCpp single-binary story writing and roleplay | app | GUI launcher + Web UI + Server (API) | GGUF | Oui | NVIDIA (CUDA), AMD (Vulkan), Apple (Metal), CPU | AGPL-3.0 |
| LocalAI self-hosted drop-in OpenAI API replacement | server | Server (API) | GGUF (plus multimodal/whisper/diffusers backends) | Oui | NVIDIA (CUDA), AMD (ROCm), Apple (Metal), CPU | MIT |
| Llamafile single portable file that runs across OSes | engine | CLI + server (single-file executable) | GGUF | Oui | NVIDIA (CUDA), AMD (ROCm), Apple (Metal), CPU | Apache-2.0 |
| Open WebUI self-hosted chat UI in front of Ollama or OpenAI-compatible APIs | frontend | Web UI | N/A (uses a backend) | No | N/A (backend-dependent) | BSD-3-Clause (v0.6.6+ adds a branding clause + CLA) |
| MLX / mlx-lm Apple Silicon native inference | library | Python library + CLI | MLX (converts from HF safetensors) | Oui | Apple (Metal) only | MIT |
| Hugging Face TGI production serving of Hugging Face models | server | Server (API) | HF safetensors, GPTQ, AWQ | Oui | NVIDIA (CUDA) first, AMD (ROCm), Intel Gaudi | Apache-2.0 |
| ExLlamaV2 / TabbyAPI fast EXL2 quantized inference on NVIDIA GPUs | engine | Python library + Server (API via TabbyAPI) | EXL2, GPTQ | Oui | NVIDIA (CUDA) | MIT (ExLlamaV2); AGPL-3.0 (TabbyAPI) |
| SGLang high-throughput structured/agentic GPU serving | server | Server (API) + Python library | HF safetensors, GPTQ, AWQ, FP8 | Oui | NVIDIA (CUDA) first, AMD (ROCm) | Apache-2.0 |
| AnythingLLM all-in-one local RAG desktop app | app | Desktop GUI + Web UI (Docker) | GGUF (built-in engine; also connects to external providers) | No | NVIDIA (CUDA), Apple (Metal), CPU | MIT |
Source : le dépôt et la documentation de chaque projet. Se marie avec le calculateur de VRAM pour LLM local, le hub d'auto-hébergement et le catalogue d'auto-hébergement souverain. Pour la couche de récupération RAG, voir la comparaison des modèles d'embedding locaux. L'outillage d'IA locale évolue vite — confirmez les détails dans le dépôt du projet.
Produits, réparations et guides connexes
- comment D-Central diagnostique les réparations ASIC
- bibliothèque de dépannage ASIC
- manuels ASIC et guides de réparation
- hashboards de remplacement
- cartes de contrôle ASIC
- blocs d’alimentation ASIC
- hashboard de remplacement pour la famille S19
- carte de contrôle de remplacement C52
- bloc d’alimentation APW12 pour S19
- comparer les specs dans la base de mineurs ASIC
- comparer les specs des mineurs ASIC
- base de mineurs ASIC
- services de réparation ASIC
- specs et rentabilité de l’Antminer S19
- acheter un Antminer S19 testé
- guide d’entretien Antminer S19
- service de réparation Antminer S19
- specs de l’Antminer S21
- Bitmain Antminer S21
- guide d’entretien Antminer S21
- puce BM1370BC pour S21 Pro
- specs de l’Antminer S9
- Bitmain Antminer S9
- guide d’entretien Antminer S9
- ensemble de pièces de réparation de hashboard S9
Dernière révision: 27 juillet 2026.
