Passer au contenu

Bitcoin accepté au paiement  |  Expédié depuis Montréal, QC, Canada  |  Soutien expert depuis 2016

Comparaison des runtimes d’IA locale

Réponse rapide

Ceci compare 16 runtimes d'inférence IA locale — le logiciel avec lequel vous exécutez des LLM à poids ouverts sur votre propre matériel, sans API cloud. Pour chacun, on liste la catégorie (moteur, application de bureau, serveur ou frontal), la façon d'interagir avec, quels formats de modèle il charge, s'il expose une API compatible OpenAI (14 le font, pour pointer des applications existantes vers votre propre machine), le support GPU, la licence et le système d'exploitation.

Il n'y a pas de meilleur runtime unique : choisissez selon votre interface (CLI vs interface de bureau vs serveur), votre matériel (NVIDIA vs Apple Silicon vs CPU) et vos besoins de licence. Beaucoup enveloppent llama.cpp en interne, donc le GGUF est le format de modèle commun. Une API compatible OpenAI est la clé de la souveraineté — elle permet de remplacer un point de terminaison cloud par le vôtre sans réécrire vos applications. D-Central est un nœud dans cet écosystème ; vérifiez les détails actuels dans chaque dépôt de projet. CSV/JSON gratuits sous CC BY 4.0.

Télécharger le CSV Télécharger le JSON API REST →

RuntimeCatégorieInterfaceFormatsAPI OpenAIGPULicence
Ollama
simplest local model runner
engineCLI + serverGGUF (can import safetensors)OuiNVIDIA (CUDA), AMD (ROCm), Apple (Metal)MIT
llama.cpp
underlying GGUF inference engine many tools wrap
engineCLI + server (also a C/C++ library)GGUFOuiNVIDIA (CUDA), AMD (ROCm), Apple (Metal), Vulkan, CPUMIT
LM Studio
non-technical desktop users
appDesktop GUI (+ local server, CLI 'lms')GGUF, MLXOuiNVIDIA (CUDA), AMD (ROCm/Vulkan), Apple (Metal)Closed (proprietary); free for personal use
vLLM
max-throughput GPU serving
serverServer (API) + Python libraryHF safetensors, GPTQ, AWQOuiNVIDIA (CUDA) first, AMD (ROCm)Apache-2.0
text-generation-webui (oobabooga)
power users wanting many backends and quant formats
appWeb UI (+ API)GGUF, EXL2, GPTQ, AWQ, HF safetensorsOuiNVIDIA (CUDA), AMD (ROCm), Apple (Metal), CPUAGPL-3.0
Jan
open-source offline desktop ChatGPT alternative
appDesktop GUI (+ local server)GGUF (llama.cpp engine)OuiNVIDIA (CUDA), AMD (Vulkan), Apple (Metal)Apache-2.0
GPT4All
privacy-focused desktop chat with local documents
appDesktop GUI (+ local API server)GGUFOuiNVIDIA/AMD (Vulkan), Apple (Metal), CPUMIT
KoboldCpp
single-binary story writing and roleplay
appGUI launcher + Web UI + Server (API)GGUFOuiNVIDIA (CUDA), AMD (Vulkan), Apple (Metal), CPUAGPL-3.0
LocalAI
self-hosted drop-in OpenAI API replacement
serverServer (API)GGUF (plus multimodal/whisper/diffusers backends)OuiNVIDIA (CUDA), AMD (ROCm), Apple (Metal), CPUMIT
Llamafile
single portable file that runs across OSes
engineCLI + server (single-file executable)GGUFOuiNVIDIA (CUDA), AMD (ROCm), Apple (Metal), CPUApache-2.0
Open WebUI
self-hosted chat UI in front of Ollama or OpenAI-compatible APIs
frontendWeb UIN/A (uses a backend)NoN/A (backend-dependent)BSD-3-Clause (v0.6.6+ adds a branding clause + CLA)
MLX / mlx-lm
Apple Silicon native inference
libraryPython library + CLIMLX (converts from HF safetensors)OuiApple (Metal) onlyMIT
Hugging Face TGI
production serving of Hugging Face models
serverServer (API)HF safetensors, GPTQ, AWQOuiNVIDIA (CUDA) first, AMD (ROCm), Intel GaudiApache-2.0
ExLlamaV2 / TabbyAPI
fast EXL2 quantized inference on NVIDIA GPUs
enginePython library + Server (API via TabbyAPI)EXL2, GPTQOuiNVIDIA (CUDA)MIT (ExLlamaV2); AGPL-3.0 (TabbyAPI)
SGLang
high-throughput structured/agentic GPU serving
serverServer (API) + Python libraryHF safetensors, GPTQ, AWQ, FP8OuiNVIDIA (CUDA) first, AMD (ROCm)Apache-2.0
AnythingLLM
all-in-one local RAG desktop app
appDesktop GUI + Web UI (Docker)GGUF (built-in engine; also connects to external providers)NoNVIDIA (CUDA), Apple (Metal), CPUMIT

Source : le dépôt et la documentation de chaque projet. Se marie avec le calculateur de VRAM pour LLM local, le hub d'auto-hébergement et le catalogue d'auto-hébergement souverain. Pour la couche de récupération RAG, voir la comparaison des modèles d'embedding locaux. L'outillage d'IA locale évolue vite — confirmez les détails dans le dépôt du projet.