Quel LLM open source choisir selon votre VRAM ?
Tableau de correspondance entre mémoire vidéo disponible et modèles open source 2026 : quel LLM local choisir avec 8, 16, 32 ou 48 Go de VRAM.
La règle simple
En quantification 4 bits — le standard en local — un modèle occupe environ 0,6 Go de mémoire par milliard de paramètres, auxquels s'ajoutent 2 à 4 Go pour le contexte. Un modèle 30B demande donc grossièrement 20 à 24 Go de VRAM.
Retenez le principe : mieux vaut un modèle plus petit qui tient entièrement en VRAM qu'un modèle plus gros qui déborde. La différence de vitesse est d'un ordre de grandeur.
Le tableau de correspondance
Les recommandations ci-dessous portent sur les modèles disponibles en 2026 :
| VRAM disponible | Modèles recommandés | Niveau atteint |
|---|---|---|
| 8 Go | Mistral 7B, Ornith 9B | Rédaction, résumé, traduction |
| 12–16 Go | Gemma 4 12B, Qwen 3.5 9B | Analyse documentaire, RAG, code simple |
| 24 Go | Qwen 3.5 32B, Gemma 4 31B | Raisonnement soutenu, agents, code avancé |
| 32 Go | Ornith 35B, Qwen 3.6 35B | Code niveau haut de gamme, multimodal |
| 48 Go et + | Qwen 3.5 122B, Nemotron-3 Super 120B, gpt-oss 120B | Proche des meilleurs modèles propriétaires |
Choisir selon la tâche, pas seulement selon la taille
À mémoire égale, un modèle spécialisé bat souvent un modèle généraliste plus gros. Quelques repères issus de nos configurations :
- Code et agents de développement : la famille Ornith, conçue pour l'assistance au code.
- Documents et RAG : un modèle généraliste accompagné de Qwen3-embedding 4B et de Deepseek-OCR 3B.
- Français et rapidité : Mistral, qui reste le meilleur rapport vitesse / qualité sur notre langue.
- Multimodal (texte et image en entrée) : Gemma 4 et Qwen 3.5.
Et si votre VRAM ne suffit pas ?
L'offloading permet de répartir un modèle entre VRAM et RAM système. La vitesse baisse, mais un modèle 120B devient utilisable sur une machine à 32 Go de VRAM accompagnée de 64 Go de RAM — c'est précisément la logique de notre configuration Predator IA.
Questions fréquentes
Qu'est-ce que la quantification d'un LLM ?
C'est une compression des poids du modèle, généralement en 4 bits, qui divise par trois ou quatre la mémoire nécessaire avec une perte de qualité très faible sur les usages courants.
Quel est le meilleur LLM open source en 2026 ?
Il n'y en a pas un seul : Qwen 3.5 122B et gpt-oss 120B dominent le haut de gamme, Gemma 4 offre le meilleur rapport qualité / mémoire, et Ornith reste la référence pour le code.
Peut-on faire tourner plusieurs modèles en même temps ?
Oui, si la mémoire cumulée le permet. C'est le fonctionnement habituel d'une station complète : un LLM pour le chat, un modèle d'embedding pour le RAG et un modèle d'image en parallèle.
Passez à l'IA locale souveraine
Stations assemblées en France, modèles 2026 pré-installés, données 100% chez vous.
