Tous les articles
    6 min de lecture

    Quel LLM open source choisir selon votre VRAM ?

    Tableau de correspondance entre mémoire vidéo disponible et modèles open source 2026 : quel LLM local choisir avec 8, 16, 32 ou 48 Go de VRAM.

    La règle simple

    En quantification 4 bits — le standard en local — un modèle occupe environ 0,6 Go de mémoire par milliard de paramètres, auxquels s'ajoutent 2 à 4 Go pour le contexte. Un modèle 30B demande donc grossièrement 20 à 24 Go de VRAM.

    Retenez le principe : mieux vaut un modèle plus petit qui tient entièrement en VRAM qu'un modèle plus gros qui déborde. La différence de vitesse est d'un ordre de grandeur.

    Le tableau de correspondance

    Les recommandations ci-dessous portent sur les modèles disponibles en 2026 :

    Quel LLM open source pour quelle VRAM
    VRAM disponibleModèles recommandésNiveau atteint
    8 GoMistral 7B, Ornith 9BRédaction, résumé, traduction
    12–16 GoGemma 4 12B, Qwen 3.5 9BAnalyse documentaire, RAG, code simple
    24 GoQwen 3.5 32B, Gemma 4 31BRaisonnement soutenu, agents, code avancé
    32 GoOrnith 35B, Qwen 3.6 35BCode niveau haut de gamme, multimodal
    48 Go et +Qwen 3.5 122B, Nemotron-3 Super 120B, gpt-oss 120BProche des meilleurs modèles propriétaires

    Choisir selon la tâche, pas seulement selon la taille

    À mémoire égale, un modèle spécialisé bat souvent un modèle généraliste plus gros. Quelques repères issus de nos configurations :

    • Code et agents de développement : la famille Ornith, conçue pour l'assistance au code.
    • Documents et RAG : un modèle généraliste accompagné de Qwen3-embedding 4B et de Deepseek-OCR 3B.
    • Français et rapidité : Mistral, qui reste le meilleur rapport vitesse / qualité sur notre langue.
    • Multimodal (texte et image en entrée) : Gemma 4 et Qwen 3.5.

    Et si votre VRAM ne suffit pas ?

    L'offloading permet de répartir un modèle entre VRAM et RAM système. La vitesse baisse, mais un modèle 120B devient utilisable sur une machine à 32 Go de VRAM accompagnée de 64 Go de RAM — c'est précisément la logique de notre configuration Predator IA.

    Questions fréquentes

    Qu'est-ce que la quantification d'un LLM ?

    C'est une compression des poids du modèle, généralement en 4 bits, qui divise par trois ou quatre la mémoire nécessaire avec une perte de qualité très faible sur les usages courants.

    Quel est le meilleur LLM open source en 2026 ?

    Il n'y en a pas un seul : Qwen 3.5 122B et gpt-oss 120B dominent le haut de gamme, Gemma 4 offre le meilleur rapport qualité / mémoire, et Ornith reste la référence pour le code.

    Peut-on faire tourner plusieurs modèles en même temps ?

    Oui, si la mémoire cumulée le permet. C'est le fonctionnement habituel d'une station complète : un LLM pour le chat, un modèle d'embedding pour le RAG et un modèle d'image en parallèle.

    Passez à l'IA locale souveraine

    Stations assemblées en France, modèles 2026 pré-installés, données 100% chez vous.