Ressource ouverte · mise à jour 2026

    Comparatif des LLM open source exécutables en local (2026)

    Quel modèle open source pouvez-vous réellement faire tourner sur votre machine, et avec quelle qualité ? Ce comparatif croise les grands modèles disponibles en 2026 avec la VRAM nécessaire, l'usage auquel ils sont adaptés et la station IA Local correspondante.

    Toutes les valeurs sont données pour une quantification usuelle en production (4 bits) et pour un contexte de travail réaliste. Un modèle « confortable » signifie qu'il tient intégralement en mémoire vidéo et répond à vitesse de conversation ; en offloading, une partie des couches passe en RAM système, ce qui reste utilisable mais plus lent.

    Tableau comparatif des modèles

    Ce tableau est la référence que nous utilisons pour dimensionner une station. Il vaut pour un usage professionnel : rédaction, analyse documentaire, code et agents.

    Modèles open source 2026, VRAM requise et usage recommandé
    ModèleVRAM (4 bits)Usage de prédilectionStation adaptée
    Mistral 7B~6 GoRédaction en français, réponses rapides, assistant du quotidienStarter IA
    Ornith 9B~8 GoGénération et revue de code sur des bases modestesStarter IA
    Gemma 4 12B~10 GoMultimodal MoE : documents, images, automatisationsStarter IA
    Qwen3-embedding 4B~4 GoVectorisation pour RAG documentaireToutes
    Deepseek-OCR 3B~4 GoOCR structuré de PDF et actes scannésToutes
    Gemma 4 31B~22 GoRaisonnement long, synthèse de dossiers volumineuxPredator IA
    Qwen 3.5 32B~22 GoMultimodal polyvalent, agents et outilsPredator IA
    Ornith 35B~24 GoCode de niveau assistant premium, refactoringPredator IA
    gpt-oss 120B~65 Go (offloading)Raisonnement profond, tâches complexesMaster IA (Predator IA en offloading)
    Nemotron-3 Super 120B~65 Go (offloading)Analyse technique et scientifiqueMaster IA (Predator IA en offloading)
    Qwen 3.5 122B~68 Go (offloading)Qualité la plus proche des modèles cloudMaster IA
    Stable Diffusion (ComfyUI)8 à 16 GoGénération d'images illimitée en localToutes

    Comment calculer la VRAM dont vous avez besoin

    La règle de dimensionnement est simple : en quantification 4 bits, un modèle consomme environ la moitié de son nombre de paramètres en gigaoctets. Un modèle 32B occupe donc autour de 16 à 22 Go selon l'implémentation, auxquels il faut ajouter le cache de contexte.

    Le cache grandit avec la longueur de conversation et le nombre de documents chargés. Comptez 2 à 6 Go supplémentaires pour un usage documentaire sérieux, davantage si vous travaillez sur des contextes de plus de 100 000 tokens.

    • Paramètres ÷ 2 = VRAM approximative en Go (quantification 4 bits).
    • Ajoutez 2 à 6 Go pour le cache de contexte en usage documentaire.
    • Prévoyez une marge de 10 % : un modèle qui déborde d'un gigaoctet perd la moitié de sa vitesse.
    • La RAM système sert d'appoint en offloading : elle doit valoir au moins le double de la VRAM.

    Quelle station pour quel profil

    Le bon dimensionnement dépend moins du budget que de la nature des documents traités et du nombre d'utilisateurs simultanés.

    Correspondance profil / configuration
    ProfilBesoin typiqueConfiguration
    Indépendant, TPERédaction, courriers, recherche documentaire sur un fonds modesteStarter IA — 16 Go de VRAM, modèles jusqu'à 14B confortables
    Cabinet, PME, équipeAnalyse de dossiers volumineux, agents, plusieurs utilisateursPredator IA — 32 Go de VRAM, modèles 35B fluides, 120B en offloading
    Production intensive, studioRaisonnement profond, génération d'images et de vidéos en continuMaster IA — 48 Go de VRAM, modèles 120B+ pleinement exploitables (≈2× la vitesse du Predator)

    Pourquoi le local plutôt que l'API

    À usage soutenu, l'écart économique se referme vite : un abonnement professionnel par utilisateur, multiplié par une équipe et par douze mois, atteint en deux ans le prix d'une station qui, elle, reste votre propriété.

    Surtout, l'exécution locale supprime la question juridique. Aucun document ne quitte vos locaux, donc aucun transfert hors Union européenne à documenter, aucune exposition au droit extraterritorial, aucun risque que vos contenus alimentent l'entraînement d'un modèle tiers.

    Questions fréquentes

    Peut-on faire tourner un modèle 120B sur une machine de bureau ?

    Oui, en offloading : les couches qui ne tiennent pas en VRAM sont déportées en RAM système. La station Predator IA (32 Go de VRAM, 64 Go de RAM) exécute gpt-oss 120B, Nemotron-3 Super 120B et Qwen 3.5 122B de cette manière, à une vitesse compatible avec un usage réfléchi plutôt que conversationnel. La Master IA (48 Go de VRAM, 96 Go de RAM) fait tourner ces mêmes modèles environ deux fois plus vite : ils y sont pré-installés et utilisables au quotidien.

    La quantification dégrade-t-elle la qualité des réponses ?

    En 4 bits, la perte est marginale sur les tâches professionnelles courantes — rédaction, synthèse, extraction. Elle devient perceptible sur le raisonnement mathématique complexe et le code très long, où l'on privilégie une quantification 8 bits sur un modèle plus petit plutôt que 4 bits sur un modèle plus grand.

    Quel modèle choisir pour du français juridique ou administratif ?

    Mistral 7B pour la réactivité au quotidien, Gemma 4 31B ou Qwen 3.5 32B dès qu'il faut raisonner sur un dossier complet. Le couple gagnant reste un modèle de raisonnement associé à Qwen3-embedding 4B et Deepseek-OCR 3B pour indexer vos propres documents.

    Faut-il une connexion Internet pour utiliser ces modèles ?

    Non. Une fois les modèles installés sur la station, l'inférence fonctionne intégralement hors ligne. La connexion ne sert qu'aux mises à jour des modèles et du système, que vous déclenchez quand vous le souhaitez.

    Une station dimensionnée pour vos modèles

    Nos trois configurations sont livrées avec les modèles déjà installés, quantifiés et testés. Aucune installation à faire, aucun réglage à deviner.