Tous les articles
    9 min de lecture

    Comment faire tourner une IA en local : le guide complet 2026

    Installer une IA en local en 20 minutes : Ollama ou LM Studio, quel modèle selon votre VRAM, et les erreurs à éviter. Guide pratique testé en 2026.

    La réponse courte

    Pour faire tourner une IA en local, installez Ollama (ou LM Studio), téléchargez un modèle open source adapté à votre mémoire vidéo — Mistral 7B avec 8 Go, Gemma 4 12B avec 16 Go, Qwen 3.5 32B avec 32 Go — puis lancez-le depuis l'interface. L'opération prend une vingtaine de minutes et ne nécessite aucun abonnement : tout s'exécute sur votre machine, hors ligne.

    Ce que veut dire « faire tourner une IA en local »

    Faire tourner une IA en local, c'est exécuter le modèle de langage directement sur votre propre ordinateur, sans passer par un serveur distant. Vos questions, vos documents et les réponses générées ne quittent jamais la machine : il n'y a ni compte, ni abonnement, ni facturation au token, ni connexion Internet obligatoire.

    Techniquement, il vous faut trois choses : un moteur d'inférence (le logiciel qui exécute le modèle), un modèle open source téléchargé sur votre disque, et suffisamment de mémoire vidéo pour charger ce modèle. Le reste — interface de chat, lecture de documents, génération d'images — s'ajoute par-dessus.

    Étape 1 : choisir son moteur d'inférence

    Trois outils couvrent aujourd'hui l'essentiel des besoins. Ils sont gratuits et fonctionnent sous Windows, macOS et Linux. Pour un comparatif détaillé, lisez notre article Ollama, LM Studio ou Open WebUI : quelle interface pour une IA locale.

    • Ollama — le plus simple : une commande (`ollama run qwen3`) télécharge et lance le modèle. Idéal pour démarrer et pour brancher d'autres applications dessus via son API locale.
    • LM Studio — interface graphique complète, avec navigateur de modèles, réglages de quantification et serveur local compatible OpenAI. Le meilleur compromis pour un usage non technique.
    • llama.cpp / vLLM — pour les utilisateurs avancés qui veulent optimiser finement la vitesse, le contexte ou servir plusieurs utilisateurs simultanés.

    Étape 2 : dimensionner la mémoire (le point qui bloque tout le monde)

    C'est ici que 90% des installations échouent. Un modèle doit tenir entièrement en mémoire vidéo (VRAM) pour tourner à vitesse confortable. S'il déborde sur la RAM système, il fonctionne quand même mais devient nettement plus lent — c'est ce qu'on appelle l'offloading.

    Voici les ordres de grandeur réels en quantification 4 bits, la plus utilisée en local :

    Mémoire nécessaire selon la taille du modèle (quantification 4 bits)
    Taille du modèleVRAM recommandéeCe que vous pouvez en faire
    7B à 9B8 à 12 GoRédaction, résumé, traduction, assistance quotidienne
    12B à 14B12 à 16 GoAnalyse documentaire, code simple, RAG léger
    30B à 35B24 à 32 GoRaisonnement soutenu, code avancé, agents
    70B48 GoQualité proche du cloud sur la plupart des tâches
    120B et +48 Go de VRAM, ou 32 Go en offloadingNiveau des meilleurs modèles propriétaires

    Étape 3 : choisir le bon modèle en 2026

    L'écart avec les modèles propriétaires s'est refermé. Les familles à privilégier cette année : Mistral et Gemma 4 pour la légèreté, Qwen 3.5 pour la polyvalence multimodale, Ornith pour le code, Nemotron-3 Super et gpt-oss 120B pour le haut de gamme.

    Conseil pratique : commencez par un modèle plus petit que ce que votre machine peut supporter. Un 12B rapide est plus utile au quotidien qu'un 35B qui répond en trois minutes.

    Étape 4 : aller au-delà du chat

    Une fois le modèle en place, l'intérêt vient des couches supplémentaires : le RAG pour interroger vos propres documents (avec un modèle d'embedding et un OCR pour les PDF), ComfyUI et Stable Diffusion pour générer des images, et le protocole MCP pour connecter l'IA à vos outils métier.

    C'est exactement ce que nos stations livrent pré-installé et pré-configuré : moteur, modèles, RAG, OCR et génération d'images, prêts à l'emploi le jour de la livraison.

    Questions fréquentes

    Faut-il une connexion Internet pour utiliser une IA en local ?

    Non. Une fois le modèle téléchargé, tout fonctionne hors ligne. La connexion ne sert qu'au téléchargement initial et aux mises à jour.

    Peut-on faire tourner une IA locale sans carte graphique ?

    Oui, sur processeur uniquement, mais la vitesse chute fortement. C'est jouable pour un modèle 7B en usage occasionnel, pas pour un usage professionnel quotidien.

    Une IA locale est-elle aussi bonne que ChatGPT ?

    Sur la grande majorité des tâches professionnelles — rédaction, synthèse, traduction, analyse, code — les modèles open source de 2026 sont au niveau. Les modèles propriétaires conservent une avance marginale sur quelques tâches de raisonnement de pointe.

    Combien coûte une IA locale ?

    Le logiciel et les modèles sont gratuits. Le coût est celui du matériel : à partir d'environ 3 000 € pour une station capable de faire tourner confortablement des modèles jusqu'à 14B, sans aucun abonnement ensuite.

    Passez à l'IA locale souveraine

    Stations assemblées en France, modèles 2026 pré-installés, données 100% chez vous.