ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à L’IA est open source
Ollama : exécuter des LLM en local – coûts matériels, choix du modèle et vrais pièges

Ollama : exécuter des LLM en local – coûts matériels, choix du modèle et vrais pièges

L’IA est open source • Admin • • 2 vues

Faire tourner un grand modèle de langage en local avec Ollama se résume en une phrase : cela transforme le modèle d'un « appel API cloud » en une simple commande sur sa propre machine. On installe Ollama, on récupère le modèle avec ollama pull llama3.1, puis ollama run suffit pour discuter, coder et lire des documents entièrement hors ligne — rien ne transite jamais par un serveur tiers. Le problème résolu n'est pas « le modèle est-il assez intelligent », mais « le modèle peut-il tourner en privé, hors ligne et sans coût marginal sur mon propre matériel ».

Dépôt officiel

Le projet est hébergé sur GitHub, organisation Ollama, nom de projet ollama (chemin du dépôt ollama/ollama), sous licence MIT. À la mi-2026, il a dépassé les 170 000 étoiles, ce qui en fait le projet open source le plus suivi dans l'espace des runtimes LLM locaux. Les installeurs officiels couvrent Windows, macOS et Linux, avec en plus une version GUI de bureau ; Ollama intègre un point d'API local compatible OpenAI, auquel de nombreux clients de bureau et frameworks d'agents se branchent directement comme backend de modèle local.

Les trois problèmes réellement résolus

D'abord la confidentialité : documents sensibles et code n'ont plus besoin d'être téléversés chez un tiers. Ensuite l'usage hors ligne : l'IA continue de fonctionner dans l'avion ou sur une connexion instable. Enfin le coût : le modèle est téléchargé une fois, et ensuite aucun token ne coûte plus rien. Le prix à payer est tout aussi clair — un modèle local de classe 7B/8B ne joue pas dans la même catégorie qu'un modèle cloud phare, et il faut l'accepter avant de choisir cette voie.

Coût de déploiement : matériel et disque, les deux barrières

Ollama lui-même s'installe gratuitement ; le vrai coût est dans le matériel. Règle empirique : 8 Go de RAM pour les petits modèles de classe 3B, 16 Go pour la classe 7B/8B, et la classe 30B demande environ 24 Go de VRAM. Avec un GPU NVIDIA dédié, l'accélération est automatique ; sans GPU, seul le CPU travaille — ça fonctionne, mais plusieurs fois plus lentement. La seconde barrière est le disque, souvent sous-estimée : un modèle 8B quantifié pèse environ 4 à 5 Go, la classe 70B atteint facilement plusieurs dizaines de gigaoctets. Mieux vaut réserver plusieurs dizaines de gigaoctets au répertoire des modèles.

Vrais pièges : quantification, VRAM et noms de modèles

Premièrement, se tromper de niveau de quantification, c'est télécharger pour rien. Un même modèle existe en versions Q4, Q5, Q8 et autres variantes quantifiées — plus le chiffre est élevé, plus le fichier est gros et plus la perte de qualité est faible. VRAM limitée ? On choisit directement une version 4 bits comme Q4_K_M ; Q8_0 seulement quand la VRAM est abondante. Deuxièmement, un manque de VRAM ne provoque pas d'erreur, juste de la lenteur. Quand la VRAM manque, Ollama bascule silencieusement vers l'inférence CPU et la vitesse s'effondre. Vérifiez dans le gestionnaire des tâches que le GPU travaille vraiment avant de conclure que « ça tourne ». Troisièmement, ne pas ignorer les deux-points dans les noms de modèles : llama3.1 et llama3.1:70b sont deux téléchargements totalement différents en taille comme en capacité, et la confusion est l'erreur classique des débutants.

Avec une machine de plus de 16 Go de RAM et un GPU correct, Ollama est aujourd'hui la porte d'entrée la plus simple pour accueillir les modèles open source chez soi. Faites d'abord le calcul VRAM et disque, puis décidez quel modèle récupérer — cela évite la plupart des détours.

Q : Après avoir récupéré un modèle avec Ollama, ai-je encore besoin d'une connexion Internet ?

A : Non. Une fois les fichiers du modèle téléchargés, l'inférence se fait entièrement hors ligne ; une connexion n'est nécessaire que pour le téléchargement initial et les vérifications de mise à jour.

Outils Recommandés

Plus