Faire tourner un grand modèle en local, c'est souvent avant même la fin du téléchargement que la VRAM de la carte graphique fixe le plafond de l'expérience. Beaucoup regardent d'abord la puissance de calcul, puis découvrent que le modèle ne rentre pas, ou seulement avec un contexte très court. La VRAM est une limite dure : en acheter trop peu ne se rattrape pas ensuite, il faut changer toute la carte.
D'abord les paliers : quel modèle pour combien de VRAM
| VRAM | Modèles qui tournent confortablement | Pour qui |
|---|---|---|
| 8 Go | Modèles 7B/8B quantifiés en Q4, contexte court | Pour découvrir, un usage hors ligne occasionnel |
| 16 Go | 14B confortablement, 32B en limitant le contexte | Pour la plupart des personnes qui déploient sérieusement en local |
| 24 Go | 32B avec de la marge pour le contexte | Pour celles et ceux qui ont besoin d'un long contexte stable |
| 32 Go | Large marge pour 32B, encore insuffisant pour 70B | Pour les budgets généreux qui veulent de la marge |
| 48 Go et plus | Modèles de classe 70B | Pour les bidouilleurs de grands modèles, prêts au double GPU ou à changer de plateforme |
Ce tableau parle de tourner confortablement, pas de rentrer au chausse-pied. En quantification Q4, à titre d'ordre de grandeur, les poids d'un 7B/8B occupent environ 4,5 à 5,5 Go, un 14B environ 9 Go, un 32B environ 19 à 20 Go et un 70B plus de 40 Go. Aux poids s'ajoutent le contexte, le cache KV et l'usage système : trop peu de marge signifie erreurs de mémoire ou ralentissements fréquents.
Pourquoi la VRAM bloque avant la puissance de calcul
À l'exécution, les poids ne sont pas seuls à occuper la VRAM. Plus la conversation est longue et le contexte grand, plus le cache KV grossit. Cas typique : le fichier du modèle rentre clairement, mais après quelques échanges une erreur survient, ou il faut réduire le contexte au point que le modèle oublie le début. Ce n'est pas un manque de calcul, c'est la VRAM remplie par les poids et le cache ensemble.
Il ne faut donc pas choisir une carte en égalant la taille des poids à la VRAM. Pour un 14B, 9 Go de poids deviennent confortables avec 16 Go de VRAM ; pour un 32B, 19 à 20 Go de poids appellent 24 Go de VRAM, 16 Go n'étant qu'une tentative limite. Si des cartes comme la RTX 5080, puissantes mais limitées à 16 Go de VRAM, sont souvent critiquées, c'est pour cette raison : ce n'est pas la vitesse qui bloque, c'est la capacité.
Côté modèles courants, la RTX 5060 Ti existe en version 16 Go, la RTX 5070 a 12 Go, les RTX 5070 Ti et RTX 5080 ont 16 Go, la RTX 5090 a 32 Go, et les RTX 4090 et RTX 3090 ont toutes deux 24 Go. Une RTX 3090 d'occasion est souvent vue comme un bon filon rapport qualité-prix précisément grâce à ses 24 Go, mais les prix varient selon le marché, donc vérifiez l'état et la consommation.
Comment trois profils doivent acheter
Découvrir
Si votre carte actuelle a 8 Go ou 12 Go, inutile de la remplacer en hâte. Un modèle 7B/8B quantifié en Q4 suffit pour découvrir le chat local et écrire des textes courts. Pour démarrer facilement, voir LM Studio : mettre un grand modèle dans une application de bureau, télécharger et discuter en toute simplicité, avec trois coûts côté mémoire, quantification et choix du modèle : faites d'abord tourner le flux, puis décidez si un plus grand modèle mérite la dépense.
Déployer sérieusement en local
Visez 14B à 32B : 16 Go est le point doux actuel, 24 Go est plus stable. Pour coder au quotidien, traiter des documents et garder les données chez soi, un 14B couvre déjà l'essentiel, sans raison de sauter d'emblée au plus grand modèle. Si votre usage charge souvent de longs documents et de longs contextes, passez directement à 24 Go et évitez les réglages répétés.
Bidouiller de grands modèles
Viser 70B, c'est accepter un coût nettement supérieur : une seule carte grand public n'a pas assez de VRAM, il faut envisager le double GPU ou une plateforme à mémoire unifiée plus grande. Les cartes grand public des séries 40 et 50 n'ont pas de NVLink, l'extensibilité multi-GPU et le support logiciel sont limités : n'imaginez pas que deux cartes doublent simplement la capacité, vérifiez d'abord le support multi-GPU de votre framework d'inférence.
Là où ce n'est pas rentable, et les alternatives
Acheter une RTX 5090 uniquement pour discuter est un gaspillage classique. Vous n'exploiterez ni ses 32 Go de VRAM ni sa puissance, alors que le refroidissement et l'alimentation coûteront quand même. À l'inverse, s'imposer une carte neuve de 8 Go en espérant faire tourner plus tard de grands modèles n'est pas rentable non plus, car un manque de VRAM ne se corrige pas par un réglage.
Il existe deux alternatives. D'une part la mémoire unifiée des Mac Apple : les machines de 64 Go ou 128 Go peuvent contenir de plus grands modèles et conviennent à celles et ceux déjà dans l'écosystème Mac, mais la vitesse, les formats de quantification et l'outillage diffèrent des cartes N, l'expérience des cartes graphiques ne se transpose pas directement. D'autre part les API cloud pures, souvent moins chères qu'une carte à grande VRAM pour un usage occasionnel soucieux de la qualité. La valeur du local, c'est la confidentialité, l'usage hors ligne et un coût maîtrisable à fort volume ; si aucun de ces trois points ne vous concerne, ne vous précipitez pas pour acheter une carte.