ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Matériel d’IA
Faire tourner un grand modèle en local : combien de VRAM faut-il ? Ce que permettent 8 Go, 16 Go et 24 Go

Faire tourner un grand modèle en local : combien de VRAM faut-il ? Ce que permettent 8 Go, 16 Go et 24 Go

Matériel d’IA • Admin • • 5 vues

Faire tourner un grand modèle en local, c'est souvent avant même la fin du téléchargement que la VRAM de la carte graphique fixe le plafond de l'expérience. Beaucoup regardent d'abord la puissance de calcul, puis découvrent que le modèle ne rentre pas, ou seulement avec un contexte très court. La VRAM est une limite dure : en acheter trop peu ne se rattrape pas ensuite, il faut changer toute la carte.

D'abord les paliers : quel modèle pour combien de VRAM

VRAMModèles qui tournent confortablementPour qui
8 GoModèles 7B/8B quantifiés en Q4, contexte courtPour découvrir, un usage hors ligne occasionnel
16 Go14B confortablement, 32B en limitant le contextePour la plupart des personnes qui déploient sérieusement en local
24 Go32B avec de la marge pour le contextePour celles et ceux qui ont besoin d'un long contexte stable
32 GoLarge marge pour 32B, encore insuffisant pour 70BPour les budgets généreux qui veulent de la marge
48 Go et plusModèles de classe 70BPour les bidouilleurs de grands modèles, prêts au double GPU ou à changer de plateforme

Ce tableau parle de tourner confortablement, pas de rentrer au chausse-pied. En quantification Q4, à titre d'ordre de grandeur, les poids d'un 7B/8B occupent environ 4,5 à 5,5 Go, un 14B environ 9 Go, un 32B environ 19 à 20 Go et un 70B plus de 40 Go. Aux poids s'ajoutent le contexte, le cache KV et l'usage système : trop peu de marge signifie erreurs de mémoire ou ralentissements fréquents.

Pourquoi la VRAM bloque avant la puissance de calcul

À l'exécution, les poids ne sont pas seuls à occuper la VRAM. Plus la conversation est longue et le contexte grand, plus le cache KV grossit. Cas typique : le fichier du modèle rentre clairement, mais après quelques échanges une erreur survient, ou il faut réduire le contexte au point que le modèle oublie le début. Ce n'est pas un manque de calcul, c'est la VRAM remplie par les poids et le cache ensemble.

Il ne faut donc pas choisir une carte en égalant la taille des poids à la VRAM. Pour un 14B, 9 Go de poids deviennent confortables avec 16 Go de VRAM ; pour un 32B, 19 à 20 Go de poids appellent 24 Go de VRAM, 16 Go n'étant qu'une tentative limite. Si des cartes comme la RTX 5080, puissantes mais limitées à 16 Go de VRAM, sont souvent critiquées, c'est pour cette raison : ce n'est pas la vitesse qui bloque, c'est la capacité.

Côté modèles courants, la RTX 5060 Ti existe en version 16 Go, la RTX 5070 a 12 Go, les RTX 5070 Ti et RTX 5080 ont 16 Go, la RTX 5090 a 32 Go, et les RTX 4090 et RTX 3090 ont toutes deux 24 Go. Une RTX 3090 d'occasion est souvent vue comme un bon filon rapport qualité-prix précisément grâce à ses 24 Go, mais les prix varient selon le marché, donc vérifiez l'état et la consommation.

Comment trois profils doivent acheter

Découvrir

Si votre carte actuelle a 8 Go ou 12 Go, inutile de la remplacer en hâte. Un modèle 7B/8B quantifié en Q4 suffit pour découvrir le chat local et écrire des textes courts. Pour démarrer facilement, voir LM Studio : mettre un grand modèle dans une application de bureau, télécharger et discuter en toute simplicité, avec trois coûts côté mémoire, quantification et choix du modèle : faites d'abord tourner le flux, puis décidez si un plus grand modèle mérite la dépense.

Déployer sérieusement en local

Visez 14B à 32B : 16 Go est le point doux actuel, 24 Go est plus stable. Pour coder au quotidien, traiter des documents et garder les données chez soi, un 14B couvre déjà l'essentiel, sans raison de sauter d'emblée au plus grand modèle. Si votre usage charge souvent de longs documents et de longs contextes, passez directement à 24 Go et évitez les réglages répétés.

Bidouiller de grands modèles

Viser 70B, c'est accepter un coût nettement supérieur : une seule carte grand public n'a pas assez de VRAM, il faut envisager le double GPU ou une plateforme à mémoire unifiée plus grande. Les cartes grand public des séries 40 et 50 n'ont pas de NVLink, l'extensibilité multi-GPU et le support logiciel sont limités : n'imaginez pas que deux cartes doublent simplement la capacité, vérifiez d'abord le support multi-GPU de votre framework d'inférence.

Là où ce n'est pas rentable, et les alternatives

Acheter une RTX 5090 uniquement pour discuter est un gaspillage classique. Vous n'exploiterez ni ses 32 Go de VRAM ni sa puissance, alors que le refroidissement et l'alimentation coûteront quand même. À l'inverse, s'imposer une carte neuve de 8 Go en espérant faire tourner plus tard de grands modèles n'est pas rentable non plus, car un manque de VRAM ne se corrige pas par un réglage.

Il existe deux alternatives. D'une part la mémoire unifiée des Mac Apple : les machines de 64 Go ou 128 Go peuvent contenir de plus grands modèles et conviennent à celles et ceux déjà dans l'écosystème Mac, mais la vitesse, les formats de quantification et l'outillage diffèrent des cartes N, l'expérience des cartes graphiques ne se transpose pas directement. D'autre part les API cloud pures, souvent moins chères qu'une carte à grande VRAM pour un usage occasionnel soucieux de la qualité. La valeur du local, c'est la confidentialité, l'usage hors ligne et un coût maîtrisable à fort volume ; si aucun de ces trois points ne vous concerne, ne vous précipitez pas pour acheter une carte.

Outils Recommandés

Plus