Combien de VRAM pour un LLM local en 2026 ? Le guide par modèle
Partager
La VRAM décide de tout.
Voici comment la calculer.
Taille du modèle, quantisation, longueur du contexte : trois variables, un résultat. Estimez le vôtre ci-dessous.
C'est la question qui revient avant chaque achat de machine IA. Et la réponse habituelle, un chiffre unique par modèle, est presque toujours fausse, parce qu'elle ne compte que les poids.
Estimez votre besoin
Votre configuration
VRAM estimée
Estimation indicative. L'empreinte réelle varie selon le moteur d'inférence, l'architecture du modèle, la méthode de quantisation et les options d'optimisation. Considérez ce résultat comme un ordre de grandeur pour dimensionner, pas comme une mesure.
Les trois règles à connaître
1. Les poids sont le plancher, jamais le total
Le chiffre que vous lisez partout correspond au modèle chargé, avant la moindre requête. Le cache de contexte, les tampons d'exécution et les composants multimodaux s'ajoutent par-dessus.
2. Le contexte coûte cher, et personne ne le dit
Le cache grandit avec chaque token traité. Sur une fenêtre longue, il peut à lui seul doubler l'empreinte mémoire. C'est ce qui explique qu'un modèle qui démarre sans problème sature après vingt échanges.
3. La VRAM détermine la taille, la bande passante détermine la vitesse
Deux paramètres distincts. La VRAM dit si le modèle tient. La bande passante mémoire dit à quelle vitesse il répond. Un modèle qui déborde vers la RAM système chute à quelques tokens par seconde.
Tableau de référence par modèle
Valeurs pour les poids seuls, en contexte court. Ajoutez le cache selon votre usage.
| Modèle | Type | 4-bit | 8-bit | 16-bit | Carte conseillée |
|---|---|---|---|---|---|
| Gemma 4 12B | Dense, multimodal | ~6,6 Go | ~13 Go | ~24 Go | 16 Go |
| Qwen 3.8-27B | Dense, vision | ~17 Go | ~27 Go | ~55 Go | 32 Go |
| Qwen 3.6-27B | Dense | ~17 Go | ~30 Go | ~54 Go | 24 à 32 Go |
| Qwen 3.6-35B-A3B | MoE (3B actifs) | ~21 Go | ~38 Go | ~70 Go | 24 à 32 Go |
| Hermes 4.3 36B | Dense, agent | ~21 Go | ~40 Go | ~72 Go | 32 Go |
| Modèle 70B | Dense | ~40 Go | ~75 Go | ~140 Go | 48 Go et plus |
| Whisper large-v3 | Transcription | non applicable | ~3 Go | ~6 Go | 8 Go |
| Modèles vidéo IA | Génération | non applicable | 16 à 24 Go | 50 Go et plus | 32 Go |
Ce que vous pouvez faire à chaque palier
Trois leviers pour tenir dans moins de VRAM
Quantiser le cache de contexte. C'est le geste le plus rentable. Il réduit souvent de moitié l'empreinte du contexte, avec un impact minime sur la qualité. C'est ce qui permet de loger une longue fenêtre là où la configuration par défaut sature.
Choisir une quantisation moderne. Les formats récents offrent une qualité nettement supérieure à taille égale par rapport aux quantisations de première génération. À 4-bit, l'écart avec la précision native est aujourd'hui faible sur la plupart des usages.
Réduire la fenêtre de contexte au nécessaire. Peu d'usages exigent réellement 256 000 tokens. Fixer la fenêtre à ce dont vous avez besoin libère beaucoup de mémoire, et accélère souvent le traitement.
Nos machines par palier de VRAM
Toutes assemblées à la main à Auriol (13390), entièrement configurables via le configurateur en ligne ou sur devis à contact@radiancesystems.eu.
CoreAI 16 : 16 Go de VRAMModèles 12B en haute qualité, 27B en 4-bit contexte modéré.
1 703 €
CoreAI 32 : 16 Go de VRAMMême enveloppe VRAM, CPU et RAM renforcés pour le pipeline.
2 442 €
CoreAI 64 : 32 Go de VRAM1 792 Go/s. Contexte long, agents, vision, vidéo IA.
6 042 €
Mini serveur GB10, 128 Go unifiésTrès grands modèles, contexte massif, plusieurs composants IA.
3 999 €
CoreAI Rack : 64 Go de VRAMDeux cartes : modèles 70B en 4-bit, sessions en parallèle.
11 221 €
Pro AI Ultra, 96 Go VRAM ECCModèles 70B confortables, précision native, fine-tuning.
20 213 €
CoreAI 128 Rack, 192 Go VRAM ECCProduction continue, entraînement, nombreux utilisateurs.
27 980 €
En bref
Combien de VRAM pour un LLM local en 2026 ?
16 Go couvrent un usage individuel sérieux avec des modèles jusqu'à 27 milliards de paramètres en 4-bit. 32 Go constituent le palier professionnel : contexte long, agents, vision. Au-delà de 70 milliards de paramètres, comptez 48 Go et plus.
Pourquoi les chiffres annoncés sont-ils souvent sous-évalués ?
Parce qu'ils ne comptent que les poids du modèle. Le cache de contexte s'ajoute par-dessus et croît avec la longueur des échanges et le nombre de sessions.
Peut-on faire tourner un modèle plus gros que sa VRAM ?
Techniquement oui, en débordant vers la RAM système, mais la vitesse s'effondre à quelques tokens par seconde. En pratique, c'est inutilisable pour un usage interactif.
La quantisation dégrade-t-elle beaucoup la qualité ?
Beaucoup moins qu'avant. En 4-bit avec les formats récents, l'écart avec la précision native reste faible sur la plupart des usages courants. La perte devient perceptible sur les tâches de raisonnement les plus exigeantes.
Faut-il privilégier la VRAM ou la vitesse de la carte ?
La VRAM d'abord : sans elle, le modèle ne tourne pas du tout. La bande passante ensuite, car elle détermine le confort d'utilisation une fois le modèle chargé.
Les valeurs de ce guide sont des ordres de grandeur issus des retours de l'écosystème et des documentations publiques. Elles varient selon l'architecture du modèle, le moteur d'inférence, la méthode de quantisation et les optimisations activées. Pour un dimensionnement précis adapté à votre usage, contactez-nous.




