Combien de VRAM pour un LLM local en 2026 ? Le guide par modèle

La VRAM décide de tout.
Voici comment la calculer.

Taille du modèle, quantisation, longueur du contexte : trois variables, un résultat. Estimez le vôtre ci-dessous.

C'est la question qui revient avant chaque achat de machine IA. Et la réponse habituelle, un chiffre unique par modèle, est presque toujours fausse, parce qu'elle ne compte que les poids.


Estimez votre besoin

Votre configuration

VRAM estimée

gigaoctets nécessaires
Poids du modèle
Cache de contexte
Marge système
Machine adaptée Voir la configuration

Estimation indicative. L'empreinte réelle varie selon le moteur d'inférence, l'architecture du modèle, la méthode de quantisation et les options d'optimisation. Considérez ce résultat comme un ordre de grandeur pour dimensionner, pas comme une mesure.


Les trois règles à connaître

1. Les poids sont le plancher, jamais le total

Le chiffre que vous lisez partout correspond au modèle chargé, avant la moindre requête. Le cache de contexte, les tampons d'exécution et les composants multimodaux s'ajoutent par-dessus.

2. Le contexte coûte cher, et personne ne le dit

Le cache grandit avec chaque token traité. Sur une fenêtre longue, il peut à lui seul doubler l'empreinte mémoire. C'est ce qui explique qu'un modèle qui démarre sans problème sature après vingt échanges.

3. La VRAM détermine la taille, la bande passante détermine la vitesse

Deux paramètres distincts. La VRAM dit si le modèle tient. La bande passante mémoire dit à quelle vitesse il répond. Un modèle qui déborde vers la RAM système chute à quelques tokens par seconde.

tokens par seconde ≈ bande passante ÷ taille du modèle
À chaque token généré, le modèle est relu entièrement depuis la mémoire. C'est pourquoi la bande passante, et non la puissance de calcul, dicte la vitesse en génération de texte.


Tableau de référence par modèle

Valeurs pour les poids seuls, en contexte court. Ajoutez le cache selon votre usage.

Modèle Type 4-bit 8-bit 16-bit Carte conseillée
Gemma 4 12B Dense, multimodal ~6,6 Go ~13 Go ~24 Go 16 Go
Qwen 3.8-27B Dense, vision ~17 Go ~27 Go ~55 Go 32 Go
Qwen 3.6-27B Dense ~17 Go ~30 Go ~54 Go 24 à 32 Go
Qwen 3.6-35B-A3B MoE (3B actifs) ~21 Go ~38 Go ~70 Go 24 à 32 Go
Hermes 4.3 36B Dense, agent ~21 Go ~40 Go ~72 Go 32 Go
Modèle 70B Dense ~40 Go ~75 Go ~140 Go 48 Go et plus
Whisper large-v3 Transcription non applicable ~3 Go ~6 Go 8 Go
Modèles vidéo IA Génération non applicable 16 à 24 Go 50 Go et plus 32 Go
Attention aux modèles MoE. Un modèle « 35B-A3B » contient 35 milliards de paramètres mais n'en active que 3 milliards par token. Le coût de calcul est celui d'un petit modèle, mais la totalité des poids doit être chargée en mémoire. On dimensionne sur le nombre total, jamais sur le nombre actif.


Ce que vous pouvez faire à chaque palier

8 Go
Découverte Modèles jusqu'à 12 milliards en 4-bit, transcription Whisper, contextes courts. Suffisant pour se faire une idée, limitant au quotidien.
16 Go
Usage individuel sérieux Modèles 12B en haute qualité, modèles 27B en 4-bit avec contexte modéré, génération d'images. Le meilleur rapport capacité/prix pour débuter.
24 Go
Confort réel Modèles 27B à 36B en 4-bit avec un contexte étendu, agents multi-étapes, marge pour le cache. Le palier où l'on cesse de faire attention.
32 Go
Professionnel Modèles 27B en 8-bit, contexte long, vision, plusieurs sessions, vidéo IA, fine-tuning léger. La configuration de référence du métier.
96 Go ECC
Recherche et production Modèles 70B confortables, précision native sur les modèles moyens, fine-tuning sérieux, fiabilité ECC pour les calculs longs.
128 Go
Mémoire unifiée Très grands modèles, contexte massif sans contrainte, plusieurs composants IA simultanés. Format compact, consommation réduite.
Le conseil que nous donnons le plus souvent : prenez une marge d'un palier au-dessus de votre besoin actuel. Les modèles grossissent, les contextes s'allongent, et les usages s'ajoutent les uns aux autres. Une machine dimensionnée au plus juste est celle qu'on remplace le plus vite.


Trois leviers pour tenir dans moins de VRAM

Quantiser le cache de contexte. C'est le geste le plus rentable. Il réduit souvent de moitié l'empreinte du contexte, avec un impact minime sur la qualité. C'est ce qui permet de loger une longue fenêtre là où la configuration par défaut sature.

Choisir une quantisation moderne. Les formats récents offrent une qualité nettement supérieure à taille égale par rapport aux quantisations de première génération. À 4-bit, l'écart avec la précision native est aujourd'hui faible sur la plupart des usages.

Réduire la fenêtre de contexte au nécessaire. Peu d'usages exigent réellement 256 000 tokens. Fixer la fenêtre à ce dont vous avez besoin libère beaucoup de mémoire, et accélère souvent le traitement.


Nos machines par palier de VRAM

Toutes assemblées à la main à Auriol (13390), entièrement configurables via le configurateur en ligne ou sur devis à contact@radiancesystems.eu.

Radiance CoreAI 16 CoreAI 16 : 16 Go de VRAMModèles 12B en haute qualité, 27B en 4-bit contexte modéré. 1 703 € Radiance CoreAI 32 CoreAI 32 : 16 Go de VRAMMême enveloppe VRAM, CPU et RAM renforcés pour le pipeline. 2 442 € Radiance CoreAI 64 RTX 5090 CoreAI 64 : 32 Go de VRAM1 792 Go/s. Contexte long, agents, vision, vidéo IA. 6 042 € ASUS Ascent GX10 GB10 Mini serveur GB10, 128 Go unifiésTrès grands modèles, contexte massif, plusieurs composants IA. 3 999 € Radiance Rack 2x RTX 5090 CoreAI Rack : 64 Go de VRAMDeux cartes : modèles 70B en 4-bit, sessions en parallèle. 11 221 € Radiance Pro AI Ultra Threadripper Pro AI Ultra, 96 Go VRAM ECCModèles 70B confortables, précision native, fine-tuning. 20 213 € Radiance Rack 2x RTX 6000 Blackwell ECC CoreAI 128 Rack, 192 Go VRAM ECCProduction continue, entraînement, nombreux utilisateurs. 27 980 €


En bref

Combien de VRAM pour un LLM local en 2026 ?
16 Go couvrent un usage individuel sérieux avec des modèles jusqu'à 27 milliards de paramètres en 4-bit. 32 Go constituent le palier professionnel : contexte long, agents, vision. Au-delà de 70 milliards de paramètres, comptez 48 Go et plus.

Pourquoi les chiffres annoncés sont-ils souvent sous-évalués ?
Parce qu'ils ne comptent que les poids du modèle. Le cache de contexte s'ajoute par-dessus et croît avec la longueur des échanges et le nombre de sessions.

Peut-on faire tourner un modèle plus gros que sa VRAM ?
Techniquement oui, en débordant vers la RAM système, mais la vitesse s'effondre à quelques tokens par seconde. En pratique, c'est inutilisable pour un usage interactif.

La quantisation dégrade-t-elle beaucoup la qualité ?
Beaucoup moins qu'avant. En 4-bit avec les formats récents, l'écart avec la précision native reste faible sur la plupart des usages courants. La perte devient perceptible sur les tâches de raisonnement les plus exigeantes.

Faut-il privilégier la VRAM ou la vitesse de la carte ?
La VRAM d'abord : sans elle, le modèle ne tourne pas du tout. La bande passante ensuite, car elle détermine le confort d'utilisation une fois le modèle chargé.

Les valeurs de ce guide sont des ordres de grandeur issus des retours de l'écosystème et des documentations publiques. Elles varient selon l'architecture du modèle, le moteur d'inférence, la méthode de quantisation et les optimisations activées. Pour un dimensionnement précis adapté à votre usage, contactez-nous.

Retour au blog

Votre devis pour une solution IA sur mesure sous 24–48h

Chaque projet Radiance commence par une conversation. Remplissez ce formulaire et un expert vous répondra rapidement avec une solution adaptée à votre métier et votre budget.

Réponse sous 24–48h ouvrés
Livraison dans toute l'Europe (UE)
Garantie 2 ans incluse
Installation sur site possible
Aucun engagement à la demande
Support dédié avant et après achat
01 Quel est votre usage principal de l'IA ?
Choix multiple.
02 Dans quel contexte sera utilisé le système ?
Choix unique.
03 Quel type de système recherchez-vous ?
Choix unique.
04 Quel système d'exploitation préférez-vous ?
Choix unique.
05 Quel est votre niveau d'attente sur le logiciel ?
Choix multiple.
06 Quel est votre budget indicatif ?
Choix unique.
07 Quand souhaitez-vous recevoir votre système ?
Choix unique.
08 Souhaitez-vous un accompagnement à la mise en place ?
Choix unique. Un technicien Radiance peut intervenir chez vous ou à distance.
09 Pays de livraison (UE uniquement) *
Nous livrons uniquement dans l'Union Européenne (UE).
10 Informations complémentaires (optionnel mais très utile)
Décrivez brièvement votre projet, vos contraintes spécifiques ou toute information utile.
11 Souhaitez-vous être recontacté pour échanger sur votre projet ?
Si vous choisissez "Devis uniquement", vous pourrez répondre à notre email pour poser vos questions et affiner le devis.
12 Email *
Nous vous enverrons le devis à cette adresse.

Plus de questions ?

Envoyez nous un email à contact@radiancesystems,eu ou contactez nous via le formulaire de contact, nous répondons en moins de 3h à toutes les demandes pendant les horaires de travail (Du lundi au vendredi de 9h à 17h).

📞 +33 4 65 84 48 21