Combien de VRAM pour un LLM local en 2026 ? Le guide par modèle

La VRAM décide de tout.
Voici comment la calculer.

Taille du modèle, quantisation, longueur du contexte : trois variables, un résultat. Estimez le vôtre ci-dessous.

C'est la question qui revient avant chaque achat de machine IA. Et la réponse habituelle, un chiffre unique par modèle, est presque toujours fausse, parce qu'elle ne compte que les poids.


Estimez votre besoin

Votre configuration

VRAM estimée

gigaoctets nécessaires
Poids du modèle
Cache de contexte
Marge système
Machine adaptée Voir la configuration

Estimation indicative. L'empreinte réelle varie selon le moteur d'inférence, l'architecture du modèle, la méthode de quantisation et les options d'optimisation. Considérez ce résultat comme un ordre de grandeur pour dimensionner, pas comme une mesure.


Les trois règles à connaître

1. Les poids sont le plancher, jamais le total

Le chiffre que vous lisez partout correspond au modèle chargé, avant la moindre requête. Le cache de contexte, les tampons d'exécution et les composants multimodaux s'ajoutent par-dessus.

2. Le contexte coûte cher, et personne ne le dit

Le cache grandit avec chaque token traité. Sur une fenêtre longue, il peut à lui seul doubler l'empreinte mémoire. C'est ce qui explique qu'un modèle qui démarre sans problème sature après vingt échanges.

3. La VRAM détermine la taille, la bande passante détermine la vitesse

Deux paramètres distincts. La VRAM dit si le modèle tient. La bande passante mémoire dit à quelle vitesse il répond. Un modèle qui déborde vers la RAM système chute à quelques tokens par seconde.

tokens par seconde ≈ bande passante ÷ taille du modèle
À chaque token généré, le modèle est relu entièrement depuis la mémoire. C'est pourquoi la bande passante, et non la puissance de calcul, dicte la vitesse en génération de texte.


Tableau de référence par modèle

Valeurs pour les poids seuls, en contexte court. Ajoutez le cache selon votre usage.

Modèle Type 4-bit 8-bit 16-bit Carte conseillée
Gemma 4 12B Dense, multimodal ~6,6 Go ~13 Go ~24 Go 16 Go
Qwen 3.8-27B Dense, vision ~17 Go ~27 Go ~55 Go 32 Go
Qwen 3.6-27B Dense ~17 Go ~30 Go ~54 Go 24 à 32 Go
Qwen 3.6-35B-A3B MoE (3B actifs) ~21 Go ~38 Go ~70 Go 24 à 32 Go
Hermes 4.3 36B Dense, agent ~21 Go ~40 Go ~72 Go 32 Go
Modèle 70B Dense ~40 Go ~75 Go ~140 Go 48 Go et plus
Whisper large-v3 Transcription non applicable ~3 Go ~6 Go 8 Go
Modèles vidéo IA Génération non applicable 16 à 24 Go 50 Go et plus 32 Go
Attention aux modèles MoE. Un modèle « 35B-A3B » contient 35 milliards de paramètres mais n'en active que 3 milliards par token. Le coût de calcul est celui d'un petit modèle, mais la totalité des poids doit être chargée en mémoire. On dimensionne sur le nombre total, jamais sur le nombre actif.


Ce que vous pouvez faire à chaque palier

8 Go
Découverte Modèles jusqu'à 12 milliards en 4-bit, transcription Whisper, contextes courts. Suffisant pour se faire une idée, limitant au quotidien.
16 Go
Usage individuel sérieux Modèles 12B en haute qualité, modèles 27B en 4-bit avec contexte modéré, génération d'images. Le meilleur rapport capacité/prix pour débuter.
24 Go
Confort réel Modèles 27B à 36B en 4-bit avec un contexte étendu, agents multi-étapes, marge pour le cache. Le palier où l'on cesse de faire attention.
32 Go
Professionnel Modèles 27B en 8-bit, contexte long, vision, plusieurs sessions, vidéo IA, fine-tuning léger. La configuration de référence du métier.
96 Go ECC
Recherche et production Modèles 70B confortables, précision native sur les modèles moyens, fine-tuning sérieux, fiabilité ECC pour les calculs longs.
128 Go
Mémoire unifiée Très grands modèles, contexte massif sans contrainte, plusieurs composants IA simultanés. Format compact, consommation réduite.
Le conseil que nous donnons le plus souvent : prenez une marge d'un palier au-dessus de votre besoin actuel. Les modèles grossissent, les contextes s'allongent, et les usages s'ajoutent les uns aux autres. Une machine dimensionnée au plus juste est celle qu'on remplace le plus vite.


Trois leviers pour tenir dans moins de VRAM

Quantiser le cache de contexte. C'est le geste le plus rentable. Il réduit souvent de moitié l'empreinte du contexte, avec un impact minime sur la qualité. C'est ce qui permet de loger une longue fenêtre là où la configuration par défaut sature.

Choisir une quantisation moderne. Les formats récents offrent une qualité nettement supérieure à taille égale par rapport aux quantisations de première génération. À 4-bit, l'écart avec la précision native est aujourd'hui faible sur la plupart des usages.

Réduire la fenêtre de contexte au nécessaire. Peu d'usages exigent réellement 256 000 tokens. Fixer la fenêtre à ce dont vous avez besoin libère beaucoup de mémoire, et accélère souvent le traitement.


Nos machines par palier de VRAM

Toutes assemblées à la main à Auriol (13390), entièrement configurables via le configurateur en ligne ou sur devis à contact@radiancesystems.eu.

Radiance CoreAI 16 CoreAI 16 : 16 Go de VRAMModèles 12B en haute qualité, 27B en 4-bit contexte modéré. 1 703 € Radiance CoreAI 32 CoreAI 32 : 16 Go de VRAMMême enveloppe VRAM, CPU et RAM renforcés pour le pipeline. 2 442 € Radiance CoreAI 64 RTX 5090 CoreAI 64 : 32 Go de VRAM1 792 Go/s. Contexte long, agents, vision, vidéo IA. 6 042 € ASUS Ascent GX10 GB10 Mini serveur GB10, 128 Go unifiésTrès grands modèles, contexte massif, plusieurs composants IA. 3 999 € Radiance Rack 2x RTX 5090 CoreAI Rack : 64 Go de VRAMDeux cartes : modèles 70B en 4-bit, sessions en parallèle. 11 221 € Radiance Pro AI Ultra Threadripper Pro AI Ultra, 96 Go VRAM ECCModèles 70B confortables, précision native, fine-tuning. 20 213 € Radiance Rack 2x RTX 6000 Blackwell ECC CoreAI 128 Rack, 192 Go VRAM ECCProduction continue, entraînement, nombreux utilisateurs. 27 980 €


En bref

Combien de VRAM pour un LLM local en 2026 ?
16 Go couvrent un usage individuel sérieux avec des modèles jusqu'à 27 milliards de paramètres en 4-bit. 32 Go constituent le palier professionnel : contexte long, agents, vision. Au-delà de 70 milliards de paramètres, comptez 48 Go et plus.

Pourquoi les chiffres annoncés sont-ils souvent sous-évalués ?
Parce qu'ils ne comptent que les poids du modèle. Le cache de contexte s'ajoute par-dessus et croît avec la longueur des échanges et le nombre de sessions.

Peut-on faire tourner un modèle plus gros que sa VRAM ?
Techniquement oui, en débordant vers la RAM système, mais la vitesse s'effondre à quelques tokens par seconde. En pratique, c'est inutilisable pour un usage interactif.

La quantisation dégrade-t-elle beaucoup la qualité ?
Beaucoup moins qu'avant. En 4-bit avec les formats récents, l'écart avec la précision native reste faible sur la plupart des usages courants. La perte devient perceptible sur les tâches de raisonnement les plus exigeantes.

Faut-il privilégier la VRAM ou la vitesse de la carte ?
La VRAM d'abord : sans elle, le modèle ne tourne pas du tout. La bande passante ensuite, car elle détermine le confort d'utilisation une fois le modèle chargé.

Les valeurs de ce guide sont des ordres de grandeur issus des retours de l'écosystème et des documentations publiques. Elles varient selon l'architecture du modèle, le moteur d'inférence, la méthode de quantisation et les optimisations activées. Pour un dimensionnement précis adapté à votre usage, contactez-nous.

Back to the blog

Your quote for a custom AI solution within 24–48 hours

Every Radiance project begins with a conversation. Fill out this form and an expert will respond promptly with a solution tailored to your business and budget.

Response within 24–48 business hours
Delivery throughout Europe (EU)
2-year warranty included
On-site installation possible
No commitment required
Dedicated support before and after purchase
01 What is your primary use for AI?
Multiple choice.
02 In what context will the system be used?
Single choice.
03 What type of system are you looking for?
Single choice.
04 Which operating system do you prefer?
Single choice.
05 What are your expectations for the software?
Multiple choice.
06 What is your indicative budget?
Single choice.
07 When would you like to receive your system?
Single choice.
08 Would you like help with the setup?
Single choice. A Radiance technician can assist you remotely or in person.
09 Delivery Country (EU only) *
We only deliver within the European Union (EU).
10 Additional Information (optional but very helpful)
Please briefly describe your project, specific constraints, or any useful information.
11 Would you like to be contacted to discuss your project?
If you choose "Quote only", you can reply to our email to ask your questions and refine the quote.
12 Email *
We will send the quote to this address.

Any more questions?

Send us an email at contact@radiancesystems.eu or contact us via the contact form. We respond to all inquiries within 3 hours during business hours (Monday to Friday, 9am to 5pm).

📞 +33 4 65 84 48 21