Meilleur PC pour Qwen 3.8 27B : la VRAM dont vous avez vraiment besoin
Share
« Il tourne sur 17 Go. »
C'est vrai. Et c'est trompeur.
Qwen 3.8-27B charge sur une carte de 16 Go. Il ne s'y comporte pas de la même façon selon ce que vous en faites.
Qwen 3.8-27B est le modèle ouvert le plus commenté du moment. Modèle dense de 27 milliards de paramètres publié par Alibaba sous licence Apache 2.0, il combine raisonnement, capacités agentiques, codage et vision, avec une fenêtre de contexte native de 256 000 tokens.
Partout, on lit le même chiffre : il tourne sur environ 17 Go. Ce chiffre est exact. Il ne dit simplement pas toute la vérité.
Le piège des 17 Go
Les poids sont le plancher, pas le total
Les 17 Go annoncés correspondent au poids du modèle quantisé en 4-bit. C'est ce qui est chargé au démarrage, avant que vous n'ayez posé la moindre question.
Vient ensuite le cache KV. Il stocke le contexte de la conversation et grandit avec chaque token traité. Sur un contexte long, il peut à lui seul doubler l'empreinte mémoire.
S'y ajoutent les tampons d'exécution, les graphes CUDA, l'encodeur visuel si vous traitez des images, et la mémoire consommée par chaque session simultanée. La prédiction multi-tokens, si vous l'activez, demande encore 1 à 2 Go de marge.
D'où l'écart entre « il charge sur ma carte » et « il tient ma charge de travail ».
Proportions illustratives. L'empreinte réelle du cache dépend de la longueur du contexte, du nombre de sessions simultanées et des options de quantisation du cache.
La VRAM réellement nécessaire
| Format | Poids seuls | Carte minimale | Carte confortable |
|---|---|---|---|
| 4-bit (GGUF, NVFP4) | environ 16 à 19 Go | 16 Go, contexte court | 24 à 32 Go |
| 4-bit + contexte long | 17 Go + cache KV | 24 Go | 32 Go |
| FP8 | environ 27 à 28 Go | 32 Go | 48 Go et plus |
| BF16 (précision native) | environ 54 à 56 Go | 2 cartes ou 96 Go | 96 Go ECC |
Trois scénarios, trois machines
Découverte et usage conversationnel
16 GoVous voulez tester Qwen 3.8-27B, l'utiliser pour rédiger, résumer, poser des questions, traiter des documents de taille raisonnable.
Une carte de 16 Go suffit en 4-bit, à condition de rester sur des contextes modérés. C'est le point d'entrée le plus économique pour un usage individuel sérieux.
La limite se fait sentir dès que vous chargez de très longs documents ou que vous enchaînez de longues conversations.
Agent de code et outils
32 GoC'est le terrain où Qwen 3.8-27B excelle : codage agentique, appels d'outils, travail sur une base de code.
Un agent relit son contexte à chaque étape. Dix tours d'appels d'outils sur un dépôt volumineux font gonfler le cache très vite. Sur 16 Go, la session finit par saturer.
Avec 32 Go, vous gardez de la marge pour un contexte étendu et un débit correct. C'est la configuration de référence pour un usage professionnel quotidien.
Contexte massif, vision, multi-utilisateurs
96 Go et plusExploiter les 256K tokens de contexte, traiter des images, ou servir plusieurs personnes en parallèle change de catégorie.
Le cache KV devient alors le poste dominant, loin devant les poids. Une mémoire unifiée de 128 Go ou une carte professionnelle de 96 Go ECC deviennent pertinentes, tout comme le FP8 pour préserver la qualité.
C'est aussi le seuil à partir duquel on peut envisager le fine-tuning du modèle sur vos propres données.
Notre recommandation
Radiance CoreAI 64 — RTX 5090 32 Go
- GPU RTX 5090, 32 Go GDDR7
- Bande passante 1 792 Go/s
- CPU Ryzen 9 9950X3D
- RAM DDR5 64 Go
- Stockage NVMe 1 To
- Alimentation 1 200 W 80+ Gold
32 Go : le modèle en 4-bit, un contexte étendu et de la marge pour les agents.
Le lancer en pratique
Le plus rapide passe par Ollama. Le téléchargement représente environ 18 Go.
# Lancement direct ollama run qwen3.8:27b # Variante avec contexte étendu et cache quantisé cat > Modelfile <<'EOF' FROM qwen3.8:27b PARAMETER num_ctx 65536 EOF ollama create qwen3.8-long -f Modelfile
Qwen 3.8-27B est un modèle hybride : il dispose d'un mode de raisonnement et d'un mode instruction directe, avec des réglages recommandés distincts.
| Mode | temperature | top_p | top_k | Usage |
|---|---|---|---|---|
| Raisonnement | 1.0 | 0.95 | 20 | Problèmes complexes, code, analyse |
| Instruction directe | 0.7 | 0.80 | 20 | Rédaction, réponses rapides |
Toute notre gamme
Chaque machine est assemblée à la main à Auriol (13390) et entièrement configurable, via le configurateur en ligne ou sur devis à contact@radiancesystems.eu.
Stations individuelles
CoreAI 16 — RTX 5060 Ti 16 GoQwen 3.8-27B en 4-bit, contexte court. Le point d'entrée.
1 703 €
CoreAI 32 — RTX 5070 Ti 16 GoMême enveloppe VRAM, plus de CPU et de RAM pour le pipeline.
2 442 €
CoreAI 64 — RTX 5090 32 GoLa référence : agents, contexte étendu, vision, débit maximal.
6 042 €
Serveur compact
Mini serveur IA NVIDIA GB10128 Go unifiés : contexte 256K sans contrainte, plusieurs utilisateurs.
3 999 €
Rack et multi-GPU
CoreAI Rack — 2 × RTX 5090 (64 Go)FP8 confortable, plusieurs sessions en parallèle, format rack 4U.
11 221 €
Pro AI Ultra — Threadripper PRO96 Go ECC : BF16 en précision native, fine-tuning du modèle.
20 213 €
CoreAI 128 Rack — 2 × RTX 6000 (192 Go ECC)Production, nombreux utilisateurs, entraînement, fiabilité ECC.
27 980 €
En bref
Quelle VRAM pour Qwen 3.8-27B ?
16 Go pour le 4-bit en contexte court. 32 Go pour les agents et le contexte étendu. 96 Go et plus pour la précision native ou le fine-tuning.
Pourquoi 16 Go ne suffisent pas toujours ?
Parce que les 17 Go annoncés ne comptent que les poids. Le cache KV, les tampons d'exécution et l'encodeur visuel s'ajoutent, et le cache grandit avec la longueur du contexte.
Qwen 3.8-27B est-il gratuit ?
Oui, licence Apache 2.0, usage commercial inclus. Vous ne payez que le matériel.
Traite-t-il les images ?
Oui, il embarque un encodeur visuel. La vision consomme de la mémoire supplémentaire, à prévoir dans le dimensionnement.
Peut-on l'affiner sur ses propres données ?
Oui, c'est l'un des intérêts d'un modèle dense de cette taille. Comptez toutefois nettement plus de VRAM que pour l'inférence : les configurations à 96 Go ECC et plus sont les plus adaptées.
Les valeurs de mémoire indiquées sont des ordres de grandeur issus des retours de l'écosystème et varient selon le moteur d'inférence, la méthode de quantisation, la longueur du contexte et le nombre de sessions simultanées. Nous vous conseillons volontiers en fonction de votre usage réel.




