Meilleur PC pour Qwen 3.8 27B : la VRAM dont vous avez vraiment besoin

« Il tourne sur 17 Go. »
C'est vrai. Et c'est trompeur.

Qwen 3.8-27B charge sur une carte de 16 Go. Il ne s'y comporte pas de la même façon selon ce que vous en faites.

27B denseApache 2.0
256K contextenatif
Vision inclusetexte et image
~17 Go en 4-bitpoids seuls

Qwen 3.8-27B est le modèle ouvert le plus commenté du moment. Modèle dense de 27 milliards de paramètres publié par Alibaba sous licence Apache 2.0, il combine raisonnement, capacités agentiques, codage et vision, avec une fenêtre de contexte native de 256 000 tokens.

Partout, on lit le même chiffre : il tourne sur environ 17 Go. Ce chiffre est exact. Il ne dit simplement pas toute la vérité.


Le piège des 17 Go

Les poids sont le plancher, pas le total

Les 17 Go annoncés correspondent au poids du modèle quantisé en 4-bit. C'est ce qui est chargé au démarrage, avant que vous n'ayez posé la moindre question.

Vient ensuite le cache KV. Il stocke le contexte de la conversation et grandit avec chaque token traité. Sur un contexte long, il peut à lui seul doubler l'empreinte mémoire.

S'y ajoutent les tampons d'exécution, les graphes CUDA, l'encodeur visuel si vous traitez des images, et la mémoire consommée par chaque session simultanée. La prédiction multi-tokens, si vous l'activez, demande encore 1 à 2 Go de marge.

D'où l'écart entre « il charge sur ma carte » et « il tient ma charge de travail ».

Chat court, contexte réduittient sur 16 Go
Poids ~17 Go
KV
Agent de code, contexte moyen16 Go devient juste
Poids ~17 Go
Cache KV
Contexte long ou plusieurs sessionsdépasse 16 Go
Poids
Cache KV
Dépassement

Proportions illustratives. L'empreinte réelle du cache dépend de la longueur du contexte, du nombre de sessions simultanées et des options de quantisation du cache.


La VRAM réellement nécessaire

Format Poids seuls Carte minimale Carte confortable
4-bit (GGUF, NVFP4) environ 16 à 19 Go 16 Go, contexte court 24 à 32 Go
4-bit + contexte long 17 Go + cache KV 24 Go 32 Go
FP8 environ 27 à 28 Go 32 Go 48 Go et plus
BF16 (précision native) environ 54 à 56 Go 2 cartes ou 96 Go 96 Go ECC
La règle pratique. Une carte de 16 Go fait tourner Qwen 3.8-27B en 4-bit pour du chat et des tâches courtes. Dès que vous exploitez le contexte long, la vision, ou plusieurs sessions simultanées, visez 32 Go. C'est l'écart entre un modèle qui démarre et un modèle qui travaille.


Trois scénarios, trois machines

Découverte et usage conversationnel

16 Go

Vous voulez tester Qwen 3.8-27B, l'utiliser pour rédiger, résumer, poser des questions, traiter des documents de taille raisonnable.

Une carte de 16 Go suffit en 4-bit, à condition de rester sur des contextes modérés. C'est le point d'entrée le plus économique pour un usage individuel sérieux.

La limite se fait sentir dès que vous chargez de très longs documents ou que vous enchaînez de longues conversations.

Agent de code et outils

32 Go

C'est le terrain où Qwen 3.8-27B excelle : codage agentique, appels d'outils, travail sur une base de code.

Un agent relit son contexte à chaque étape. Dix tours d'appels d'outils sur un dépôt volumineux font gonfler le cache très vite. Sur 16 Go, la session finit par saturer.

Avec 32 Go, vous gardez de la marge pour un contexte étendu et un débit correct. C'est la configuration de référence pour un usage professionnel quotidien.

Contexte massif, vision, multi-utilisateurs

96 Go et plus

Exploiter les 256K tokens de contexte, traiter des images, ou servir plusieurs personnes en parallèle change de catégorie.

Le cache KV devient alors le poste dominant, loin devant les poids. Une mémoire unifiée de 128 Go ou une carte professionnelle de 96 Go ECC deviennent pertinentes, tout comme le FP8 pour préserver la qualité.

C'est aussi le seuil à partir duquel on peut envisager le fine-tuning du modèle sur vos propres données.


Notre recommandation

Le meilleur choix pour Qwen 3.8-27B

Radiance CoreAI 64 — RTX 5090 32 Go

  • GPU RTX 5090, 32 Go GDDR7
  • Bande passante 1 792 Go/s
  • CPU Ryzen 9 9950X3D
  • RAM DDR5 64 Go
  • Stockage NVMe 1 To
  • Alimentation 1 200 W 80+ Gold

32 Go : le modèle en 4-bit, un contexte étendu et de la marge pour les agents.

6 042 € à partir de, configurable
Configurer cette station
Un point honnête sur le budget. Si votre usage se limite au chat et à la rédaction sur des documents courts, la CoreAI 16 à 1 703 € fait tourner Qwen 3.8-27B en 4-bit et vous coûtera bien moins cher. Nous ne recommandons la RTX 5090 que si vous visez les agents, le contexte long ou la vision. Décrivez-nous votre usage réel et nous vous orienterons vers la machine adaptée, pas vers la plus chère.


Le lancer en pratique

Le plus rapide passe par Ollama. Le téléchargement représente environ 18 Go.

# Lancement direct
ollama run qwen3.8:27b

# Variante avec contexte étendu et cache quantisé
cat > Modelfile <<'EOF'
FROM qwen3.8:27b
PARAMETER num_ctx 65536
EOF
ollama create qwen3.8-long -f Modelfile

Qwen 3.8-27B est un modèle hybride : il dispose d'un mode de raisonnement et d'un mode instruction directe, avec des réglages recommandés distincts.

Mode temperature top_p top_k Usage
Raisonnement 1.0 0.95 20 Problèmes complexes, code, analyse
Instruction directe 0.7 0.80 20 Rédaction, réponses rapides
Une astuce qui change tout sur 16 Go. Quantiser le cache KV réduit fortement son empreinte mémoire, souvent de moitié. C'est ce qui permet de loger un contexte étendu là où la configuration par défaut sature. Sur nos machines, ces optimisations sont préconfigurées sur demande.


Toute notre gamme

Chaque machine est assemblée à la main à Auriol (13390) et entièrement configurable, via le configurateur en ligne ou sur devis à contact@radiancesystems.eu.

Stations individuelles

Radiance CoreAI 16 CoreAI 16 — RTX 5060 Ti 16 GoQwen 3.8-27B en 4-bit, contexte court. Le point d'entrée. 1 703 € Radiance CoreAI 32 CoreAI 32 — RTX 5070 Ti 16 GoMême enveloppe VRAM, plus de CPU et de RAM pour le pipeline. 2 442 € Radiance CoreAI 64 RTX 5090 CoreAI 64 — RTX 5090 32 GoLa référence : agents, contexte étendu, vision, débit maximal. 6 042 €

Serveur compact

ASUS Ascent GX10 GB10 Mini serveur IA NVIDIA GB10128 Go unifiés : contexte 256K sans contrainte, plusieurs utilisateurs. 3 999 €

Rack et multi-GPU

Radiance Rack 2x RTX 5090 CoreAI Rack — 2 × RTX 5090 (64 Go)FP8 confortable, plusieurs sessions en parallèle, format rack 4U. 11 221 € Radiance Pro AI Ultra Threadripper Pro AI Ultra — Threadripper PRO96 Go ECC : BF16 en précision native, fine-tuning du modèle. 20 213 € Radiance Rack 2x RTX 6000 Blackwell ECC CoreAI 128 Rack — 2 × RTX 6000 (192 Go ECC)Production, nombreux utilisateurs, entraînement, fiabilité ECC. 27 980 €


En bref

Quelle VRAM pour Qwen 3.8-27B ?
16 Go pour le 4-bit en contexte court. 32 Go pour les agents et le contexte étendu. 96 Go et plus pour la précision native ou le fine-tuning.

Pourquoi 16 Go ne suffisent pas toujours ?
Parce que les 17 Go annoncés ne comptent que les poids. Le cache KV, les tampons d'exécution et l'encodeur visuel s'ajoutent, et le cache grandit avec la longueur du contexte.

Qwen 3.8-27B est-il gratuit ?
Oui, licence Apache 2.0, usage commercial inclus. Vous ne payez que le matériel.

Traite-t-il les images ?
Oui, il embarque un encodeur visuel. La vision consomme de la mémoire supplémentaire, à prévoir dans le dimensionnement.

Peut-on l'affiner sur ses propres données ?
Oui, c'est l'un des intérêts d'un modèle dense de cette taille. Comptez toutefois nettement plus de VRAM que pour l'inférence : les configurations à 96 Go ECC et plus sont les plus adaptées.

Les valeurs de mémoire indiquées sont des ordres de grandeur issus des retours de l'écosystème et varient selon le moteur d'inférence, la méthode de quantisation, la longueur du contexte et le nombre de sessions simultanées. Nous vous conseillons volontiers en fonction de votre usage réel.

Retour au blog

Votre devis pour une solution IA sur mesure sous 24–48h

Chaque projet Radiance commence par une conversation. Remplissez ce formulaire et un expert vous répondra rapidement avec une solution adaptée à votre métier et votre budget.

Réponse sous 24–48h ouvrés
Livraison dans toute l'Europe (UE)
Garantie 2 ans incluse
Installation sur site possible
Aucun engagement à la demande
Support dédié avant et après achat
01 Quel est votre usage principal de l'IA ?
Choix multiple.
02 Dans quel contexte sera utilisé le système ?
Choix unique.
03 Quel type de système recherchez-vous ?
Choix unique.
04 Quel système d'exploitation préférez-vous ?
Choix unique.
05 Quel est votre niveau d'attente sur le logiciel ?
Choix multiple.
06 Quel est votre budget indicatif ?
Choix unique.
07 Quand souhaitez-vous recevoir votre système ?
Choix unique.
08 Souhaitez-vous un accompagnement à la mise en place ?
Choix unique. Un technicien Radiance peut intervenir chez vous ou à distance.
09 Pays de livraison (UE uniquement) *
Nous livrons uniquement dans l'Union Européenne (UE).
10 Informations complémentaires (optionnel mais très utile)
Décrivez brièvement votre projet, vos contraintes spécifiques ou toute information utile.
11 Souhaitez-vous être recontacté pour échanger sur votre projet ?
Si vous choisissez "Devis uniquement", vous pourrez répondre à notre email pour poser vos questions et affiner le devis.
12 Email *
Nous vous enverrons le devis à cette adresse.

Plus de questions ?

Envoyez nous un email à contact@radiancesystems,eu ou contactez nous via le formulaire de contact, nous répondons en moins de 3h à toutes les demandes pendant les horaires de travail (Du lundi au vendredi de 9h à 17h).

📞 +33 4 65 84 48 21