Bester PC für Qwen 3.8 27B: Der VRAM, den Sie wirklich brauchen
Teilen
„Es läuft mit 17 GB.“
Das stimmt. Und es ist irreführend.
Qwen 3.8-27B lädt auf einer 16 GB Karte. Je nachdem, was Sie damit machen, verhält es sich jedoch nicht gleich.
Qwen 3.8-27B ist das derzeit meistdiskutierte offene Modell. Ein dichtes Modell mit 27 Milliarden Parametern, veröffentlicht von Alibaba unter der Apache 2.0 Lizenz, das Reasoning, Agentenfähigkeiten, Codierung und Vision kombiniert, mit einem nativen Kontextfenster von 256.000 Tokens.
Überall liest man die gleiche Zahl: Es läuft mit etwa 17 GB. Diese Zahl ist korrekt. Sie sagt nur nicht die ganze Wahrheit.
Die 17 GB Falle
Die Gewichte sind die Untergrenze, nicht das Gesamtvolumen
Die angegebenen 17 GB entsprechen dem Gewicht des in 4-bit quantisierten Modells. Das ist das, was beim Start geladen wird, bevor Sie überhaupt eine Frage gestellt haben.
Danach kommt der KV-Cache. Er speichert den Gesprächskontext und wächst mit jedem verarbeiteten Token. Bei einem langen Kontext kann er allein den Speicherbedarf verdoppeln.
Dazu kommen die Ausführungspuffer, CUDA-Graphen, der visuelle Encoder, wenn Sie Bilder verarbeiten, und der Speicher, der von jeder gleichzeitigen Sitzung verbraucht wird. Die Multi-Token-Vorhersage, wenn Sie sie aktivieren, benötigt weitere 1 bis 2 GB Puffer.
Daraus ergibt sich der Unterschied zwischen „es lädt auf meiner Karte“ und „es bewältigt meine Arbeitslast“.
Illustrative Proportionen. Der tatsächliche Speicherbedarf des Caches hängt von der Länge des Kontexts, der Anzahl der gleichzeitigen Sitzungen und den Quantisierungsoptionen des Caches ab.
Der tatsächlich benötigte VRAM
| Format | Nur Gewichte | Minimale Karte | Komfortable Karte |
|---|---|---|---|
| 4-bit (GGUF, NVFP4) | ca. 16 bis 19 GB | 16 GB, kurzer Kontext | 24 bis 32 GB |
| 4-bit + langer Kontext | 17 GB + KV-Cache | 24 GB | 32 GB |
| FP8 | ca. 27 bis 28 GB | 32 GB | 48 GB und mehr |
| BF16 (native Präzision) | ca. 54 bis 56 GB | 2 Karten oder 96 GB | 96 GB ECC |
Drei Szenarien, drei Maschinen
Entdeckung und konversationelle Nutzung
16 GBSie möchten Qwen 3.8-27B testen, es zum Schreiben, Zusammenfassen, Fragen stellen oder zur Bearbeitung von Dokumenten angemessener Größe verwenden.
Eine 16-GB-Karte reicht in 4-bit aus, vorausgesetzt, Sie bleiben bei moderaten Kontexten. Dies ist der wirtschaftlichste Einstiegspunkt für eine ernsthafte Einzelnutzung.
Die Grenze wird spürbar, sobald Sie sehr lange Dokumente laden oder lange Gespräche führen.
Code-Agent und Tools
32 GBDies ist das Terrain, auf dem Qwen 3.8-27B glänzt: agentenbasiertes Codieren, Tool-Aufrufe, Arbeit an einer Codebasis.
Ein Agent liest seinen Kontext bei jedem Schritt neu. Zehn Runden von Tool-Aufrufen in einem umfangreichen Repository lassen den Cache sehr schnell anschwellen. Mit 16 GB gerät die Sitzung schließlich ins Stocken.
Mit 32 GB haben Sie genügend Spielraum für einen erweiterten Kontext und eine gute Durchsatzrate. Dies ist die Referenzkonfiguration für den täglichen professionellen Einsatz.
Massiver Kontext, Vision, Multi-User
96 GB und mehrDie Nutzung der 256K Kontext-Tokens, die Verarbeitung von Bildern oder die parallele Bedienung mehrerer Personen gehört zu einer anderen Kategorie.
Der KV-Cache wird dann zum dominierenden Faktor, weit vor den Gewichten. Ein einheitlicher Speicher von 128 GB oder eine professionelle ECC-Karte mit 96 GB werden relevant, ebenso wie FP8, um die Qualität zu erhalten.
Dies ist auch die Schwelle, ab der man das Fine-Tuning des Modells mit eigenen Daten in Betracht ziehen kann.
Unsere Empfehlung
Radiance CoreAI 64 — RTX 5090 32 GB
- GPU RTX 5090, 32 GB GDDR7
- Bandbreite 1.792 GB/s
- CPU Ryzen 9 9950X3D
- RAM DDR5 64 GB
- Speicher NVMe 1 TB
- Netzteil 1.200 W 80+ Gold
32 GB: das 4-bit Modell, erweiterter Kontext und Spielraum für Agenten.
Praktischer Start
Am schnellsten geht es über Ollama. Der Download beträgt etwa 18 GB.
# Direkter Start ollama run qwen3.8:27b # Variante mit erweitertem Kontext und quantisiertem Cache cat > Modelfile <<'EOF' FROM qwen3.8:27b PARAMETER num_ctx 65536 EOF ollama create qwen3.8-long -f Modelfile
Qwen 3.8-27B ist ein Hybridmodell: Es verfügt über einen Denkmodus und einen direkten Instruktionsmodus mit separaten empfohlenen Einstellungen.
| Modus | Temperatur | top_p | top_k | Verwendung |
|---|---|---|---|---|
| Denkmodus | 1.0 | 0.95 | 20 | Komplexe Probleme, Code, Analyse |
| Direkte Instruktion | 0.7 | 0.80 | 20 | Schreiben, schnelle Antworten |
Unser gesamtes Sortiment
Jede Maschine wird in Auriol (13390) von Hand zusammengebaut und ist vollständig konfigurierbar, über den Online-Konfigurator oder auf Anfrage an contact@radiancesystems.eu.
Einzelne Workstations
CoreAI 16 — RTX 5060 Ti 16 GBQwen 3.8-27B in 4-bit, kurzer Kontext. Der Einstiegspunkt.
1.703 €
CoreAI 32 — RTX 5070 Ti 16 GBGleicher VRAM, mehr CPU und RAM für die Pipeline.
2.442 €
CoreAI 64 — RTX 5090 32 GBDie Referenz: Agenten, erweiterter Kontext, Vision, maximale Durchsatzrate.
6.042 €
Kompakter Server
Mini-IA-Server NVIDIA GB10128 GB Unified Memory: 256K Kontext ohne Einschränkungen, mehrere Benutzer.
3.999 €
Rack und Multi-GPU
CoreAI Rack — 2 × RTX 5090 (64 GB)Komfortables FP8, mehrere parallele Sitzungen, 4U-Rackformat.
11.221 €
Pro AI Ultra — Threadripper PRO96 GB ECC: BF16 in nativer Präzision, Modell-Fine-Tuning.
20.213 €
CoreAI 128 Rack — 2 × RTX 6000 (192 GB ECC)Produktion, viele Benutzer, Training, ECC-Zuverlässigkeit.
27.980 €
Kurz gesagt
Welchen VRAM für Qwen 3.8-27B?
16 GB für 4-bit bei kurzem Kontext. 32 GB für Agenten und erweiterten Kontext. 96 GB und mehr für native Präzision oder Fine-Tuning.
Warum reichen 16 GB nicht immer aus?
Weil die angegebenen 17 GB nur die Gewichte umfassen. Der KV-Cache, die Ausführungspuffer und der visuelle Encoder kommen hinzu, und der Cache wächst mit der Länge des Kontexts.
Ist Qwen 3.8-27B kostenlos?
Ja, Apache 2.0 Lizenz, kommerzielle Nutzung inklusive. Sie zahlen nur für die Hardware.
Verarbeitet es Bilder?
Ja, es enthält einen visuellen Encoder. Vision verbraucht zusätzlichen Speicher, der bei der Dimensionierung berücksichtigt werden muss.
Kann man es auf eigene Daten anpassen (Fine-Tuning)?
Ja, das ist einer der Vorteile eines dichten Modells dieser Größe. Rechnen Sie jedoch mit deutlich mehr VRAM als für die Inferenz: Konfigurationen mit 96 GB ECC und mehr sind am besten geeignet.
Die angegebenen Speicherwerte sind Richtwerte, die aus Rückmeldungen des Ökosystems stammen und je nach Inferenz-Engine, Quantisierungsmethode, Kontextlänge und Anzahl der gleichzeitigen Sitzungen variieren. Wir beraten Sie gerne basierend auf Ihrer tatsächlichen Nutzung.




