Bester PC für Qwen 3.8 27B: Der VRAM, den Sie wirklich brauchen

„Es läuft mit 17 GB.“
Das stimmt. Und es ist irreführend.

Qwen 3.8-27B lädt auf einer 16 GB Karte. Je nachdem, was Sie damit machen, verhält es sich jedoch nicht gleich.

27B dichtApache 2.0
256K Kontextnativ
Vision enthaltenText und Bild
~17 GB in 4-bitnur Gewichte

Qwen 3.8-27B ist das derzeit meistdiskutierte offene Modell. Ein dichtes Modell mit 27 Milliarden Parametern, veröffentlicht von Alibaba unter der Apache 2.0 Lizenz, das Reasoning, Agentenfähigkeiten, Codierung und Vision kombiniert, mit einem nativen Kontextfenster von 256.000 Tokens.

Überall liest man die gleiche Zahl: Es läuft mit etwa 17 GB. Diese Zahl ist korrekt. Sie sagt nur nicht die ganze Wahrheit.


Die 17 GB Falle

Die Gewichte sind die Untergrenze, nicht das Gesamtvolumen

Die angegebenen 17 GB entsprechen dem Gewicht des in 4-bit quantisierten Modells. Das ist das, was beim Start geladen wird, bevor Sie überhaupt eine Frage gestellt haben.

Danach kommt der KV-Cache. Er speichert den Gesprächskontext und wächst mit jedem verarbeiteten Token. Bei einem langen Kontext kann er allein den Speicherbedarf verdoppeln.

Dazu kommen die Ausführungspuffer, CUDA-Graphen, der visuelle Encoder, wenn Sie Bilder verarbeiten, und der Speicher, der von jeder gleichzeitigen Sitzung verbraucht wird. Die Multi-Token-Vorhersage, wenn Sie sie aktivieren, benötigt weitere 1 bis 2 GB Puffer.

Daraus ergibt sich der Unterschied zwischen „es lädt auf meiner Karte“ und „es bewältigt meine Arbeitslast“.

Kurzer Chat, reduzierter Kontextpasst auf 16 GB
Gewichte ~17 GB
KV
Code-Agent, mittlerer Kontext16 GB wird knapp
Gewichte ~17 GB
KV-Cache
Langer Kontext oder mehrere Sitzungenüberschreitet 16 GB
Gewichte
KV-Cache
Überlauf

Illustrative Proportionen. Der tatsächliche Speicherbedarf des Caches hängt von der Länge des Kontexts, der Anzahl der gleichzeitigen Sitzungen und den Quantisierungsoptionen des Caches ab.


Der tatsächlich benötigte VRAM

Format Nur Gewichte Minimale Karte Komfortable Karte
4-bit (GGUF, NVFP4) ca. 16 bis 19 GB 16 GB, kurzer Kontext 24 bis 32 GB
4-bit + langer Kontext 17 GB + KV-Cache 24 GB 32 GB
FP8 ca. 27 bis 28 GB 32 GB 48 GB und mehr
BF16 (native Präzision) ca. 54 bis 56 GB 2 Karten oder 96 GB 96 GB ECC
Die Faustregel. Eine 16-GB-Karte betreibt Qwen 3.8-27B in 4-bit für Chat und kurze Aufgaben. Sobald Sie den langen Kontext, die Vision oder mehrere gleichzeitige Sitzungen nutzen, streben Sie 32 GB an. Das ist der Unterschied zwischen einem Modell, das startet, und einem Modell, das arbeitet.


Drei Szenarien, drei Maschinen

Entdeckung und konversationelle Nutzung

16 GB

Sie möchten Qwen 3.8-27B testen, es zum Schreiben, Zusammenfassen, Fragen stellen oder zur Bearbeitung von Dokumenten angemessener Größe verwenden.

Eine 16-GB-Karte reicht in 4-bit aus, vorausgesetzt, Sie bleiben bei moderaten Kontexten. Dies ist der wirtschaftlichste Einstiegspunkt für eine ernsthafte Einzelnutzung.

Die Grenze wird spürbar, sobald Sie sehr lange Dokumente laden oder lange Gespräche führen.

Code-Agent und Tools

32 GB

Dies ist das Terrain, auf dem Qwen 3.8-27B glänzt: agentenbasiertes Codieren, Tool-Aufrufe, Arbeit an einer Codebasis.

Ein Agent liest seinen Kontext bei jedem Schritt neu. Zehn Runden von Tool-Aufrufen in einem umfangreichen Repository lassen den Cache sehr schnell anschwellen. Mit 16 GB gerät die Sitzung schließlich ins Stocken.

Mit 32 GB haben Sie genügend Spielraum für einen erweiterten Kontext und eine gute Durchsatzrate. Dies ist die Referenzkonfiguration für den täglichen professionellen Einsatz.

Massiver Kontext, Vision, Multi-User

96 GB und mehr

Die Nutzung der 256K Kontext-Tokens, die Verarbeitung von Bildern oder die parallele Bedienung mehrerer Personen gehört zu einer anderen Kategorie.

Der KV-Cache wird dann zum dominierenden Faktor, weit vor den Gewichten. Ein einheitlicher Speicher von 128 GB oder eine professionelle ECC-Karte mit 96 GB werden relevant, ebenso wie FP8, um die Qualität zu erhalten.

Dies ist auch die Schwelle, ab der man das Fine-Tuning des Modells mit eigenen Daten in Betracht ziehen kann.


Unsere Empfehlung

Die beste Wahl für Qwen 3.8-27B

Radiance CoreAI 64 — RTX 5090 32 GB

  • GPU RTX 5090, 32 GB GDDR7
  • Bandbreite 1.792 GB/s
  • CPU Ryzen 9 9950X3D
  • RAM DDR5 64 GB
  • Speicher NVMe 1 TB
  • Netzteil 1.200 W 80+ Gold

32 GB: das 4-bit Modell, erweiterter Kontext und Spielraum für Agenten.

6.042 € ab, konfigurierbar
Diese Station konfigurieren
Ein ehrlicher Hinweis zum Budget. Wenn sich Ihre Nutzung auf Chat und das Schreiben kurzer Dokumente beschränkt, läuft Qwen 3.8-27B in 4-bit auf dem CoreAI 16 für 1.703 € und kostet Sie deutlich weniger. Wir empfehlen die RTX 5090 nur, wenn Sie Agenten, langen Kontext oder Vision anstreben. Beschreiben Sie uns Ihre tatsächliche Nutzung, und wir leiten Sie zur passenden Maschine, nicht zur teuersten.


Praktischer Start

Am schnellsten geht es über Ollama. Der Download beträgt etwa 18 GB.

# Direkter Start
ollama run qwen3.8:27b

# Variante mit erweitertem Kontext und quantisiertem Cache
cat > Modelfile <<'EOF'
FROM qwen3.8:27b
PARAMETER num_ctx 65536
EOF
ollama create qwen3.8-long -f Modelfile

Qwen 3.8-27B ist ein Hybridmodell: Es verfügt über einen Denkmodus und einen direkten Instruktionsmodus mit separaten empfohlenen Einstellungen.

Modus Temperatur top_p top_k Verwendung
Denkmodus 1.0 0.95 20 Komplexe Probleme, Code, Analyse
Direkte Instruktion 0.7 0.80 20 Schreiben, schnelle Antworten
Ein Trick, der auf 16 GB alles verändert. Die Quantisierung des KV-Caches reduziert dessen Speicherbedarf erheblich, oft um die Hälfte. Dies ermöglicht es, einen erweiterten Kontext unterzubringen, wo die Standardkonfiguration überlastet wäre. Auf unseren Maschinen sind diese Optimierungen auf Anfrage vorkonfiguriert.


Unser gesamtes Sortiment

Jede Maschine wird in Auriol (13390) von Hand zusammengebaut und ist vollständig konfigurierbar, über den Online-Konfigurator oder auf Anfrage an contact@radiancesystems.eu.

Einzelne Workstations

Radiance CoreAI 16 CoreAI 16 — RTX 5060 Ti 16 GBQwen 3.8-27B in 4-bit, kurzer Kontext. Der Einstiegspunkt. 1.703 € Radiance CoreAI 32 CoreAI 32 — RTX 5070 Ti 16 GBGleicher VRAM, mehr CPU und RAM für die Pipeline. 2.442 € Radiance CoreAI 64 RTX 5090 CoreAI 64 — RTX 5090 32 GBDie Referenz: Agenten, erweiterter Kontext, Vision, maximale Durchsatzrate. 6.042 €

Kompakter Server

ASUS Ascent GX10 GB10 Mini-IA-Server NVIDIA GB10128 GB Unified Memory: 256K Kontext ohne Einschränkungen, mehrere Benutzer. 3.999 €

Rack und Multi-GPU

Radiance Rack 2x RTX 5090 CoreAI Rack — 2 × RTX 5090 (64 GB)Komfortables FP8, mehrere parallele Sitzungen, 4U-Rackformat. 11.221 € Radiance Pro AI Ultra Threadripper Pro AI Ultra — Threadripper PRO96 GB ECC: BF16 in nativer Präzision, Modell-Fine-Tuning. 20.213 € Radiance Rack 2x RTX 6000 Blackwell ECC CoreAI 128 Rack — 2 × RTX 6000 (192 GB ECC)Produktion, viele Benutzer, Training, ECC-Zuverlässigkeit. 27.980 €


Kurz gesagt

Welchen VRAM für Qwen 3.8-27B?
16 GB für 4-bit bei kurzem Kontext. 32 GB für Agenten und erweiterten Kontext. 96 GB und mehr für native Präzision oder Fine-Tuning.

Warum reichen 16 GB nicht immer aus?
Weil die angegebenen 17 GB nur die Gewichte umfassen. Der KV-Cache, die Ausführungspuffer und der visuelle Encoder kommen hinzu, und der Cache wächst mit der Länge des Kontexts.

Ist Qwen 3.8-27B kostenlos?
Ja, Apache 2.0 Lizenz, kommerzielle Nutzung inklusive. Sie zahlen nur für die Hardware.

Verarbeitet es Bilder?
Ja, es enthält einen visuellen Encoder. Vision verbraucht zusätzlichen Speicher, der bei der Dimensionierung berücksichtigt werden muss.

Kann man es auf eigene Daten anpassen (Fine-Tuning)?
Ja, das ist einer der Vorteile eines dichten Modells dieser Größe. Rechnen Sie jedoch mit deutlich mehr VRAM als für die Inferenz: Konfigurationen mit 96 GB ECC und mehr sind am besten geeignet.

Die angegebenen Speicherwerte sind Richtwerte, die aus Rückmeldungen des Ökosystems stammen und je nach Inferenz-Engine, Quantisierungsmethode, Kontextlänge und Anzahl der gleichzeitigen Sitzungen variieren. Wir beraten Sie gerne basierend auf Ihrer tatsächlichen Nutzung.

Zurück zum Blog

Ihr Angebot für eine maßgeschneiderte KI-Lösung innerhalb von 24–48 Stunden

Jedes Radiance-Projekt beginnt mit einem Gespräch. Füllen Sie dieses Formular aus und ein Experte wird sich umgehend mit einer auf Ihr Unternehmen und Ihr Budget zugeschnittenen Lösung bei Ihnen melden.

Antwort innerhalb von 24–48 Arbeitsstunden
Lieferung innerhalb Europas (EU)
2 Jahre Garantie inklusive
Installation vor Ort möglich
Keine Verpflichtung auf Abruf
Dedizierter Support vor und nach dem Kauf
01 Was ist Ihr Hauptverwendungszweck für KI?
Mehrfachauswahl.
02 In welchem Kontext wird das System verwendet?
Einzelwahl.
03 Welche Art von System suchen Sie?
Einzelwahl.
04 Welches Betriebssystem bevorzugen Sie?
Einzelwahl.
05 Welche Erwartungen haben Sie an die Software?
Mehrfachauswahl.
06 Was ist Ihr Richtbudget?
Einzelwahl.
07 Wann möchten Sie Ihr System erhalten?
Einzelwahl.
08 Wünschen Sie eine Begleitung bei der Umsetzung?
Einzelne Auswahl. Ein Radiance-Techniker kann Sie vor Ort oder per Fernzugriff unterstützen.
09 Lieferland (nur EU) *
Wir liefern ausschließlich innerhalb der Europäischen Union (EU).
10 Zusätzliche Informationen (optional, aber sehr nützlich)
Beschreiben Sie kurz Ihr Projekt, Ihre spezifischen Einschränkungen oder sonstige nützliche Informationen.
11 Möchten Sie für ein Gespräch über Ihr Projekt kontaktiert werden?
Wenn Sie „Nur Kostenvoranschlag“ auswählen, können Sie auf unsere E-Mail antworten, um Ihre Fragen zu stellen und den Kostenvoranschlag zu verfeinern.
12 E-Mail *
Wir senden Ihnen das Angebot an diese Adresse.

Noch Fragen?

Senden Sie uns eine E-Mail an contact@radiancesystems,eu oder kontaktieren Sie uns über das Kontaktformular. Wir beantworten alle Anfragen innerhalb von 3 Stunden während der Arbeitszeiten (Montag bis Freitag von 9 bis 17 Uhr).

📞 +33 4 65 84 48 21