PC für Qwen 3.6: 27B dicht oder 35B-A3B MoE, welche Wahl?

Qwen 3.6 ist das meistdiskutierte Open-Source-Modell des Augenblicks. Doch bevor man einen PC für den Betrieb auswählt, muss eine einzige Frage beantwortet werden: die dichte 27B-Version oder die MoE 35B-A3B-Version? Alles Weitere ergibt sich daraus.

Beide gehören zur selben Familie. Beide passen auf eine Consumer-Grafikkarte im 4-Bit-Format. Beide stehen unter der Apache 2.0 Lizenz. Doch sie verhalten sich im Gebrauch sehr unterschiedlich.

Dieser Leitfaden klärt die Frage zuerst und zeigt Ihnen dann den passenden PC für Ihre Wahl.


Qwen 3.6: Was Sie wissen müssen

Qwen 3.6 ist die neueste Generation offener Modelle von Alibaba. Es ist ein multimodales Modell (Text, Bild, Video) mit hybrider Argumentation und einem außergewöhnlichen nativen Kontextfenster von bis zu 1 Million Tokens.

Zwei offene Varianten sind für den lokalen Einsatz relevant:

Qwen3.6-27B

Dense — Codequalität

  • 27 Milliarden Parameter, alle aktiv
  • Passt in etwa 16,8 GB im 4-Bit-Modus
  • Stabiles und vorhersehbares Verhalten
  • Besser bei Code und Befolgung von Anweisungen
  • Inklusive Vision
  • Profitiert von DFlash-Beschleunigung (aktuelle NVIDIA)

Qwen3.6-35B-A3B

MoE — Geschwindigkeit

  • Insgesamt 35 Milliarden, 3 Milliarden pro Token aktiv
  • Rechenkosten ähnlich einem 3B-Modell
  • Qualität ähnlich einem 35B-Dense-Modell
  • Sehr schnell: über 100 Tokens/s auf High-End-GPUs gemeldet
  • Ca. 21 GB im 4-Bit-Modus, benötigt 24 GB VRAM
  • Ideal für Agenten und schnellen Tool-Einsatz
So liest man „35B-A3B“: Dies ist ein Mixture-of-Experts-Modell. Es enthält insgesamt 35 Milliarden Parameter, aber ein Router aktiviert nur etwa 3 Milliarden für jedes generierte Token. Das Ergebnis: Rechenkosten eines kleinen Modells, für eine Qualität nahe an einem großen Modell. Dies ermöglicht über 100 Tokens pro Sekunde auf Consumer-Hardware.


Dense oder MoE: Wie wählen

Sie programmieren viel und die Zuverlässigkeit des Tool-Callings ist entscheidend
27B Dense
Sie möchten die maximale Geschwindigkeit auf einer 24-GB-Karte für Chat und Agenten
35B-A3B
Sie haben 16 GB VRAM und nicht mehr
27B Dense
Sie setzen lange Agenten-Schleifen mit vielen Tool-Aufrufen ein
27B Dense
Sie bevorzugen die gefühlte Reaktionsfähigkeit im Gespräch
35B-A3B
Ein ehrlicher Punkt zur MoE-Variante. Community-Feedback deutet darauf hin, dass die 35B-A3B-Variante bei langen Agenten-Schleifen fehlerhafte Tool-Aufrufe wiederholen oder überspringen kann. Die dichte 27B-Variante ist bei diesen Aufgaben konsistenter. Wenn Sie Qwen 3.6 in einem Agenten-Framework (MCP, OpenCode usw.) einsetzen, testen Sie es, bevor Sie sich festlegen. Außerdem funktioniert die DFlash-Beschleunigung, die die Geschwindigkeit verdoppelt, nur bei der dichten Variante, nicht beim MoE.


VRAM: Was Sie wirklich einplanen müssen

Die untenstehenden Zahlen gelten für einen kurzen bis mittleren Kontext. Achtung: Bei erweitertem Kontext bläht der KV-Cache den benötigten Speicher stark auf.

Variante Quantisierung VRAM (kurzer Kontext) Empfohlene Karte
Qwen3.6-27B Dense Q4_K_M ca. 16,8 GB 16 GB knapp, 24 GB komfortabel
Qwen3.6-27B Dense Q5_K_M ca. 20 GB 24 GB
Qwen3.6-35B-A3B MoE Q4_K_M ca. 21 GB 24 GB
Qwen3.6-35B-A3B MoE Q5_K_M ca. 26 GB 32 GB
Egal welche, sehr langer Kontext Q4 + quantisierter Cache +20 bis 40 GB KV-Cache 32 GB und mehr
Die 16-GB-Falle. Die 35B-A3B im 4-Bit-Modus passt nicht komfortabel auf 16 GB VRAM, entgegen dem, was man manchmal liest. Auf einer 16-GB-Karte sollte man die 27B-Dense-Variante verwenden, die für diesen Rahmen konzipiert ist. Um die 35B-A3B voll auszuschöpfen, streben Sie 24 GB an. Für sehr langen Kontext oder Q5 streben Sie 32 GB an.
Gut zu wissen: Mit llama.cpp und einem quantisierten KV-Cache (q8_0) halbiert sich der Speicherbedarf des Kontextes nahezu. Dadurch kann ein erweiterter Kontext untergebracht werden, wo die Standardkonfiguration das Budget überschreiten würde. Auf unseren Maschinen sind diese Optimierungen vorkonfiguriert.


Qwen 3.6 in zwei Minuten starten

Am einfachsten geht es über Ollama. Wählen Sie die Variante je nach Ihrer Grafikkarte:

# Dichte 27B-Variante (16 GB und mehr)
ollama run qwen3.6:27b

# MoE 35B-A3B-Variante (24 GB und mehr)
ollama run qwen3.6:35b-a3b

# Für Agenten- oder Code-Nutzung wird oft llama.cpp verwendet
# mit quantisiertem KV-Cache für langen Kontext:
llama-server -m qwen3.6-35b-a3b-Q4_K_M.gguf \
  --cache-type-k q8_0 --cache-type-v q8_0 \
  --ctx-size 65536 --n-gpu-layers 99


Welchen PC für Qwen 3.6

Die Wahl der Maschine ergibt sich direkt aus der angestrebten Variante. Hier sind unsere passenden Workstations, die in Auriol (13390) montiert und in die gesamte EU geliefert werden, auf Wunsch mit vorinstalliertem Ollama und Open WebUI.

Radiance CoreAI 16 CoreAI 16 — RTX 5060 Ti 16 GBFür Qwen3.6-27B Dense in Q4. Der Einstiegspunkt. 1 703 € Radiance CoreAI 64 RTX 5090 CoreAI 64 — RTX 5090 32 GBDie Referenz: 35B-A3B in Q5, langer Kontext, über 100 Tok/s. 6 042 € ASUS Ascent GX10 GB10 Mini Server KI NVIDIA GB10128 GB Unified Memory für 1M Token Kontext ohne Einschränkungen. 3 999 €
Wichtig zur RTX 5070 Ti und 16-GB-Karten. Für die 35B-A3B reichen 16 GB nicht aus, auch nicht in Q4. Wenn Ihr Ziel die MoE 35B-A3B ist, wählen Sie eine 24- oder 32-GB-Karte (RTX 5090). Wenn Sie bei 16 GB bleiben, ist die 27B Dense die richtige Wahl, und sie ist ausgezeichnet. Wir beraten Sie je nach der gewünschten Variante.


Warum Qwen 3.6 lokal ausführen

Neben der Vertraulichkeit bietet Qwen 3.6 lokal konkrete Vorteile für alle, die eine ernsthafte KI zu Hause haben möchten.

  • Keine wiederkehrenden Kosten. Kein Abonnement, keine Abrechnung pro Token. Nach dem Kauf der Maschine ist die Nutzung unbegrenzt.
  • Private Daten. Ihre Prompts, Ihr Code, Ihre Dokumente verlassen niemals Ihr Netzwerk.
  • Erstklassige Qualität. Qwen 3.6 konkurriert mit den besten offenen Modellen in Bezug auf Code, Reasoning und Agentenaufgaben.
  • Massiver Kontext. Bis zu 1 Million Tokens nativ, um ganze Codebasen oder lange Dokumente zu verarbeiten.
  • Apache 2.0 Lizenz. Freie kommerzielle Nutzung, ohne Einschränkungen.


Kurz gesagt

27B Dense oder 35B-A3B MoE?
Dense für Code und zuverlässiges Tool-Use auf 16 GB. MoE für maximale Geschwindigkeit auf 24 GB und mehr.

Welcher VRAM ist mindestens erforderlich?
16 GB für die 27B Dense. 24 GB für die 35B-A3B. 32 GB für langen Kontext oder Q5.

Ist Qwen 3.6 kostenlos?
Ja, Open Source unter Apache 2.0. Sie zahlen nur die Hardware.

Kann es für Code und Agenten verwendet werden?
Ja, das ist eine seiner Stärken. Für lange Agenten-Schleifen bevorzugen Sie die 27B Dense, da sie konsistenter ist.

Benötigt man eine große Maschine für den 1M-Token-Kontext?
Ja: Der KV-Cache kann 20 bis 40 GB hinzufügen. Der Mini-Server GB10 mit seinen 128 GB Unified Memory ist hier am besten geeignet.

Zurück zum Blog

Ihr Angebot für eine maßgeschneiderte KI-Lösung innerhalb von 24–48 Stunden

Jedes Radiance-Projekt beginnt mit einem Gespräch. Füllen Sie dieses Formular aus und ein Experte wird sich umgehend mit einer auf Ihr Unternehmen und Ihr Budget zugeschnittenen Lösung bei Ihnen melden.

Antwort innerhalb von 24–48 Arbeitsstunden
Lieferung innerhalb Europas (EU)
2 Jahre Garantie inklusive
Installation vor Ort möglich
Keine Verpflichtung auf Abruf
Dedizierter Support vor und nach dem Kauf
01 Was ist Ihr Hauptverwendungszweck für KI?
Multiple Choice.
02 In welchem Kontext wird das System verwendet?
Nur eine Wahlmöglichkeit.
03 Welche Art von System suchen Sie?
Nur eine Wahlmöglichkeit.
04 Welches Betriebssystem bevorzugen Sie?
Nur eine Wahlmöglichkeit.
05 Welche Erwartungen haben Sie an die Software?
Multiple Choice.
06 Was ist Ihr Richtbudget?
Nur eine Wahlmöglichkeit.
07 Wann möchten Sie Ihr System erhalten?
Nur eine Wahlmöglichkeit.
08 Wünschen Sie eine Begleitung bei der Umsetzung?
Einzelne Auswahl. Ein Radiance-Techniker kann Sie vor Ort oder per Fernzugriff unterstützen.
09 Lieferland (nur EU) *
Wir liefern ausschließlich innerhalb der Europäischen Union (EU).
10 Zusätzliche Informationen (optional, aber sehr nützlich)
Beschreiben Sie kurz Ihr Projekt, etwaige spezifische Einschränkungen oder sonstige relevante Informationen.
11 Möchten Sie kontaktiert werden, um Ihr Projekt zu besprechen?
Wenn Sie „Nur Kostenvoranschlag“ auswählen, können Sie auf unsere E-Mail antworten, um Ihre Fragen zu stellen und den Kostenvoranschlag zu verfeinern.
12 E-Mail *
Wir senden Ihnen das Angebot an diese Adresse.

Weitere Fragen?

Senden Sie uns eine E-Mail an contact@radiancesystems,eu oder kontaktieren Sie uns über das Kontaktformular. Wir beantworten alle Anfragen während der Arbeitszeiten (Montag bis Freitag von 9 bis 17 Uhr) innerhalb von 3 Stunden.

📞 +33 4 65 84 48 21