PC für Qwen 3.6: 27B dicht oder 35B-A3B MoE, welche Wahl?
Aktie
Qwen 3.6 ist das meistdiskutierte Open-Source-Modell des Augenblicks. Doch bevor man einen PC für den Betrieb auswählt, muss eine einzige Frage beantwortet werden: die dichte 27B-Version oder die MoE 35B-A3B-Version? Alles Weitere ergibt sich daraus.
Beide gehören zur selben Familie. Beide passen auf eine Consumer-Grafikkarte im 4-Bit-Format. Beide stehen unter der Apache 2.0 Lizenz. Doch sie verhalten sich im Gebrauch sehr unterschiedlich.
Dieser Leitfaden klärt die Frage zuerst und zeigt Ihnen dann den passenden PC für Ihre Wahl.
Qwen 3.6: Was Sie wissen müssen
Qwen 3.6 ist die neueste Generation offener Modelle von Alibaba. Es ist ein multimodales Modell (Text, Bild, Video) mit hybrider Argumentation und einem außergewöhnlichen nativen Kontextfenster von bis zu 1 Million Tokens.
Zwei offene Varianten sind für den lokalen Einsatz relevant:
Qwen3.6-27B
Dense — Codequalität
- 27 Milliarden Parameter, alle aktiv
- Passt in etwa 16,8 GB im 4-Bit-Modus
- Stabiles und vorhersehbares Verhalten
- Besser bei Code und Befolgung von Anweisungen
- Inklusive Vision
- Profitiert von DFlash-Beschleunigung (aktuelle NVIDIA)
Qwen3.6-35B-A3B
MoE — Geschwindigkeit
- Insgesamt 35 Milliarden, 3 Milliarden pro Token aktiv
- Rechenkosten ähnlich einem 3B-Modell
- Qualität ähnlich einem 35B-Dense-Modell
- Sehr schnell: über 100 Tokens/s auf High-End-GPUs gemeldet
- Ca. 21 GB im 4-Bit-Modus, benötigt 24 GB VRAM
- Ideal für Agenten und schnellen Tool-Einsatz
Dense oder MoE: Wie wählen
VRAM: Was Sie wirklich einplanen müssen
Die untenstehenden Zahlen gelten für einen kurzen bis mittleren Kontext. Achtung: Bei erweitertem Kontext bläht der KV-Cache den benötigten Speicher stark auf.
| Variante | Quantisierung | VRAM (kurzer Kontext) | Empfohlene Karte |
|---|---|---|---|
| Qwen3.6-27B Dense | Q4_K_M | ca. 16,8 GB | 16 GB knapp, 24 GB komfortabel |
| Qwen3.6-27B Dense | Q5_K_M | ca. 20 GB | 24 GB |
| Qwen3.6-35B-A3B MoE | Q4_K_M | ca. 21 GB | 24 GB |
| Qwen3.6-35B-A3B MoE | Q5_K_M | ca. 26 GB | 32 GB |
| Egal welche, sehr langer Kontext | Q4 + quantisierter Cache | +20 bis 40 GB KV-Cache | 32 GB und mehr |
Qwen 3.6 in zwei Minuten starten
Am einfachsten geht es über Ollama. Wählen Sie die Variante je nach Ihrer Grafikkarte:
# Dichte 27B-Variante (16 GB und mehr) ollama run qwen3.6:27b # MoE 35B-A3B-Variante (24 GB und mehr) ollama run qwen3.6:35b-a3b # Für Agenten- oder Code-Nutzung wird oft llama.cpp verwendet # mit quantisiertem KV-Cache für langen Kontext: llama-server -m qwen3.6-35b-a3b-Q4_K_M.gguf \ --cache-type-k q8_0 --cache-type-v q8_0 \ --ctx-size 65536 --n-gpu-layers 99
Welchen PC für Qwen 3.6
Die Wahl der Maschine ergibt sich direkt aus der angestrebten Variante. Hier sind unsere passenden Workstations, die in Auriol (13390) montiert und in die gesamte EU geliefert werden, auf Wunsch mit vorinstalliertem Ollama und Open WebUI.
Warum Qwen 3.6 lokal ausführen
Neben der Vertraulichkeit bietet Qwen 3.6 lokal konkrete Vorteile für alle, die eine ernsthafte KI zu Hause haben möchten.
- Keine wiederkehrenden Kosten. Kein Abonnement, keine Abrechnung pro Token. Nach dem Kauf der Maschine ist die Nutzung unbegrenzt.
- Private Daten. Ihre Prompts, Ihr Code, Ihre Dokumente verlassen niemals Ihr Netzwerk.
- Erstklassige Qualität. Qwen 3.6 konkurriert mit den besten offenen Modellen in Bezug auf Code, Reasoning und Agentenaufgaben.
- Massiver Kontext. Bis zu 1 Million Tokens nativ, um ganze Codebasen oder lange Dokumente zu verarbeiten.
- Apache 2.0 Lizenz. Freie kommerzielle Nutzung, ohne Einschränkungen.
Kurz gesagt
27B Dense oder 35B-A3B MoE?
Dense für Code und zuverlässiges Tool-Use auf 16 GB. MoE für maximale Geschwindigkeit auf 24 GB und mehr.
Welcher VRAM ist mindestens erforderlich?
16 GB für die 27B Dense. 24 GB für die 35B-A3B. 32 GB für langen Kontext oder Q5.
Ist Qwen 3.6 kostenlos?
Ja, Open Source unter Apache 2.0. Sie zahlen nur die Hardware.
Kann es für Code und Agenten verwendet werden?
Ja, das ist eine seiner Stärken. Für lange Agenten-Schleifen bevorzugen Sie die 27B Dense, da sie konsistenter ist.
Benötigt man eine große Maschine für den 1M-Token-Kontext?
Ja: Der KV-Cache kann 20 bis 40 GB hinzufügen. Der Mini-Server GB10 mit seinen 128 GB Unified Memory ist hier am besten geeignet.




