Wie viel VRAM für ein lokales LLM im Jahr 2026? Der modellbasierte Leitfaden
Teilen
VRAM entscheidet alles.
So berechnen Sie es.
Modellgröße, Quantisierung, Kontextlänge: drei Variablen, ein Ergebnis. Schätzen Sie Ihr Ergebnis unten.
Dies ist die Frage, die vor jedem Kauf einer KI-Maschine gestellt wird. Und die übliche Antwort, eine einzelne Zahl pro Modell, ist fast immer falsch, da sie nur die Gewichte berücksichtigt.
Schätzen Sie Ihren Bedarf
Ihre Konfiguration
Geschätzter VRAM
Indikative Schätzung. Der tatsächliche Bedarf variiert je nach Inferenz-Engine, Modellarchitektur, Quantisierungsmethode und Optimierungsoptionen. Betrachten Sie dieses Ergebnis als Größenordnung zur Dimensionierung, nicht als genaue Messung.
Die drei wichtigsten Regeln
1. Gewichte sind die Untergrenze, niemals das Ganze
Die Zahl, die Sie überall lesen, entspricht dem geladenen Modell, bevor eine einzige Anfrage gestellt wird. Der Kontext-Cache, Ausführungspuffer und multimodale Komponenten kommen noch hinzu.
2. Kontext ist teuer, und niemand sagt es
Der Cache wächst mit jedem verarbeiteten Token. Bei einem langen Fenster kann er allein den Speicherbedarf verdoppeln. Das erklärt, warum ein Modell, das problemlos startet, nach zwanzig Interaktionen überläuft.
3. VRAM bestimmt die Größe, Bandbreite die Geschwindigkeit
Zwei getrennte Parameter. VRAM sagt aus, ob das Modell passt. Die Speicherbandbreite sagt aus, wie schnell es reagiert. Ein Modell, das in den System-RAM auslagert, fällt auf wenige Tokens pro Sekunde ab.
Referenztabelle nach Modell
Werte nur für Gewichte, bei kurzem Kontext. Fügen Sie den Cache je nach Nutzung hinzu.
| Modell | Typ | 4-Bit | 8-Bit | 16-Bit | Empfohlene Karte |
|---|---|---|---|---|---|
| Gemma 4 12B | Dicht, multimodal | ~6,6 GB | ~13 GB | ~24 GB | 16 GB |
| Qwen 3.8-27B | Dicht, Vision | ~17 GB | ~27 GB | ~55 GB | 32 GB |
| Qwen 3.6-27B | Dicht | ~17 GB | ~30 GB | ~54 GB | 24 bis 32 GB |
| Qwen 3.6-35B-A3B | MoE (3B aktiv) | ~21 GB | ~38 GB | ~70 GB | 24 bis 32 GB |
| Hermes 4.3 36B | Dicht, Agent | ~21 GB | ~40 GB | ~72 GB | 32 GB |
| Modell 70B | Dicht | ~40 GB | ~75 GB | ~140 GB | 48 GB und mehr |
| Whisper large-v3 | Transkription | nicht zutreffend | ~3 GB | ~6 GB | 8 GB |
| KI-Videomodelle | Generierung | nicht zutreffend | 16 bis 24 GB | 50 GB und mehr | 32 GB |
Was Sie auf jeder Stufe erreichen können
Drei Hebel, um mit weniger VRAM auszukommen
Quantisierung des Kontext-Caches. Dies ist die kostengünstigste Maßnahme. Sie reduziert oft den Kontext-Footprint um die Hälfte, mit minimalen Auswirkungen auf die Qualität. Dadurch kann ein langes Fenster untergebracht werden, wo die Standardkonfiguration überlastet wäre.
Wählen Sie eine moderne Quantisierung. Neuere Formate bieten eine deutlich höhere Qualität bei gleicher Größe im Vergleich zu Quantisierungen der ersten Generation. Bei 4-Bit ist der Unterschied zur nativen Präzision bei den meisten Anwendungen gering.
Reduzieren Sie das Kontextfenster auf das Nötigste. Wenige Anwendungen erfordern tatsächlich 256.000 Tokens. Die Begrenzung des Fensters auf das, was Sie benötigen, spart viel Speicher und beschleunigt oft die Verarbeitung.
Unsere Maschinen nach VRAM-Stufe
Alle werden in Auriol (13390) handmontiert und sind über den Online-Konfigurator oder auf Anfrage unter contact@radiancesystems.eu vollständig konfigurierbar.
CoreAI 16: 16 GB VRAM12B-Modelle in hoher Qualität, 27B in 4-Bit mit moderatem Kontext.
1 703 €
CoreAI 32: 16 GB VRAMGleiche VRAM-Leistung, verstärkte CPU und RAM für die Pipeline.
2 442 €
CoreAI 64: 32 GB VRAM1.792 GB/s. Langer Kontext, Agenten, Vision, KI-Video.
6 042 €
Mini-Server GB10, 128 GB Unified MemorySehr große Modelle, massiver Kontext, mehrere KI-Komponenten.
3 999 €
CoreAI Rack: 64 GB VRAMZwei Karten: 70B-Modelle in 4-Bit, parallele Sitzungen.
11 221 €
Pro AI Ultra, 96 GB ECC VRAMKomfortable 70B-Modelle, native Präzision, Fine-Tuning.
20 213 €
CoreAI 128 Rack, 192 GB ECC VRAMKontinuierliche Produktion, Training, viele Benutzer.
27 980 €
Kurz gesagt
Wie viel VRAM für ein lokales LLM im Jahr 2026?
16 GB decken eine ernsthafte individuelle Nutzung mit Modellen bis zu 27 Milliarden Parametern in 4-Bit ab. 32 GB bilden die professionelle Schwelle: langer Kontext, Agenten, Vision. Ab 70 Milliarden Parametern sind 48 GB und mehr erforderlich.
Warum werden die angegebenen Zahlen oft unterschätzt?
Weil sie nur die Gewichte des Modells berücksichtigen. Der Kontext-Cache kommt noch hinzu und wächst mit der Länge der Interaktionen und der Anzahl der Sitzungen.
Kann man ein größeres Modell als seinen VRAM ausführen?
Technisch ja, indem man in den System-RAM auslagert, aber die Geschwindigkeit bricht auf wenige Tokens pro Sekunde zusammen. In der Praxis ist es für interaktive Nutzung unbrauchbar.
Beeinträchtigt die Quantisierung die Qualität stark?
Viel weniger als früher. Bei 4-Bit mit modernen Formaten ist der Unterschied zur nativen Präzision bei den meisten gängigen Anwendungen gering. Der Verlust wird bei den anspruchsvollsten Denkaufgaben spürbar.
Sollte man VRAM oder die Geschwindigkeit der Karte priorisieren?
Zuerst VRAM: Ohne es läuft das Modell überhaupt nicht. Dann die Bandbreite, denn sie bestimmt den Bedienkomfort, sobald das Modell geladen ist.
Die Werte in diesem Leitfaden sind grobe Schätzungen, die aus Feedback aus dem Ökosystem und öffentlichen Dokumentationen stammen. Sie variieren je nach Modellarchitektur, Inferenz-Engine, Quantisierungsmethode und aktivierten Optimierungen. Für eine präzise, an Ihre Nutzung angepasste Dimensionierung kontaktieren Sie uns.




