Wie viel VRAM für ein lokales LLM im Jahr 2026? Der modellbasierte Leitfaden

VRAM entscheidet alles.
So berechnen Sie es.

Modellgröße, Quantisierung, Kontextlänge: drei Variablen, ein Ergebnis. Schätzen Sie Ihr Ergebnis unten.

Dies ist die Frage, die vor jedem Kauf einer KI-Maschine gestellt wird. Und die übliche Antwort, eine einzelne Zahl pro Modell, ist fast immer falsch, da sie nur die Gewichte berücksichtigt.


Schätzen Sie Ihren Bedarf

Ihre Konfiguration

Geschätzter VRAM

benötigte Gigabytes
Modellgewichte
Kontext-Cache
System-Marge
Geeignete Maschine Konfiguration ansehen

Indikative Schätzung. Der tatsächliche Bedarf variiert je nach Inferenz-Engine, Modellarchitektur, Quantisierungsmethode und Optimierungsoptionen. Betrachten Sie dieses Ergebnis als Größenordnung zur Dimensionierung, nicht als genaue Messung.


Die drei wichtigsten Regeln

1. Gewichte sind die Untergrenze, niemals das Ganze

Die Zahl, die Sie überall lesen, entspricht dem geladenen Modell, bevor eine einzige Anfrage gestellt wird. Der Kontext-Cache, Ausführungspuffer und multimodale Komponenten kommen noch hinzu.

2. Kontext ist teuer, und niemand sagt es

Der Cache wächst mit jedem verarbeiteten Token. Bei einem langen Fenster kann er allein den Speicherbedarf verdoppeln. Das erklärt, warum ein Modell, das problemlos startet, nach zwanzig Interaktionen überläuft.

3. VRAM bestimmt die Größe, Bandbreite die Geschwindigkeit

Zwei getrennte Parameter. VRAM sagt aus, ob das Modell passt. Die Speicherbandbreite sagt aus, wie schnell es reagiert. Ein Modell, das in den System-RAM auslagert, fällt auf wenige Tokens pro Sekunde ab.

Tokens pro Sekunde ≈ Bandbreite ÷ Modellgröße
Bei jedem generierten Token wird das Modell vollständig aus dem Speicher gelesen. Deshalb bestimmt die Bandbreite und nicht die Rechenleistung die Geschwindigkeit bei der Textgenerierung.


Referenztabelle nach Modell

Werte nur für Gewichte, bei kurzem Kontext. Fügen Sie den Cache je nach Nutzung hinzu.

Modell Typ 4-Bit 8-Bit 16-Bit Empfohlene Karte
Gemma 4 12B Dicht, multimodal ~6,6 GB ~13 GB ~24 GB 16 GB
Qwen 3.8-27B Dicht, Vision ~17 GB ~27 GB ~55 GB 32 GB
Qwen 3.6-27B Dicht ~17 GB ~30 GB ~54 GB 24 bis 32 GB
Qwen 3.6-35B-A3B MoE (3B aktiv) ~21 GB ~38 GB ~70 GB 24 bis 32 GB
Hermes 4.3 36B Dicht, Agent ~21 GB ~40 GB ~72 GB 32 GB
Modell 70B Dicht ~40 GB ~75 GB ~140 GB 48 GB und mehr
Whisper large-v3 Transkription nicht zutreffend ~3 GB ~6 GB 8 GB
KI-Videomodelle Generierung nicht zutreffend 16 bis 24 GB 50 GB und mehr 32 GB
Achtung bei MoE-Modellen. Ein Modell „35B-A3B“ enthält 35 Milliarden Parameter, aktiviert aber nur 3 Milliarden pro Token. Die Rechenkosten sind die eines kleinen Modells, aber alle Gewichte müssen in den Speicher geladen werden. Man dimensioniert nach der Gesamtzahl, niemals nach der aktiven Zahl.


Was Sie auf jeder Stufe erreichen können

8 GB
Entdeckung Modelle bis 12 Milliarden in 4-Bit, Whisper-Transkription, kurze Kontexte. Ausreichend, um einen Eindruck zu bekommen, im Alltag aber einschränkend.
16 GB
Ernster individueller Gebrauch 12B-Modelle in hoher Qualität, 27B-Modelle in 4-Bit mit moderatem Kontext, Bilderzeugung. Das beste Preis-Leistungs-Verhältnis für den Einstieg.
24 GB
Echter Komfort 27B- bis 36B-Modelle in 4-Bit mit erweitertem Kontext, mehrstufige Agenten, Cache-Puffer. Die Stufe, auf der man aufhört, auf den Speicher zu achten.
32 GB
Professionell 27B-Modelle in 8-Bit, langer Kontext, Vision, mehrere Sitzungen, KI-Video, leichtes Fine-Tuning. Die Referenzkonfiguration für Profis.
96 GB ECC
Forschung und Produktion Komfortable 70B-Modelle, native Präzision bei mittleren Modellen, ernsthaftes Fine-Tuning, ECC-Zuverlässigkeit für lange Berechnungen.
128 GB
Vereinheitlichter Speicher Sehr große Modelle, massiver Kontext ohne Einschränkungen, mehrere KI-Komponenten gleichzeitig. Kompaktes Format, reduzierter Verbrauch.
Der Ratschlag, den wir am häufigsten geben: Nehmen Sie eine Pufferzone eine Stufe über Ihrem aktuellen Bedarf. Modelle werden größer, Kontexte länger, und Verwendungen addieren sich. Eine Maschine, die zu knapp dimensioniert ist, wird am schnellsten ersetzt.


Drei Hebel, um mit weniger VRAM auszukommen

Quantisierung des Kontext-Caches. Dies ist die kostengünstigste Maßnahme. Sie reduziert oft den Kontext-Footprint um die Hälfte, mit minimalen Auswirkungen auf die Qualität. Dadurch kann ein langes Fenster untergebracht werden, wo die Standardkonfiguration überlastet wäre.

Wählen Sie eine moderne Quantisierung. Neuere Formate bieten eine deutlich höhere Qualität bei gleicher Größe im Vergleich zu Quantisierungen der ersten Generation. Bei 4-Bit ist der Unterschied zur nativen Präzision bei den meisten Anwendungen gering.

Reduzieren Sie das Kontextfenster auf das Nötigste. Wenige Anwendungen erfordern tatsächlich 256.000 Tokens. Die Begrenzung des Fensters auf das, was Sie benötigen, spart viel Speicher und beschleunigt oft die Verarbeitung.


Unsere Maschinen nach VRAM-Stufe

Alle werden in Auriol (13390) handmontiert und sind über den Online-Konfigurator oder auf Anfrage unter contact@radiancesystems.eu vollständig konfigurierbar.

Radiance CoreAI 16 CoreAI 16: 16 GB VRAM12B-Modelle in hoher Qualität, 27B in 4-Bit mit moderatem Kontext. 1 703 € Radiance CoreAI 32 CoreAI 32: 16 GB VRAMGleiche VRAM-Leistung, verstärkte CPU und RAM für die Pipeline. 2 442 € Radiance CoreAI 64 RTX 5090 CoreAI 64: 32 GB VRAM1.792 GB/s. Langer Kontext, Agenten, Vision, KI-Video. 6 042 € ASUS Ascent GX10 GB10 Mini-Server GB10, 128 GB Unified MemorySehr große Modelle, massiver Kontext, mehrere KI-Komponenten. 3 999 € Radiance Rack 2x RTX 5090 CoreAI Rack: 64 GB VRAMZwei Karten: 70B-Modelle in 4-Bit, parallele Sitzungen. 11 221 € Radiance Pro AI Ultra Threadripper Pro AI Ultra, 96 GB ECC VRAMKomfortable 70B-Modelle, native Präzision, Fine-Tuning. 20 213 € Radiance Rack 2x RTX 6000 Blackwell ECC CoreAI 128 Rack, 192 GB ECC VRAMKontinuierliche Produktion, Training, viele Benutzer. 27 980 €


Kurz gesagt

Wie viel VRAM für ein lokales LLM im Jahr 2026?
16 GB decken eine ernsthafte individuelle Nutzung mit Modellen bis zu 27 Milliarden Parametern in 4-Bit ab. 32 GB bilden die professionelle Schwelle: langer Kontext, Agenten, Vision. Ab 70 Milliarden Parametern sind 48 GB und mehr erforderlich.

Warum werden die angegebenen Zahlen oft unterschätzt?
Weil sie nur die Gewichte des Modells berücksichtigen. Der Kontext-Cache kommt noch hinzu und wächst mit der Länge der Interaktionen und der Anzahl der Sitzungen.

Kann man ein größeres Modell als seinen VRAM ausführen?
Technisch ja, indem man in den System-RAM auslagert, aber die Geschwindigkeit bricht auf wenige Tokens pro Sekunde zusammen. In der Praxis ist es für interaktive Nutzung unbrauchbar.

Beeinträchtigt die Quantisierung die Qualität stark?
Viel weniger als früher. Bei 4-Bit mit modernen Formaten ist der Unterschied zur nativen Präzision bei den meisten gängigen Anwendungen gering. Der Verlust wird bei den anspruchsvollsten Denkaufgaben spürbar.

Sollte man VRAM oder die Geschwindigkeit der Karte priorisieren?
Zuerst VRAM: Ohne es läuft das Modell überhaupt nicht. Dann die Bandbreite, denn sie bestimmt den Bedienkomfort, sobald das Modell geladen ist.

Die Werte in diesem Leitfaden sind grobe Schätzungen, die aus Feedback aus dem Ökosystem und öffentlichen Dokumentationen stammen. Sie variieren je nach Modellarchitektur, Inferenz-Engine, Quantisierungsmethode und aktivierten Optimierungen. Für eine präzise, an Ihre Nutzung angepasste Dimensionierung kontaktieren Sie uns.

Zurück zum Blog

Ihr Angebot für eine maßgeschneiderte KI-Lösung innerhalb von 24–48 Stunden

Jedes Radiance-Projekt beginnt mit einem Gespräch. Füllen Sie dieses Formular aus und ein Experte wird sich umgehend mit einer auf Ihr Unternehmen und Ihr Budget zugeschnittenen Lösung bei Ihnen melden.

Antwort innerhalb von 24–48 Arbeitsstunden
Lieferung innerhalb Europas (EU)
2 Jahre Garantie inklusive
Installation vor Ort möglich
Keine Verpflichtung auf Abruf
Dedizierter Support vor und nach dem Kauf
01 Was ist Ihr Hauptverwendungszweck für KI?
Mehrfachauswahl.
02 In welchem Kontext wird das System verwendet?
Einzelwahl.
03 Welche Art von System suchen Sie?
Einzelwahl.
04 Welches Betriebssystem bevorzugen Sie?
Einzelwahl.
05 Welche Erwartungen haben Sie an die Software?
Mehrfachauswahl.
06 Was ist Ihr Richtbudget?
Einzelwahl.
07 Wann möchten Sie Ihr System erhalten?
Einzelwahl.
08 Wünschen Sie eine Begleitung bei der Umsetzung?
Einzelne Auswahl. Ein Radiance-Techniker kann Sie vor Ort oder per Fernzugriff unterstützen.
09 Lieferland (nur EU) *
Wir liefern ausschließlich innerhalb der Europäischen Union (EU).
10 Zusätzliche Informationen (optional, aber sehr nützlich)
Beschreiben Sie kurz Ihr Projekt, Ihre spezifischen Einschränkungen oder sonstige nützliche Informationen.
11 Möchten Sie für ein Gespräch über Ihr Projekt kontaktiert werden?
Wenn Sie „Nur Kostenvoranschlag“ auswählen, können Sie auf unsere E-Mail antworten, um Ihre Fragen zu stellen und den Kostenvoranschlag zu verfeinern.
12 E-Mail *
Wir senden Ihnen das Angebot an diese Adresse.

Noch Fragen?

Senden Sie uns eine E-Mail an contact@radiancesystems,eu oder kontaktieren Sie uns über das Kontaktformular. Wir beantworten alle Anfragen innerhalb von 3 Stunden während der Arbeitszeiten (Montag bis Freitag von 9 bis 17 Uhr).

📞 +33 4 65 84 48 21