PC für ComfyUI 2026: Empfohlener PC-Modellleitfaden, VRAM und Workflows
Teilen
ComfyUI hat sich 2026 zur Referenzoberfläche für KI-Bilderzeugung entwickelt. Nodale Architektur, effizientes Speichermanagement, native Unterstützung für Flux, SD 3.5, Qwen Image, KI-Video (Hunyuan, LTX-Video), Audio (StableAudio) – es ist das Werkzeug, das alle Profis nutzen. Aber ComfyUI ist auch hungrig und anspruchsvoll: Multi-Modell-Workflows, Hunderte von Custom Nodes, gestapelte ControlNets, TensorRT... Welchen PC braucht man wirklich, um das Beste herauszuholen? Dieser Leitfaden gibt Ihnen die genaue Antwort, Modell für Modell, mit realen Benchmarks.
Warum ComfyUI 2026 zum Standard geworden ist?
Im Jahr 2024 dominierte Automatic1111 (A1111). Im Jahr 2026 hat ComfyUI seinen Platz eingenommen, aus vier Gründen:
- Nodale Architektur. Sie erstellen Ihre Pipeline visuell: Nodes zum Laden von Modellen, Konditionierung, Sampler, VAE Decode usw. Sie sehen genau, was in jedem Schritt passiert – und können alles ändern.
- Effizientes Speichermanagement. ComfyUI lädt und entlädt Komponenten bei Bedarf. Eine 12-GB-GPU kann Workflows ausführen, die in A1111 oder Forge abstürzen.
- Unterstützung neuer Modelle innerhalb von Tagen. Flux, SD 3.5, Qwen Image, Hunyuan Video – alle werden nativ wenige Tage nach ihrer Veröffentlichung unterstützt. A1111 benötigt oft Monate.
- Riesiges Ökosystem an Custom Nodes. Der ComfyUI Manager bietet im Mai 2026 Zugriff auf über 2.000 Community-Erweiterungen – ControlNet Aux, IPAdapter, AnimateDiff, ComfyRoll, Impact Pack, WAS Suite und viele andere.
Die wahren Hardware-Anforderungen von ComfyUI im Jahr 2026
ComfyUI hat den Ruf, "VRAM-schonend" zu sein. Das stimmt für die einfache Generierung. Falsch, sobald man stapelt: ein ControlNet hinzufügen (+2 GB), ein IPAdapter (+2 GB), einen Refiner (+5 GB), einen LoRA (+200 MB jeweils), einen Upscaler (+3 GB)… man landet schnell bei 20 GB, selbst bei einem einfachen SDXL-Modell.
Hier sind die wahren Anforderungen pro Workflow-Typ im Mai 2026:
Einfache SDXL-Generierung
Basischer Text→Bild-Workflow mit SDXL-Checkpoint, Sampler, VAE Decode. Ohne Extras.
VRAM: 8 GB ausreichendSDXL + Refiner + 1 ControlNet
Klassische Profi-Pipeline: SDXL-Basis → Refiner → ControlNet Pose oder Depth. Standard-Setup für Illustrationen.
VRAM: 12-16 GBFlux Dev FP8 + ControlNet
Der Standard-Workflow 2026. Flux Dev quantisiert FP8 (~13 GB) + ControlNet (Union oder Canny).
VRAM: 16 GB (knapp) / 20 GB (komfortabel)SDXL + IPAdapter + ControlNet + LoRA Stack
Profi-Illustrations-Workflow: Stilübertragung (IPAdapter), Pose (ControlNet), 2-3 gestapelte LoRAs, Upscale.
VRAM: 16-24 GBAnimateDiff / KI-Video (LTX-Video, Hunyuan)
Generierung kurzer Videosequenzen. Hunyuan Video und LTX-Video sind sehr VRAM-hungrig pro Bild × Anzahl der Frames.
VRAM: mindestens 24 GB, 32 GB komfortabelMulti-Modell parallel (SDXL + Flux + Qwen)
Fortgeschrittene Vergleichs-Workflows oder Produktions-Pipelines, die mehrere verschiedene Modelle ohne Entladen verketten.
VRAM: 32 GB oder Dual-GPUFlux LoRA Training (via ComfyUI Nodes)
Training von LoRA Flux direkt aus ComfyUI über Custom Nodes (Kohya, AI Toolkit). Sehr anspruchsvoll.
VRAM: mindestens 24 GB, 32 GB komfortabelProduktionsstudio Batch + API Server
ComfyUI im Server-Modus (REST-API), Batches von 10-50 Flux-Bildern, parallele Warteschlangen.
VRAM: 32 GB oder Multi-GPUMindest-VRAM-Empfehlung für ComfyUI im Jahr 2026
| ComfyUI Nutzung | Mindest-VRAM | Komfort-VRAM | GPU-Typ |
|---|---|---|---|
| Einstieg / Einfaches SDXL | 8 GB | 12 GB | RTX 5060 12 GB |
| Standard Pro-Workflow ⭐ | 16 GB | 16 GB | RTX 5060 Ti / 5070 Ti 16 GB |
| Flux FP16 / IPAdapter Stack | 16 GB (knapp) | 24 GB | RTX 4090 24 GB |
| KI-Video + LoRA Training | 24 GB | 32 GB | RTX 5090 32 GB |
| Produktionsstudio Multi-GPU | 2× 32 GB | 2× 96 GB ECC | Rack 2× RTX 5090 oder 2× RTX 6000 Pro |
Jenseits von VRAM: Was für ComfyUI zählt
System-RAM — mindestens 32 GB, 64 GB empfohlen
ComfyUI tauscht Modelle zwischen VRAM und System-RAM aus, wenn der VRAM nicht ausreicht. Mit 32 GB DDR5 halten Sie 2-3 geladene Checkpoints im RAM für sofortige Wechsel. Mit 64 GB laden Sie Ihre gesamte Bibliothek (SDXL Basis + Refiner + Flux + 5 LoRAs + 3 ControlNets) in den Speicher – kein erneutes Laden von der Festplatte zwischen den Generierungen.
NVMe SSD Gen 4 oder Gen 5 — kritisch
Jeder Checkpoint-Wechsel = Festplattenlesevorgang. Ein Flux Dev wiegt 24 GB, ein SDXL 7 GB, ein ControlNet 2-5 GB. Auf einer Gen 4 SSD (5.000 MB/s) dauert das initiale Laden eines Flux + IPAdapter + ControlNet Workflows ~8 Sekunden. Auf Gen 5 (12.000+ MB/s) sind es 3 Sekunden. Auf einer SATA SSD über 30 Sekunden. Planen Sie mindestens 2 TB NVMe Gen 4 ein, um keine externe Bibliothek verwalten zu müssen.
CPU — weniger kritisch, als Sie denken
Die ComfyUI-Inferenz ist zu ~95 % GPU-basiert. Die CPU dient der Vorverarbeitung (Laden von Modellen, Parsen des JSON-Workflows, PIL-Nachverarbeitung). Ein aktueller Ryzen 5 reicht aus. Für komplexe Workflows mit Dutzenden von Nodes oder Echtzeit-Pipelines bietet ein Ryzen 7 oder 9 marginalen Komfort.
GPU-Bandbreite — die versteckte Optimierung
Für ComfyUI zählt die Speicherbandbreite der GPU fast genauso viel wie der VRAM. Eine RTX 5090 (1.792 GB/s) ist 2,7-mal schneller als eine RTX 5060 Ti 16 GB (672 GB/s) bei Flux, selbst wenn das Modell auf beide Karten passt. Deshalb bleibt die RTX 4060 Ti 16 GB (288 GB/s) trotz ihres korrekten VRAMs eine Falle.
ComfyUI-Optimierungen 2026 — 30-60 % Geschwindigkeitsgewinn
Einige Start-Flags und Erweiterungen transformieren Ihr ComfyUI-Setup:
# Optimierter ComfyUI-Start Blackwell (RTX 50xx): python main.py \ --use-pytorch-cross-attention \ --fast \ --highvram \ --enable-cors-header # Nützliche Umgebungsvariablen: export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True export CUDA_LAUNCH_BLOCKING=0 export TORCHINDUCTOR_CACHE_DIR=/path/ssd/cache
-
TensorRT-Kompilierung über
ComfyUI-TensorRT: +30-60 % Geschwindigkeit bei repetitiven Workflows. Erste Generierung langsam (Kompilierung), folgende extrem schnell. - FP8 / GGUF Quantisierung: Flux in FP8 = -50 % VRAM, nahezu identische Qualität. GGUF Q4/Q6 = noch weniger VRAM für 12-GB-Konfigurationen.
- Flash Attention 2: 15-25 % VRAM-Ersparnis bei unterstützten Architekturen (Blackwell, Ada Lovelace).
- Tiled VAE in VAE Decode: ermöglicht 4K selbst bei 16 GB.
- ComfyUI-Crystools: Echtzeit-GPU/VRAM-Monitoring in der Oberfläche – unerlässlich zur Optimierung von Workflows.
- RAM-Disk für Modelle: Wenn Sie 128 GB RAM haben, ermöglicht das Zuordnen einer RAM-Disk für Checkpoints sofortige Wechsel.
Unverzichtbare ComfyUI Custom Nodes im Jahr 2026
| Custom Node | Nutzen | VRAM-Auswirkung |
|---|---|---|
| ComfyUI Manager | Installation/Update von Custom Nodes mit 1 Klick | Keine |
| ComfyUI-Impact-Pack | Gesichts-/Hand-Detailer, Segmentierung, regionale Prompts | +1-3 GB |
| ComfyUI_IPAdapter_plus | Stilübertragung von einem Quellbild | +1-2 GB |
| ComfyUI-AnimateDiff-Evolved | Animation von Sequenzen aus Standbildern | +4-8 GB |
| comfyui_controlnet_aux | ControlNet-Preprozessoren (Tiefe, Pose, Canny, Lineart) | +0,5-2 GB |
| ComfyUI-WAS-Suite | 200+ Dienstprogramm-Nodes (Text, Masken, Mathematik) | Vernachlässigbar |
| ComfyUI-TensorRT | TensorRT-Kompilierung = +30-60 % Geschwindigkeit | +2-4 GB während der Kompilierung |
| ComfyUI-Crystools | Echtzeit-GPU/CPU/RAM-Überwachung | Vernachlässigbar |
| ComfyUI-HunyuanVideoWrapper | Hunyuan-Videogenerierung | +12-20 GB |
| ComfyUI-LTXVideo | LTX-Videogenerierung (schneller als Hunyuan) | +8-14 GB |
Schnelle Installation von optimiertem ComfyUI auf Ihrem PC
# 1. ComfyUI klonen git clone https://github.com/comfyanonymous/ComfyUI cd ComfyUI # 2. Eine Python 3.12 venv erstellen python -m venv venv source venv/bin/activate # Linux/Mac # .\venv\Scripts\activate # Windows # 3. PyTorch mit CUDA 12.8 (RTX 50xx Blackwell) pip install torch torchvision torchaudio \ --index-url https://download.pytorch.org/whl/cu128 # 4. ComfyUI-Abhängigkeiten pip install -r requirements.txt # 5. ComfyUI Manager installieren (essentiell) cd custom_nodes git clone https://github.com/ltdrdata/ComfyUI-Manager cd .. # 6. Ein Basismodell herunterladen (Flux Dev FP8) # https://huggingface.co/Comfy-Org/flux1-dev # Die .safetensors-Datei in ComfyUI/models/diffusion_models/ ablegen # 7. Optimiertes ComfyUI starten python main.py --use-pytorch-cross-attention --fast --highvram
Unsere für ComfyUI optimierten PCs — vorkonfiguriert und bereit zur Generierung
Radiance Systems entwickelt Workstations, die speziell unter ComfyUI getestet wurden. Auf Anfrage liefern wir Ihren PC mit installiertem und konfiguriertem ComfyUI (PyTorch CUDA, Manager, essentielle Custom Nodes) sowie den von Ihnen ausgewählten Modellen (Flux Dev, SDXL, ControlNets, IPAdapter) heruntergeladen aus – Sie starten und generieren Ihr erstes Bild in weniger als 2 Minuten.
Radiance PC CoreAI 16 — RTX 5060 Ti 16 GB
✅ Workflows SDXL + Refiner · Flux Dev FP8 · ControlNet · IPAdapter · Leichter LoRA Stack
Idealer Einstiegspunkt für ernsthaftes ComfyUI im Jahr 2026. 16 GB GDDR7 — das Minimum für standardmäßige Profi-Workflows. AM5 DDR5 Plattform für schnelle Modellwechsel. Aufrüstbar: GPU-Upgrade später ohne Plattformwechsel möglich.
ComfyUI + Manager + Flux Dev FP8 auf Anfrage vorinstalliert
Diese Workstation konfigurieren →
Radiance PC CoreAI 32 — RTX 5070 Ti 16 GB
✅ Kompletter Profi-Workflow · Multi-ControlNet · IPAdapter Stack · TensorRT · AnimateDiff
Die vielseitige Workstation für Illustratoren und Kreative, die Knoten stapeln. 1,9-mal höhere Bandbreite für flüssige Generierungen in komplexen Workflows. 32 GB DDR5 ermöglichen es, Flux + SDXL + 5 LoRAs + 3 ControlNets gleichzeitig im Speicher zu halten.
TensorRT vorkonfiguriert · Essentielle Custom Nodes installiert
Diese Workstation konfigurieren →
⭐ Radiance PC CoreAI 64 — RTX 5090 32 GB
✅ Alle ComfyUI-Workflows · KI-Video (LTX, Hunyuan) · Flux LoRA-Training · Gleichzeitiges Multi-Modell
Die beste Consumer-Workstation für ComfyUI im Jahr 2026. 32 GB GDDR7 ermöglichen es, alle Komponenten gleichzeitig geladen zu halten – kein Entladen zwischen Knoten. Rekord-Bandbreite (1.792 GB/s) für 3-5x schnellere Workflows als eine RTX 5070 Ti. KI-Video, LoRA Flux-Training, Flux Dev FP16-Batches – alles ist zugänglich.
Komplette ComfyUI-Bibliothek auf Anfrage vorinstalliert
Diese Workstation konfigurieren →
Radiance CoreAI Rack — 2× RTX 5090 (64 GB VRAM)
✅ ComfyUI Server Multi-Tenant · Parallele Pipelines · Batch-Produktion · Lange KI-Videos
Für Studios und Kreativagenturen, die volumenmäßig produzieren. 2× unabhängige RTX 5090 über ComfyUI Server-Modus: eine GPU ist der aktuellen Generierung gewidmet, die andere dem Vor-Rendering des nächsten Batches oder dem Training von LoRAs. Ideal für Teams von 3-10 Kreativen.
ComfyUI Server API · Multi-Tenant · 4U Rack
Dieses Rack konfigurieren →
CoreAI 128 Rack — 2× RTX 6000 PRO Blackwell (192 GB ECC)
✅ Lange KI-Videos · Fine-Tuning von Basismodellen · Flux 2 9B-Batches · 24/7 Produktion
Die ultimative Workstation für Profi-Studios, die lange KI-Videos (Hunyuan 30+ Sekunden), vollständiges Fine-Tuning von Modellen oder 24/7-Produktion betreiben. 192 GB ECC VRAM ermöglichen das gleichzeitige Laden mehrerer kompletter Modelle und das Generieren massiver Batches ohne Speichereinschränkungen.
Profi-Studios · Lange KI-Videos · Kontinuierliche Produktion
Dieses Rack konfigurieren →
Radiance PC Pro AI Ultra Threadripper
✅ KI-Forschung · Entwicklung von Custom Nodes · HPC-Pipelines · Schweres Fine-Tuning
Für VFX-Studios, Forscher und KI-Agenturen, die ihre eigenen Custom Nodes oder fortschrittliche Pipelines entwickeln. Threadripper PRO sTR5-Plattform, erweiterbar auf bis zu 96 Kerne und 2 TB ECC RAM. Die zukunftssichere Maschine für 5+ Jahre, um nie eingeschränkt zu sein.
Maßgeschneidert · Individuelles Angebot · Vor-Ort-Installation
Angebot anfordern →Häufig gestellte Fragen – PC für ComfyUI
Ist ComfyUI anspruchsvoller als Automatic1111?
Nein, für die einfache Generierung ist sogar das Gegenteil der Fall. ComfyUI verwaltet den Speicher besser und kann Flux auf 12 GB ausführen, wo A1111 abstürzen würde. Sobald jedoch Custom Nodes und komplexe Workflows (Multi-ControlNet, IPAdapter, AnimateDiff…) gestapelt werden, kann ComfyUI für dieselbe Aufgabe mehr Ressourcen verbrauchen als A1111, da es alles in den Speicher lädt, um die Geschwindigkeit zu optimieren.
Wie viel VRAM wird benötigt, um ComfyUI reibungslos auszuführen?
16 GB sind das praktische Minimum im Jahr 2026 für professionelle Workflows (SDXL + Refiner + ControlNet + LoRA Stack). 24 GB bieten Komfort für Flux FP16 und komplexe Pipelines. 32 GB (RTX 5090) oder mehr sind für KI-Videos, LoRA Flux-Training oder Studio-Produktionen erforderlich.
Was ist der Unterschied zwischen ComfyUI und Forge UI?
ComfyUI ist nodal (visueller Knotengraph) – steilere Lernkurve, aber totale Flexibilität, ideal für Profis. Forge UI ist ein Fork von A1111 – klassische Oberfläche, einfacher zu erlernen, gute VRAM-Verwaltung. Für 2026 ist ComfyUI die empfohlene Wahl, da es alle neuen Modelle zuerst unterstützt und das Ökosystem der Custom Nodes unübertroffen ist.
Kann ComfyUI auf AMD-GPUs oder Mac verwendet werden?
Ja, technisch gesehen, über ROCm für AMD oder MPS für Apple Silicon. In der Praxis sind viele Custom Nodes (TensorRT, bestimmte ControlNets, fortgeschrittene IPAdapter, Trainings-Nodes) nur für NVIDIA oder sehr eingeschränkt. Für einen dedizierten ComfyUI-PC im Jahr 2026 wird NVIDIA weiterhin dringend empfohlen – insbesondere die RTX 50xx (Blackwell), die die beste PyTorch- und TensorRT-Unterstützung bieten.
Kann ein ComfyUI-Server für mehrere Benutzer im Netzwerk betrieben werden?
Ja. ComfyUI kann im Server-Modus mit einer REST-API gestartet werden, die im lokalen Netzwerk oder über Cloudflare Tunnel zugänglich ist. Mehrere Benutzer können Workflows in eine Warteschlange stellen. Für 3-10 gleichzeitige Benutzer sind das Rack 2× RTX 5090 oder das Rack 2× RTX 6000 ECC die idealen Konfigurationen – jede GPU kann eine separate Warteschlange bearbeiten.
Lohnt sich TensorRT wirklich für ComfyUI?
Ja, für repetitive Workflows (Batch-Produktion, API-Server). Die Kompilierung dauert 5-15 Minuten pro Modell/Auflösung, aber die folgenden Generierungen sind 30-60% schneller. Nachteil: Jede Modell+Auflösungs-Kombination muss separat kompiliert werden, und das Ergebnis ist nicht zwischen GPUs portierbar. Für gelegentliche Experimente ist TensorRT unnötig.
Welches Netzteil für ComfyUI mit einer RTX 5090?
Mindestens 1.200 W 80+ Gold. Die RTX 5090 verbraucht bis zu 575 W Spitzenleistung, der Ryzen 9 9950X3D etwa 170 W, plus weitere Komponenten. Rechnen Sie mit 30-40% Marge für die Langlebigkeit des Netzteils und gleichzeitige Spitzenverbräuche. Für Dual-GPU 2.000 W Platinum.
Linux oder Windows für ComfyUI?
Linux (Ubuntu 24.04) bietet die beste Rohleistung, optimale CUDA-Unterstützung und maximale Kompatibilität mit den anspruchsvollsten Custom Nodes. Windows 11 funktioniert sehr gut und ist einfacher für Nicht-Entwickler. WSL2 unter Windows 11 bietet einen ausgezeichneten Kompromiss. Unsere Workstations werden mit dem Betriebssystem Ihrer Wahl und vorkonfiguriertem ComfyUI geliefert.




