Lokaler KI-Server für Unternehmen: Multi-User-LLM, Kosten und Skalierung
Aktie
Zwanzig Mitarbeiter mit einem Cloud-KI-Abonnement – das sind bereits mehrere tausend Euro pro Jahr, ganz zu schweigen davon, dass jeder Prompt, jedes eingefügte Dokument an einen Drittserver gesendet wird. Ein lokaler KI-Server ändert die Gleichung: Eine einmalige Investition, das gesamte Team ist angeschlossen, und keine Daten verlassen das Unternehmen.
Dieser Leitfaden richtet sich an IT-Entscheider und Führungskräfte, die die Bereitstellung eines internen Shared LLM in Betracht ziehen: die tatsächlichen Kosten im Vergleich zur Cloud, die technischen Kriterien für Mehrfachnutzer, die Dimensionierung nach Mitarbeiterzahl und die Bereitstellungs-Checkliste.
Das Cloud-Problem im Teammaßstab
Ein individuelles KI-Abonnement scheint harmlos. Multipliziert mit der Mitarbeiterzahl ist es das nicht mehr.
Cloud-Abonnement pro Benutzer
Wird kontinuierlich abgerechnet, solange das Konto besteht. Die Kosten steigen mit jeder Neueinstellung. Die Daten werden über die Server des Anbieters übertragen.
Lokaler KI-Server
Das gesamte Team ist über das Netzwerk mit demselben Gerät verbunden. Keine zusätzlichen Kosten pro Benutzer, keine Daten verlassen das Unternehmen.
Was ein lokaler Multi-User-KI-Server ist
Es ist ein einzelnes Gerät, dimensioniert für Rechenleistung, das in Ihrem Netzwerk installiert ist. Jeder Mitarbeiter greift von seinem Arbeitsplatz aus über eine Weboberfläche darauf zu, genau wie bei einem Cloud-Tool, mit dem Unterschied, dass die Anfrage niemals Ihre Räumlichkeiten verlässt.
Das Prinzip ändert alles im Maßstab: Anstatt eine Lizenz pro Person zu bezahlen, zahlen Sie einmal für eine Infrastruktur, die für die tatsächliche Nutzung Ihres Teams dimensioniert ist.
Die technischen Kriterien für mehrere Benutzer
Ein freigegebener Server hat andere Anforderungen als ein Einzelplatzrechner. Hier ist, was wirklich zählt.
- Gleichzeitige Anfragen. Mehrere Personen stellen dem Modell gleichzeitig Fragen. Der Server muss diese Anfragen parallel bearbeiten, ohne dass jeder auf seinen Zug warten muss, was VRAM erfordert, das über das reine Modellgewicht hinausgeht.
- Durchsatz, nicht nur Kapazität. Ein Modell, das für einen einzelnen Benutzer schnell antwortet, kann bei fünf oder zehn gleichzeitigen Anfragen merklich langsamer werden. Die Speicherkapazität des GPUs ist der Faktor, der diesen Durchsatz bestimmt.
- Kontoverwaltung. Jeder Mitarbeiter muss seinen eigenen Bereich, seine Historie und seine Zugänge haben. Eine Schnittstelle wie Open WebUI verwaltet separate Konten auf demselben Server nativ.
- Kontinuierliche Verfügbarkeit. Ein Teamserver muss während der Arbeitszeit eingeschaltet und erreichbar sein, mit einer Stabilität, die auf einen längeren Betrieb ausgelegt ist, nicht auf einmalige Sitzungen.
- Wachstumsmarge. Die Mitarbeiterzahl oder die Nutzung nimmt selten in die entgegengesetzte Richtung zu. Die Bereitstellung einer VRAM- und RAM-Marge verhindert einen vorzeitigen Austausch.
Welcher Server für welche Mitarbeiterzahl
Die folgende Tabelle gibt eine Größenordnung an. Die tatsächliche Nutzung (Länge der Konversationen, RAG-Dokumente, Codegenerierung) variiert diese Richtwerte.
| Angeschlossene Mitarbeiter | Empfohlenes VRAM | Referenzmaschine | Äquivalente Cloud-Kosten (Richtwert, pro Jahr) |
|---|---|---|---|
| Bis zu 10 Benutzer | 16 bis 32 GB | CoreAI 64 (RTX 5090) | ca. 3 000 € |
| 10 bis 25 Benutzer | 64 bis 96 GB | Mini Server GB10 oder Rack 2 × RTX 5090 | ca. 6 000 bis 9 000 € |
| 25 bis 50 Benutzer | 96 GB ECC | Pro AI Ultra Threadripper | ca. 9 000 bis 18 000 € |
| 50 bis 100 Benutzer und mehr | 192 GB ECC | Rack 2 × RTX 6000 Blackwell | ca. 18 000 bis 36 000 € |
Bereitstellungs-Checkliste
- Authentifizierung aktiviert sofort nach der Inbetriebnahme, individuelle Konten für jeden Mitarbeiter.
- Netzwerkzugang beschränkt auf das interne Netzwerk oder über VPN, niemals ohne Kontrolle über das Internet.
- HTTPS zur Verschlüsselung des Austauschs zwischen Clients und Server.
- Regelmäßige Backups von Konversationen und indizierten Dokumenten, wenn RAG verwendet wird.
- Überwachung der Auslastung, um einen Anstieg der Mitarbeiterzahl zu antizipieren, bevor er die Antwortzeiten beeinträchtigt.
- Geplante Updates der Inferenz-Engine und der Benutzeroberfläche, ohne den Betrieb zu unterbrechen.
Unsere Server für Multi-User LLM
Alle diese Maschinen werden in Auriol (13390) von Hand zusammengebaut und sind über den Online-Konfigurator oder auf Anfrage für spezielle Anforderungen vollständig konfigurierbar.
CoreAI 64 — RTX 5090 32 GB
32 GB VRAM · Ryzen 9 9950X3D · 64 GB DDR5
Server für kleines Team, Modelle bis 70B.
NVIDIA GB10 — ASUS Ascent GX10
128 GB Unified Memory · Grace Blackwell · DGX OS
Kompakter und leiser Server, ideal für Shared Offices.
CoreAI Rack — 2 × RTX 5090 (64 GB)
64 GB VRAM · Ryzen 9 9950X3D · 128 GB DDR5 · Rack 4U
Höherer Durchsatz, mehr gleichzeitige Anfragen.
Pro AI Ultra — Threadripper PRO
96 GB VRAM ECC · Threadripper PRO 7955WX · 128 GB ECC erweiterbar
ECC-Zuverlässigkeit für kontinuierlichen Betrieb in großem Maßstab.
CoreAI 128 Rack — 2 × RTX 6000 Blackwell (192 GB ECC)
192 GB VRAM ECC · Ryzen 9 9950X3D · 128 GB DDR5 · Rack 4U
Die Spitze der Produktreihe: große Modelle, 24/7 Verfügbarkeit, mehrere Dutzend Arbeitsplätze.
Häufig gestellte Fragen
Wie viele Benutzer kann ein lokaler KI-Server unterstützen?
Dies hängt hauptsächlich vom VRAM und der Speicherbandbreite der GPU ab, nicht von einer Softwarebegrenzung. Unsere Konfigurationen decken kleine Teams mit wenigen Arbeitsplätzen bis hin zu Bereitstellungen für mehrere Dutzend gleichzeitige Benutzer auf Rack- und Threadripper-Konfigurationen ab.
Ersetzt der Server wirklich ein Cloud-Abonnement wie ChatGPT oder Copilot?
Für Schreib-, Synthese-, Analyse- und Code-Anwendungen ja: Aktuelle offene Modelle können mit den besten proprietären Tools mithalten. Der lokale Server bietet vollständige Vertraulichkeit und eliminiert die wiederkehrenden Kosten pro Benutzer. Einige sehr spezifische Integrationen in ein proprietäres Ökosystem erfordern möglicherweise eine Ergänzung, die je nach Ihren Tools bewertet werden muss.
Benötigt man ein IT-Team, um den Server zu verwalten?
Nicht täglich. Auf Anfrage liefern wir die vorkonfigurierte Umgebung mit erstellten Benutzerkonten. Eine Vor-Ort-Installation ist für die anfängliche Netzwerkeinrichtung möglich. Die routinemäßige Wartung (Updates, Backups) ist vergleichbar mit der eines klassischen Dateiservers.
Was passiert, wenn die Mitarbeiterzahl steigt?
Die Maschinen sind so konzipiert, dass sie erweiterbar sind: Hinzufügen von RAM, Speicher oder sogar einer zweiten GPU bei Konfigurationen, die dies zulassen. Eine anfängliche Marge verhindert einen vollständigen Austausch, wenn das Team wächst.
Bleiben die Daten wirklich im Unternehmen?
Ja. Der Server läuft in Ihrem lokalen Netzwerk oder über VPN. Keine Anfrage, kein Dokument, keine Konversation wird an einen Drittdienst gesendet. Das ist der grundlegende Unterschied zu einem Cloud-Abonnement.
Kann ein Dokumenten-RAG zum Server hinzugefügt werden?
Ja, optional, wie bei all unseren Workstations. Der Server kann eine gemeinsame Dokumentenbasis für das gesamte Team indizieren, die von jedem Benutzer abgefragt werden kann, mit den gleichen Vertraulichkeitsgarantien.




