Lokaler KI-Server für Unternehmen: Multi-User-LLM, Kosten und Skalierung

Zwanzig Mitarbeiter mit einem Cloud-KI-Abonnement – das sind bereits mehrere tausend Euro pro Jahr, ganz zu schweigen davon, dass jeder Prompt, jedes eingefügte Dokument an einen Drittserver gesendet wird. Ein lokaler KI-Server ändert die Gleichung: Eine einmalige Investition, das gesamte Team ist angeschlossen, und keine Daten verlassen das Unternehmen.

Dieser Leitfaden richtet sich an IT-Entscheider und Führungskräfte, die die Bereitstellung eines internen Shared LLM in Betracht ziehen: die tatsächlichen Kosten im Vergleich zur Cloud, die technischen Kriterien für Mehrfachnutzer, die Dimensionierung nach Mitarbeiterzahl und die Bereitstellungs-Checkliste.


Das Cloud-Problem im Teammaßstab

Ein individuelles KI-Abonnement scheint harmlos. Multipliziert mit der Mitarbeiterzahl ist es das nicht mehr.

Cloud-Abonnement pro Benutzer

20 bis 30 €
pro Monat und pro Benutzer, Standardangebote

Wird kontinuierlich abgerechnet, solange das Konto besteht. Die Kosten steigen mit jeder Neueinstellung. Die Daten werden über die Server des Anbieters übertragen.

Lokaler KI-Server

Einmalige Investition
in der Regel in 12 bis 18 Monaten amortisiert

Das gesamte Team ist über das Netzwerk mit demselben Gerät verbunden. Keine zusätzlichen Kosten pro Benutzer, keine Daten verlassen das Unternehmen.

Angaben dienen als Richtwert. Die Preise für Cloud-Angebote variieren je nach Anbieter, Level (Standard oder Enterprise) und ausgehandelten Mengenrabatten; fortgeschrittene Angebote mit erweiterten Compliance-Funktionen kosten oft mehr. Die oben genannten Beträge dienen als Orientierungshilfe für die Argumentation, nicht als garantierte Preisangabe. Für einen genauen Vergleich gehen Sie von Ihren tatsächlichen Cloud-Angeboten aus.


Was ein lokaler Multi-User-KI-Server ist

Es ist ein einzelnes Gerät, dimensioniert für Rechenleistung, das in Ihrem Netzwerk installiert ist. Jeder Mitarbeiter greift von seinem Arbeitsplatz aus über eine Weboberfläche darauf zu, genau wie bei einem Cloud-Tool, mit dem Unterschied, dass die Anfrage niemals Ihre Räumlichkeiten verlässt.

Das Prinzip ändert alles im Maßstab: Anstatt eine Lizenz pro Person zu bezahlen, zahlen Sie einmal für eine Infrastruktur, die für die tatsächliche Nutzung Ihres Teams dimensioniert ist.


Die technischen Kriterien für mehrere Benutzer

Ein freigegebener Server hat andere Anforderungen als ein Einzelplatzrechner. Hier ist, was wirklich zählt.

  • Gleichzeitige Anfragen. Mehrere Personen stellen dem Modell gleichzeitig Fragen. Der Server muss diese Anfragen parallel bearbeiten, ohne dass jeder auf seinen Zug warten muss, was VRAM erfordert, das über das reine Modellgewicht hinausgeht.
  • Durchsatz, nicht nur Kapazität. Ein Modell, das für einen einzelnen Benutzer schnell antwortet, kann bei fünf oder zehn gleichzeitigen Anfragen merklich langsamer werden. Die Speicherkapazität des GPUs ist der Faktor, der diesen Durchsatz bestimmt.
  • Kontoverwaltung. Jeder Mitarbeiter muss seinen eigenen Bereich, seine Historie und seine Zugänge haben. Eine Schnittstelle wie Open WebUI verwaltet separate Konten auf demselben Server nativ.
  • Kontinuierliche Verfügbarkeit. Ein Teamserver muss während der Arbeitszeit eingeschaltet und erreichbar sein, mit einer Stabilität, die auf einen längeren Betrieb ausgelegt ist, nicht auf einmalige Sitzungen.
  • Wachstumsmarge. Die Mitarbeiterzahl oder die Nutzung nimmt selten in die entgegengesetzte Richtung zu. Die Bereitstellung einer VRAM- und RAM-Marge verhindert einen vorzeitigen Austausch.
Der häufigste Fehler bei der Dimensionierung: einen Server für die Modellgröße zu wählen, ohne die Benutzer zu berücksichtigen. Ein Modell, das für einen einzelnen Benutzer 16 GB benötigt, kann zwei- bis dreimal mehr VRAM erfordern, um fünf bis zehn gleichzeitige Sitzungen mit einem komfortablen Kontext zu ermöglichen. Die Anzahl der Benutzer ist bei der Dimensionierung ebenso wichtig wie das Modell.


Welcher Server für welche Mitarbeiterzahl

Die folgende Tabelle gibt eine Größenordnung an. Die tatsächliche Nutzung (Länge der Konversationen, RAG-Dokumente, Codegenerierung) variiert diese Richtwerte.

Angeschlossene Mitarbeiter Empfohlenes VRAM Referenzmaschine Äquivalente Cloud-Kosten (Richtwert, pro Jahr)
Bis zu 10 Benutzer 16 bis 32 GB CoreAI 64 (RTX 5090) ca. 3 000 €
10 bis 25 Benutzer 64 bis 96 GB Mini Server GB10 oder Rack 2 × RTX 5090 ca. 6 000 bis 9 000 €
25 bis 50 Benutzer 96 GB ECC Pro AI Ultra Threadripper ca. 9 000 bis 18 000 €
50 bis 100 Benutzer und mehr 192 GB ECC Rack 2 × RTX 6000 Blackwell ca. 18 000 bis 36 000 €
Typische Rentabilität. Bei gleichbleibender Mitarbeiterzahl amortisiert sich ein lokaler Server in der Regel zwischen 12 und 18 Monaten im Vergleich zu einem gleichwertigen Cloud-Abonnement, noch bevor man berücksichtigt, dass die Hardware-Investition mehrere Jahre nutzbar bleibt. Nach dieser Periode werden die Grenzkosten pro Benutzer null.


Bereitstellungs-Checkliste

  • Authentifizierung aktiviert sofort nach der Inbetriebnahme, individuelle Konten für jeden Mitarbeiter.
  • Netzwerkzugang beschränkt auf das interne Netzwerk oder über VPN, niemals ohne Kontrolle über das Internet.
  • HTTPS zur Verschlüsselung des Austauschs zwischen Clients und Server.
  • Regelmäßige Backups von Konversationen und indizierten Dokumenten, wenn RAG verwendet wird.
  • Überwachung der Auslastung, um einen Anstieg der Mitarbeiterzahl zu antizipieren, bevor er die Antwortzeiten beeinträchtigt.
  • Geplante Updates der Inferenz-Engine und der Benutzeroberfläche, ohne den Betrieb zu unterbrechen.
Schlüsselfertige Installation. Auf Anfrage liefern wir den Server mit der komplett vorkonfigurierten Umgebung: Inferenz-Engine, Multi-User-Oberfläche, eingerichtete Konten und eine mögliche Vor-Ort-Installation überall in Frankreich und Europa für die anfängliche Netzwerkeinrichtung.


Unsere Server für Multi-User LLM

Alle diese Maschinen werden in Auriol (13390) von Hand zusammengebaut und sind über den Online-Konfigurator oder auf Anfrage für spezielle Anforderungen vollständig konfigurierbar.

Kleines Team, bis zu 10 Arbeitsplätze
Radiance CoreAI 64 RTX 5090

CoreAI 64 — RTX 5090 32 GB

32 GB VRAM · Ryzen 9 9950X3D · 64 GB DDR5

Server für kleines Team, Modelle bis 70B.

6 042 €ab
Mittleres Team, 10 bis 25 Arbeitsplätze
ASUS Ascent GX10 NVIDIA GB10

NVIDIA GB10 — ASUS Ascent GX10

128 GB Unified Memory · Grace Blackwell · DGX OS

Kompakter und leiser Server, ideal für Shared Offices.

3 999 €ab
Radiance Rack 2x RTX 5090

CoreAI Rack — 2 × RTX 5090 (64 GB)

64 GB VRAM · Ryzen 9 9950X3D · 128 GB DDR5 · Rack 4U

Höherer Durchsatz, mehr gleichzeitige Anfragen.

11 221 €ab
Großes Team, 25 bis 50 Arbeitsplätze
Radiance Pro AI Ultra Threadripper

Pro AI Ultra — Threadripper PRO

96 GB VRAM ECC · Threadripper PRO 7955WX · 128 GB ECC erweiterbar

ECC-Zuverlässigkeit für kontinuierlichen Betrieb in großem Maßstab.

20 213 €ab
Unternehmen, 50 bis 100 Arbeitsplätze und mehr
Radiance Rack 2x RTX 6000 Blackwell ECC

CoreAI 128 Rack — 2 × RTX 6000 Blackwell (192 GB ECC)

192 GB VRAM ECC · Ryzen 9 9950X3D · 128 GB DDR5 · Rack 4U

Die Spitze der Produktreihe: große Modelle, 24/7 Verfügbarkeit, mehrere Dutzend Arbeitsplätze.

27 980 €ab
Alles konfigurierbar. Jeder Server passt sich genau an Ihre Mitarbeiterzahl und Ihre Nutzung an: VRAM, RAM, Speicher, Stromversorgung. Konfigurieren Sie ihn direkt über den Online-Konfigurator oder beschreiben Sie uns Ihren Bedarf für ein maßgeschneidertes Angebot, auch für mehr als 100 Arbeitsplätze. Schreiben Sie an contact@radiancesystems.eu oder über das Angebotsformular auf der Website.


Häufig gestellte Fragen


Wie viele Benutzer kann ein lokaler KI-Server unterstützen?

Dies hängt hauptsächlich vom VRAM und der Speicherbandbreite der GPU ab, nicht von einer Softwarebegrenzung. Unsere Konfigurationen decken kleine Teams mit wenigen Arbeitsplätzen bis hin zu Bereitstellungen für mehrere Dutzend gleichzeitige Benutzer auf Rack- und Threadripper-Konfigurationen ab.


Ersetzt der Server wirklich ein Cloud-Abonnement wie ChatGPT oder Copilot?

Für Schreib-, Synthese-, Analyse- und Code-Anwendungen ja: Aktuelle offene Modelle können mit den besten proprietären Tools mithalten. Der lokale Server bietet vollständige Vertraulichkeit und eliminiert die wiederkehrenden Kosten pro Benutzer. Einige sehr spezifische Integrationen in ein proprietäres Ökosystem erfordern möglicherweise eine Ergänzung, die je nach Ihren Tools bewertet werden muss.


Benötigt man ein IT-Team, um den Server zu verwalten?

Nicht täglich. Auf Anfrage liefern wir die vorkonfigurierte Umgebung mit erstellten Benutzerkonten. Eine Vor-Ort-Installation ist für die anfängliche Netzwerkeinrichtung möglich. Die routinemäßige Wartung (Updates, Backups) ist vergleichbar mit der eines klassischen Dateiservers.


Was passiert, wenn die Mitarbeiterzahl steigt?

Die Maschinen sind so konzipiert, dass sie erweiterbar sind: Hinzufügen von RAM, Speicher oder sogar einer zweiten GPU bei Konfigurationen, die dies zulassen. Eine anfängliche Marge verhindert einen vollständigen Austausch, wenn das Team wächst.


Bleiben die Daten wirklich im Unternehmen?

Ja. Der Server läuft in Ihrem lokalen Netzwerk oder über VPN. Keine Anfrage, kein Dokument, keine Konversation wird an einen Drittdienst gesendet. Das ist der grundlegende Unterschied zu einem Cloud-Abonnement.


Kann ein Dokumenten-RAG zum Server hinzugefügt werden?

Ja, optional, wie bei all unseren Workstations. Der Server kann eine gemeinsame Dokumentenbasis für das gesamte Team indizieren, die von jedem Benutzer abgefragt werden kann, mit den gleichen Vertraulichkeitsgarantien.

Zurück zum Blog

Ihr Angebot für eine maßgeschneiderte KI-Lösung innerhalb von 24–48 Stunden

Jedes Radiance-Projekt beginnt mit einem Gespräch. Füllen Sie dieses Formular aus und ein Experte wird sich umgehend mit einer auf Ihr Unternehmen und Ihr Budget zugeschnittenen Lösung bei Ihnen melden.

Antwort innerhalb von 24–48 Arbeitsstunden
Lieferung innerhalb Europas (EU)
2 Jahre Garantie inklusive
Installation vor Ort möglich
Keine Verpflichtung auf Abruf
Dedizierter Support vor und nach dem Kauf
01 Was ist Ihr Hauptverwendungszweck für KI?
Multiple Choice.
02 In welchem Kontext wird das System verwendet?
Nur eine Wahlmöglichkeit.
03 Welche Art von System suchen Sie?
Nur eine Wahlmöglichkeit.
04 Welches Betriebssystem bevorzugen Sie?
Nur eine Wahlmöglichkeit.
05 Welche Erwartungen haben Sie an die Software?
Multiple Choice.
06 Was ist Ihr Richtbudget?
Nur eine Wahlmöglichkeit.
07 Wann möchten Sie Ihr System erhalten?
Nur eine Wahlmöglichkeit.
08 Wünschen Sie eine Begleitung bei der Umsetzung?
Einzelne Auswahl. Ein Radiance-Techniker kann Sie vor Ort oder per Fernzugriff unterstützen.
09 Lieferland (nur EU) *
Wir liefern ausschließlich innerhalb der Europäischen Union (EU).
10 Zusätzliche Informationen (optional, aber sehr nützlich)
Beschreiben Sie kurz Ihr Projekt, etwaige spezifische Einschränkungen oder sonstige relevante Informationen.
11 Möchten Sie kontaktiert werden, um Ihr Projekt zu besprechen?
Wenn Sie „Nur Kostenvoranschlag“ auswählen, können Sie auf unsere E-Mail antworten, um Ihre Fragen zu stellen und den Kostenvoranschlag zu verfeinern.
12 E-Mail *
Wir senden Ihnen das Angebot an diese Adresse.

Weitere Fragen?

Senden Sie uns eine E-Mail an contact@radiancesystems,eu oder kontaktieren Sie uns über das Kontaktformular. Wir beantworten alle Anfragen während der Arbeitszeiten (Montag bis Freitag von 9 bis 17 Uhr) innerhalb von 3 Stunden.

📞 +33 4 65 84 48 21