Serveur IA local pour entreprise : LLM multi-utilisateurs, coût et dimensionnement
Share
Vingt collaborateurs sur un abonnement IA cloud, c'est déjà plusieurs milliers d'euros par an, sans compter que chaque prompt, chaque document collé, part vers un serveur tiers. Un serveur IA local change l'équation : un seul investissement, toute l'équipe branchée dessus, et aucune donnée qui sort de l'entreprise.
Ce guide s'adresse aux décideurs IT et dirigeants qui envisagent de déployer un LLM partagé en interne : le coût réel comparé au cloud, les critères techniques du multi-utilisateurs, comment dimensionner selon l'effectif, et la checklist de déploiement.
Le problème du cloud à l'échelle d'une équipe
Un abonnement IA individuel semble anodin. Multiplié par l'effectif, il ne l'est plus.
Abonnement cloud, par utilisateur
Facturé en continu, tant que le compte existe. Le coût grandit avec chaque embauche. Les données transitent par les serveurs du fournisseur.
Serveur IA local
Toute l'équipe branchée sur la même machine via le réseau. Aucun coût par utilisateur ajouté, aucune donnée qui sort de l'entreprise.
Ce qu'est un serveur IA local multi-utilisateurs
C'est une seule machine, dimensionnée pour la puissance de calcul, installée sur votre réseau. Chaque collaborateur y accède depuis son poste via une interface web, comme il le ferait avec un outil cloud, sauf que la requête ne quitte jamais vos murs.
Le principe change tout à l'échelle : au lieu de payer une licence par personne, vous payez une infrastructure une fois, dimensionnée pour l'usage réel de votre équipe.
Les critères techniques propres au multi-utilisateurs
Un serveur partagé n'a pas les mêmes contraintes qu'un poste individuel. Voici ce qui compte vraiment.
- Les requêtes concurrentes. Plusieurs personnes interrogent le modèle en même temps. Le serveur doit traiter ces requêtes en parallèle sans que chacun attende son tour, ce qui demande de la VRAM disponible au-delà du seul poids du modèle.
- Le débit, pas seulement la capacité. Un modèle qui répond vite pour un utilisateur seul peut ralentir sensiblement à cinq ou dix requêtes simultanées. La bande passante mémoire du GPU est le facteur qui détermine ce débit.
- La gestion des comptes. Chaque collaborateur doit avoir son propre espace, son historique, ses accès. Une interface comme Open WebUI gère nativement les comptes séparés sur un même serveur.
- La disponibilité continue. Un serveur d'équipe doit rester allumé et joignable pendant les heures de travail, avec une stabilité pensée pour un fonctionnement prolongé, pas pour des sessions ponctuelles.
- La marge de croissance. L'effectif ou l'usage augmente rarement dans le sens inverse. Prévoir une marge de VRAM et de RAM évite un remplacement prématuré.
Quel serveur pour quel effectif
Le tableau ci-dessous donne un ordre de grandeur. L'usage réel (longueur des conversations, RAG documentaire, génération de code) fait varier ces repères.
| Effectif connecté | VRAM conseillée | Machine de référence | Coût cloud équivalent (indicatif, par an) |
|---|---|---|---|
| Jusqu'à 10 utilisateurs | 16 à 32 Go | CoreAI 64 (RTX 5090) | environ 3 000 € |
| 10 à 25 utilisateurs | 64 à 96 Go | Mini Serveur GB10 ou Rack 2 × RTX 5090 | environ 6 000 à 9 000 € |
| 25 à 50 utilisateurs | 96 Go ECC | Pro AI Ultra Threadripper | environ 9 000 à 18 000 € |
| 50 à 100 utilisateurs et plus | 192 Go ECC | Rack 2 × RTX 6000 Blackwell | environ 18 000 à 36 000 € |
Checklist de déploiement
- Authentification activée dès la mise en service, comptes individuels pour chaque collaborateur.
- Accès réseau restreint au réseau interne ou via VPN, jamais ouvert sur internet sans contrôle.
- HTTPS pour chiffrer les échanges entre les postes et le serveur.
- Sauvegardes régulières des conversations et des documents indexés si un RAG est utilisé.
- Supervision de la charge pour anticiper une montée en effectif avant qu'elle ne dégrade les temps de réponse.
- Mises à jour planifiées du moteur d'inférence et de l'interface, sans interrompre l'activité.
Nos serveurs pour LLM multi-utilisateurs
Toutes ces machines sont assemblées à la main à Auriol (13390) et entièrement configurables, via le configurateur en ligne ou sur devis pour un besoin précis.
CoreAI 64 — RTX 5090 32 Go
32 Go VRAM · Ryzen 9 9950X3D · 64 Go DDR5
Serveur d'équipe restreinte, modèles jusqu'à 70B.
NVIDIA GB10 — ASUS Ascent GX10
128 Go mémoire unifiée · Grace Blackwell · DGX OS
Serveur compact et silencieux, idéal en bureau partagé.
CoreAI Rack — 2 × RTX 5090 (64 Go)
64 Go VRAM · Ryzen 9 9950X3D · 128 Go DDR5 · Rack 4U
Débit plus élevé, davantage de requêtes simultanées.
Pro AI Ultra — Threadripper PRO
96 Go VRAM ECC · Threadripper PRO 7955WX · 128 Go ECC extensible
Fiabilité ECC pour un fonctionnement continu à grande échelle.
CoreAI 128 Rack — 2 × RTX 6000 Blackwell (192 Go ECC)
192 Go VRAM ECC · Ryzen 9 9950X3D · 128 Go DDR5 · Rack 4U
Le sommet de la gamme : gros modèles, disponibilité 24/7, plusieurs dizaines de postes.
Questions fréquentes
Combien d'utilisateurs un serveur IA local peut-il supporter ?
Cela dépend surtout de la VRAM et de la bande passante mémoire du GPU, pas d'une limite logicielle. Nos configurations couvrent de petites équipes de quelques postes à des déploiements de plusieurs dizaines d'utilisateurs simultanés sur les configurations rack et Threadripper.
Le serveur remplace-t-il vraiment un abonnement cloud comme ChatGPT ou Copilot ?
Pour les usages de rédaction, synthèse, analyse et code, oui : les modèles ouverts actuels rivalisent avec les meilleurs outils propriétaires. Le serveur local ajoute la confidentialité totale et supprime le coût récurrent par utilisateur. Certaines intégrations très spécifiques à un écosystème propriétaire peuvent nécessiter un complément, à évaluer selon vos outils.
Faut-il une équipe IT pour gérer le serveur ?
Pas au quotidien. Sur demande, nous livrons l'environnement préconfiguré, avec les comptes utilisateurs créés. Une installation sur site est possible pour la mise en réseau initiale. La maintenance courante (mises à jour, sauvegardes) reste comparable à celle d'un serveur de fichiers classique.
Que se passe-t-il si l'effectif augmente ?
Les machines sont conçues pour évoluer : ajout de RAM, de stockage, voire d'un second GPU sur les configurations qui le permettent. Prévoir une marge dès le départ évite un remplacement complet quand l'équipe grandit.
Les données restent-elles vraiment dans l'entreprise ?
Oui. Le serveur fonctionne sur votre réseau local ou via VPN. Aucune requête, aucun document, aucune conversation n'est envoyé vers un service tiers. C'est la différence fondamentale avec un abonnement cloud.
Peut-on ajouter un RAG documentaire au serveur ?
Oui, en option, comme sur toutes nos stations. Le serveur peut indexer une base documentaire commune à toute l'équipe, interrogeable par chaque utilisateur, avec les mêmes garanties de confidentialité.




