Le point de départ
Chaque retour client demandait une longue analyse : lire les documents, retrouver les rapports concernés, établir les corrélations à la main. Le volume ne cessait d’augmenter, et les données, médicales et soumises au RGPD, ne pouvaient en aucun cas quitter l’entreprise.
Le défi
- Aucune donnée ne sort : les modèles doivent tourner en local, pas dans le cloud d’un fournisseur.
- Un budget maîtrisé : trouver le matériel au meilleur rapport performance/coût, sans investir dans une salle de serveurs GPU.
- Un terrain très récent : les modèles open-weight et le protocole MCP évoluaient de mois en mois. Par moments, la question n’était pas « comment », mais « est-ce que c’est seulement possible ».
Ce que nous avons livré
- L’infrastructure : un cluster de machines on-premise, avec une orchestration sur mesure qui répartit les requêtes entre les machines, en gérant la taille du contexte et la planification des tâches. Toutes les machines sont exploitées, et l’usage reste fluide.
- Les modèles : comparaison et sélection de modèles open-weight (Llama, Qwen, Gemma), testés en conditions réelles avec le RAG et les outils métier.
- Le RAG : sur les bases de données et de connaissances internes.
- Des serveurs MCP développés par nos soins : l’assistant interroge directement les logiciels métier de l’entreprise.
Résultat
- En production : l’assistant est utilisé au quotidien.
- Plusieurs heures gagnées par dossier : l’analyse documentaire et la recherche de corrélations, autrefois manuelles, sont désormais assistées.
- Le budget : le MVP a été livré aux deux tiers du budget estimé, grâce à une gestion fine des ressources matérielles.
- La suite : le client envisage d’automatiser d’autres pans de son activité.

