Het vertrekpunt
Elke klantfeedback vergde een lange analyse: de documenten lezen, de betrokken rapporten terugvinden, de verbanden met de hand leggen. Het volume bleef groeien, en de gegevens, medisch en onderworpen aan de AVG, mochten het bedrijf in geen geval verlaten.
De uitdaging
- Er gaat geen data naar buiten: de modellen moeten lokaal draaien, niet in de cloud van een leverancier.
- Een beheerst budget: de hardware vinden met de beste prijs-prestatieverhouding, zonder te investeren in een serverruimte vol GPU’s.
- Heel nieuw terrein: open-weight modellen en het MCP-protocol veranderden maand na maand. Soms was de vraag niet “hoe”, maar “kan dit wel”.
Wat wij opleverden
- De infrastructuur: een cluster van on-premise machines, met orkestratie op maat die de verzoeken over de machines verdeelt en daarbij de contextgrootte en de taakplanning beheert. Alle machines worden benut, en het gebruik blijft vlot.
- De modellen: vergelijking en selectie van open-weight modellen (Llama, Qwen, Gemma), getest in reële omstandigheden met de RAG en de bedrijfstools.
- De RAG: op de interne databanken en kennisbanken.
- MCP-servers die wij zelf ontwikkelden: de assistent bevraagt rechtstreeks de bedrijfssoftware.
Resultaat
- In productie: de assistent wordt dagelijks gebruikt.
- Enkele uren tijdswinst per dossier: documentanalyse en het zoeken naar verbanden, vroeger handwerk, worden nu ondersteund.
- Het budget: de MVP werd opgeleverd voor twee derde van het geraamde budget, dankzij een nauwkeurig beheer van de hardware.
- De volgende stap: de klant overweegt andere delen van zijn activiteiten te automatiseren.

