IT-dienstverlener

Van 15 incidenten per dag naar 1 of 2 per maand: open-source observability voor 1.500 services

Een IT-dienstverlener monitorde 1.500 services en applicaties met een propriëtaire oplossing aan het eind van haar latijn. De teams kregen een vijftiental incidenten per dag te verwerken, en wie van wacht was, werd meerdere keren per nacht gewekt. Wij bouwden een hoogbeschikbaar open-source observabilityplatform. Het aantal incidenten daalde tot één of twee per maand.

Het vertrekpunt

De propriëtaire monitoringoplossing van de klant had haar grenzen bereikt:

  • geen manier om signalen te groeperen of afhankelijkheden tussen services te modelleren;
  • prestatieproblemen;
  • datavolumes die steeds moeilijker te verwerken waren.

Wat wij opleverden

  • Een volledig observabilityplatform: OpenTelemetry voor de verzameling, Mimir en VictoriaMetrics voor de metrics, Loki voor de logs, Tempo voor de traces.
  • Hoge beschikbaarheid: load balancing en automatische failover, zodat de tool die de productie bewaakt zelf nooit een zwak punt wordt.
  • Service discovery: elke nieuwe service wordt automatisch gemonitord, zonder handmatige configuratie, over alle 1.500 services heen.
  • Tools en probes op maat, compatibel met Prometheus: synthetische tests en regressietests geïntegreerd in het platform, met hun eigen datavolumes.
  • Het bestaande: legacy-tools zijn op het platform aangesloten in plaats van opzijgeschoven.

Het kantelpunt

Beide oplossingen draaiden naast elkaar toen de oude tool uitviel. De klant stapte snel over naar het nieuwe platform, en is nooit meer teruggekeerd.

Resultaat

  • Incidenten: van een vijftiental per dag naar één of twee per maand.
  • Wachtdiensten: vroeger meerdere keren per nacht gewekt, nu nog maar zelden.
  • De kosten: een veel lagere totale kost, zonder propriëtaire licenties of support.
  • De exploitatie: de klant beheert het platform dagelijks. Wij zorgen voor de evolutie en blijven als back-up beschikbaar.

Andere klantcases

  • Ontwikkelaar van videosoftware

    Air-gapped Kubernetes, ingebouwd in vrachtwagens

    Context
    Geen ervaring met containerorkestratie, en een ambitieus doel: Kubernetes-clusters ingebouwd in vrachtwagens die overal ter wereld werken, van jungle tot woestijn, zonder enige verbinding.
    Aanpak
    Een volledig air-gapped Kubernetes-cluster op maat, uitgerold via geversioneerde en geteste Ansible-playbooks, en schaalbaarheid voor de applicatie van de klant.
    Resultaat
    Een autonoom platform dat zonder enige verbinding draait, en waarop de klant vandaag nog verder bouwt.
    Lees de volledige case — Air-gapped Kubernetes, ingebouwd in vrachtwagens
  • Financiële instelling

    Beveiligde AWS-landingzone

    Context
    Teams die verspreid naar de cloud trokken: accounts die geval per geval werden aangemaakt, zonder centrale organisatie of least privilege.
    Aanpak
    Een AWS-landingzone (Organizations, Control Tower, Terraform), SSO gekoppeld aan het identiteitssysteem van de onderneming, en guardrails die de interne regels automatisch afdwingen.
    Resultaat
    Een volledig vernieuwde beveiligingshouding, en het cloudfundament van de hele organisatie, dat nieuwe diensten blijft verwelkomen.
    Lees de volledige case — Beveiligde AWS-landingzone
  • Start-up in de zorg

    Soevereine AI on-premise

    Context
    Volumes klantfeedback die onbeheersbaar waren geworden, en medische gegevens die het bedrijf in geen geval mogen verlaten.
    Aanpak
    Open-weight LLM’s op on-premise hardware met orkestratie op maat, RAG op interne kennis, en MCP-servers ontwikkeld om bedrijfssoftware te bevragen.
    Resultaat
    In productie, enkele uren tijdswinst per dossier, en een MVP opgeleverd voor twee derde van het geraamde budget.
    Lees de volledige case — Soevereine AI on-premise

Contact

Een gelijkaardig project?

Beschrijf ons uw context. Wij antwoorden binnen twee werkdagen met een eerste, concreet advies.

Liever rechtstreeks?

contact@okko.be