Le point de départ
La solution de supervision propriétaire du client avait atteint ses limites :
- impossible de regrouper les signaux ou de modéliser les dépendances entre services ;
- des problèmes de performance ;
- une volumétrie de plus en plus difficile à absorber.
Ce que nous avons livré
- Une plateforme d’observabilité complète : OpenTelemetry pour la collecte, Mimir et VictoriaMetrics pour les métriques, Loki pour les logs, Tempo pour les traces.
- La haute disponibilité : répartition de charge et bascule automatique, pour que l’outil qui surveille la production ne devienne jamais lui-même un point de panne.
- Le service discovery : chaque nouveau service est surveillé automatiquement, sans configuration manuelle, sur l’ensemble des 1 500 services.
- Des outils et des sondes sur mesure, compatibles Prometheus : tests synthétiques et tests de non-régression intégrés à la plateforme, avec leur volumétrie propre.
- L’existant : les outils legacy sont raccordés à la plateforme plutôt que laissés de côté.
Le moment de bascule
Les deux solutions coexistaient quand l’ancien outil est tombé en panne. Le client a basculé rapidement sur la nouvelle plateforme, et n’est jamais revenu en arrière.
Résultat
- Les incidents : d’une quinzaine par jour à un ou deux par mois.
- Les gardes : autrefois réveillés plusieurs fois par nuit, ils ne le sont plus que très rarement.
- Le coût : un coût total nettement inférieur, sans licence ni support propriétaire.
- L’exploitation : le client opère la plateforme au quotidien. Nous en assurons l’évolution et restons en soutien.

