Étude de cas

Comment Sentry a divisé son MTTR par 5 grâce au triage IA

En automatisant le triage et la classification des incidents, l'équipe engineering de Sentry a réduit son MTTR de 80 % et libéré ses ingénieurs des alertes de faible priorité.

Sentry

Secteur

DevTools · Monitoring

Volume

10 000+ alertes/semaine

Usage

Triage & incident response

Déploiement

9 jours

-80 %

Temps de triage

incidents entrants

MTTR ÷5

Résolution

temps moyen

94 %

Alertes classées

automatiquement

Le défi

Sentry gère sa propre plateforme de monitoring d'erreurs en interne. Avec plus de 10 000 alertes par semaine générées par leur infrastructure, l'équipe SRE passait l'essentiel de son temps à trier des notifications, dont 78 % se révélaient être du bruit (faux positifs, alertes déjà résolues, événements sans impact utilisateur).

Ce fatigue d'alerte ("alert fatigue") conduisait à des délais de réponse allongés sur les vrais incidents critiques, et à une démotivation progressive de l'équipe engineering. Le MTTR (Mean Time To Resolution) avait doublé en 18 mois malgré des investissements en outillage.

La solution EzyAgents

En 9 jours, l'équipe SRE a déployé un agent EzyAgents connecté à leur système de monitoring (PagerDuty, Datadog), leur base de code (GitHub) et leur historique d'incidents. L'agent analyse chaque alerte entrante en temps réel et prend une décision de routage.

  • Classification automatique de chaque alerte : critique, majeure, mineure, bruit
  • Corrélation avec l'historique des incidents similaires pour contexte immédiat
  • Notification uniquement de l'ingénieur de garde pertinent avec le contexte complet
  • Suggestion de runbook et actions correctives basées sur les résolutions passées
  • Validation HITL avant tout rollback automatique en production
  • Post-mortem automatique généré dans Notion après résolution de chaque incident P1/P2

Les résultats

Dès la première semaine, le volume de notifications adressées aux ingénieurs a diminué de 80 %. L'agent classe correctement 94 % des alertes sans intervention humaine. Le MTTR est passé de 47 minutes à 9 minutes en moyenne sur les incidents P1.

L'équipe SRE a récupéré en moyenne 12 heures par ingénieur et par semaine, réaffectées à des projets de fiabilité proactive. Le nombre d'incidents récurrents a diminué de 60 % en trois mois grâce aux post-mortems automatisés et à l'identification systématique des causes racines.

"L'agent EzyAgents analyse et classe nos incidents en temps réel. Le MTTR a été divisé par 5 depuis le déploiement, nos ingénieurs n'interviennent plus que sur les vrais incidents critiques."

Alex R., Head of Engineering, Sentry

Éliminez l'alert fatigue de votre équipe

Un agent de triage opérationnel sur votre monitoring en moins de 2 semaines.

Essayer gratuitement
Étude de cas Sentry · EzyAgents | EzyAgents