Was ein Service Level Indicator ist, was ein Service Level Objective, und wie beide zusammenwirken.
Ein SLI ist eine messbare Eigenschaft des Services, etwa ein Latenz-Perzentil, die Error Rate oder die Verfuegbarkeit. Ein SLO ist das Ziel fuer diesen SLI, zum Beispiel eine P99-Latenz unter 500 Millisekunden oder eine Error Rate unter 0,1 Prozent.
SLOs sind Vertraege mit sich selbst. Werden sie verletzt, muss jemand reagieren.
Was gemessen werden sollte
Die vier goldenen Signale aus dem Google-SRE-Buch, Latency, Traffic, Errors und Saturation, sind auch fuer APIs der richtige Ausgangspunkt: Request Rate pro Endpoint, P50, P95 und P99 Response Time, Error Rate nach Status Code, sowie die Latenz kritischer Abhaengigkeiten wie Datenbank oder externe Services.
Alert-Design: Symptome, nicht Ursachen
Gute Alerts warnen bei Symptomen, die Nutzer tatsaechlich bemerken, nicht bei internen Metriken, die niemanden interessieren. Eine hohe CPU-Auslastung ist eine Ursache, oft ohne akuten Handlungsbedarf, eine ueberschrittene P99-Response-Time ist ein Symptom, bei dem jemand handeln muss.
Alert-Muedigkeit vermeiden
Zu viele Alerts fuehren dazu, dass niemand mehr reagiert. Jeder Alert braucht einen klaren Schweregrad, einen eindeutigen Handlungsauftrag und einen Verweis auf ein Runbook. Und Alerts sollten regelmaessig ueberprueft werden, was seit Monaten nie angeschlagen hat, kann oft weg.
Checkliste: SLIs und SLOs pro kritischer API definiert, Dashboards fuer die vier goldenen Signale, Alerts auf Symptome statt interne Metriken, Runbooks fuer jeden kritischen Alert verlinkt, Alert-Review-Zyklus definiert.
Ein Beispiel aus der Praxis
Eine API galt intern als stabil, weil die durchschnittliche Antwortzeit gut aussah. Erst nach der Einfuehrung von P95- und P99-Metriken zeigte sich, dass ein kleiner, aber relevanter Anteil der Anfragen deutlich laenger dauerte als der Durchschnitt vermuten liess, genau bei den umsatzstaerksten Kunden mit den groessten Datenmengen. Der Durchschnitt hatte dieses Problem komplett verdeckt. Nach der gezielten Behebung der langsamsten Anfragen verbesserte sich die Nutzererfahrung genau der Kunden, die am meisten zaehlten.
API-Monitoring aufsetzen? markom.digital richtet SLI- und SLO-basiertes Monitoring ein, mit Dashboards und Alerting, das im Ernstfall wirklich hilft.