Deployment-Alarme und automatischer Rollback
Prüfungsbezug: DOP-C02 Domain 1 zu Pipelines, Tests, Artefakten oder Deployment.
Lernziel
Technische und Business-Metriken mit sicheren Release-Entscheidungen verbinden.
| Difficulty / Schwierigkeitsgrad | Fortgeschritten |
| Study time / Lernzeit | 120 Minuten |
| Prerequisites / Voraussetzungen | Vorherige Lektionen dieses Bandes |
Berufliches Szenario
Release besteht Instance Health, aber Zahlungsfehler steigen stark.
Kernkonzepte
- Infrastruktur-Health ist nötig, aber nicht ausreichend.
- Business-Metriken messen Kundenergebnis.
- Alarme können unterstützte Deployments stoppen oder zurückrollen.
- Rollback berücksichtigt Schema- und Konfigurationskompatibilität.
Architekturablauf
- Release-Input und unveränderliche Identität bestimmen.
- Managed AWS Control Plane und Least-Privilege-Rolle wählen.
- Build-, Test-, Artefakt- oder Deployment-Arbeit ausführen.
- Service Events, Logs, Reports und Runtime-Metriken sammeln.
- Nach klaren Regeln stoppen, wiederholen oder zurückrollen.
Entscheidungsmatrix
| Anforderung | Bevorzugte Wahl | Begründung |
|---|---|---|
| Schneller schwerer Fehler | Kurzes robustes Alarmfenster | Schnelle Begrenzung |
| Rauschende Signale | Composite Alarm | Weniger Fehlrollback |
| Kritische Transaktion | Custom Business Metric | Misst Kundenergebnis |
Fehlerbilder und Fehlersuche
- Durchschnitt verdeckt Tail-Latenz.
- Missing-Data-Verhalten ist falsch.
- Code-Rollback kehrt Schema nicht um.
Sicherheit und Betrieb
- Kurzlebige Service-Rollen und Least Privilege.
- Artefakte verschlüsseln und Secrets aus Logs fernhalten.
- Änderungen und Freigaben für Audit erfassen.
Praxislabor
Goal / Ziel: Einen technischen und einen Business-Rollback-Alarm erstellen.
Aufgaben
- Kleinste sichere Testarchitektur erstellen.
- Hauptworkflow umsetzen oder simulieren.
- Einen kontrollierten Fehler einführen.
- Anhand von Service-Nachweisen diagnostizieren.
- Cleanup und eine Verbesserung dokumentieren.
Validierung
- Workflow nutzt unveränderliche Version.
- Pflichtfehler blockiert Promotion.
- Diagnose identifiziert ersten fehlerhaften Übergang.
Cost control / Kostenkontrolle: Ressourcen kurzlebig halten; Cleanup vorher lesen.
Aufräumen
- Pipeline-, Build- und Deployment-Ressourcen löschen.
- Temporäre Artefakte, Images, Logs und Rollen entfernen.
Prüfungsfallen
- Nur CPU überwachen.
- Nicht relevante Metrik verwenden.
Wichtigste Erkenntnisse
- Infrastruktur-Health ist nötig, aber nicht ausreichend.
- Rollback berücksichtigt Schema- und Konfigurationskompatibilität.
- Entscheidungen werden mit Anforderungen und Fehlerverhalten begründet.
Wiederholungsfragen
- Was ist die unveränderliche Release-Identität?
- Welche Nachweise belegen Erfolg oder Fehler?
- Was ist die sicherste Recovery-Aktion?
Antworten
- Version, Digest oder eindeutig versioniertes Artefakt.
- Service Events, Logs, Reports, Health Checks und Runtime-Metriken.
- Bekannte gute Version über konfigurierten Rollback wiederherstellen.