Eine übersichtliche Referenz der Architekturmuster, die in der SOA-C03-Prüfung getestet werden. Von oben nach unten lesen oder zu einem Abschnitt springen.
Überwachung, Protokollierung, Analyse, Behebung und Leistungsoptimierung
Sammeln Sie Speicher-, Festplatten- und Prozessmetriken von der EC2-Flotte. Standardmäßige CloudWatch-Metriken enthalten diese nicht.
Installieren Sie den CloudWatch-Agenten über SSM Distributor oder den `AmazonCloudWatch-ManageAgent` Run Command. Übertragen Sie die Agent-Konfiguration aus dem Parameter Store.
Warum: Speicher und Festplatte sind Gast-Betriebssystem-Metriken - der Hypervisor kann sie nicht sehen. Standardmäßige CW-Metriken sind nur CPU-/Netzwerk-/Festplatten-E/A auf der EBS-Ebene.
Die Anwendung muss einen Geschäfts-KPI (z. B. Bestellungen/Min.) an CloudWatch veröffentlichen.
`PutMetricData` API mit benutzerdefiniertem Namespace + Dimensionen. Für hohe Volumina das Embedded Metric Format (EMF) verwenden - strukturiertes JSON in Logs schreiben, und CW extrahiert Metriken automatisch.
Kosten für benutzerdefinierte Metriken mit hoher Kardinalität senken.
Embedded Metric Format (EMF). Ein strukturiertes Ereignis einmal protokollieren; CW extrahiert daraus Metriken. Ein Log + eine Metrik = günstiger als separate `PutMetricData`-Aufrufe pro Dimensionskombination.
Bereitschaftsdienst nur benachrichtigen, wenn SOWOHL eine hohe Fehlerrate ALS AUCH geringer Datenverkehr vorliegen - nicht, wenn nur einer davon ausgelöst wird.
Zusammengesetzter Alarm mit Regelausdruck `ALARM(errors) AND ALARM(low_traffic)`. Zugrunde liegende Alarme werden weiterhin einzeln ausgelöst, aber nur der zusammengesetzte Alarm benachrichtigt SNS.
Die Aufbewahrung von Log-Gruppen ist standardmäßig auf „Nie ablaufen“ eingestellt - die Rechnung wächst.
Legen Sie die Aufbewahrung pro Log-Gruppe fest (1 Tag-10 Jahre). Anwendung über `aws logs put-retention-policy` oder eine AWS Config-Regel, die neue Gruppen automatisch korrigiert.
Logs von 50 Konten in einem Sicherheitskonto zentralisieren.
Abonnementfilter für jede Quell-Log-Gruppe → Kinesis Data Streams oder Firehose im zentralen Konto. CloudWatch Cross-Account-Observability für Metriken + Traces.
Muss das EC2 vCPU-Kontingent in einer Region für einen bevorstehenden Start erhöhen.
Service Quotas-Konsole - Kontingenterhöhung anfordern. Oder Service Quotas API für Skriptnutzung verwenden. Einige Kontingente werden automatisch genehmigt; andere durchlaufen den Support.
Nicht-Produktions-EC2s automatisch stoppen, wenn das Monatsbudget den Schwellenwert überschreitet.
AWS Budgets-Aktion - bei Überschreitung des Schwellenwerts eine SSM Automation ausführen, die getaggte Instanzen stoppt oder eine Deny-All-SCP über IAM anwendet.
Verbindungen abbauen + Logs leeren, bevor ASG eine Instanz beendet.
Lifecycle-Hook bei `EC2_INSTANCE_TERMINATING`. Instanz wechselt in `Terminating:Wait`; SSM-Dokument führt Drain-Skript aus; `CONTINUE`-Aktion auslösen, wenn abgeschlossen.
Automatische Skalierung, um die durchschnittliche CPU-Auslastung bei etwa 60 % zu halten.
Target-Tracking-Skalierungsrichtlinie mit `ASGAverageCPUUtilization` = 60. ASG erstellt automatisch Step-Alarme.
Warum: Einfacher als Step-Skalierung. Am besten für symmetrische Metriken. Step-Skalierung ist für fein granulierte Regeln zum Hoch- und Herunterskalieren.
Eine ASG hauptsächlich auf Spot-Instanzen betreiben, um Kosten zu sparen, aber mit einer Basis von On-Demand-Instanzen für Stabilität.
Mixed Instances Policy - Launch-Vorlage + Basiskapazität (On-Demand) + Prozentsatz über der Basis auf Spot. Mehrere Instanztypen für Spot-Diversifikation verwenden.
Verwenden Sie Launch Templates. AWS hat Launch Configurations für neue ASGs eingestellt; nur LTs unterstützen neuere Funktionen (Warm Pool, gemischte Instanzen, IMDSv2-Erzwingung, EBS gp3, etc.).
Eine RDS-Datenbank muss einen AZ-Ausfall mit minimaler Ausfallzeit überstehen.
Multi-AZ-Bereitstellung. Synchroner Standby in einer anderen AZ; Failover ausgelöst durch Host-/Speicherausfall oder AZ-Ausfall. Endpunkt bleibt gleich.
Warum: Multi-AZ ist für Hochverfügbarkeit, nicht für Read-Scale-Out. Für Read-Scale-Out eine Read Replica hinzufügen.
Compliance mit regulatorischen Anforderungen für unveränderliche Backups (WORM).
AWS Backup Vault Lock mit Compliance-Modus. Einmal erzwungen, können Backups nicht vor Ablauf der Aufbewahrungsfrist gelöscht werden - nicht einmal vom Root-Benutzer.
Langzeitverbindungen werden unterbrochen, wenn ALB während der Bereitstellung ein Ziel entfernt.
Target Group Deregistrierungsverzögerung (Standard 300s, nach Bedarf erhöhen). Neue Anfragen werden sofort gestoppt; laufende Verbindungen werden abgebaut, bis die Verzögerung abläuft.
Wechseln Sie in den Elastic Throughput-Modus (automatisch skalierend). Oder Provisioned Throughput für vorhersehbare Workloads. Der standardmäßige Bursting-Modus ist kreditbasiert und erschöpft sich unter anhaltender Last.
S3-Objekte in eine zweite Region replizieren für Compliance + DR.
S3 Cross-Region Replication (CRR). Quell- + Ziel-Buckets, IAM-Rolle, Replikationsregel. Verwenden Sie Replication Time Control (RTC) für eine 15-Minuten-SLA.
Objekte vor versehentlichem oder böswilligem Löschen schützen.
Versioning + MFA Delete für den Bucket aktivieren. MFA Delete erfordert Root-Anmeldeinformationen + MFA-Code, um Versionen dauerhaft zu löschen oder Versioning zu deaktivieren.
TCP/UDP-Anwendung benötigt statische IPs und schnelles Failover über Regionen hinweg.
AWS Global Accelerator - 2 Anycast-IPs, die den Datenverkehr über das AWS-Backbone zum nächstgelegenen gesunden regionalen Endpunkt leiten. Failover unter 30 Sekunden.
Warum: Besser als Route 53 Failover für Nicht-HTTP-Verkehr; Clients behalten dieselbe IP.
Sehen Sie genau, was CloudFormation ändern wird, bevor Sie eine Template-Änderung anwenden.
Zuerst einen Change Set erstellen; vorgeschlagene Änderungen überprüfen; nur ausführen, wenn sicher. Change Sets unterstützen verschachtelte Stacks und Cross-Stack-Referenzen.
Versehentliche Aktualisierungen einer kritischen Ressource (z. B. Produktions-RDS) innerhalb eines Stacks verhindern.
CloudFormation Stack Policy - IAM-ähnliches Dokument, das `Update:*` auf bestimmte logische Ressourcen-IDs zulässt oder verweigert. Auf den Stack angewendet, getrennt von IAM.
Konfiguration ausführen + Abschlussmeldung an CloudFormation von EC2-Benutzerdaten senden.
cfn-init (Konfiguration), cfn-signal (Signal CreationPolicy), cfn-hup (Metadatenänderungen anwenden). CreationPolicy lässt den Stack auf das Signal warten, bevor er CREATE_COMPLETE markiert.
Stack automatisch zurücksetzen, wenn CloudWatch-Alarme nach der Bereitstellung ausgelöst werden.
CloudFormation Rollback-Konfiguration - Liste der CW-Alarme + Überwachungszeit. Wenn ein Alarm während des Zeitfensters ausgelöst wird, wird der Stack automatisch zurückgesetzt.
SSH-Zugriff auf Instanz im privaten Subnetz ohne Bastion-Host oder offene eingehende Ports.
SSM Session Manager - Agent + IAM-Rolle öffnen die Sitzung über die SSM Messages API. Keine öffentliche IP, kein SSH-Schlüssel, vollständige Sitzungsprotokollierung.
CodeDeploy Blue/Green-Deployment-Gruppe - provisioniert neue ASG, registriert sich bei ALB-Zielgruppe, wartet auf Health, tauscht Datenverkehr, beendet alte.
Entwicklungsteams die Selbstbedienung genehmigter Infrastruktur (z. B. VPC, S3-Bucket) ermöglichen, ohne vollständigen IAM-Zugriff zu gewähren.
AWS Service Catalog - Admin veröffentlicht Produkte (CFN-Templates), Benutzer starten über IAM-Berechtigung die Produktrolle, nicht die zugrunde liegenden Ressourcen.
Org-weit durchsetzen, dass alle Ressourcen `Environment`- und `CostCenter`-Tags haben.
AWS Organizations Tag-Richtlinien. Erlaubte Tag-Schlüssel + Werte definieren; nicht-konforme Tagging wird im Resource Groups Tag Editor + Config angezeigt.
OpsWorks Stacks ist End-of-Life. Migrieren Sie zu AWS Systems Manager + nativem Chef/Puppet auf EC2, oder konvertieren Sie zu ECS/EKS, oder erstellen Sie neu über SSM Automation + CFN.
Wählen Sie zwischen verschachtelten Stacks und Cross-Stack-Referenzen.
Verschachtelte Stacks: stark gekoppelt, Lebenszyklus zusammen verwaltet (einzelnes Update). Cross-Stack `Export`/`ImportValue`: lose gekoppelt, unabhängige Lebenszyklen, Exporte unveränderlich während des Imports.
IAM-Benutzer mit Zugriffsschlüsseln, die älter als 90 Tage sind, identifizieren.
Credential Report generieren (`generate-credential-report` + `get-credential-report`). CSV mit letzter Verwendung + Schlüsselalter pro Benutzer. Mit Access Analyzer für Least-Privilege-Überprüfung kombinieren.
IAM-Rollen, S3-Buckets, KMS-Schlüssel finden, die von außerhalb des Kontos / der Organisation zugänglich sind.
IAM Access Analyzer - Zone-of-Trust-Scan meldet Ergebnisse externer Zugriffe. External-Access-Analyzer ist kostenlos; Unused-Access-Analyzer ist kostenpflichtig.
Überberechtigte IAM-Richtlinien kürzen - Dienste entfernen, die der Principal nie verwendet hat.
IAM Last Accessed Information pro Rolle/Benutzer. Listet letzte Nutzung auf Dienstebene + (für einige Dienste) auf Aktionsebene. Ungenutzte Berechtigungen entfernen.
Alle API-Aufrufe über jedes Konto in der Organisation mit zentraler Speicherung auditieren.
Organisations-Trail im Management- oder delegierten Administratorkonto. Ein einziger S3-Bucket; umfasst alle aktuellen + zukünftigen Mitgliedskonten; kann von Mitgliedern nicht deaktiviert werden.
Jede S3-Objektlesung in einem sensiblen Bucket aufzeichnen.
CloudTrail-Datenereignisse für S3 aktivieren (pro Bucket oder alle). Standard-Trails erfassen nur Management-Ereignisse; Datenereignisse werden separat abgerechnet.
GuardDuty in jeder Region aktivieren. Delegierter Admin im Sicherheitskonto aggregiert Findings org-weit. EventBridge-Regel → SNS für hohe Schweregrade.
KMS-Verschlüsselungsschlüssel rotieren, ohne Daten neu zu verschlüsseln.
Automatische Schlüsselrotation für kundenverwaltete CMKs aktivieren (jährlich). KMS behält altes Schlüsselmaterial, um bestehende Ciphertexte zu entschlüsseln; neue Verschlüsselungen verwenden das neueste Material.
CIS Benchmarks über die gesamte Organisation anwenden.
AWS Config Conformance Pack - Bündel von Config-Regeln + Korrekturaktionen. Bereitstellung über Config an alle Konten über Aggregator; org-weit über das Management-Konto.
Verdächtigen Lateral-Movement-Datenverkehr zwischen Subnetzen untersuchen.
VPC Flow Logs an CloudWatch Logs / S3 / Firehose. Benutzerdefiniertes Format mit `pkt-srcaddr` + `pkt-dstaddr` zeigt die tatsächliche Paket-Quell-/Zieladresse (vs. ENI-Quell-/Zieladresse).
Alle Pfade vom Internet zu einem Datenbank-Subnetz org-weit finden.
Network Access Analyzer mit Network Access Scope (z. B. `Source: internet, Destination: db-subnet-tag`). Gibt passende Netzwerkpfade zur Überprüfung zurück.
Private Konnektivität von VPC zu den meisten anderen AWS-Diensten (KMS, SSM, ECR, etc.).
Interface VPC Endpoint (PowerLink). ENI in Ihrem Subnetz, Abrechnung pro AZ + pro GB. Endpunktrichtlinien verwenden, um den Zugriff auf bestimmte Ressourcen zu beschränken.
NAT Gateway Datenverarbeitungsgebühren dominieren die Rechnung.
S3/DynamoDB-Datenverkehr zu Gateway-Endpunkten (kostenlos) verschieben. Anderen AWS-Dienstverkehr zu Interface-Endpunkten verschieben. Für Inter-VPC Transit Gateway / VPC Peering anstelle von Routing durch NAT verwenden.
40 VPCs benötigen Any-to-Any-Konnektivität ohne N×N-Peering.
Transit Gateway als Hub. VPCs werden an TGW angehängt; Routing-Tabellen steuern, welche VPCs kommunizieren können. Ein einziger verwalteter Hub vs. O(N²) Peering-Verbindungen.
Cache-Hit-Rate für größtenteils statischen Inhalt maximieren.
`Cache-Control: max-age=...` in Origin-Antworten setzen; CloudFront so konfigurieren, dass nur erforderliche Cache-Schlüssel weitergeleitet werden (Vermeidung der Weiterleitung aller Header/Cookies/Query Strings, was die Cache-Effektivität zerstört).
SQL-Injection blockieren + aggressive Clients auf ALB ratenbegrenzen.
AWS WAFv2 Web ACL: AWS Managed Rule Group `AWSManagedRulesSQLiRuleSet` + ratenbasierte Regel (z. B. 2000 Anfragen / 5 Min. pro IP). Mit ALB / API Gateway / CloudFront / AppSync assoziieren.
Anhaltende Layer-7-DDoS-Angriffe mit Kostenschutzgarantie mindern.
AWS Shield Advanced - proaktives Engagement, DDoS-Erkennung auf Anwendungsebene, 24×7 SRT-Zugriff, Kostenerstattung für Skalierungsspitzen während eines Angriffs. Auf Route 53 / CloudFront / ALB / EIP / Global Accelerator aktivieren.
Zentrale Verwaltung von WAF / Shield / SG / Network Firewall-Richtlinien über alle Org-Konten hinweg.
AWS Firewall Manager (delegierter Admin). Richtlinien werden automatisch auf die im Geltungsbereich liegenden Konten/Ressourcen angewendet; meldet Non-Compliance.