Buchhaltung, Kundenservice oder Produktion laufen bei vielen Unternehmen über Cloud-Dienste und APIs außerhalb der eigenen Kontrolle. Fällt eine Plattform aus, sind die Folgen weltweit sofort spürbar. Klassische Notfallpläne greifen dann zu spät. Wie Architekturen aus solchen Störungen lernen und robuster werden, zeigt ein fünfstufiges Resilienz-Modell.
Verteilte Cloud-Infrastrukturen verbinden Unternehmen weltweit, aber auch mit fremden Ausfallrisiken. Wer Störungen frühzeitig einordnet, hält die Kontrolle auch dann, wenn Drittsysteme ausfallen.
Aufgrund der Zunahme von KI-Systemen, regulatorischen Anforderungen und hybriden Infrastrukturen müssen Unternehmen nicht mehr nur einzelne Angriffe abwehren. Cyberresilienz beginnt schon bei der Frage, wie viel Sichtbarkeit, Kontrolle und Durchgriff sie bei Anwendungen, APIs und digitalen Prozessen besitzen. Mit geeigneten Maßnahmen können sie Risiken schneller einordnen, die operative Kontrolle behalten und kritische digitale Infrastrukturen auch unter steigender Komplexität belastbar steuern.
Sicherheitsvorfälle sind unvermeidlich. Doch inzwischen haben sie ihren Ursprung häufig außerhalb des Unternehmens. Wenn eine große Cloud-Region oder eine weltweite Plattform ausfällt, sind davon abhängige Anwendungen nicht mehr verfügbar. Diese Skalierung bedeutet jedoch, dass die herkömmliche reaktive Wiederherstellung in Unternehmen nicht mehr funktioniert. Wenn verteilte Systeme schnell und global ausfallen, kann dies kein einzelnes Team beheben. Die Frage lautet daher, wie die Architektur während und nach einem Ausfall reagiert, sich anpasst und verbessert.
Was Resilienz in einer hybriden Multicloud-Welt bedeutet
Bislang konzentrieren sich Resilienzstrategien auf die Rückkehr zum Normalzustand: mit Notfallwiederherstellungsplänen, Ausweichstandorten sowie Recovery Time Objectives (RTOs) und Recovery Point Objectives (RPOs). Dieser Ansatz setzt voraus, dass Ausfälle lokal begrenzt sind, bei bekannten Abhängigkeiten und klar definierten Kontrollgrenzen. Dies gilt bei hybriden Multicloud-Umgebungen nicht mehr. Denn Identität, Routing, Speicherung und Datenverteilung liegen oft bei Dritten. Wenn deren Systeme ausfallen, sind die Auswirkungen sofort weltweit spürbar.
Daher muss ein moderner Ansatz Cyberresilienz als eine Fähigkeit definieren, die sich unter Stress verbessert. Er sollte Störungen erwarten, ihren Wirkungsradius begrenzen, sich in Echtzeit anpassen und Telemetriedaten aus anormalen Zuständen nutzen, um die Architektur so zu verfeinern, dass nachfolgende, ähnliche Ereignisse weniger oder keine Schäden verursachen. Der Erfolg wird daran gemessen, wie gering die Auswirkungen einer Störung auf das System sind, wie schnell sich das System während des Vorfalls anpasst und wie sich die Architekturen dadurch weiterentwickeln.
Dieser Ansatz führt zu klaren Ergebnissen:
kleinere, kontrollierte Ausbreitungsradien
höhere Verfügbarkeit trotz Störungen bei Drittsystemen
kürzere Wiederherstellungszeiten, da Systeme auf Anpassungen vorbereitet sind
automatisierte Reaktionen auf anormale Zustände
mehr Sicherheit für externe Dienste, da Resilienz gezielt aufgebaut und nicht ausgelagert wird
Für einen solchen „antifragilen“ Ansatz sind folgende technische Maßnahmen erforderlich, die sich über den gesamten Stack hinweg integrieren lassen, damit sich Systeme unter Belastung vorhersehbar verhalten:
Kontrolle des Ausbreitungseffekts: Klare Vertrauens- und Fehlergrenzen definieren, sodass sich ein Ausfall in einer Region, einer Cloud oder einer Abhängigkeit nicht ungehindert in den eigenen Systemen ausbreiten kann.
Diversifizierung der Abhängigkeiten: Tragfähige Alternativen für kritische Dienste schaffen. Redundanz geht über bloße Duplizierung hinaus und umfasst kontrollierte Optionen, damit nicht ein einzelner Anbieter das Systemverhalten bestimmt.
Richtliniengesteuerte Anpassung: Statische Konfigurationen durch Richtlinien ersetzen, die auf den aktuellen Zustand reagieren. Dies gilt insbesondere in den Bereichen Routing, Authentifizierung und Vertrauenswürdigkeit.
Inkrementelle Adaptierung: In kleinen, beobachtbaren architektonischen Schritten die Resilienz erhöhen, ohne das System zu destabilisieren.
Beobachtungsgestützte Governance und Laufzeitautomatisierung: Mit Hilfe von Telemetrie Entscheidungen treffen und Reaktionen automatisieren. So beginnt die Anpassung, bevor Vorfälle eskalieren.
Dabei ist zu berücksichtigen, dass für Anwendungen in Hybrid- und Multi-Cloud-Umgebungen keine einzelne Funktion die Resilienz allein gewährleisten kann – sei es Sicherheit, Netzwerk, Cloud-Betrieb oder der Anbieter. Das erfordert ein koordiniertes Betriebsmodell, das interne Verantwortlichkeiten mit externen Abhängigkeiten in Einklang bringt und Unklarheiten bei Vorfällen reduziert. Dies unterstützt auch die Einhaltung regulatorischer Rahmenbedingungen wie DORA oder ISO/IEC 27001.
Zur Skalierung der technischen Maßnahmen empfiehlt sich ein übergreifendes Konzeptmodell wie die fünfstufige Architektur von F5. Jede Stufe ist sowohl eine Technologieebene als auch ein Verantwortungsbereich, die gemeinsam für Resilienz entscheidend sind.
Die erste Ebene ist global ausgerichtet und regelt externe Kontroll- und Vertrauensgrenzen durch die Steuerung des Auswirkungsbereichs und richtliniengesteuertes Routing. Als Nächstes definiert die Standort-Ebene der Architektur regionale Ausführungs- und Isolationszonen durch Diversifizierung der Abhängigkeiten und Failover-Domänen. Die Plattform-Ebene sorgt für Rechenleistung und Datenverarbeitung und ermöglicht Laufzeitautomatisierung sowie Workload-Mobilität. Die Anwendungs-Ebene stellt die Geschäftslogik und die Endnutzererfahrung bereit. Schließlich zentralisiert die Management-Ebene Observability, Governance und Orchestrierung, um eine auf Telemetriedaten basierende Richtlinienentwicklung zu unterstützen.
Die Ebenen und Maßnahmen in die Praxis umsetzen
Um jede Ebene und Vorgehensweise optimal umzusetzen, muss man jedoch genau verstehen, wie sie zusammenwirken. Auf globaler Ebene tragen die Begrenzung des Ausbreitungsradius und richtliniengesteuertes Routing dazu bei, systemweite Ausfälle einzudämmen, bevor sie sich ausbreiten. Dies minimiert die Auswirkungen auf die damit verbundenen Systeme. Auf Standort-Ebene ermöglichen es die Diversifizierung von Abhängigkeiten und die Bereitstellung von Failover-Domänen, Störungen zu isolieren und die Kontinuität durch alternative Ausführungszonen sicherzustellen.
Stand: 08.12.2025
Es ist für uns eine Selbstverständlichkeit, dass wir verantwortungsvoll mit Ihren personenbezogenen Daten umgehen. Sofern wir personenbezogene Daten von Ihnen erheben, verarbeiten wir diese unter Beachtung der geltenden Datenschutzvorschriften. Detaillierte Informationen finden Sie in unserer Datenschutzerklärung.
Einwilligung in die Verwendung von Daten zu Werbezwecken
Ich bin damit einverstanden, dass die Vogel IT-Medien GmbH, Max-Josef-Metzger-Straße 21, 86157 Augsburg, einschließlich aller mit ihr im Sinne der §§ 15 ff. AktG verbundenen Unternehmen (im weiteren: Vogel Communications Group) meine E-Mail-Adresse für die Zusendung von Newslettern und Werbung nutzt. Auflistungen der jeweils zugehörigen Unternehmen können hier abgerufen werden.
Der Newsletterinhalt erstreckt sich dabei auf Produkte und Dienstleistungen aller zuvor genannten Unternehmen, darunter beispielsweise Fachzeitschriften und Fachbücher, Veranstaltungen und Messen sowie veranstaltungsbezogene Produkte und Dienstleistungen, Print- und Digital-Mediaangebote und Services wie weitere (redaktionelle) Newsletter, Gewinnspiele, Lead-Kampagnen, Marktforschung im Online- und Offline-Bereich, fachspezifische Webportale und E-Learning-Angebote. Wenn auch meine persönliche Telefonnummer erhoben wurde, darf diese für die Unterbreitung von Angeboten der vorgenannten Produkte und Dienstleistungen der vorgenannten Unternehmen und Marktforschung genutzt werden.
Meine Einwilligung umfasst zudem die Verarbeitung meiner E-Mail-Adresse und Telefonnummer für den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern wie z.B. LinkedIN, Google und Meta. Hierfür darf die Vogel Communications Group die genannten Daten gehasht an Werbepartner übermitteln, die diese Daten dann nutzen, um feststellen zu können, ob ich ebenfalls Mitglied auf den besagten Werbepartnerportalen bin. Die Vogel Communications Group nutzt diese Funktion zu Zwecken des Retargeting (Upselling, Crossselling und Kundenbindung), der Generierung von sog. Lookalike Audiences zur Neukundengewinnung und als Ausschlussgrundlage für laufende Werbekampagnen. Weitere Informationen kann ich dem Abschnitt „Datenabgleich zu Marketingzwecken“ in der Datenschutzerklärung entnehmen.
Falls ich im Internet auf Portalen der Vogel Communications Group einschließlich deren mit ihr im Sinne der §§ 15 ff. AktG verbundenen Unternehmen geschützte Inhalte abrufe, muss ich mich mit weiteren Daten für den Zugang zu diesen Inhalten registrieren. Im Gegenzug für diesen gebührenlosen Zugang zu redaktionellen Inhalten dürfen meine Daten im Sinne dieser Einwilligung für die hier genannten Zwecke verwendet werden. Dies gilt nicht für den Datenabgleich zu Marketingzwecken.
Recht auf Widerruf
Mir ist bewusst, dass ich diese Einwilligung jederzeit für die Zukunft widerrufen kann. Durch meinen Widerruf wird die Rechtmäßigkeit der aufgrund meiner Einwilligung bis zum Widerruf erfolgten Verarbeitung nicht berührt. Um meinen Widerruf zu erklären, kann ich als eine Möglichkeit das unter https://contact.vogel.de abrufbare Kontaktformular nutzen. Sofern ich einzelne von mir abonnierte Newsletter nicht mehr erhalten möchte, kann ich darüber hinaus auch den am Ende eines Newsletters eingebundenen Abmeldelink anklicken. Weitere Informationen zu meinem Widerrufsrecht und dessen Ausübung sowie zu den Folgen meines Widerrufs finde ich in der Datenschutzerklärung.
Laufzeitautomatisierung und Workload-Mobilität ermöglichen auf der Plattform-Ebene eine schnelle Anpassung an jede Störung. Dank automatisierter Reaktionen können Systeme sofort auf Ausfälle reagieren. Workload-Mobilität bedeutet, dass Anwendungen in mehreren Umgebungen bereitgestellt werden, um Kontinuität zu gewährleisten.
Auf der Anwendungs-Ebene tragen schrittweise Anpassung und kontrollierte Leistungsreduzierung dazu bei, Störungen abzufangen, sodass die Applikationen nicht vollständig ausfallen. So lässt sich ein teilweiser Ausfall überstehen, und die Auswirkungen auf Endnutzer sind minimal.
Zu den Anforderungen auf Management-Ebene gehören telemetriegestützte Richtlinien, die auf der Nutzung von Betriebsereignissen für verbesserte Governance basieren. Das Lernen aus Störungen erzeugt eine Feedback-Schleife, um Richtlinien auf der Grundlage historischer Daten zu verfeinern, sodass der antifragile Ansatz kontinuierlich gestärkt wird.
Schritt für Schritt zur Cyberresilienz
Insgesamt erweitert der antifragile Ansatz für Cyberresilienz den Umfang der Wiederherstellung von „sich erholen“ zu „sich erholen, schnell lernen und stärker werden“. So sind Vorfälle nicht mehr ein Problem, sondern eine Möglichkeit zur Weiterentwicklung und Optimierung der Architektur. Allerdings sollten die Maßnahmen schrittweise eingeführt werden, da ein solcher umfassender Ansatz nicht auf einen Schlag entsteht, sondern durch kleine, messbare Veränderungen. Dann lernen Unternehmen schnell und verbessern stetig ihre Cyberresilienz.
Über den Autor: Chris Dercks ist Regional VP CEE bei F5.