Unternehmensweites Disaster Recovery bezeichnet die Gesamtheit der Technologien und Verfahren, die Daten und Systeme nach einer Betriebsunterbrechung wiederherstellen und so eine messbare Betriebskontinuität für Großunternehmen gewährleisten.
Disaster Recovery dient der Wiederherstellung von Daten, Anwendungen und IT-Systemen nach Ausfällen, Cyberangriffen oder Katastrophenereignissen. Damit dies effektiv funktioniert, müssen Parameter wie akzeptable Wiederherstellungszeiten und -punkte im Voraus festgelegt und die für die Unternehmensanforderungen am besten geeignete Umgebung ausgewählt werden: Cloud, On-Premise oder Hybrid. Dies ist nicht zu verwechseln mit der Geschäftskontinuität, die einen umfassenderen Geltungsbereich hat und auch Prozesse, Mitarbeiter, Standorte und organisatorische Ressourcen einschließt. Die zunehmende Bedeutung all dessen wird durch europäische Vorschriften unterstrichen, die Betriebskontinuität und digitale Resilienz zu strengen Anforderungen machen. Schließlich ist es bei der Beauftragung eines externen Partners von entscheidender Bedeutung, Service-Level-Agreements (SLAs), Verantwortlichkeiten, Interventionsverfahren und etwaige Vertragsstrafen klar zu definieren.
Für ein Unternehmen ist ein Systemausfall kein isoliertes technisches Problem: Es handelt sich um einen betrieblichen Verlust, der sich in Arbeitsstunden, blockierten Aufträgen und dem Vertrauen der Kunden bemisst. Ein Hardwareausfall, ein Ransomware-Angriff oder ein einfacher menschlicher Fehler können die Kerndienste innerhalb weniger Minuten zum Erliegen bringen. Unter Disaster Recovery versteht man die Wiederherstellung von Daten, Anwendungen und Infrastruktur innerhalb vorhersehbarer und dokumentierter Zeiträume.
Und genau an dieser Stelle hört Disaster Recovery auf, eine rein technische Angelegenheit zu sein, und wird zu einer strategischen Entscheidung. Es geht nicht mehr nur darum, über die richtigen Instrumente zu verfügen, um die Systeme wieder in Betrieb zu nehmen, sondern darum, Risiken zu managen und ein Unternehmen aufzubauen, das in der Lage ist, unvorhergesehene Ereignisse zu bewältigen. Denn wenn etwas schiefgeht, macht die Fähigkeit, schnell und geordnet zu reagieren, den Unterschied aus: Davon hängen die Geschäftskontinuität, das Vertrauen der Kunden und oft auch die Wettbewerbsfähigkeit des Unternehmens selbst ab.
Es lohnt sich daher, die grundlegenden Aspekte, die bei der Festlegung einer Resilienzstrategie zu berücksichtigen sind, näher zu beleuchten: die wichtigsten Parameter für die Wiederherstellung, den Vergleich zwischen Cloud-, On-Premise- und Hybrid-Architekturen, die europäischen regulatorischen Anforderungen sowie die Kriterien für die Auswahl eines zuverlässigen Infrastrukturpartners.
Das Ziel besteht nicht darin, die fortschrittlichste Technologie einzusetzen, sondern das Schutzniveau an den Wert der jeweiligen Dienstleistung anzupassen.
Was ist Disaster Recovery?
Disaster Recovery ist der strukturierte Prozess, der Daten, Anwendungen und Systeme nach einem kritischen Ereignis innerhalb festgelegter und überprüfbarer Zeiträume wiederherstellt.
Jedes Unternehmen ist auf digitale Dienste angewiesen, die nicht lange ausfallen dürfen: Unternehmenssoftware, E-Commerce-Plattformen oder Kundendatenbanken sind kritische Ressourcen, und die Notfallwiederherstellung kommt zum Tragen, wenn diese Systeme nicht mehr verfügbar sind. Ihre Aufgabe besteht nicht nur darin, Daten zu sichern, sondern auch festzulegen, wie und in welcher Zeit diese wieder online gestellt werden sollen: Hierin liegt der Unterschied zu einem einfachen Backup, das lediglich eine Kopie aufbewahrt, während die Notfallwiederherstellung die vollständige Wiederherstellung der Betriebsumgebung – einschließlich Servern, Netzwerken und Anwendungen – koordiniert. Es schützt vor verschiedenen Ereignissen, von Hardwareausfällen über Cyberangriffe bis hin zu menschlichen Fehlern, stets mit einem Ziel vor Augen: die Wiederherstellung des Betriebs innerhalb der vereinbarten Fristen und mit minimalem Datenverlust. Nicht zu verwechseln mit der Geschäftskontinuität (Business Continuity), einem umfassenderen Konzept, das die gesamte Kontinuität der Unternehmensprozesse abdeckt, einschließlich Mitarbeiter, Standorte und Lieferanten.
Warum die Disaster Recovery im Unternehmen eine unternehmensweite Priorität darstellt
Die Notfallwiederherstellung hat oberste Priorität, da die Kosten eines Systemausfalls mit der Größe des Unternehmens und der Abhängigkeit von digitalen Diensten steigen.
Für ein Unternehmen ist die entscheidende Frage nicht technischer, sondern wirtschaftlicher Natur: Wie viel kostet eine Stunde Ausfallzeit der Kernsysteme? Die Antwort umfasst entgangene Umsätze, Vertragsstrafen, Reputationsschäden, Wiederherstellungskosten und das Risiko eines dauerhaften Datenverlusts. Ein klar definiertes Serviceniveau, das in einem SLA festgehalten ist, wandelt diese Variablen in messbare Verpflichtungen um; ohne eine dokumentierte Disaster-Recovery-Strategie hingegen geht das Unternehmen ein Risiko ein, das es weder quantifizieren noch rechtfertigen kann.
In einem Umfeld, das zunehmend von digitalen Technologien geprägt ist, gehören Daten zudem zu den wertvollsten Vermögenswerten eines Unternehmens: Sie bilden das Informationskapital, auf dem die betrieblichen Prozesse, strategischen Entscheidungen, Beziehungen zu Kunden und Lieferanten sowie die Erbringung von Dienstleistungen beruhen. Ihre Integrität, Vertraulichkeit und Verfügbarkeit sind mittlerweile entscheidende Faktoren für die Betriebskontinuität und die Wettbewerbsfähigkeit, und eine Kompromittierung kritischer Informationen oder eine schlecht bewältigte Unterbrechung der IT-Dienste kann – mitunter irreversibel – die Fähigkeit des Unternehmens, seine Geschäftstätigkeit fortzusetzen, beeinträchtigen. Wirtschaftliche Verluste, Sanktionen, die anhaltende Nichtverfügbarkeit von Daten und Infrastrukturen sowie Reputationsschäden haben Auswirkungen, die weit über die technische Störung hinausreichen. Deshalb ist es heute mehr denn je unerlässlich, über eine solide Disaster-Recovery-Strategie zu verfügen, um die strategischen Ziele des Unternehmens zu sichern.
Laut dem Uptime Institute (Annual Outage Analysis 2024) geben 54 % der Unternehmen an, dass die letzte nennenswerte Betriebsunterbrechung Kosten von über 100.000 Dollar verursacht hat. Für ein Großunternehmen wird die Notfallwiederherstellung dadurch zu einer Entscheidung im Rahmen des Risikomanagements und nicht zu einem optionalen Aufwand.
Wie viel kostet ein Betriebsausfall ein Großunternehmen?
Jüngsten Branchenstudien zufolge können in Italien die Kosten für große Unternehmen, die durch eine einstündige Ausfallzeit einer geschäftskritischen Anwendung entstehen, 90.000 Euro übersteigen, während die Kosten für kleine und mittlere Unternehmen zwar geringer ausfallen, dennoch mehrere Tausend Euro pro Ausfallstunde betragen können.
Die Kosten eines Ausfalls hängen von der Branche und der Kritikalität des Dienstes ab, belaufen sich jedoch für viele Unternehmensorganisationen auf mehrere Zehntausend Euro pro Stunde der Nichtverfügbarkeit. Diese Zahlen steigen in den Bereichen Finanzwesen, Gesundheitswesen und Fertigung, wo Ausfälle Transaktionen oder Produktionslinien zum Erliegen bringen. Wie Data Center Dynamics berichtet, sind Ausfälle im Jahr 2024 zwar seltener geworden, aber kostspieliger. Dieser Trend kommt denjenigen zugute, die bereits vor dem Vorfall in Ausfallsicherheit investieren.
Wie erstellt man einen Notfallwiederherstellungsplan (DRP)?
Ein Notfallwiederherstellungsplan legt die Maßnahmen fest, die im Falle einer Katastrophe zu ergreifen sind. Es ist unerlässlich, gut vorbereitet zu sein: Der Trend zeigt, dass diejenigen im Vorteil sind, die bereits vor dem Vorfall angemessen in Resilienz investieren. Bei der Ausarbeitung des Plans sind verschiedene Punkte zu berücksichtigen und zu analysieren.
- Was wiederhergestellt werden soll: Diese Entscheidung ergibt sich aus der Analyse der Kritikalität der verschiedenen Geschäftsprozesse, der beteiligten IT-Ressourcen und der damit verbundenen Risiken. Vorrang haben stets die Systeme und Daten, die für die Aufrechterhaltung der wesentlichen Geschäftsprozesse unverzichtbar sind. Es reicht jedoch nicht aus, nur die einzelnen Dienste zu betrachten: Man muss auch berücksichtigen, wie diese miteinander verflochten sind, da oft der eine vom anderen abhängt. Nur unter Berücksichtigung dieser Zusammenhänge lässt sich eine geordnete Wiederherstellungsreihenfolge festlegen, die den Betrieb des Unternehmens wirklich wieder in Gang bringt, ohne dass es zu Ausfällen kommt.
- Wiederherstellungszeiten und -punkte: Legen Sie im Voraus akzeptable Wiederherstellungszeiten (RTO) und -punkte (RPO) fest, um die Geschäftskontinuität zu gewährleisten.
- Architekturen und Strategien: Welche Disaster-Recovery-Lösungen sollten implementiert werden, wobei zwischen Cloud-, On-Premise- und Hybridumgebungen abgewogen werden muss; welche Hardware- und Softwareprodukte sollten eingesetzt werden? Das Ziel besteht nicht darin, die ausgefeilteste und teuerste Technologie einzusetzen, sondern das Schutzniveau an den Wert jedes einzelnen Dienstes anzupassen.
- Geschäftskontinuität: Hierbei handelt es sich um ein umfassenderes Konzept, in dessen Rahmen die Notfallwiederherstellung (Disaster Recovery) angesiedelt ist, die daher im Gesamtkontext der Geschäftskontinuität und der Cybersicherheit synergetisch eingebunden werden muss. Es umfasst Geschäftsprozesse, Mitarbeiter, Standorte und organisatorische Ressourcen.
- Rechtliche Rahmenbedingungen: Nationale und europäische Richtlinien und Verordnungen, die sich direkt oder indirekt auf die Ausarbeitung des Notfallwiederherstellungsplans auswirken und mehr oder weniger strenge Anforderungen vorgeben.
- Partner: Die Wahl des Partners ist von entscheidender Bedeutung, da mit ihm Service-Level-Vereinbarungen (SLA), Zuständigkeiten, Interventionsverfahren und etwaige Vertragsstrafen festgelegt und dokumentiert werden müssen.
- Tests und Übungen: Es ist erforderlich, regelmäßig zu überprüfen, ob der Notfallwiederherstellungsplan ordnungsgemäß und reibungslos funktioniert, indem die Leistung gemessen und etwaige Aspekte, die seine Wirksamkeit beeinträchtigen, im Sinne einer kontinuierlichen Verbesserung korrigiert werden. Schulungen und Sensibilisierungsmaßnahmen spielen in dieser Phase eine Schlüsselrolle.
- Failback: Ein Aspekt, der bei der DR-Planung oft übersehen wird, der jedoch von großer Bedeutung ist. Dies ist der Zeitpunkt der „Rückkehr zur Normalität“, an dem der Notfall beendet ist, alle Primärsysteme wiederhergestellt wurden und die Rückkehr zum Hauptproduktionsstandort erfolgen muss, wobei die Synchronisation mit den Produktionsdaten gewährleistet werden muss, die in der Zwischenzeit im DR aktualisiert wurden.
Garantisci la continuità operativa della tua infrastruttura IT
Ogni fase alimenta la successiva, senza interruzioni.
Kontextanalyse, Risikobewertung und BIA: Das Bewertungsrahmenwerk
Bevor Sie entscheiden, was und wie Sie schützen möchten, müssen Sie das Unternehmen gründlich kennenlernen. Dabei handelt es sich um einen Prozess in drei klar voneinander abgegrenzten, aber miteinander verbundenen Phasen, wobei jede Phase einer bestimmten Frage gewidmet ist. Die Kontextanalyse beantwortet die Frage „Was soll geschützt werden?“: Sie erfasst Prozesse, Dienste, Infrastrukturen, Rollen und gesetzliche Auflagen und definiert damit den Umfang des Plans. Die Risikobewertung beantwortet die Frage „Vor welchen Risiken?“: Sie identifiziert und bewertet Bedrohungen – von Naturkatastrophen über Ausfälle bis hin zu Cyberangriffen – und schätzt deren Wahrscheinlichkeit und Schweregrad ein, um Präventionsmaßnahmen wie Redundanz, Datensicherung und Datenreplikation auszurichten. Die Business-Impact-Analyse beantwortet die Frage „Mit welchen Folgen?“: Sie misst die wirtschaftlichen, betrieblichen, regulatorischen und rufbezogenen Auswirkungen der Nichtverfügbarkeit jedes einzelnen Prozesses und legt die Prioritäten für die Wiederherstellung fest.
Die Zuordnung eines wirtschaftlichen Werts zu den Risiken hilft zudem dabei, Investitionen richtig einzuschätzen, indem die Kosten einer potenziellen Katastrophe mit denen der Gegenmaßnahmen verglichen und die Gesamtbetriebskosten (TCO) optimiert werden. Zusammen bieten diese drei Phasen alles, was für eine effektive Disaster-Recovery-Strategie erforderlich ist, die genau auf die tatsächlichen Bedürfnisse des Unternehmens zugeschnitten ist.
Festlegung der Wiederherstellungszeiten in einem Notfallwiederherstellungsplan
Ein Notfallwiederherstellungsplan wird anhand einiger Schlüsselparameter gemessen, die die Wiederherstellungsziele in konkrete Zahlen umsetzen. Die beiden wichtigsten sindder RTO (Recovery Time Objective), also die maximale Zeitspanne, innerhalb derer ein Dienst wieder betriebsbereit sein muss, unddas RPO (Recovery Point Objective), d. h. die maximale Datenmenge, deren Verlust sich das Unternehmen leisten kann, ausgedrückt als Zeitspanne zwischen der letzten brauchbaren Sicherung und dem Zeitpunkt des Ausfalls. Hinzu kommtdie MTD (Maximum Tolerable Downtime), die die maximal tolerierbare Ausfallzeit angibt, bevor der Schaden untragbar wird. Praktisch gesehen sind RTO und RPO die beiden Maßstäbe, anhand derer die Zuverlässigkeit eines Plans bewertet wird: Der erste gibt an, wie schnell der Betrieb wieder aufgenommen wird, der zweite, wie viele Daten dabei möglicherweise verloren gehen.
Beispiele für RPO und RTO
Was den RPO betrifft, so variieren die Werte je nachdem, wie viele Daten das Unternehmen zu verlieren bereit ist. Ein RPO von 0 Sekunden bedeutet, dass keinerlei Datenverlust akzeptabel ist und eine synchrone Datenreplikation erforderlich ist; ein RPO von 5 Minuten bedeutet, dass im Katastrophenfall höchstens die Daten der letzten 5 Minuten verloren gehen können; bei einem RPO von 1 Stunde wird der Verlust von bis zu einer Stunde an Daten in Kauf genommen, während bei einem RPO von 24 Stunden ein einfaches tägliches Backup ausreicht.
Der RTO hingegen definiert die Geschwindigkeit der Wiederherstellung. Ein RTO von 0 lässt keinerlei Unterbrechung zu: Das schädliche Ereignis wird faktisch verhindert, wie dies bei Hochverfügbarkeitssystemen, in Active-Active-Architekturen und bei automatischen Failover-Mechanismen der Fall ist. Ein RTO von 5 Minuten toleriert einen Ausfall des Dienstes von gleicher Dauer, während ein RTO von 1 Stunde typisch für weniger kritische Dienste ist. Bei nicht essenziellen Diensten oder selten abgerufenen Archiven schließlich können Wiederherstellungszeiten von sogar einem oder mehreren Tagen akzeptiert werden.
DR-Architekturen: Cloud, On-Premise oder Hybrid – welche Variante ist die richtige?
In der Regel hängt die Entscheidung zwischen einer Cloud-basierten, einer lokalen oder einer hybriden Disaster-Recovery-Lösung von den geforderten Wiederherstellungszeiten, den Vorgaben zur Datenhoheit, dem vom Unternehmen gewählten Kostenmodell und ganz allgemein von den Ergebnissen der zuvor beschriebenen Analysephasen ab.
Die drei Architekturen erfüllen unterschiedliche Anforderungen. Bei der lokalen Notfallwiederherstellung (Disaster Recovery on-Premise) werden die Daten an einem eigenen sekundären Standort repliziert. Bei der Cloud-basierten Notfallwiederherstellung, auch bekannt als „Disaster Recovery as a Service“ (DRaaS), werden die Replikation und die Wiederherstellung einem Anbieter auf einer verwalteten Infrastruktur übertragen. Der hybride Ansatz kombiniert beide Modelle, wobei kritische Daten lokal gespeichert bleiben und die Wiederherstellungskapazitäten an die Cloud delegiert werden. Die folgende Tabelle vergleicht die Kriterien, die bei der technischen Bewertung am stärksten ins Gewicht fallen.
Confronto dei modelli di Disaster Recovery
| Criterio | DR on-premise | DR cloud (DRaaS) | DR ibrido |
|---|---|---|---|
| Modello di costo | Prevalentemente CAPEX | Prevalentemente OPEX | Misto CAPEX e OPEX |
| Tempo di ripristino tipico | Da ore a giorni | Da minuti a ore | Da minuti a ore |
| Investimento iniziale | Elevato | Contenuto | Medio |
| Scalabilità | Limitata dall’hardware | Elevata e on-demand | Buona |
| Sovranità del dato | Controllo totale | Dipende dal provider | Bilanciata |
| Gestione operativa | A carico del team interno | Delegata al provider | Condivisa |
Die Cloud-basierte Notfallwiederherstellung ist daher sinnvoll, wenn das Unternehmen kurze Wiederherstellungszeiten benötigt, ohne in ein zweites Rechenzentrum investieren zu müssen. Das nutzungsbasierte Modell senkt die Fixkosten und lässt sich an den jeweiligen Bedarf anpassen. Eine On-Premise-Lösung ist weiterhin vorzuziehen, wenn datenhoheitliche Auflagen oder sehr strenge Latenzanforderungen eine direkte Kontrolle über die Infrastruktur erfordern. Unternehmen, die sich für einen hybriden Ansatz entscheiden, versuchen, die Vorteile dieser beiden Architekturen in Einklang zu bringen.
Wie lassen sich Disaster Recovery und Geschäftskontinuität miteinander verbinden?
Disaster Recovery und Business Continuity werden ausgehend von der Analyse der Auswirkungen auf den Geschäftsbetrieb miteinander verknüpft; diese legt die Prioritäten für die Wiederherstellung sowie die organisatorischen Prozesse fest, die im Notfall zu aktivieren sind.
Disaster Recovery und Business Continuity sind unterschiedliche, sich jedoch ergänzende Konzepte. Ersteres betrifft die technische Wiederherstellung von Daten und Systemen nach einem kritischen Vorfall; Letzteres hat einen umfassenderen Geltungsbereich, da es darauf abzielt, den gesamten Betrieb des Unternehmens aufrechtzuerhalten, wobei Mitarbeiter, Ausweichstandorte, Lieferanten und Notfallverfahren einbezogen werden. Die Notfallwiederherstellung ist somit die technische Komponente eines umfassenderen Kontinuitätsplans: Eine schnelle Wiederherstellung nützt wenig, wenn die Organisation nicht in der Lage ist, diese zu nutzen.
Aus diesem Grund beginnt ein wirksamer Plan bei den Menschen und den Prozessen, nicht bei der Technologie. Die Business Impact Analysis ermittelt die kritischen Prozesse und die tolerierbaren Ausfallzeiten, aus denen sich die technischen Anforderungen sowie die RTO- und RPO-Werte ableiten. Die Festlegung der Strategie bedeutet, diese Ergebnisse in konkrete Lösungen umzusetzen und dabei Schutz und Kosten in Einklang zu bringen: von der Datensicherung bis zur Echtzeit-Replikation, von redundanten Infrastrukturen bis zum sekundären Standort (Cold, Warm oder Hot) sowie bis hin zur Cloud und zu Failover-Mechanismen. Die Wahl hängt von der Kritikalität der Dienste ab – von redundanten Systemen mit automatischem Failover für die kritischsten Anwendungen bis hin zu einfachen regelmäßigen Backups für weniger dringende Dienste.
Von Bedeutung sind zudem die Betriebsabläufe: klare und dokumentierte Anweisungen dazu, wie der Vorfall erfasst, der Notfall ausgerufen, der Disaster-Recovery-Standort aktiviert, Systeme und Daten wiederhergestellt und das Failback abgewickelt werden. Dazu gehört auch der Kommunikationsplan, der festlegt, wer zu welchem Zeitpunkt zu informieren ist, um Techniker, Geschäftsleitung, Nutzer und, falls erforderlich, Lieferanten, Kunden sowie Behörden zu koordinieren. Von entscheidender Bedeutung ist schließlich die Überwachung: Automatische Tools, die Verfügbarkeit, Leistung, den Status von Replikaten und Backups sowie mögliche Angriffe überwachen und Warnmeldungen ausgeben, die es ermöglichen, einzugreifen, bevor aus der Störung ein Ausfall wird.
Notfallwiederherstellung und Compliance: Was schreiben die europäischen Vorschriften vor?
Die europäischen Vorschriften NIS2 (Network and Information Security 2) und DORA (Digital Operational Resilience Act) haben die Messlatte höher gelegt: Für viele Organisationen sind Betriebskontinuität, Vorfallmanagement und digitale Widerstandsfähigkeit keine optionalen Maßnahmen mehr, sondern verbindliche Verpflichtungen, die es einzuhalten gilt.
Die Geschäftskontinuität ist nicht mehr nur eine bewährte Praxis: Für viele Organisationen ist sie zu einer gesetzlichen Verpflichtung geworden. Die europäische NIS2-Richtlinie, die in Italien im Jahr 2024 umgesetzt und ab 2025 vollständig anwendbar ist, schreibt Risikomanagementmaßnahmen, Verfahren zur Reaktion auf Vorfälle und die Meldung an die zuständigen Behörden vor, sowie die Bewertung der Sicherheit kritischer Lieferanten, von Konnektivitätsanbietern bis hin zu Managed Services. Die ab 2025 geltende DORA-Verordnung erweitert ähnliche Anforderungen auf den Finanzsektor, wobei der Schwerpunkt auf der digitalen Betriebsresilienz und der Überwachung von Anbietern liegt. In beiden Fällen ist ein getesteter Notfallwiederherstellungsplan fester Bestandteil der Konformitätsdokumentation, und die Nichteinhaltung führt zu Sanktionen sowie zur direkten Haftung der Führungsgremien.
Es geht nicht nur um formale Auflagen. Laut ENISA (Threat Landscape 2024) stehen Bedrohungen der Verfügbarkeit und Ransomware an der Spitze der sieben größten Bedrohungen unter mehr als 11.000 analysierten Vorfällen. Angesichts von DDoS-Angriffen und böswilliger Datenverschlüsselung wird die Fähigkeit, Dienste schnell wiederherzustellen, zu einer Sicherheitsanforderung und nicht mehr nur zu einer Anforderung der Geschäftskontinuität.
Welche Verpflichtungen sieht NIS2 hinsichtlich der Betriebskontinuität vor?
NIS2 führt die Verpflichtung ein, technische und organisatorische Maßnahmen zur Bewältigung von Risiken für die Sicherheit von Netzwerken und Informationssystemen zu ergreifen. Dazu gehören Verfahren zur Geschäftskontinuität, zum Krisenmanagement und zur Notfallwiederherstellung. Darüber hinaus müssen Organisationen die Sicherheit kritischer Lieferanten bewerten, einschließlich Anbietern von Konnektivität und Managed Services. Die Nichteinhaltung der Vorschriften zieht Sanktionen nach sich und führt zu einer Haftung der Geschäftsleitung.
Die Auswahl eines Partners für die Notfallwiederherstellung: Von den Kosten bis zum geschäftlichen Nutzen
Ein Partner für die unternehmensweite Notfallwiederherstellung wird anhand garantierter Wiederherstellungszeiten, Zertifizierungen der Rechenzentren, der Transparenz der Service-Levels und der Fähigkeit, den Plan regelmäßig zu testen, bewertet.
Die Wahl des Partners entscheidet über die tatsächliche Zuverlässigkeit des Plans. Ein solider Anbieter dokumentiert seine SLAs durch vertragliche Strafklauseln und nicht durch mündliche Zusicherungen. Zertifizierte Rechenzentren und die geografische Trennung der Standorte verringern das Risiko eines einzelnen Ausfallpunkts. Das Auswahlkriterium kann einer bedingten Logik folgen. Wenn das Unternehmen zahlreiche Standorte betreibt und eine Wiederherstellungszeit von weniger als zwei Stunden benötigt, ist eine verwaltete geografische Cloud-Disaster-Recovery-Lösung die am besten geeignete Option. Unterliegen die Daten hingegen strengen Hoheitsauflagen, ist eine Hybridarchitektur mit Replikation auf zertifizierte Rechenzentren vorzuziehen.
- Service-Levels: Überprüfung der vertraglich garantierten RTO- und RPO-Werte mit nachvollziehbarer Berichterstattung.
- Zertifizierungen: Überprüfen Sie die Zertifizierungen der Rechenzentren und die Einhaltung der gesetzlichen Vorschriften durch den Anbieter.
- Geografische Trennung: Stellen Sie sicher, dass sich die Wiederherstellungsstandorte physisch vom Primärstandort entfernt befinden.
- Tests und Abnahme: Fordern Sie dokumentierte Benchmark-Ergebnisse und Wiederherstellungstests (Proof of Concept) an, nicht nur theoretische Aussagen.
Ziehen Sie einen Partner in Betracht, der zertifizierte Rechenzentren – wie den Avalon-Campus – mit Managed Services für Datensicherung und Notfallwiederherstellung sowie dokumentierten Service-Levels kombiniert.
Häufig gestellte Fragen zur Disaster Recovery für Großunternehmen
Bei einer Datensicherung wird eine Kopie der Daten gespeichert, während bei der Notfallwiederherstellung die gesamte Betriebsumgebung wiederhergestellt wird. Eine Datensicherung beantwortet die Frage: „Verfüge ich über eine Kopie der Daten?“. Die Notfallwiederherstellung beantwortet die Frage: „Wie lange dauert es, bis der Betrieb wieder aufgenommen werden kann?“. Die Datensicherung ist somit ein notwendiger, aber nicht ausreichender Bestandteil einer Strategie zur Geschäftskontinuität.
Ein Notfallwiederherstellungsplan für Unternehmen sollte mindestens ein- bis zweimal im Jahr sowie nach jeder wesentlichen Änderung an der Infrastruktur getestet werden. Durch die Tests wird sichergestellt, dass die angegebenen Wiederherstellungszeiten realistisch sind und die Verfahren auf dem neuesten Stand sind. Ein nicht getesteter Plan bietet nur scheinbare Sicherheit, da Fehler oft erst bei der tatsächlichen Durchführung zutage treten.
Für viele Organisationen ist die Notfallwiederherstellung faktisch obligatorisch, da Vorschriften wie NIS2 und DORA Maßnahmen zur Gewährleistung der Betriebskontinuität und der Ausfallsicherheit vorschreiben. Selbst dort, wo keine ausdrückliche Verpflichtung besteht, macht die Verantwortung der Führungsgremien für die Datensicherheit einen solchen Plan zu einer Notwendigkeit. Die Einhaltung der Vorschriften erfordert zudem eine nachprüfbare Dokumentation und Tests.
Das Budget für ein Disaster-Recovery-Projekt in einem Unternehmen wird ausgehend von den Kosten pro Stunde Ausfallzeit für kritische Dienste berechnet. Dieser Wert legt fest, wie viel sinnvollerweise investiert werden sollte, um RTO und RPO zu reduzieren. Anschließend werden im Rahmen der Berechnung On-Premise-, Cloud- und Hybrid-Modelle über einen mehrjährigen Zeitraum hinweg verglichen, wobei Betriebsführung, Wartung und Tests berücksichtigt werden.
Die hohe Verfügbarkeit beugt Ausfällen durch redundante Komponenten vor, während die Notfallwiederherstellung die Dienste nach einem Ausfall wiederherstellt. Die beiden Strategien ergänzen sich. Die hohe Verfügbarkeit verringert die Wahrscheinlichkeit eines Ausfalls innerhalb desselben Standorts.
In Zusammenarbeit mit Giancarlo Vadruccio, Corporate Accounts Customer Engineering, Retelit