콘텐츠로 이동

재해 복구와 훈련

재해 복구(Disaster 복구, DR)는 장애가 나기 전에 복구 경로를 연습하고 측정해 봐야 믿을 수 있습니다. FDAI는 범위를 정한 훈련을 예약하고, 격리된 대상으로 복원하고, 복구 목표를 검증하고, 정리 작업과 감사 근거를 기록합니다.

훈련에는 보호 대상 워크로드, 목표 RPO와 RTO, 훈련 시간대, 격리된 복원 위치, 소유자, 중단 조건, 영향 범위, 정리 계획, 필요한 근거를 적습니다. 검증용 복원이 운영 데이터를 덮어쓰는 일은 없습니다.

  1. 백업 준비 상태, 복원 시간대, 자격 증명, 할당량, 복원 위치의 격리 상태를 확인합니다.
  2. 복원 시점을 고르고 예상 RPO를 기록합니다.
  3. 새로 격리한 리소스 그룹이나 그에 준하는 범위로 복원합니다.
  4. 연결, 스키마, 무결성, 애플리케이션 수준 검증을 실행합니다.
  5. 실제로 달성한 RPO와 RTO를 목표와 비교해 측정합니다.
  6. 근거를 기록하고 임시 리소스를 지운 뒤, 정리가 끝났는지 확인합니다.

원본 자격 증명이 모호하거나, 복원 위치가 운영 환경을 건드릴 수 있거나, 백업 메타데이터가 없거나, 검증이 덜 끝났거나, 정리를 보장할 수 없으면 훈련을 중단합니다. 실패한 훈련은 복구 공백을 보여 주는 근거이지, 워크로드를 정상으로 표시할 이유가 아닙니다.

지금까지는 여러분의 워크로드를 복구하는 이야기였습니다. FDAI의 컨트롤 플레인은 별개의 복구 문제이고, 리전 장애 상황에서는 그 차이가 중요해집니다.

워크로드 복원이 실패해도 컨트롤 플레인이 살아 있으면 그것을 감지하고 판단하고 기록할 수 있습니다. 반대로 컨트롤 플레인이 내려가면 그중 아무것도 일어나지 않습니다. 새 결정도, 감사 기록도, 워크로드 복구가 성공했는지에 대한 측정도 없습니다. 그래서 두 경로는 각자의 계획과 근거와 훈련을 따로 가집니다.

컨트롤 플레인 장애 조치는 복구 에포크(복구 에포크) 로 차단됩니다. 장애 조치가 어떤 리전에 권한을 넘길 때마다 증가하는 카운터입니다. 세대 번호라고 생각하면 됩니다. 새 리전은 자기 에포크 동안 배타적 쓰기 권한을 가지고, 이전 리전은 차단됩니다. 더 낮은 에포크를 들고 도착한 쓰기는 적용되지 않고 거부됩니다. 재시도해도 안전한 전환 키와 함께라면, 두 리전이 서로 자기가 주도권을 쥐었다고 믿고 같은 복구를 두 번 실행하는 최악의 상황을 막습니다.

현재 기준선: 영역 중복성을 갖춘 단일 리전, 백업과 가용성 게이트, 복구 계획 리듀서와 코디네이터, 복원 검증, 예약 훈련 작업이 준비돼 있습니다. 대체 리전 인프라, 트래픽 장애 조치, 이벤트 데이터 연속성, 측정된 장애 조치 및 복귀 근거는 각자의 게이트를 통과해야 하는 배포 작업입니다. 그때까지는 단일 리전 기준선을 전제로 런북을 준비하세요.

새로 만든 훈련 자동화는 관찰 모드에서 시작합니다. 주기는 스케줄러가, 범위와 실행 자격은 안전성 검토가, 증명은 감사 로그가 맡습니다. 승격하려면 반복해서 성공해야 하고, 정책을 우회한 사례가 한 건도 없어야 합니다.

알아볼 내용문서
데이터베이스 상세 절차DB 재해 복구 복원 훈련
장애 주입이 재해 복구를 보완하는 방법카오스 엔지니어링
복구를 측정하는 방법SRE 성과 측정
회복탄력성 기능회복탄력성