대응 계획과 완화
인시던트 대응 계획(인시던트 응답 계획, IRP)은 특정 경보 등급에 대한 사전 작성된 gated 응답입니다. 트리거, ordered 응답 단계, activation 요구사항, 승인자 역할, 알림 채널을 선언합니다. 계획은 완화를 제안하고 라우팅할 수 있지만 직접 실행하지 않습니다.
작성 게이트
섹션 제목: “작성 게이트”모든 계획은 초안으로 시작합니다. Activation은 stop 조건, 롤백, 영향 범위(영향 radius), 승인자, 알림 채널이 모두 선언되고 충족됐는지 확인합니다. 요구사항을 생략해도 게이트를 우회할 수 없으며 계획은 inactive 상태로 남습니다.
Pretest는 resolved historical 인시던트에 대해 계획을 결정론적으로 평가합니다. 계획의 트리거 신호를 포함한 인시던트만 denominator에 들어갑니다. 과거에 기록된 resolving 액션이 계획의 응답 단계에 있으면 해당 사례가 covered 상태가 됩니다. 보고는 matched 개수, 합계 개수, unmatched 인시던트 참조를 기록합니다. 커버리지는 검토 증거이며 자동 activation이 아닙니다.
계획 activation과 액션 승격은 별개의 판단입니다. 계획을 activate한다는 것은 트리거와
응답 structure를 사용할 준비가 됐다는 뜻입니다. 참조된 ActionType을 승격하거나
risk 계층을 낮추거나 실행 권한을 부여하지 않습니다.
| 계획 관심사 | 소유 판단 | 안전한 실패 |
|---|---|---|
| Stop, 롤백, 영향 범위, 승인자, 채널 | 계획 준비 상태 게이트 | 계획을 inactive로 유지 |
| Historical 커버리지 | Pretest 검토 | 공백 기록, 자동 activate 금지 |
| 액션 안전성 및 승격 | 액션 레지스트리 및 안전성 검토 | 관찰 모드, 사람 승인 또는 거부 |
| 런타임 변경 | 실행기 검사 | No-op, 중지 또는 롤백 |
경보 대응 흐름
섹션 제목: “경보 대응 흐름”- 경보가 시간 제한이 있는 조사를 시작합니다.
- 조사가 발견된 문제와 prioritized 권고를 반환합니다.
- 조정기가 근거에 기반한 actionable 권고 중 우선순위가 가장 높은 항목을 선택합니다.
- 완화 제안을 설정된 승인 게이트로 보냅니다.
- 승인된 제안이 타입이 지정된 trust 및 risk 파이프라인에 다시 들어갑니다.
- Teams 또는 Slack이 통제된 결과를 받습니다.
기본 승인 게이트는 거부합니다. Approval 연결이 없거나 고장 나면 액션이 발생하지 않습니다.
완화하기 전에 선택지 비교하기
섹션 제목: “완화하기 전에 선택지 비교하기”타당한 완화안이 여러 개일 때, FDAI는 새벽 3시에 당직 중인 사람에게 비교를 떠넘기는 대신 그 비교를 대신 정리해 줄 수 있습니다. 전문 에이전트가 각자 담당하는 것을 제공합니다. Heimdall은 관측과 예측 근거를, Freyr는 용량과 사이징을, Njord는 제한된 비용 근거를, Loki는 요청이 있을 때 회복탄력성 시나리오를 제공하고, Mimir는 관련된 규칙과 작업 타입이 실재하고 최신인지 검증합니다.
결과는 그대로 믿어야 하는 권고가 아니라 비교표입니다. 아무것도 하지 않는 선택지를 명시적 기준선으로 포함하고, 후보 선택지들, 빠진 선택지를 제외시킨 강한 제약, 영수증이 붙은 시뮬레이션 효과, 그리고 각 선택지가 왜 탈락했는지가 함께 담깁니다. 보통 가장 쓸모 있는 항목은 후보를 무행동과 비교하는 것입니다.
적격한 선택지가 없거나, 제약을 통과한 안전한 선택지가 남지 않거나, 필요한 컨텍스트가 오래됐거나 불완전하거나 충돌하거나 잘렸을 때 계획은 선택하지 않고 보류합니다. 여기서의 보류도 실질적인 답입니다. 결정론적 경로가 어떤 선택지도 정당화하지 못했다는 뜻이기 때문입니다.
계획은 읽기 전용입니다. 근거와 제안을 만들 뿐입니다. 승인하거나 실행하거나 승격하거나 외부 효과를 주장할 수 없고, 선택된 선택지도 다른 제안과 똑같은 경로를 거칩니다. 또한 계획 기능은 배포 환경이 온톨로지 릴리스, 운영 컨텍스트, 프로세스 저장소, 효과 모델 리더, 인과 검증기를 제공할 때만 연결되므로, 항상 존재하는 기능이 아니라 선택적 기능으로 다루세요.
직무 분리 유지
섹션 제목: “직무 분리 유지”계획 조정기는 근거 있는 권고를 선택하지만 판정자, approve, execute를 모두 수행하지 않습니다. Forseti는 결정을 만들고, Var는 승인 기록을 전달하며, Thor는 privileged 실행기이고, Vidar는 롤백을 소유하며, Saga는 감사 근거를 덧붙이기합니다. Policy가 요구하는 경우 요청자, 승인자, 실행기는 서로 다른 principal로 유지됩니다. Chat 메시지나 성공한 알림 전달은 인증된 승인 결정이 아닙니다.
완화는 실행이 아님
섹션 제목: “완화는 실행이 아님”응답 단계는 ActionType을 지정하며 실행기를 호출하지 않습니다. 일반 파이프라인이
precondition, stop 조건, 영향 범위, 롤백, 모드, 잠금, 신원, 정책을 계속
검증합니다. 거부와 시간 초과는 감사되는 no-op으로 종료됩니다.
실패 동작
섹션 제목: “실패 동작”| 실패 지점 | 최종 동작 | 유지되는 증거 |
|---|---|---|
| 근거에 기반한 actionable 발견된 문제 없음 | 제안 없음 | 조사 결과 및 공백 |
| 조사 시간 초과 또는 exception | 액션 없음 | 부분 보고 및 사용 불가 근거 |
| Approval 거부 | 감사되는 no-op | Rejecting principal 및 사유 |
| Approval 시간 초과 | 감사되는 no-op 또는 에스컬레이션 | 만료 및 단계 구조 상태 |
| 라우팅 또는 알림 실패 | 영속 재시도 또는 에스컬레이션 | 전달 시도, 승인 아님 |
| 실행 중 stop 조건 | 중지 후 보상 정책 적용 | 단계 결과 및 롤백 참조 |
응답 없는 에스컬레이션 기한 이후 유효한 standing 권한 확인이 적용되더라도 계획이 직접 실행하지 않습니다. Supervisor는 pending 타입이 지정된 액션을 새 안전성 검토 판단에 제출합니다. 만료된 권한 확인, stale 인벤토리, 넓어진 영향 범위, 묶음 mismatch는 no-op으로 종료됩니다.
다음 단계
섹션 제목: “다음 단계”| 학습 대상 | 문서 |
|---|---|
| 증거를 수집하는 방법 | 분류와 조사 |
| 승인 경로를 선택하는 방법 | 온콜과 에스컬레이션 |
| 타입이 지정된 액션이 안전을 유지하는 방법 | 에이전트 기반 자동화 |
| 운영자 절차 | SRE 런북 |