SRE 기초(SRE foundations)
FDAI는 사이트 신뢰성 엔지니어링(Site Reliability Engineering, SRE) 업무를 자율화하는 컨트롤 플레인입니다. SRE 분야는 반복되는 기능 집합을 정의합니다. 시스템을 관찰하고, 회귀를 잡아내고, 변경을 안전하게 배포하고, 용량을 계획하고, 비용을 통제하고, 재해에 대비하고, 토일(toil)을 제거하는 것입니다. FDAI는 이 기능들을 유지하되 누가 실행하는지를 바꿉니다. 반복 가능한 사례는 규칙 기반 처리 후보가 되고, 새롭거나 고위험이거나 근거가 부족한 사례에는 사람이 계속 참여합니다. 실제 자율 처리 커버리지는 관찰 모드 평가와 승격 후에 측정합니다.
이 페이지에서는 FDAI가 다루는 SRE 기능, 각 기능이 하는 일, 메커니즘을 자세히 읽을 위치를 한눈에 보여 줍니다.
FDAI가 자동화하는 기능
섹션 제목: “FDAI가 자동화하는 기능”| SRE 기능 | FDAI에서 하는 일 | 버티컬 / 소유자 |
|---|---|---|
| 모니터링과 관측성 | 리소스 변경 신호, Activity Log 이벤트, 탐지 결과를 수집해 인시던트로 연계 | Heimdall, Huginn |
| 인시던트 탐지와 대응 | 각 신호를 신뢰도로 라우팅하고, 판정을 내리고, 실행하거나 에스컬레이션 | trust-router, Forseti |
| 변경 관리 | 제안된 모든 변경을 배포 전 policy-as-code에 대해 게이트 | 변경 안전성 |
| 용량과 성능 | 사이징 격차를 탐지하고 측정된 수요에 맞춘 승격된 스케일 액션을 제안 또는 실행 | Freyr, 비용 거버넌스 |
| 비용과 효율 | 지출 이상을 탐지하고 승격된 낭비 제거 후보를 평가 | Njord, 비용 거버넌스 |
| 신뢰성과 재해 복구 | 승격된 DR 훈련, DB 복원 훈련, 범위가 제한된 카오스 실험을 계획 및 실행 | 복원력, Loki, Vidar |
| 토일 제거 | 검증된 반복 사례를 수동 처리에서 결정론 규칙으로 전환 | deterministic-first |
| 포스트모템과 학습 | 모든 액션에 추가 전용 감사 기록을 남기고 운영 신호에서 카탈로그 갱신 제안 | Saga, Norns |
모니터링과 관측성
섹션 제목: “모니터링과 관측성”FDAI는 폴링 대시보드가 아니라 이벤트 기반입니다. 리소스 변경, Activity Log 이벤트, 이상 또는 예측 탐지 결과가 이벤트 버스로 도착합니다. 센싱 에이전트들이 이를 정규화하고 중복을 제거하고 연계해 인시던트로 묶어, 하나의 근본 이벤트가 열 개의 증상으로 집계되지 않도록 합니다.
예시: 하나의 실패한 배포에서 다섯 개 알림이 발생 -> 수집기가 공유 리소스 키로 연계 -> 다섯 개가 아니라 하나의 인시던트가 루프에 진입.
인시던트 탐지와 대응
섹션 제목: “인시던트 탐지와 대응”연계된 모든 이벤트는 trust-router가 점수를 매기고 판단할 수 있는 가장 낮은 티어를 선택합니다(risk-tiers-ko.md). 결정론적으로 처리할 수 있는 사례는 모델 호출 없이 T0에서 판정하고 모호한 사례는 에스컬레이션합니다. 이상이나 예측은 안전성 검토가 관리하는 탐지 결과를 만들 뿐 스스로 액션을 자동 실행하지 않습니다.
탐지 결과는 액션이 아니다
섹션 제목: “탐지 결과는 액션이 아니다”이상, 예측, 상관 관계, 근본 원인 결과는 증거입니다. 다른 이벤트와 동일하게 trust-router와
안전성 검토를 통과합니다. 유효한 ActionType이 안전 계약을 제공하고 검증, 범위, 잠금,
승인 요구 사항을 모두 통과해야 실행 가능한 액션이 됩니다.
예시: 예측기가 용량 부족을 예측 -> Freyr가 탐지 결과 생성 -> 라우터가 티어 선택 -> 안전성 검토가 제안된 스케일 작업을 평가 -> 결과는 관찰 모드, 사람 승인, 또는 이미 승격된 작업이라면 자동 실행입니다. 예측 자체가 워크로드를 스케일하지는 않습니다.
추론 티어는 자율성 수준이 아니다
섹션 제목: “추론 티어는 자율성 수준이 아니다”FDAI는 자율성을 높이지 않는 두 가지 판단을 수행합니다. 먼저 트러스트 라우터가 근거 있는
후보를 만들 수 있는 가장 낮은 티어를 고릅니다. 다음으로 안전성 검토가 그 티어를 일치한
정책, ActionType 상한, 선언된 영향 범위와 실시간 영향 범위, 환경, 운영자 역할, 근거
최신성, 승격 상태와 함께 봅니다. 각 입력은 자율성을 낮출 수 있지만, 더 엄격한 입력보다
높일 수는 없습니다.
| 후보 출처 | 증명하는 내용 | 증명하지 않는 내용 |
|---|---|---|
| T0 룰 일치 | 결정론 룰이 적용된다는 사실 | 작업이 저위험이거나 승격됐다는 사실 |
| T1 재사용 | 재검증 후 과거 패턴이 적용될 수 있다는 사실 | 현재 범위와 의존성이 그대로라는 사실 |
| T2 제안 | 근거 기반 추론이 품질 검토를 통과했다는 사실 | 제안을 실행해도 된다는 사실 |
이렇게 나누기 때문에 결정론적으로 발견된 문제도 사람 검토로 갈 수 있고, 근거가 충분한 T2 결과도 관찰 모드에 머물 수 있습니다.
실행 시점 계약은 여전히 필수
섹션 제목: “실행 시점 계약은 여전히 필수”변경 전에 FDAI는 현재 인벤토리와 정책에 대해 제안된 작업을 다시 검사합니다. 실행기는 사전 검증(dry 실행), 중단 조건, 롤백 경로, 영향 범위 제한, 리소스별 잠금, 안정적인 멱등성 키, 권한이 있는 워크로드 자격 증명, 쓸 수 있는 감사 경로가 모두 있을 때만 진행합니다. 필수 입력이 오래되거나 사라지면 정책에 따라 작업은 감사되는 미실행, 관찰 모드 결과, 또는 거부가 됩니다. 콘솔 버튼이나 알림 답장이 이 검사를 대신할 수는 없습니다.
변경 관리
섹션 제목: “변경 관리”변경을 배포하기 전에 FDAI는 policy-as-code에 대해 사전 검증하고, 영향 범위를 제한한 뒤, 설정된 pull 요청 병합 정책으로 넘기거나 사람 승인으로 보냅니다. 작업은 수정 pull 요청로 전달되므로 검토, 승인, 롤백 기록을 Git에서 그대로 물려받습니다.
예시: IaC pull 요청이 public-egress 룰을 제안 -> 안전성 검토가 고위험으로 판정 -> Teams로 승인 카드 도착 -> 승인 -> 병합 정책이나 권한 있는 승인자가 전달 완료 -> FDAI가 감사 기록 기록.
용량, 성능, 비용
섹션 제목: “용량, 성능, 비용”용량과 비용은 같은 질문의 두 관점입니다. 이 리소스가 수요에 맞게 사이징되어 있는가? FDAI는 과잉 및 과소 프로비저닝을 탐지하고 사이즈 최적화를 권고합니다. 연결되지 않은 공개 IP 해제 같은 저위험 후보도 자동 실행 전에 관찰 근거를 모으고 개별적으로 승격해야 합니다. 라이브 워크로드를 저하시킬 수 있는 작업은 계속 게이트됩니다.
신뢰성과 재해 복구
섹션 제목: “신뢰성과 재해 복구”여기서 신뢰성 작업은 능동적입니다. 예약된 DR 훈련, DB 복원 훈련, 영향 범위가 한정된 카오스 실험이 주기적으로 돌아갑니다. 주기, 범위, 근거는 따로 관리됩니다. 스케줄러가 주기를, 안전성 검토가 범위를, 감사 로그가 근거를 담당합니다.
토일 제거
섹션 제목: “토일 제거”결정론 우선 설계의 핵심은 토일 제거입니다. 반복 가능한 다수를 규칙이 결정하므로, 운영자는 매주 같은 드리프트·비용 회귀·정책 위반을 손으로 승인하는 일을 멈춥니다. 사람은 신규이고 고위험인 것에만 남습니다(deterministic-first-ko.md).
포스트모템과 학습
섹션 제목: “포스트모템과 학습”모든 최종 결정은 미실행, 거부, 승인 시간 초과를 포함해 추가 전용 감사 기록을 남깁니다. 학습 루프가 승인, 관찰 모드 편차, 오버라이드 같은 신호를 지켜보며 근거가 있는 카탈로그 후보를 제안합니다. 카탈로그를 직접 고치거나 승격하지는 않습니다.
SRE 개선을 측정하는 방법
섹션 제목: “SRE 개선을 측정하는 방법”동일한 시나리오 세트에서 짝을 이룬 기준선과 적용 기간을 사용합니다. 결과 지표에는 MTTR 분포(평균, 중앙값, p90), 자동 처리율, 인시던트당 사람 개입 횟수, 변경 lead 시간, 해결된 이벤트당 비용이 포함됩니다. 보호 지표에는 변경 실패율, false 긍정과 false 부정 비율, 롤백 비율, 정책 위반 escape, 감사 공백이 포함됩니다.
자동화 비율이 높아졌다는 사실만으로 개선을 주장하지 않습니다. 보호 지표가 악화되지 않으면서 결과가 개선되어야 의미 있는 성과로 기록합니다.
FDAI 자체가 비정상인 경우
섹션 제목: “FDAI 자체가 비정상인 경우”컨트롤 플레인은 준비 상태, 이벤트 지연, dead-letter 깊이, 의존성 상태, 합성 canary 결과, 감사 완전성을 노출합니다. 필수 의존성이 실패하면 영향을 받는 작업을 관찰 모드나 거부로 낮춥니다. 안전 계약, 인벤토리 최신성, 잠금, 롤백 지원, 감사 기록을 보장할 수 없으면 실행기는 변경 실행을 중지합니다.
이 동작은 관측성 장애가 자율성 장애로 확산되는 것을 막습니다. 운영자는 저하된 상태와 대기 작업을 계속 확인할 수 있지만, 콘솔이나 알림 채널이 실행기 권한을 물려받지는 않습니다.
다음 단계
섹션 제목: “다음 단계”| 학습 대상 | 문서 |
|---|---|
| 운영자를 위한 전체 SRE 지도 | 사이트 신뢰성 엔지니어링 |
| 인시던트가 열림에서 종료까지 이동하는 방법 | 인시던트 관리 |
| FDAI가 근거 있는 원인 가설을 만드는 방법 | 근본 원인 분석 |
| 반복 가능한 다수가 왜 LLM에 닿지 않는가 | deterministic-first-ko.md |
| 결정이 자동 실행과 사람 승인으로 갈리는 기준 | risk-tiers-ko.md |
| 모든 액션이 어떻게 안전 계약을 물려받는가 | ontology-driven-automation-ko.md |
| 어떤 에이전트가 각 기능을 돌리고 어떻게 자가 치유하는가 | agents-and-self-healing-ko.md |
| 세 버티컬 전체 | ../get-started-ko.md |