콘텐츠로 이동

관측성, 감지, 예측

FDAI는 관측성을 실행 수단이 아니라 근거를 만들어 내는 일로 다룹니다. 이벤트, 메트릭, 로그, 트레이스, 이상 징후, 예측은 모두 정규화된 발견 결과가 되어, 다른 이벤트와 똑같은 신뢰 및 위험 파이프라인을 다시 거칩니다.

이벤트 상관관계, 결정론적 이상 감지, 예측은 상위 프로젝트에 이미 구현되어 있습니다. 다만 실제 워크로드를 관찰하려면 배포 환경에서 메트릭, 로그, 트레이스 프로바이더를 연결해야 합니다.

  • 원시 신호, 발견 결과, 인시던트, 작업이 어떻게 다른지.
  • 결정론적 상관관계가 데이터를 버리지 않고도 알림 소음을 줄이는 방법.
  • 이상 감지와 예측이 설명 가능성을 지키고 관찰부터 시작하는 방법.
  • 감지 결과를 믿기 전에 운영자가 확인해야 할 근거.
기록의미실행 가능 여부
원시 신호프로바이더 이벤트, 메트릭 표본, 로그, 트레이스 하나불가
발견 결과정규화된 이상 징후, 예측, 정책 관측불가
인시던트관련 이벤트와 발견 결과를 묶은 안정적인 그룹불가
근본 원인 가설인용이 붙은 인시던트 설명불가
작업 제안안전 계약을 갖춘, 타입이 정의된 변경일반 관문을 통과한 뒤에만 가능

발견 결과 자체는 변경 권한을 주지 않습니다. ActionType에 연결되고, 검증과 범위 검사를 통과하고, 리소스 잠금을 확보하고, 정책이 요구하는 위험 판단까지 받아야 합니다.

상관관계는 정규화와 중복 제거가 끝난 뒤에 실행됩니다. 리소스, 배포, 트레이스, 인과 관계상의 상위 항목, 제한된 시간 구간처럼 안정적인 키로 신호를 묶습니다. 늦게 도착한 신호도 열려 있는 인시던트에 합류할 수 있고, 설정된 구간을 지난 이벤트는 서로 연결된 후속 인시던트를 만듭니다.

상관관계는 기록들이 서로 관련 있다는 사실만 말할 뿐, 하나가 다른 하나의 원인이라고 주장하지 않습니다. 인과관계 판단은 근본 원인 분석이 맡습니다.

예시: 배포 하나가 변경 이벤트를 만들고 서비스 네 곳에서 오류가 발생 -> 공통된 배포와 리소스 관계가 인시던트 하나를 만듦 -> 원시 기록 다섯 개는 구성원으로 모두 남음 -> 원인은 근본 원인 분석이 따로 평가.

결정론적 탐지기는 메트릭을 설정된 이동 기준선이나 계절성 기준선과 비교합니다. 발견 결과에는 기준선, 관측값, 편차, 방향, 구간, 심각도를 기록하므로 운영자가 왜 그렇게 판단했는지 그대로 재현할 수 있습니다.

  • 이력 부족: 과거 데이터가 모자라면 추측하지 않고 판단을 보류합니다.
  • 변동 없는 기준선: 분산이 0인 경우를 따로 처리해서 0으로 나누거나 심각도가 무한대가 되는 일을 막습니다.
  • 계절성: 24시간 7일을 뭉뚱그린 평균이 아니라 같은 시간대나 같은 요일 구간과 비교합니다.
  • 복합 저하: 여러 메트릭의 발견 결과가 정족수를 채워야 복합 이상으로 인정합니다.
  • 변경 인식: 정기 점검이나 진행 중인 변경은 예상된 편차라고 표시하거나 아예 억제합니다.

복합 감지는 또 하나의 기준선이 아니라 여러 신호를 합치는 장치입니다. 중복된 메트릭은 가장 강한 것 하나로 줄이고, 같은 리소스와 같은 구간에서 서로 다른 신호가 설정된 정족수만큼 모일 때만 발견 결과를 만듭니다. 정족수에 못 미치면 판단을 보류합니다. 정족수를 넘기면 구성 신호의 범위와 합쳐진 크기에 따라 심각도를 올릴 수 있지만, 결과는 여전히 관찰 모드의 발견 결과로 남습니다.

결정론적으로 운영 조건 평가하기

섹션 제목: “결정론적으로 운영 조건 평가하기”

쓸 만한 조건이라고 해서 모두 통계 기준선이 필요한 것은 아닙니다. 버전이 관리되는 운영 점검 카탈로그는 인프라, 애플리케이션 성능, 데이터 시스템, SLO 소진, 알림 품질, 비용, 보안, 복구 위생을 위한 결정론적 점검법을 제공합니다. 각 점검법은 정규화된 표본에 above, below, 차이, 비율, absent, stale 같은 명시적인 연산자를 적용합니다.

점검법은 관측값, 기준값, 임계값, 점수, 설명을 기록합니다. 입력이 불완전하거나 유한하지 않거나, 표본이 모자라거나, 비율 계산의 입력이 잘못되면 발견 결과를 만들지 않고 보류합니다. 임계값과 메트릭 연결은 카탈로그 데이터에 남으므로, 배포 환경에서 평가기를 고치지 않고도 조정할 수 있습니다. 모든 점검법은 관찰 모드에서 시작하며, 신뢰 라우팅에 들어가기 전에 안정적인 중복 제거를 거치도록 이벤트 수집을 다시 통과합니다.

고정된 기준선과 비교해 구성 드리프트 탐지하기

섹션 제목: “고정된 기준선과 비교해 구성 드리프트 탐지하기”

구성 드리프트는 지금 범위의 상태를 의도된 상태로 고정해 둔 검토된 스냅샷과 비교합니다. 나중에 관측한 내용이 그 기준선을 스스로 대체하지는 않습니다. 사람이 변경을 검토하고 기준선을 다시 고정합니다.

보고서는 모든 리소스, 속성, 토폴로지 연결을 다음과 같이 분류합니다.

분류의미
unchanged고정된 기준선과 일치합니다
added, removed, changed기준선과 다르며 차이를 근거와 함께 제시합니다
unauthorized현재 존재하지만 기준선에서 승인되지 않았습니다
unknown분류하기에 근거가 충분하지 않습니다

비교의 신뢰성은 세 가지 규칙으로 유지됩니다.

  • 기준선은 고르는 것이 아니라 고정된 것입니다. 버전, 다이제스트, 범위는 배포 환경이 정합니다. 호출하는 쪽에서 다른 기준선이나 다른 범위를 지정할 수 없습니다.
  • 근거가 불완전하면 삭제로 단정하지 않습니다. 일부만 담긴 스냅샷으로는 리소스가 사라졌음을 증명할 수 없으므로, 완전한 원본이 확인해 줄 때까지 unknown으로 남습니다.
  • 범위마다 활성 기준선은 하나입니다. 변경할 수 없는 레지스트리가 후보, 활성, 대체됨, 보관됨 상태의 버전을 보관하며 비교는 항상 활성 버전과 이뤄집니다.

FDAI가 주간 드리프트 검토를 반복 작업으로 제안하려면, 같은 고정 기준선이 서로 독립된 읽기 전용 실행을 세 번 통과해야 합니다. 차단되거나 안전하지 않은 실행이 한 번이라도 있으면 검토가 멈춥니다. 세 번 모두 통과하면 결과는 사람이 일정을 정하도록 제출되는 거버넌스 청사진입니다. 예약된 작업도 아니고, FDAI가 스스로 시작하는 수정도 아닙니다.

예시: 어떤 리소스 그룹 범위가 3분기 기준선으로 고정되어 있습니다. 이후 스캔에서 기준선에 없는 인바운드 규칙을 발견합니다. 보고서는 이를 unauthorized로 표시하고 고정된 문서와 그 다이제스트를 인용하며, 다른 발견된 문제와 똑같이 같은 신뢰 및 리스크 파이프라인으로 다시 들어갑니다.

데이터가 없는 것과 프로바이더 실패는 다릅니다

섹션 제목: “데이터가 없는 것과 프로바이더 실패는 다릅니다”

조회는 성공했는데 표본이 없다면, 그것 자체가 absent 점검법의 근거가 될 수 있습니다. 프로바이더 오류는 다릅니다. FDAI는 그 메트릭을 확인 불가로 표시하고 그에 기대는 모든 점검법을 막아, 관측 도구의 장애가 워크로드 장애로 잘못 보고되지 않게 합니다. stale 점검법은 제한된 범위까지만 과거를 더 살펴봅니다. 그 범위에도 마지막 표본이 없으면 시각이나 값을 지어내지 않고 보류합니다.

입력 상태탐지기 동작운영상의 의미
유효한 표본을 돌려준 성공한 조회점검법이나 기준선을 평가합니다근거를 쓸 수 있습니다
결과가 비어 있는 성공한 조회데이터 없음을 허용하는 점검만 평가합니다없다는 사실이 근거일 수 있습니다
프로바이더 오류그에 기대는 평가를 막습니다근거를 쓸 수 없습니다
이력이 부족하거나 오래됨판단을 보류합니다근거가 충분하지 않습니다

예측 탐지기는 측정된 추세가 정해진 기간 안에 설정된 임계값을 넘을지 추정합니다. 결과에는 예상 위반 시각, 추세선이 얼마나 잘 맞는지, 불확실성 구간이 함께 담깁니다. 추세가 잘 맞지 않거나 넘어설지 불확실하면 판단을 보류합니다.

흔한 대상은 용량 고갈, RPO 한계에 가까워지는 복제 지연, 인증서 만료, 예산 소진 속도, 백업 보존 기간의 어긋남입니다.

예측은 확정된 사실이 아닙니다. 발견 결과를 만들고 예방용 수정 pull 요청을 제안할 수는 있지만, 그 제안도 트러스트 라우터, 검증기, 안전성 검토, 일반 승인 정책을 그대로 거쳐야 합니다.

승격하기 전에 예측기는 이미 알려진 과거 위반으로 되짚어 검증하고, 관찰 모드에서 설정된 정확도 기준을 통과해야 합니다. 승격한 뒤에도 FDAI는 예측 오차를 계속 추적합니다. 오차가 커지면 예측기를 관찰 모드로 되돌립니다. 예측 구간은 불확실한 단일 추정 위반을 눌러 줄 수는 있지만, 단일 예측이 내다보지 못한 위반을 새로 만들어 내지는 못합니다.

  1. 프로바이더, 리소스, 시간 구간, 데이터 최신성을 확인합니다.
  2. 기준선, 임계값, 편차, 이력 부족 여부를 살펴봅니다.
  3. 결과가 비어 있는 성공한 조회와 프로바이더를 쓸 수 없는 경우를 구분합니다.
  4. 인시던트 구성원과 배포 또는 점검 시간대가 이 신호를 설명하는지 확인합니다.
  5. 상관관계 ID를 따라가며 근본 원인 분석, 결정, 작업 제안, 감사 기록을 확인합니다.
  6. 빠진 근거는 확인 불가로 처리하세요. 0이나 정상으로 넘겨짚지 마세요.

탐지기 발동 빈도, 이력 부족으로 보류한 비율, 오탐률, 미탐률, 예측 정밀도와 재현율, 예측이 벌어 주는 시간, 원시 신호 대비 인시던트 비율을 추적합니다. 승격하려면 고정된 시나리오 묶음에서 측정한 근거가 있어야 하고, 지표가 나빠지면 탐지기를 관찰 모드로 되돌립니다.

구현 계약, 탐지 알고리즘, 컨트롤 루프 연결 방식은 관측성과 감지에 정리되어 있습니다.

알아볼 내용문서
발견 결과가 인시던트가 되는 방법인시던트 관리
워크로드 영향이 우선순위를 바꾸는 방법SLO와 오류 예산
원인이 상관관계와 다른 이유근본 원인 분석
최종 근거를 확인하는 방법감사 로그 읽기