계층
L3 — 장애 징후와 백업 실패를 운영자가 알아차릴 수 있게 만드는 관측 작업입니다.
배경 및 목적
서비스가 멈춘 뒤 사용자의 제보로 처음 알게 되면 복구가 늦습니다. CPU 하나만 보는 것으로는 API 지연, JVM 메모리, PostgreSQL 복제 지연과 Cilium 차단 원인을 구분하기도 어렵습니다.
Alloy가 필요한 메트릭과 로그만 Grafana Cloud로 보냅니다. 무료 티어를 넘기지 않도록 라벨과 수집 대상을 처음부터 제한합니다.
현재 상태
아키텍처와 로드맵에 대상만 정해져 있고 Alloy, dashboard, alert와 무료 사용량 관리 manifest는 없습니다.
작업 흐름
k3s·Cilium·CNPG·API·JVM → Alloy 필터링 → Grafana Cloud → 대시보드·경보 → 운영자
구현 방향
- Alloy를 모든 노드 또는 필요한 수집 범위에 맞게 배치합니다.
- 노드, Kubernetes, etcd, Cilium, CNPG, API와 JVM의 최소 메트릭을 정의합니다.
- Pod 이름처럼 자주 바뀌는 라벨을 제거하거나 집계합니다.
- 오류 조사에 필요한 로그만 수집하고 secret 패턴을 제거합니다.
- API 오류·지연, 디스크 부족, etcd 이상, Cilium drop, 복제 지연, WAL·snapshot 실패와 인증서 만료 경보를 만듭니다.
- 테스트 장애를 발생시켜 경보 전달과 복구 알림을 확인합니다.
- Grafana Cloud 사용량과 예상 초과 시점을 대시보드와 경보로 관리합니다.
완료 조건
하지 않는 일
- 모든 로그와 메트릭을 무제한 수집하지 않습니다.
- Hubble Relay와 UI를 관측 화면 목적으로 추가하지 않습니다.
참고 자료
위험 확인
계층
L3 — 장애 징후와 백업 실패를 운영자가 알아차릴 수 있게 만드는 관측 작업입니다.
배경 및 목적
서비스가 멈춘 뒤 사용자의 제보로 처음 알게 되면 복구가 늦습니다. CPU 하나만 보는 것으로는 API 지연, JVM 메모리, PostgreSQL 복제 지연과 Cilium 차단 원인을 구분하기도 어렵습니다.
Alloy가 필요한 메트릭과 로그만 Grafana Cloud로 보냅니다. 무료 티어를 넘기지 않도록 라벨과 수집 대상을 처음부터 제한합니다.
현재 상태
아키텍처와 로드맵에 대상만 정해져 있고 Alloy, dashboard, alert와 무료 사용량 관리 manifest는 없습니다.
작업 흐름
구현 방향
완료 조건
하지 않는 일
참고 자료
위험 확인