서버 모니터링 분석 가이드

1 week ago 11

대시보드 설치 가이드는 많지만 그래프를 실제로 읽고 진단하는 방법에 대한 가이드는 드물다는 문제의식에서 모니터링을 어떻게 읽고 행동할지 정리한 글 수많은 그래프는 구글 SRE의 네 가지 황금 신호(트래픽·지연 시간·에러·포화도)로 묶이며, 증상(지연·에러)을 먼저 파악하고 원인(CPU·메모리·풀)으로 범인을 좁히는 순서가 분석의 기본임 리소스 지표는 혼자 읽으면 거짓말을 함. CPU 90%여도 응답이 빠르면 당장 문제가 아니고, 20%여도 응답이 느리면 문제임 평균 응답 시간은 분포의 모양을 지우므로 백분위수(P50/P95/P99) 로 읽어야 하며, 장애의 전조는 거의 항상 P99에 먼저 나타남 정상 패턴과 이상 패턴을 애니메이션으로 비교하며 설명하는 구성으로 평시·장애 중·장애 후 각 시점의 분석법까지 다룸 무엇이 중요한가 어떤 지표든 네 가지 황금 신호 중 하나에 속함: 트래픽(얼마나 들어오는가), 지연 시간(얼마나 걸리는가), 에러(얼마나 실패하는가), 포화도(얼마나 차 있는가) 지연 시간과 에러율은 사용자가 실제로 겪는 증상이라 늘어나면 무조건 문제이고, CPU·메모리·스레드 풀 같은 리소스 지표는 원인 쪽임 알람도 원칙적으로 증상에 걸어야 함. "CPU 80% 초과" 알람은 새벽에 사람을 깨우고 아무 일 아닌 경우가 많지만, "에러율 초과" 알람은 누군가 실제로 문제를 겪고 있다는 뜻임 사용자의 문제를 읽는 법 트래픽: 이상 패턴보다 평소 모양부터 외워야 함. 평소를 모르면 이상함도 알아볼 수 없음 수직 하락은 서버가 한가해진 것이 아니라 요청이 도달하지 못하는 것(LB·DNS·게이트웨이)이며, 장애 중에 서버 지표가 전부 깨끗하다면 그것이 가장 큰 이상 신호임 새벽마다 규칙적으로 솟는 스파이크는 대부분 배치나 크론임 트래픽은 분모이기도 함. 같은 에러 500건이라도 분당 요청 백만 건일 때와 천 건일 때는 심각도가 완전히 다르므로 개수는 반드시 비율로 읽어야 함 지연 시간: 평균은 분포의 모양을 지워버림. 전부 100ms인 서버와 대부분 30ms에 일부가 900ms인 서버의 평균은 똑같이 100ms일 수 있음 초당 1,000건이면 매초 10명이 P99를 맞고, 화면 하나에 API를 40번 호출하면 전부 꼬리를 피할 확률은 67%라 사용자 셋 중 하나는 꼬리 지연을 경험함 꼬리에 걸리는 사용자는 무작위가 아님. 데이터가 많은 헤비 유저일수록 무거운 쿼리를 만들므로, P99는 최우수 고객이 겪는 응답 시...

Read Entire Article