8월 17일 GitHub 대규모 장애

19 hours ago 3

8월 17일 7시간 47분간 장애가 이어져 github.com, 인증, GitHub Actions, API, 풀 리퀘스트, 이슈, Copilot이 전 세계적으로 중단됨 트래픽이 최고치를 경신했지만 Central US 데이터센터의 핵심 인프라가 함께 확장되지 못해 용량 압박과 인증 실패가 여러 서비스로 확산됨 트래픽 우회와 인프라 격리로 대부분의 서비스는 먼저 복구됐으나, 일부 Copilot 서비스의 클라이언트 재시도 루프가 트래픽을 늘려 완전 복구가 지연됨 GitHub는 300만 개 이상의 CPU 코어와 120PB의 고속 스토리지를 추가하고, Azure가 처리하는 플랫폼 부하를 5월 12%에서 약 58%로 확대함 서비스 간 재시도 한도·예산·가변 타임아웃을 일관되게 적용하고 핵심 시스템의 공유 의존성을 제거해 장애 확산을 줄일 계획임 용량 부족으로 시작된 장애 장애는 7시간 47분 동안 이어지며 github.com과 인증, GitHub Actions, API, 풀 리퀘스트, 이슈, Copilot을 사용하는 개발자와 조직에 영향을 줌 8월 6일 GitHub Actions 장애에 이은 같은 달 두 번째 중대 사고로, GitHub는 3월과 4월부터 추진해 온 안정성 개선을 가속하기로 함 트래픽이 새로운 최고점에 도달했을 때 Central US 데이터센터의 핵심 인프라 구성요소가 함께 확장되지 못하면서 장애가 시작됨 용량 압박이 시스템 전반으로 퍼져 인증 실패와 여러 GitHub 서비스의 중단으로 이어짐 8월 6일과 17일 장애 모두 코드나 설정 변경이 아니라, 수요를 앞서 핵심 구성요소를 확장하지 못한 용량 문제에서 비롯됨 4월 이후 월간 커밋 수가 14억 개에서 29억 개로 증가했지만, GitHub는 이를 장애의 면책 사유로 보지 않음 단계적 복구와 Copilot 지연 복구팀은 트래픽을 우회하고 영향을 받은 인프라를 격리한 뒤 서비스를 단계적으로 되살림 대부분의 서비스는 먼저 복구됐지만, 일부 Copilot 서비스에서는 오류가 클라이언트 측 재시도 루프를 일으켜 복구 중 트래픽이 증가함 이 동작을 완화한 뒤에야 트래픽을 안전하게 복원할 수 있었으며, 상세 기술 일정은 근본 원인 분석에서 확인할 수 있음 인프라 확장과 안정성 개선 GitHub는 안정성 개선의 세 가지 우선순위로 용량 추가, 효율 향상, 아키텍처 병목 제거를 추진함 300만 개 이상의 CPU 코어와 120PB의 고속 스토리지, 상당한 네트워크 용량을 ...

Read Entire Article