-
장애 대응 4 - 후속 조치, 예방 조치연습장 2024. 8. 21. 17:11
3. 후속 조치
3.1 원인 분석 및 기록
3.1.1 장애 원인 분석
근본 원인 분석
- 5 Whys 기법
- 피시본 다이어그램
해결책 도출 및 실행
장애 경과 분석
3.1.2 장애 대응 기록
대응 조치 기록
커뮤니케이션 로그
3.2 후속 조치 계획
3.2.1 재발 방지 대책 수립
시스템 개선
프로세스 개선
3.2.2 교육 및 훈련
교육 프로그램 운영
훈련 시뮬레이션
3.2.3 문서화 및 공유
문서 업데이트
지식 공유
3.3 사후 평가 및 개선
3.3.1 사후 평가
평가 회의
성과 분석
3.3.2 지속적인 개선
피드백 반영
기술 도입
3.4 장애 대응 문화 정착
3.4.1 협력적 문화 조성
팀워크 강화
지속적인 학습
3.4.2 긍정적 마인드 셋
책임의식 강화
피드백 문화
4. 예방조치
4.1 장애 예방 전략
4.1.1 안정적인 아키텍처 설계
고가용성 아키텍처: msa, 클러스터링, 로드밸런싱
무중단 배포 전략: 블루-그린 배포, 카나리 릴리스 등으로 서비스의 중단 없이 배포 수행
4.1.2 클러스터링
여러 서버를 하나의 시스템처럼 구성하여 고가용성과 로드 밸런싱을 제공하는 방법. 클러스터 내의 각 서버는 동일한 데이터를 공유하고, 하나의 서버에 장애가 발생하면 다른 서버가 자동으로 그 역할 수행.
4.1.3 로드밸런싱
네트워크 트래픽을 여러 서버에 분산시키는 기술. 특정 서버에 장애가 발생해도 다른 서버가 트래픽을 처리할 수 있음.
4.1.4 지오 리던던시(Geo-Redundanct)
데이터를 지리적으로 떨어진 여러 장소에 저장하여, 한 지역에서 발생한 장애에도 다른 지역에서 서비스를 지속할 수 있도록 하는 방법.
4.1.5 성능 및 용량 계획
캐싱 전략
용량 계획
성능 테스트 및 벤치마킹
4.1.6 보안 취약점 관리
취약점 스캐닝
보안 패치 관리
침입 탐지 및 방어 시스템
4.2 장애 대응 프로세스 개선
4.2.1 DevOps 및 CI/CD 파이프라인
지속적 통합 및 배포
컨테이너 오케스트레이션
4.2.2 문제 해결 기법
장애 대응 훈련
포스트모템 리뷰(사후평가)
4.2.3 오픈 소스 및 솔루션
대시보드 및 리포팅
클라우드 기반 장애 대응
서버리스 아키텍처
Multi-Cloud 전략
############################
실제 사례
MS 클라우드 장애로 인한 마비
과기정통부, 마이크로소프트(MS) 클라우드 장애 원인 파악 및 후속 조치 예정
과기정통부, 마이크로소프트(MS) 클라우드 장애 원인 파악 및 후속 조치 예정 관련 보도자료 내용입니다. 자세한 내용은 첨부파일을 참고하시기 바랍니다.※ 대용량 첨부파일은 바로보기가 지원
www2.korea.kr
데이터 센터 화재로 인한 카카오 서비스 마비
https://www.kakaocorp.com/page/detail/9902
우리가 부족했던 이유
#카카오의다짐
www.kakaocorp.com
클라우드 페어 정전 장애
'연습장' 카테고리의 다른 글
SQLD 벼락치기... (0) 2024.08.24 SQLD 정리... (0) 2024.08.23 장애 대응 3 - 장애 복구 (0) 2024.08.21 장애 대응 2 - 장애 분석 및 진단 (0) 2024.08.21 장애 대응 1 - 모니터링 (0) 2024.08.21