-
장애 대응 3 - 장애 복구연습장 2024. 8. 21. 16:30
2.1 장애 대응 전략
2.1.1 장애 대응 계획 수립
- 대응팀 구성
- 대응 절차 수립
- 사전 테스트 및 시뮬레이션
2.1.2 실시간 대응 전략
- 즉각적인 대응 조치
- 커뮤니케이션 및 보고
- 모니터링 및 피드백
2.2 장애 복구
2.2.1 데이터베이스 장애 복구
백업 복원
- 백업 파일 확인
- 백업 파일 로드
- 무결성 검증
2.2.2 애플리케이션 장애 복구
애플리케이션 재배포
- 문제 원인 파악
- 코드 수정
- 애플리케이션 재배포
- 테스트 및 검증
캐시 클리어: 캐시 관련 문제가 발생했을 경우, 캐시를 지우는 작업을 통해 문제를 해결할 수 있음. 주로 데이터 불일치나 성능 문제를 해결하는데 사용 -> 예를 들어 MASTER ROLE 생성. 해당 개발팀 전원 및 운영팀 팀장만 /redis_clear 엔드포인트에 접근 가능하도록 설정...!
근데 주의해야 함..!!
사용자 별 데이터를 redis에 적재해 놨을 때, redis clear후 다시 db에 접근하려고 하면 성능 부하가 올 수 있음...! 더 큰 장애 포인트가 될 수 있음...!
- 캐시 문제 진단
- 캐시 클리어 명령 실행
- 시스템 상태 확인
2.2.3 시스템 장애 복구
시스템 재부팅
디스크 정리
2.2.4 네트워크 장애 복구
네트워크 장비 재시작
네트워크 구성 변경
2.2.5 페일오버(FailOver)
주 시스템에 장애가 발생했을 때, 미리 준비된 스텐바이 시스템으로 자동 또는 수동으로 전환하여 서비스의 지속성을 보장하는 방법. 라우터 또는 로드 밸런서를 사용하여 트래픽을 스텐바이 시스템으로 전환.
'연습장' 카테고리의 다른 글
SQLD 정리... (0) 2024.08.23 장애 대응 4 - 후속 조치, 예방 조치 (0) 2024.08.21 장애 대응 2 - 장애 분석 및 진단 (0) 2024.08.21 장애 대응 1 - 모니터링 (0) 2024.08.21 XSS(Cross Site Scripting) (0) 2024.08.20