핵심 요약
AWS가 AWS Elastic Disaster Recovery(DRS) 기반 재해복구 체계를 구축하고, 온프레미스 21대 서버에 대한 DR 운영을 Drill 검증으로 확보했습니다.
구현 방법
- DRS 에이전트 설치와 지속적 복제를 통해 원본 데이터를 2개 AZ의 스테이징/복구 서브넷으로 전송
- 인스턴스 타입 매핑과 Launch settings를 사전 정의하고 DR 계정을 분리 운영
- Drill 기능으로 부팅/서비스 각 단계의 이슈를 격리된 DR 네트워크에서 검증
- 서울 리전의 2개 가용영역, 2개 서브넷 구성 및 보안 그룹 최소 규칙 적용
- CloudWatch 지표(LagDuration/Backlog)로 알람 설정 및 대시보드 구성
- 초기 비용 최적화: 복제 서버 타입을 t3에서 c6i로 변경하고 복제 볼륨을 약 8% 축소
주요 결과
- 총 복제 볼륨 약 48TB에서 필요 볼륨 제외로 약 8% 축소
- 복구 인스턴스 기동 약 30분, 데이터 확인 약 20분 소요
- 복제 서버 타입 다운그레이드로 약 50% 비용 절감
- 반기 1회 정기 Drill 도입 및 DR 계획 반영으로 운영 신뢰도 증가
- 부팅 모드/볼륨 접근 제어/패치 상태 등 레거시 환경의 이슈를 사전에 파악하고 대응


