


문제 상황
vSAN 클러스터에서 경고나 오류가 보이면 곧바로 개별 항목을 해소하고 싶어집니다. 그러나 단일 항목만 보고 조치하면 같은 원인에서 파생된 여러 결과를 각각 처리하게 되거나, 서비스 영향이 있는 변경을 서두를 수 있습니다. 특히 하드웨어 호환성, 네트워크 구성, 스토리지 장치 상태, 가상 머신 객체 문제는 서로 연관될 수 있으므로, 상태 화면을 단순한 알림 목록이 아니라 우선순위를 정하는 점검 출발점으로 다뤄야 합니다.
Broadcom의 vSAN 8.0 문서는 vSAN Skyline Health가 클러스터 구성 요소의 상태를 확인하고 문제 진단과 문제 해결에 활용되는 기능이라고 설명합니다.[1] 확인 범위에는 하드웨어 호환성, 네트워크 구성과 동작, 고급 vSAN 구성 옵션, 스토리지 장치 상태, 가상 머신 객체가 포함됩니다.[1] 따라서 정기 점검의 목표는 ‘모두 녹색인지’만 확인하는 데 있지 않습니다. 어떤 항목이 언제부터 바뀌었는지, 공통 원인이 있는지, 실제 변경이 필요한지 구분하는 데 있습니다.
핵심 개념
Skyline Health 결과는 Unhealthy, Healthy, Info, Silenced로 구분됩니다.[1] Unhealthy는 주의가 필요한 중요한 문제를 뜻하지만, 경고가 곧바로 디스크 교체·네트워크 변경·클러스터 재구성을 의미하지는 않습니다. Info는 클러스터 실행 상태에 직접 영향을 주지 않을 수 있어도 운영자가 알아야 할 정보를 제공할 수 있습니다. Silenced 항목은 의도적으로 경보를 숨긴 상태이므로, 해결 완료로 해석하지 말고 숨김의 근거와 유효 기간을 별도로 확인해야 합니다.[1]
공식 문서는 문제를 해결할 때 근본 원인 기준으로 결과를 정렬하고, 먼저 주요 원인을 검토한 뒤 그 영향으로 표시된 항목이 함께 해소되는지 확인하는 방식을 안내합니다.[1] 이 순서는 장애 대응의 범위를 줄이는 데 도움이 됩니다. 다만 실제 조치는 사용 중인 vSAN 및 vCenter 버전, 하드웨어 호환성, 운영 중인 워크로드, 변경 창에 따라 달라지므로 화면의 권고만으로 적용 여부를 결정해서는 안 됩니다.
구성·점검 포인트
- 클러스터 범위와 관찰 시점을 기록합니다. 먼저 점검 일시, 클러스터 이름을 식별하지 않는 내부 작업 기록, 최근 변경 여부, 서비스 영향 징후를 남깁니다. Skyline Health의 History Details에서는 개별 항목의 상태 이력을 확인할 수 있고, 기본 조회 구간은 24시간입니다.[2] 일시적 경고와 반복 경고를 구분하려면 현재 결과만 저장하지 말고 발생·회복 추이를 함께 봐야 합니다.
- 근본 원인과 영향 항목을 나눕니다. Unhealthy 목록을 항목 수로 우선순위화하지 말고, 원인으로 표시된 결과와 그 영향으로 나타난 결과를 구분합니다. 네트워크, 디스크, 객체, 구성 동기화처럼 범주가 다른 결과가 동시에 나타나면 하나의 설정 변경으로 모두 해결될 것이라고 가정하지 않는 편이 안전합니다. 하드웨어 교체나 네트워크 수정처럼 되돌리기 어려운 작업은 영향 분석과 변경 승인이 선행되어야 합니다.
- 현재 결과와 이력을 함께 대조합니다. 공식 문서에 따르면 Health findings는 주기적으로 다시 검사되어 결과가 갱신됩니다.[1] 한 번의 화면 확인만으로 간헐 장애 여부를 확정하지 말고, History Details와 운영 모니터링의 시간대를 맞춰 비교합니다. 이력이 남아 있다고 해서 장기 보존이 보장되는 것은 아니며, vSAN 8.0 문서는 히스토리 데이터가 가용 용량에 따라 최대 30일까지 저장될 수 있다고 설명합니다.[1] 필요한 증적의 보존 위치와 기간은 별도 운영 정책으로 정해야 합니다.
- Silenced와 온라인 분석 경로를 별도 검토합니다. Silenced 항목은 경보가 보이지 않도록 만든 상태일 수 있으므로, 숨김 사유·승인자·재검토일을 확인합니다. 또한 온라인 분석이나 알림 기능은 vCenter Server의 연결 조건 및 조직의 데이터 전송 정책과 관련될 수 있습니다.[1] 외부 전송 또는 참여 옵션은 기본값만 보고 활성화하지 말고, 보안·개인정보·지원 정책에 맞는 승인 절차를 거쳐야 합니다.
- 조치 후에는 동일 범주를 다시 검증합니다. Broadcom 문서는 Monitor 탭의 vSAN > Skyline Health에서 Unhealthy 결과, 현재 결과, 이력을 확인하는 흐름을 제시합니다.[2] 조치를 했다면 해당 항목 하나만 닫지 말고, 근본 원인과 영향 항목의 상태가 함께 바뀌었는지 확인합니다. 결과가 지속되거나 원인이 불명확하면 임의 설정 변경을 늘리기보다 공식 기술 자료와 지원 절차를 통해 다음 조치를 결정합니다.
주의사항
Skyline Health에서 제공되는 재검사, 경보 숨김, 문제 해결 안내는 모두 운영 판단과 연결될 수 있습니다. 화면에서 권고된 절차라도 운영 환경에 즉시 적용하지 말고, 대상 버전과 호환성, 워크로드 영향, 최근 백업 및 복구 가능 여부, 승인된 변경 창, 실패 시 롤백 기준을 먼저 확인해야 합니다. 디스크 교체, 네트워크 구성 수정, 객체 복구, 클러스터 설정 변경은 서비스와 데이터 가용성에 영향을 줄 수 있으므로 검증 환경 또는 승인된 절차에서 수행해야 합니다.
이 글은 vSAN 8.0 공식 문서를 바탕으로 한 점검용 초안입니다. 제품 화면과 지원 범위는 설치 버전 및 계약 조건에 따라 달라질 수 있으므로, 실제 조치 전에는 사용 중인 버전의 최신 Broadcom 문서와 벤더 지원 절차를 다시 확인해야 합니다.
참고 출처
- Broadcom TechDocs, *About the vSAN Skyline Health* — 상태 범위, 결과 분류, 근본 원인 정렬, 재검사 및 이력 관련 설명.
https://techdocs.broadcom.com/us/en/vmware-cis/vsan/vsan/8-0/vsan-monitoring/monitoring-vsan-skyline-health/about-the-vsan-skyline-health.html
- Broadcom TechDocs, *Check vSAN Skyline Health* — Monitor 탭에서의 결과·현재 상태·이력 확인 절차.
https://techdocs.broadcom.com/us/en/vmware-cis/vsan/vsan/8-0/vsan-monitoring/monitoring-vsan-skyline-health/check-vsan-skyline-health.html
댓글