소프트웨어

“가상화 전환, 운영 연속성·AI 확장성 고려해야”

아이티데일리 (IT DAILY) ·

(사진: 오케스트로 웨비나 갈무리)

✦ AI 요약

브로드컴 라이선스 정책 개편 이후 기업·공공기관의 VM웨어 대체재 검토가 본격화했다.

평가 기준은 하이퍼바이저 교체 여부보다 운영 연속성과 AI 인프라 확장성, 그리고 미션 크리티컬 업무의 무중단 이전 가능 여부로 옮겨가고 있다.

서영석 오케스트로 부사장은 VM 이전과 실제 운영 지속은 다르다고 하며, 장애 시 원인 규명과 대응이 가능한 워크플로우 검증과 폐쇄망 마이그레이션 사전 진단·롤백의 필요성을 말했다.

브로드컴 라이선스 정책 개편 이후 기업·공공기관의 VM웨어 대체재 검토가 본격화하고 있다. 이에 따라 가상화 전환의 평가 기준도 하이퍼바이저 교체 여부보다 운영 연속성과 AI 인프라 확장성을 중시하는 방향으로 바뀌고 있으며, 특히 AI 인프라 확장성이 진정한 가상화 전환의 핵심 척도로 부각되고 있다.

이 같은 변화 속에서 현장 도입 단계의 핵심 검토사항으로는 미션 크리티컬 업무의 무중단 이전 가능 여부가 꼽힌다. 아울러 장애 발생 시 기존 운영팀이 즉각적으로 원인을 규명하고 대응을 지속할 수 있는지도 주요 질문이 되고 있다.

서영석 오케스트로 부사장은 최근 자체 웨비나에서 VM 이전과 실제 인프라 운영 지속은 서로 다른 차원의 과제라고 밝혔다. 그는 단순 기능 체크리스트 비교를 지양해야 하며, 장애 시 운영자의 다음 행동 판단을 돕는 실질적 워크플로우 검증이 필요하다고 설명했다.

사진은 오케스트로 웨비나 갈무리다.

가상화 전환 과정에서는 차세대 AI·컨테이너 인프라와의 연속성이 필요하다는 점이 제시됐다.

서영석 부사장은 인프라 현대화가 진행되는 데이터센터 환경이 물리 서버 중심에서 서버 VM·컨테이너·멀티클라우드 혼용 단계를 거쳐 GPU·AI 워크로드 수용 구조로 진화하고 있다고 설명했다.

이어 현재 VM 중심으로 운영하고 있더라도 가까운 시점에는 컨테이너·GPU·AI 서비스가 동일 데이터센터 내부로 통합된다고 밝혔다. 또 자원을 파편화된 개별 솔루션으로 분리해 운영하면 자원 배분 체계와 장애 대응 체계가 단절되고, 분리 운영 시 운영 복잡성이 기하급수적으로 증가한다고 말했다.

아울러 가상화 기능 대체에만 치중한 인프라를 도입할 경우 향후 쿠버네티스·AI 서비스 확장이 필요한 단계에서 아키텍처를 전면 재설계해야 하는 위험이 있다고 지적했다.

공공·금융권 등 높은 보안성을 요구하는 폐쇄망 환경에서는 마이그레이션의 위험성이 크다는 지적이 나왔다. 서 부사장은 하이퍼바이저 전환 시 단순 데이터 복사만으로는 정상 부팅과 네트워크 연결, 애플리케이션 무결성을 보장하기 어렵다고 밝혔다.

서 부사장은 망 연동 제약이 큰 폐쇄망에서는 실패율이 급증한다고 설명했다. 이에 따라 검증된 솔루션을 기반으로 한 사전 진단과 롤백 절차가 필수라고 밝혔다.

현장 운영 안정성을 담보하기 위한 구체적 검증 기준으로는 운영 판단 지원 능력이 제시됐다. 서 부사장은 대시보드 화면 수보다 장애·유지보수 상황에서 운영자가 겪는 현실적 질문 5가지를 제시했다.

대표 사례로는 원인 불명의 성능 저하가 소개됐다. 이 사례에서는 CPU 사용률 60%, 메모리 사용률 72%로 지표상 여유가 있었지만, 사용자는 서비스 지연을 호소했다.

서 부사장은 단순 평균 사용률만으로 시스템 작업의 대기 지점을 설명하는 데 한계가 있다고 밝혔다. 이어 vCPU 기준으로 실행 대기 시간 발생 여부를 파악할 필요가 있고, 메모리 할당 과정에서 메이저 페이지 폴트·경합 발생 여부를 파악할 필요가 있다고 했다. 또 원인 후보군을 축소할 수 있는 심층 지표의 직관적 제공이 필요하다고 말했다.

또한 호스트 펌웨어 업데이트 등 일상 점검 절차의 자동화가 필요하다고 했다. 점검 전에는 타깃 호스트의 수용 여유 자원을 사전 검증할 필요가 있고, 안티 어피니티 등 배치 정책 위반 여부도 사전 검증해야 한다고 밝혔다. 아울러 제약 조건이 발생할 경우에는 작업을 강행하지 말고 안전하게 중단해야 하며, 중단 사유를 리포팅하는 체계도 필요하다고 했다.

서 부사장은 가상 계층 내에 이상이 없을 경우에는 랙 구성도 연동이 필요하다고 말했다. 이를 통해 호스트의 물리 NIC 오류와 상단 ToR 물리 스위치 포트 오류를 추적할 수 있어야 한다고 했다. 그래야 인프라 부서 간 핑퐁 없이 근본 원인을 규명할 수 있다는 설명이다.

오케스트로는 장애 대응과 운영 관리를 탐지부터 증적까지 5단계로 연결한 운영 프레임워크의 정립이 필요하다고 제언했다. 1단계는 '탐지'로 이상 징후를 감지하는 것이고, 2단계는 '상관 분석'으로 알람·자원·작업 이력의 단일 타임라인을 연결하는 것이다. 3단계는 '물리 추적'으로 물리 네트워크 스위치까지 추적하는 것이며, 4단계는 '조치'로 사전 수용성 검증 기반의 안전한 조치를 수행하는 것이다. 5단계는 '증적'으로 장애 전후 변경 내역을 증명하는 단계다.

이어 서영석 부사장은 운영 완성의 기준이 서비스 복구만으로는 불충분하다고 밝혔다. 그는 감사 로그·기록 체계로 무엇이 바뀌었고 어떤 조치가 취해졌는가를 설명할 수 있어야 운영이 완성된다고 설명했다. 아울러 서영석 부사장은 가상화 대체재의 평가 기준 전환이 필요하다고 밝히며, 기존 평가 기준이 외산 솔루션 기능 목록의 복제 정도에 맞춰졌다면 전환 후 평가 기준은 운영팀의 복합 장애 상황 실제 통제·해결 가능 여부가 돼야 한다고 강조했다.

출처: 아이티데일리 (IT DAILY) · 권영석 기자
원문: https://www.itdaily.kr/news/articleView.html?idxno=242032

참고자료

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.


출처 아이티데일리 (IT DAILY)

원문 확인

이 기사는 아이티데일리 (IT DAILY) 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.