WD “AI 인프라 경제성, 컴퓨팅 넘어 데이터가 좌우”
테크월드뉴스 ·
✦ AI 요약
AI 확산으로 데이터 생성량과 보존 기간이 늘면서, 대규모 AI 인프라의 경제성 핵심이 컴퓨팅에서 데이터 스토리지까지 확대되고 있다.
WD는 10일 IDC 글로벌 연구 결과를 발표했으며, IDC는 AI 도입 확대에 따라 데이터 스토리지 수요가 구조적으로 증가한다고 분석했다.
IDC 조사에서 응답 기업·기관의 94.7%는 저장이 필요한 데이터가 증가했다고 답했고, 98.2%는 스토리지 의사결정에서 TB당 TCO가 중요하다고 평가했다.
AI 확산에 따른 데이터 생성량 증가와 데이터 보존 기간 장기화가 함께 나타나면서, 대규모 AI 인프라 경제성의 핵심 요소가 컴퓨팅에서 데이터 스토리지까지 확대되고 있다.
이와 관련해 WD는 10일 WD 후원 IDC 글로벌 연구 결과를 발표했다. 해당 IDC 백서명은 '확장성을 위한 설계: AI 시대 HDD의 지속적 역할(Built for Scale: The Enduring Role of HDDs in the AI Era)'이다.
IDC는 AI 도입 확대에 따라 기업·기관의 데이터 스토리지 수요가 구조적으로 증가하고 있다고 분석했다. 또한 AI 생성 데이터의 장기 보존 사례 증가와 과거 아카이브 데이터의 AI 워크로드 재활용 사례 증가가 나타나고 있다고 봤다. 이에 따라 전체 데이터 수명주기를 고려한 스토리지 설계의 중요성이 확대되고 있다고 분석했다.
AI 도입 확산에 따라 기업들은 더 많은 데이터를 생성하고 있으며, 데이터 가치 평가도 강화하고 있다. 이에 따라 데이터 보존 기간은 장기화하는 추세를 보이고 있다. 이와 함께 과거에 저장한 데이터를 다시 온라인으로 전환하는 사례도 늘고 있다. 이들 재전환은 새로운 AI 워크로드에 활용하려는 목적에서 이뤄지고 있다.
IDC 조사에 따르면 응답 기업·기관의 94.7%는 지난 12개월간 AI 및 생성형 AI 도입 이후 저장이 필요한 데이터가 증가했다고 응답했다. 응답자의 61%는 지난 1년 동안 AI로 데이터가 25% 이상 증가했다고 응답했다. 응답자의 74%는 향후 3년간 데이터가 25% 이상 증가할 것으로 전망했다.
데이터 레이크 규모 확대 흐름도 확인됐다. 응답자의 85.4%는 지난 12개월 동안 데이터 레이크에 저장된 데이터 규모가 증가했다고 응답했다. 이는 최근 저장 대상 데이터 증가와 맞물려 데이터 레이크의 확장이 이어지고 있음을 보여준다.
데이터 레이크 확대의 최대 요인으로는 AI 생성 데이터가 지목됐으며, 그 비중은 59.4%였다. AI 생성 데이터의 예시로는 합성 데이터, 추론 결과, 모델 로그가 제시됐다. 이는 데이터 레이크 증가가 AI 관련 데이터 확산에 의해 크게 이끌리고 있음을 보여준다.
AI 활용 구조는 데이터 활용과 신규 데이터 생성이 동시에 진행되고, 생성 데이터가 다시 재축적되는 방식으로 형성되고 있다. 이에 따라 AI는 데이터를 소비하는 데 그치지 않고 새 데이터를 만들며, 그 결과 저장·축적 구조가 강화되고 있다. 다만 컴퓨팅 작업의 변동성은 특정 워크로드·투자 주기에 따라 변화할 가능성이 있다.
AI 과정에서 생성되는 데이터는 작업 종료 후에도 상당 부분 저장·보존되는 특성을 보인다. 이 같은 흐름은 AI 도입 이후 데이터 가치 상승과 보존 기간 증가라는 소제목 취지로 이어진다.
AI 도입의 영향은 데이터 양뿐 아니라 기존 데이터 가치에도 미치고 있다. IDC 조사 결과에 따르면 대상 기업·기관 약 95%는 AI·생성형 AI 도입 이후 보유 데이터 가치가 상승했다고 응답했다.
같은 조사에서 74.3%는 AI 도입 이후 데이터 보관 기간이 장기화됐다고 응답했다. 이는 AI 도입이 데이터의 생성과 축적뿐 아니라 보존 기간의 확대와도 연결되고 있음을 보여준다.
이와 함께 과거에 아카이브한 콜드 데이터의 활용도도 증가하고 있다. 응답자 75.9%는 AI 워크로드 활용 목적의 기존 아카이브 콜드 데이터 재온라인 전환 사례가 증가하고 있다는 취지로 답했다.
아카이브 데이터의 활용 수요가 AI 추론과 RAG 애플리케이션 지원과 연결되면서 접근 속도 개선의 필요성이 커지고 있다. 전체 응답자 96%는 AI 추론·RAG 애플리케이션 지원 위해 아카이브 데이터 더 빠른 접근 필요를 전망했다. 이에 따라 아카이브 데이터 접근 속도 중요성도 증대되고 있다.
이와 동시에 실제 데이터 환경에서는 저빈도 접근 계층의 비중이 큰 것으로 나타났다. IDC 조사에 따르면 조사 대상 기업·기관 엔터프라이즈 데이터의 74.6%는 웜·쿨·콜드 스토리지 계층에 저장됐다. 또한 데이터 레이크 내 60% 이상은 콜드 데이터 또는 저빈도 접근 데이터로 구성됐다.
이 같은 구조 속에서 대규모 AI 환경에서는 데이터 특성과 접근 빈도에 따라 적절한 스토리지 계층을 구성하는 중요성이 확대되고 있다. AI 인프라 스토리지 설계에서는 고성능 스토리지 용량 확대보다 데이터 전체 수명주기를 고려할 필요가 있다는 분석도 제시됐다.
특히 데이터 규모와 보존 기간이 증가하는 상황에서는 성능만이 아니라 저장 용량과 접근성, 비용을 종합적으로 고려할 필요가 있다. 이에 따라 AI 인프라에서는 고성능 확장만이 아니라 수명주기와 계층별 특성을 함께 고려한 스토리지 설계가 요구된다.
AI 인프라에서 스토리지 비용이 경제성을 좌우하는 주요 요소로 부상했다. 조사에서는 응답자의 98.2%가 스토리지 의사결정에서 TB당 총소유비용(TCO)을 중요하거나 매우 중요하다고 평가했다. 이런 흐름과 관련해 어빙 탄(Irving Tan) WD CEO는 지난 수년간 AI 인프라 논의가 컴퓨팅 중심으로 이뤄져 왔지만, AI의 기반은 데이터라고 밝혔다. 그는 기업들이 데이터 생성을 확대하고 보존 기간을 장기화하는 한편, 기존 보유 데이터에서 새로운 가치를 창출하는 방법을 모색하고 있다고 설명했다.
어빙 탄(Irving Tan) WD CEO는 컴퓨팅 수요는 시간 경과에 따라 변화한다고 밝혔다. 반면 대규모 환경에서 데이터를 저장하고 관리하며 필요 시 접근하려는 수요는 지속적으로 증가하고 있다고 설명했다.
이어 그는 이런 데이터 기반이 AI가 확장될 수 있는 범위를 결정하는 핵심 요소라고 밝혔다.
AI 환경에서는 작업 과정에서 학습 데이터셋, 모델 체크포인트, 추론 결과, 로그, 합성 데이터 같은 여러 유형의 생성 데이터가 만들어진다. 이들 생성 데이터의 상당 부분은 컴퓨팅 작업이 종료된 후에도 지속 보존된다.
보존된 데이터는 향후 새로운 AI 애플리케이션의 입력 데이터로 활용된다. 이로 인해 현재 사용 데이터와 아카이브 데이터의 경계가 변화하고, 과거에 저장된 데이터가 AI 워크로드의 핵심 입력 데이터로 바뀌며, 장기간 미사용 데이터도 재활용 대상로 전환된다.
이 같은 변화에 따라 AI 인프라 설계의 고려사항도 확대된다. 특정 시점의 컴퓨팅 성능과 스토리지 성능만이 아니라 데이터의 생성, 저장, 장기 보존, 필요시 재활용을 포함한 데이터 전체 수명주기를 함께 고려해야 한다.
WD는 IDC 연구 결과를 기반으로 대규모 AI 환경에서 비용 효율적인 데이터 저장·관리 역량이 단순한 인프라 요소를 넘어 AI 확장의 핵심 요소로 부상하고 있다고 밝혔다.
출처: 테크월드뉴스 · 박규찬 기자
원문: https://www.epnc.co.kr/news/articleView.html?idxno=406778
참고자료
이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.
출처 테크월드뉴스
원문 확인이 기사는 테크월드뉴스 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.