인사이트

[테크 리포트] AI 시대 데이터센터의 진짜 경쟁력은 ‘전력 효율’에 있다

테크월드뉴스 ·

최태석 MPS 기술 지원 전무 [제공=MPS]

✦ AI 요약

AI 확산으로 GPU·AI 가속기 성능 향상과 함께 데이터센터 전력 문제도 커지고 있다.

데이터센터 기준은 계산 속도 중심에서 동일 전력 대비 처리량 중심으로 옮겨가고 있다.

효율을 높이려면 연산 성능뿐 아니라 데이터 이동 최소화와 전력 측정·제어가 중요하다고 본문은 설명한다.

AI 발전에 따른 컴퓨팅 산업 변화가 가속되는 가운데 GPU·AI 가속기 성능의 연도별 향상이 이어지고 있다. 다만 AI 확산으로 연산 성능이 높아지는 것과 함께 전력 문제의 확대도 동시에 나타나고 있다.

이에 따라 데이터센터 경쟁력 기준 변화도 진행되고 있다. 계산 속도 중심이던 기준은 동일 전력 대비 처리량 중심으로 옮겨가고 있다.

이 같은 변화의 배경으로는 AI·암호화폐의 대규모 연산 수요에 따른 데이터센터 전력 수요 급증이 꼽힌다. 미국 스리마일섬 원전 재가동 추진 사례는 이런 전력 수요 증가를 보여주는 사례로 제시된다.

AI·암호화폐의 전세계 에너지 소비 추정치는 1.5% 이상으로 제시된다. 관련 데이터 처리 에너지 비중 전망은 2030년 3%, 2035년 4.4%로 제시된다.

컴퓨터의 에너지 소비 상당분은 계산이 아니라 데이터 이동에서 발생한다. 데이터는 스토리지→메모리→프로세서 경로로 이동하며, 이 과정에서 여러 인터페이스를 경유한다.

데이터가 데이터 버스를 따라 이동할 때마다 전력 소비가 발생하고, 이동할 때마다 열도 생긴다. 이런 구조 때문에 전력 소모의 큰 원인으로 계산 자체보다 데이터 이동이 지목된다.

이에 따라 AI 시스템의 효율을 높이려면 연산 성능만 볼 것이 아니라 데이터 이동 최소화를 동시에 고려해야 한다. 연산 성능과 데이터 이동 최소화를 함께 따져야 효율 제고 조건을 충족할 수 있다.

이 과정에서 메모리는 중요한 변수다. 메모리의 전력 비중은 서버 전체의 약 22% 가능하다.

HBM(고대역폭메모리)은 AI 가속기에 널리 사용된다. HBM 인터페이스 효율은 약 1.5pJ/비트(bit)이며, 일반 DDR 메모리 모듈 인터페이스 효율은 약 15pJ/비트여서 HBM이 일반 DDR 메모리 모듈 대비 효율적이다.

다만 HBM 스택 전력 사용량은 75~100W 가능하다. HBM 스택은 고전력 프로세서와 같은 기판에 배치돼 HBM 적용 시 과제로 발열과 냉각을 동시에 해결해야 한다.

일반적 프로세서 캐시 라인 크기 64바이트이지만, DRAM 읽기 시 64바이트보다 훨씬 큰 내부 데이터가 활성화되면서 메모리 내부에서는 필요한 양보다 훨씬 큰 데이터가 함께 움직이는 비효율이 커진다.

예시 기준 64바이트 처리 과정 데이터 이동량은 약 20kB이며, 이 경우 실제 필요 데이터 비중은 0.3%에 그친다.

이 때문에 메모리 성능 향상보다 불필요한 데이터 이동 감소형 아키텍처가 중요해진다.

개선 방법 중 하나는 데이터의 적절한 메모리 계층 배치이며, '핫 데이터(Hot Data)'는 프로세서 가까운 계층에, '콜드 데이터(Cold Data)'는 상대적으로 먼 계층에 배치하는 원칙이 제시된다.

이와 함께 NUMA·CXL은 메모리 자원 활용 유연성 제고 기술로 거론되며, 다만 데이터가 여러 경로를 거칠 경우 전력 소비가 증가할 가능성이 있다.

메모리에 접근할 때 여러 홉을 거칠 가능성이 있을수록 소비 전력은 3배 이상 증가한다. 이에 따라 핵심 요소는 메모리 확보량 자체보다 연산-데이터 근접 연결에 있다는 설명이다. 중요성의 초점이 메모리의 절대량보다 연산과 데이터의 거리를 좁히는 데 맞춰지고 있다는 것이다.

이 같은 전력 효율은 데이터센터 경제성과 직결된다. 원문 인용 추산에 따르면 데이터센터 운영비 중 냉각 비용은 약 43%를 차지한다. 냉각 비용은 실제 컴퓨팅 장비 가동 비용과 맞먹는 수준으로 제시됐다.

전력 효율이 높아지면 전기료와 냉각 비용을 동시에 줄일 수 있다. 이와 함께 데이터센터 성능 기준도 바뀌고 있다. 단순한 페타플롭스(Petaflops per second에서 소비 전력을 고려한 Wh당 페타플롭스까지 확대되는 흐름이다.

이 같은 효율 개선의 선결 조건으로는 전력 소비 지점을 측정할 수 있어야 한다는 점이 제시됐다. 어디에서 전력이 쓰이는지 파악할 수 있어야 효율 향상도 가능하다는 취지다. 측정 가능성 확보가 먼저라는 점이 강조됐다.

이 과정에서 AI 시대 전력반도체의 역할도 확대되고 있다. 전력반도체는 단순 전원 공급을 넘어 실시간 전력 측정과 시스템 제어까지 맡는 방향으로 기능 범위가 넓어지고 있다. 효율 개선을 위한 측정과 제어의 중요성이 함께 커지고 있다는 설명이다.

MPS의 메모리 모듈용 전압 레귤레이터는 전력관리반도체(PMIC)다. 이 PMIC는 해당 요구에 대응하는 제품이다.

시스템 관리 인터페이스는 I²C, I³C, Sideband Bus 기반이다. 이를 통해 시스템 가동 중 각 전압 단 전류 판독이 가능하며, 메모리 모듈 전력 소비 파악도 가능하다.

또한 설정 한계 초과 상태 기록이 가능하다. 호스트 시스템은 텔레메트리 정보를 읽을 수 있으며, 필요 시 애플리케이션 성능 조절도 가능하다.

이와 함께 전력 변환 효율의 중요성이 제시됐다. MPS는 자사 PMIC가 경쟁 솔루션 대비 전력 변환 효율을 약 4% 개선할 수 있다고 설명했으며, 이는 데이터센터 전체로 환산하면 약 2% 전력 절감 효과로 이어질 수 있다고 밝혔다.

대규모 데이터센터에서는 수% 수준의 개선도 의미가 있다. 이는 전력 비용 절감, 냉각 비용 절감, 탄소 배출량 감소로 이어질 수 있다.

소프트웨어도 예외 아님에 따라 전력 효율 논의는 하드웨어에만 국한되지 않는다. 동일 연산의 소비 전력 차이 요인으로는 데이터 타입, 프로그래밍 방식이 꼽힌다. 필요 이상으로 큰 데이터 타입 사용 시 하드웨어 효율 개선 효과 희석이 나타나고, 불필요한 데이터 이동 반복 시 하드웨어 효율 개선 효과 희석이 발생한다.

이 때문에 하드웨어만 따로 개선해서는 효율 향상 효과가 제한된다. 프로세서·메모리·소프트웨어·전력 시스템의 통합적 관점 필요가 제기된다. 전력 소비에 직접 영향을 주는 구현 방식과 데이터 처리 방법까지 함께 봐야 한다는 흐름이다.

AI 시대 성능 경쟁의 단순 평가 기준 한계도 분명해지고 있다. 처리 연산량만으로 판단 어려움이 커지고 있으며, 향후 중요 성능 기준은 전력 1Wh당 유효 연산 수행량으로 이동한다.

이 같은 변화의 배경에는 AI의 데이터 요구 증가가 있다. AI의 데이터 요구 증가에 따른 메모리 확대가 이어지고, AI의 데이터 요구 증가에 따른 데이터 이동 증가도 함께 나타난다. 여기에 AI의 데이터 요구 증가에 따른 전력 설계 복잡화까지 더해진다.

이에 따라 향후 필요한 전력반도체의 요구 수준은 안정적 전압 공급만으로는 부족한 단계로 높아진다. 향후 필요한 전력반도체의 조건으로는 높은 변환 효율, 전력 소비 지점 실시간 측정, 측정 정보를 바탕으로 한 시스템 자율 최적화 지원이 제시된다.

AI 성능 향상이 지속 추진되는 가운데 전력 효율은 부가 설계 요소에서 시스템 성능·TCO를 동시에 결정하는 핵심 기술로 위상이 변화했다.

이 같은 변화와 맞닿은 분야에서 MPS(Monolithic Power Systems)의 최태석 기술지원 전무는 기술지원을 담당하고 있다.

엔지니어인 최태석 전무는 메모리에 필요한 전력반도체 기술지원에 집중해 왔으며, 2004년 MPS에 합류했다.

그는 컨슈머(TV, STB, Mobile) 제품 기술지원과 자동차분야 기술지원을 거치며 폭넓은 경험을 축적했고, 기술 전문성을 활용해 전력 솔루션 발전에 기여해 왔다.

출처: 테크월드뉴스 · 이광재 기자
원문: https://www.epnc.co.kr/news/articleView.html?idxno=406428

참고자료

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.


출처 테크월드뉴스

원문 확인

이 기사는 테크월드뉴스 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.