하드웨어

[엣지 인프라 ①] 엣지서 AIDC까지…AI 인프라 생태계 확장

아이티데일리 (IT DAILY) ·

(사진: 픽사베이)

✦ AI 요약

에이전틱 AI는 목표 수립, 계획, 도구 호출, 결과 확인을 반복하며 많은 토큰을 쓰기 때문에, 기업들은 클라우드 API 의존 대신 로컬 추론과 하이브리드 AI 아키텍처를 검토하고 있다.

엔비디아 조사에서 응답자의 64%가 조직 내 AI 운영 환경을 도입했고, 델·IDC 조사에서는 89%가 PC 교체 때 AI 기능을 핵심 기준으로 봤다.

데스크사이드·엣지 인프라는 비용, 데이터 주권, 지연시간, 현장 안정성 문제와 연결되며, 업계는 CPU·GPU·NPU와 통합 메모리, 개방형 소프트웨어 생태계를 강조하고 있다.

에이전틱 AI가 등장하면서 생성형 AI의 위상이 질문 응답 보조 도구 단계를 넘어섰다. 에이전틱 AI는 챗봇을 넘어 복합 워크플로우를 주도하고, 목표를 수립하며 워크플로우를 자율 실행하는 역할을 맡고 있다. 이에 따라 엔터프라이즈 컴퓨팅 환경 변화가 발생하고 있으며, 엣지에서 AIDC까지 AI 인프라 생태계 확장이 기사 주제로 부상하고 있다.

기존 엔터프라이즈 AI의 중심축은 사내 온프레미스 서버·퍼블릭 클라우드 데이터센터였다. 그러나 엔터프라이즈 인프라 지형은 로컬 기반 분산 컴퓨팅 체제로 전환되고 있으며, 현재 흐름은 사무실 책상 위(데스크사이드)·산업 현장 말단(엣지)으로 연산 자원을 전진 배치하는 방향이다. 이는 실제 데이터 생성 지점·실무 의사결정 지점에 대응하기 위한 것으로, 인프라 분산 흐름이 본격화하고 있다.

기업들은 클라우드 API 토큰 비용이 예측 불가능하다는 점과 지적재산권 유출 위험을 배경으로, 일상적·고빈도 추론 작업을 현장 말단에 배치하고 있다. 이 같은 대응의 목적은 총소유비용(TCO) 최적화에 있다. 이에 맞춰 주요 벤더들은 책상 위~데이터센터를 포괄하는 엔드투엔드 하드웨어 생태계 구축을 가속하고 있다.

AI 도입의 변화는 비즈니스 현장의 경제성·데이터 거버넌스·지연시간 단축 요구가 결합한 데 따른 구조적 전환으로 정리된다. 엔비디아가 금융·제조·유통·의료·통신 분야 3200명 이상을 대상으로 조사한 결과, 전체 응답자의 64%가 조직 내 AI의 운영 환경을 도입했다고 응답했다. 또 42%는 기존 AI 워크플로우·프로덕션 사이클 최적화를 우선 투자 과제로 지목했다. 이는 기업의 관심이 파일럿 검증 단계에서 일상 업무의 비용·효율 최적화 중심의 프로덕션 단계로 이동하고 있음을 시사한다.

이 같은 흐름은 델 테크놀로지스·IDC 공동 조사 결과에서도 확인된다. 기업 응답자의 89%는 PC 교체 때 AI 기능을 핵심 기준으로 판단했고, 78%는 로컬 엔드포인트 기기 기반 보안 이점을 매우 중요하게 평가했다. 이런 수요 변화에 맞춰 글로벌 반도체·완제 시스템 기업들은 단말·워크스테이션·분산 서버를 포괄하는 하이브리드 아키텍처를 제시하고 있으며, '책상 위 AI 인프라' 주도권 확보를 목표로 경쟁에 나서고 있다.

사진은 레노버 SE30n.1이다. 데스크사이드 인프라 확장의 동력으로는 'AI 토크노믹스(Tokenomics)' 한계가 지목된다. 챗봇이 단발성 프롬프트를 처리하는 특성을 지닌 반면, 에이전틱 AI는 자율 작동한다.

에이전틱 AI는 목표를 달성하는 과정에서 계획을 수립하고, 데이터를 탐색하며, 도구를 호출하고, 결과를 확인하는 과정을 반복한다. 이 과정의 결과로 막대한 토큰을 소비하게 된다.

이 때문에 모든 요청을 퍼블릭 클라우드 API에 의존할 경우 비용 변동성을 통제하기 어려운 문제가 제기된다. 델 테크놀로지스 관계자는 시장의 중심이 워크로드 성격별로 최적의 실행 위치를 배분하는 '하이브리드 AI 아키텍처'로 이동하고 있다고 설명했다.

분석에 따르면 클라우드 API 사용량이 누적되는 고빈도·반복형 작업을 책상 위 고성능 AI PC의 로컬 처리로 돌릴 경우 예측 가능한 비용 구조 내에서 운영 안정성을 확보할 수 있다.

클라우드 API 호출 대비 로컬 가속 환경은 비용 우위를 보이며, 하드웨어 초기 도입 비용이 들더라도 수개월 내 상쇄 가능하다는 분석이 나왔다. 인프라 업계 실증 분석에 따르면 반복적 고빈도 추론 업무를 로컬 전용 인프라로 전환할 경우 3년 누적 TCO는 클라우드 종량제 대비 10분의 1 수준으로 축소 가능하다. 반복적·예측 가능한 엔터프라이즈 추론 업무를 현장 말단에서 분산 처리할 경우에도 클라우드 서비스형 인프라(IaaS) 대비 토큰당 운영비용 절감이 가능하다는 분석이 제시됐고, 이에 따라 토큰당 운영비용 절감 분석의 설득력도 확대되고 있다.

비네이 아와스티(Vinay Awasthi) AMD 부사장은 클라우드 AI 라이선스를 보유하지 않은 직원도 별도 라이선스 추가 없이 로컬 추론을 활용할 수 있다고 설명했다. 그는 로컬 추론은 클라우드 비용에 토큰 사용량을 추가하지 않고도 활용할 수 있으며, 적용 업무 예시로 문서 작성, 요약, 분석, 테스트 코드 생성을 들었다고 밝혔다. 이어 더 많은 구성원의 AI 활용을 원하는 조직에 로컬 추론은 비용 증가 없는 접근성 확대 수단이 된다고 말했다.

이 같은 흐름 속에 인프라·소프트웨어 기업들은 '지능형 하이브리드 라우팅' 기술의 도입을 확대하고 있다. 이 방식은 고빈도·민감 워크로드를 선제적으로 로컬에서 처리하고, 복합 추론·외부 데이터 검색이 필요할 때에만 클라우드를 호출하는 구조다. 이에 따라 기업들은 비용 우위가 큰 로컬 추론 인프라를 바탕으로 단순·반복·민감 업무는 로컬로 보내고, 더 복잡한 추론이나 외부 데이터 활용이 필요한 경우에만 클라우드를 쓰는 방식으로 비용과 접근성을 함께 개선하려는 흐름을 보이고 있다.

사진 속 제품명은 델 프로 맥스 위드 GB10이다. 데스크사이드·엣지 인프라 도입은 비용 효율 외에도 데이터 주권(Data Sovereignty)·실시간 응답성(Latency)과 연결된 문제로 제시된다. 인프라 분산을 좌우하는 요소로는 현장 안정성이 꼽힌다.

외부 퍼블릭 클라우드 망으로 데이터를 전송하기 어려운 배경도 제시된다. 제조 현장 설계 데이터와 금융 거래 내역, 헬스케어 연구 데이터, 공공 기밀, 기업 내부 소스 코드를 외부 퍼블릭 클라우드 망으로 전송할 경우 보안 규정 위반 가능성 또는 지적재산권 유출 위험이 있다. 이에 따라 내부 데이터를 로컬 단말에 보관하는 방식은 보안 공격 표면의 물리적 축소 전략으로 설명된다.

지연시간은 실무 생산성과 직결되는 요소로 제시된다. 오늘날 지식 근로자 업무 환경은 수십 개 웹 브라우저 탭·실시간 화상회의 자막 생성 및 번역·다중 AI 에이전트 호출·코드 검증을 단일 단말에서 동시에 구동하는 형태로 설명되며, 그 성격은 고부하다.

이 같은 고부하 환경에서는 네트워크 환경에 따라 변동하는 클라우드 왕복시간이 연속적 업무 처리의 병목을 유발하는 요인으로 지목된다. 결국 데스크사이드 및 엣지 인프라 도입은 단순한 비용 문제가 아니라 데이터 주권과 지연시간, 그리고 현장 안정성과 맞물린 문제로 설명된다.

실무 현장에서 클라우드 배치와 로컬 배치를 어떻게 나눌지에 대한 판단 기준이 필요하다는 지적이 나온다. AMD는 워크로드를 평가하는 4대 기준으로 지연시간(Latency), 데이터 민감도(Data Sensitivity), 경제성(Economics), 운영 효율성(Operational Efficiency)을 제시했다. 이에 따르면 대규모 모델 학습은 클라우드에 적합하고, 수요 변화가 극심한 가변형 워크로드도 탄력적 클라우드 인프라에 적합하다. 반면 지연시간에 민감한 실시간 작업은 로컬 환경이 최적이며, 외부 반출이 불가능한 민감 데이터 처리 작업도 로컬 환경이 최적이다. 상시 실행되는 일상적 생산성 워크로드 역시 로컬 환경이 최적이라는 구도다.

윤석준 레노버 부사장은 추론 워크로드가 학습과 달리 반복적이고 지속적으로 발생한다고 설명했다. 그러면서 제조 현장의 품질 검사, 매장 내 고객 행동 분석, 물류 거점의 실시간 영상 분석, 통신 엣지 환경의 네트워크 최적화 등은 지연시간 요구나 민감 데이터 특성 때문에 클라우드로 전송해 일괄 처리하는 방식보다 현장 인접 처리의 효율이 더 높다고 봤다. 이 같은 흐름에 따라 모든 AI를 클라우드에서 처리하는 방식 대신 클라우드·온프레미스·엣지·디바이스가 역할을 나눠 맡는 하이브리드 AI 모델이 확산할 전망이다.

현장에서는 하드웨어 단순 연산 수치보다 시스템 안정성과 관리 복잡성 해소, 기존 시스템과의 상호운용성을 우선순위에 두고 검토한다. 기업들은 AI·디지털 워크로드를 도입하기에 앞서 플랫폼 관리 부담 축소와 서비스 연속성 확보를 요구한다.

이 같은 요구는 데스크사이드·엣지 AI 인프라를 선정하는 핵심 기준으로 이어진다. 데스크사이드·엣지 AI 인프라 선정의 핵심 기준은 플랫폼 관리 부담 축소와 서비스 연속성 확보다.

이런 흐름 속에서 반도체 제조사들의 경쟁 대상은 '책상 위 인프라' 주도권으로 모인다. 아키텍처 경쟁의 수렴 지점은 세 가지 기술적 지향점이다.

세 가지 기술적 지향점은 로컬 단말의 대규모 파라미터 수용을 위한 대용량 통합 메모리, 에이전트 워크플로우 지휘를 위한 중앙처리장치(CPU) 중심 이기종 컴퓨팅, 특정 벤더 종속 탈피를 위한 개방형 소프트웨어 생태계다. 사진 표기 대상은 델 프로 맥스 위드 GB300이며, 사진 출처는 델 테크놀로지스다.

에이전틱 AI 시대에는 CPU 역할이 재조명되고 있다. 에이전트가 수행하는 작업은 프로세스 실행, 파일 분석, 명령 수행, 여러 하위 작업자 조율이며, 이 같은 기반 실행과 오케스트레이션을 담당하는 엔진은 CPU다. 가속기 연산이 고속이어도 CPU의 시스템 파이프라인과 데이터 공급 처리 속도가 미달하면 병목이 발생한다.

이에 업계는 CPU·GPU·NPU의 유기 결합인 이기종 컴퓨팅 설계에 집중하고 있다. 이 구조에서 CPU는 범용 제어를, GPU는 병렬 연산을, NPU는 상시 저전력 처리를 맡는다. 동시에 단말 레벨에서는 수백억~수천억 개 파라미터와 장시간 컨텍스트 메모리 적재가 요구되면서 CPU·GPU 초고속 메모리 공유 구조인 통합 메모리(Unified Memory) 아키텍처가 중요해지고 있다. 통합 메모리(Unified Memory)는 데스크사이드의 새로운 표준으로 부상하고 있으며, 기존 외장 카드의 VRAM 용량 물리적 한계를 극복하고 슬림형 PC·소형 폼팩터에서 거대 모델 추론을 가능하게 하는 효과가 있다.

인터뷰 표제는 AI 인프라, '워크로드 중심 분산 아키텍처'다. 인터뷰 대상은 비네이 아와스티 AMD 부사장이다. 이번 인터뷰에서는 AI 인프라의 분산·확장 흐름 평가가 주제로 제시됐다.

조민성 인텔코리아 상무는 엣지 환경별 전력·공간·비용·실시간성 요구가 상이하다고 밝혔다. 그는 단일 가속기 중심 방식만으로는 다양한 현장 수요를 충족하는 데 한계가 있다고 설명했다.

조민성 인텔코리아 상무는 이에 대한 대안으로 기존 시스템의 전면 교체보다 PC·워크스테이션·서버에 AI 기능을 점진적으로 추가하는 방식을 권고했다. 이는 인프라 전면 교체 대신 단계적 확장을 지향하는 접근법으로 제시됐다.

그는 점진 추가 방식의 효과로 초기 투자 부담 경감을 꼽았다. 아울러 시스템 통합 부담 경감도 이 방식의 효과로 제시했다.

이 같은 접근법은 개방형 프로그래밍 모델 확산과 결합하고, 소프트웨어 최적화 도구 확산과도 결합하는 흐름으로 이어지고 있다. 이러한 결합은 특정 칩셋 종속성 완화로 연결되는 것으로 제시됐다.

이처럼 인프라 전면 교체 대신 단계적 확장을 지향하는 접근법과 개방형 프로그래밍 모델 확산, 소프트웨어 최적화 도구 확산의 결합은 특정 칩셋 종속성을 완화하는 핵심 수단으로 주목받고 있다.

에이전틱 AI는 단발성 추론이 아니라 여러 시스템 전반의 지속적 추론·정보 검색·작업 조율·실행을 수행하는 특성을 지닌다. 이에 따라 기업은 모델과 이를 둘러싼 전체 인프라를 동시에 검토해야 하며, 이는 AI 실행의 절대적 단일 최적 위치가 없다는 의미이기도 하다. 워크로드에 따라 일부는 대규모 클라우드·데이터센터 인프라가 적합하지만, 지연시간·데이터 거버넌스·효율성·토큰 경제성에 따라서는 온프레미스·엣지·AI PC가 더 적합할 수 있다.

따라서 핵심 원칙은 각 워크로드별로 적정 규모와 환경을 선택하고, 요구사항이 변화할 때 여러 환경 간 유연하게 이동할 수 있는 가능성을 확보하는 데 있다. 이런 맥락에서 제기된 질문은 에이전틱 AI 시대에 CPU의 중요성이 왜 확대되느냐는 점이다. 이에 대한 발언 요지는 에이전틱 AI에는 모델 추론을 넘어서는 상당한 오케스트레이션 작업이 수반된다는 것이다.

CPU는 에이전트의 프로세스를 실행하고 파일을 분석하며 명령을 수행하고 여러 작업자를 조율하는 과정에서 기반 실행과 오케스트레이션을 담당한다. 또 GPU·NPU에서 AI 추론을 수행할 때에도 시스템 리소스를 조율하고, 워크로드를 데이터·서비스와 연결하며, GPU·NPU에 필요한 데이터를 지속적으로 공급한다. 그 결과 CPU는 전체 워크플로의 원활한 진행을 지원하며, AI 에이전트의 자율성이 높아질수록 CPU 성능의 중요성도 커진다. AI 모델이 아무리 빨라도 주변의 전체 워크플로 처리 속도가 맞지 않으면 실질적 가치는 제한된다는 점도 함께 제시됐다.

CPU·GPU·NPU는 AI 시스템에서 상호 보완적 컴퓨팅 엔진으로 역할을 나눠 맡는다. AI PC에서 CPU는 범용 워크로드를 처리하고 오케스트레이션과 데이터 이동 관리를 담당한다. GPU는 모델 추론과 콘텐츠 생성을 맡고, 고도 병렬 처리가 필요한 워크로드를 담당한다. NPU는 전용 AI 작업을 수행하며, 저전력 기반 지속 처리와 전용 AI 작업의 효율적 수행을 맡는다.

AMD는 AI를 시스템 수준 과제로 인식하고 있으며, AI 성능은 CPU·GPU·NPU와 메모리·네트워킹·소프트웨어의 작동 효율에 의해 결정된다고 설명했다. 이에 따라 AMD는 개방형 풀스택 AI 플랫폼을 제공해 고객의 AI 구축을 지원하고, 더 높은 유연성과 성능, 선택권을 확보하도록 한다는 목표를 밝혔다. 아울러 불필요한 복잡성과 특정 공급업체 종속성을 축소하면서 데이터센터부터 AI PC까지 AI의 안정적 구축과 확장을 지원한다는 방향을 제시했다.

경량화 모델과 '브라운필드' 인프라 결합이 주목받는 가운데, AI 모델 경량화 기술 발전이 데스크사이드·현장 엣지 인프라 확산의 결정적 기폭제가 되고 있다. 지식 증류·가중치 양자화·학습 데이터 정제 기법이 고도화되면서 300억 파라미터(30B) 이하 소형 모델이 과거 대형 모델에 준하는 성능을 발휘하기 시작했다. 이에 따라 대규모 GPU 클러스터 없이도 수십 와트(W) 수준 책상 위 장비에서 실무적 비즈니스 로직 처리가 가능해졌다.

모빌린트 관계자는 AI가 화면 속 서비스에서 로봇·차량·설비·생활 공간으로 들어오면 요구 조건이 근본적으로 바뀐다고 설명했다. 이 관계자는 판단을 밀리초 단위로 수행해야 하고, 카메라·센서가 수집한 데이터는 외부 반출이 불가해야 하며, 사람의 일상과 물리적으로 맞닿은 곳에서 상시 동작해야 한다고 전했다.

이어 모빌린트 관계자는 이 세 조건이 네트워크 너머 중앙 서버가 구조적으로 충족하기 어려운 영역이라고 밝혔다. 이에 따라 AI 적용 대상이 물리적 환경으로 확장될수록 지연, 데이터 반출, 상시 작동 문제가 핵심 조건으로 떠오르고, 중앙 서버보다 현장 가까운 인프라의 필요성이 부각되고 있다.

산업 현장 도입 해법으로는 그린필드보다 브라운필드 전략이 부상하고 있다. 브라운필드 전략의 핵심은 기존 대규모 인프라를 유지하면서 AI 가속 기능을 추가하는 데 있다.

이 같은 접근은 관제·제조 환경에서 일반 카메라와 레거시 서버를 다수 운영 중인 특성과 맞물려 있다. 관제·제조 환경을 전면 교체할 경우 천문학적 비용이 드는 부담이 크기 때문이다. 이에 따라 기존 서버 슬롯 장착 방식으로는 저전력 가속 카드를 추가하고, 단말 확장 방식으로는 USB 동글·모듈 형태를 적용하는 방식이 제시된다. USB 동글·모듈은 단말에 AI 추론 성능을 즉시 부여하는 효과가 있으며, 이런 유연한 하드웨어 접근법은 기업의 AI 진입 문턱을 완화한다. 사진 속 제품은 모빌린트의 'MLD-R1 AI USB'다.

기업들은 데스크사이드·엣지 AI의 확산이 클라우드를 대체하는 것은 아니라는 공통 결론을 내리고 있다. 기업들은 데스크사이드·엣지 AI와 클라우드가 제로섬 관계가 아니라고 보고 있다.

역할 분담도 분명하다. 대규모 모델 학습과 순간적 대규모 연산이 필요한 작업은 데이터센터·클라우드가 담당하고, 지연시간에 민감한 일상 업무와 사내 보안 데이터 검색, 현장 설비 제어는 책상 위·단말이 담당한다. 이에 따라 표준 구조로는 하이브리드 분산 구조가 정착하고 있다.

AI 모델·워크로드의 빠른 진화를 배경으로 특정 하드웨어·폐쇄적 아키텍처 비종속 유연성 요구가 커지고 있다. 단일 벤더 종속 시 기술 변화마다 시스템 전체 재설계 부담이 발생하는 만큼, 업계의 주목 대상은 ROCm, UALink, 울트라 이더넷(Ultra Ethernet), OpenVINO, oneAPI 등 개방형 표준 생태계로 향하고 있다.

이와 함께 기업의 과제로는 에이전틱 AI 도입 성과의 판단 기준 설정이 제시된다. AMD는 AI 에이전트 ROI 측정 기준이 소프트웨어 도입에 따른 비용 절감, 시간 절약 같은 기존 기준에서 벗어나 비즈니스 성과 중심으로 이동할 것으로 전망했다. 이에 따라 핵심 평가 지표로는 완료된 작업당 비용, 성공적인 결과당 비용, 작업 완료율, 결과물의 품질, 실행당 비용이 거론된다. 궁극적 목표는 AI 에이전트 수 확대 자체가 아니며, 평가의 핵심은 분산된 하이브리드 환경에서 에이전트의 효율성·안정성·경제성과 목표 완수 정도에 있다고 AMD는 봤다.

엔터프라이즈 AI 패러다임의 중심이 중앙 클라우드에서 사용자 단말·현장으로 이동하고 있는 가운데, 향후 기업 AI 경쟁력의 핵심은 대형·고가 가속기 확보 자체가 아니라 워크로드 특성 분석, 데이터 민감도 분석, 토크노믹스 분석을 바탕으로 연산 자원의 최적 위치를 배치하고 이를 유기적으로 연계하는 데 있으며, 하이브리드 인프라 전략이 기업 AI 실전 배치의 성패를 좌우할 것이라는 전망이 나온다.

출처: 아이티데일리 (IT DAILY) · 권영석 기자
원문: https://www.itdaily.kr/news/articleView.html?idxno=241932

참고자료

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.


출처 아이티데일리 (IT DAILY)

원문 확인

이 기사는 아이티데일리 (IT DAILY) 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.