하드웨어

화웨이, KV 캐시 병목 겨냥한 추론 스토리지 공개

인공지능신문 ·

인공지능신문에 따르면 화웨이는 9월 17일 AI 추론 과정의 KV 캐시 병목을 풀기 위한 '컨텍스트 메모리 스토리지'를 공개하며 단일 클러스터에서 최대 64PB를 지원한다고 밝혔다. 오션스토어 M900은 NPU와 SSD를 원홉으로 연결해 지연시간을 60마이크로초까지 낮추는 구조를 내세웠다. 핵심은 온칩 메모리와 DRAM에 머물던 KV 캐시를 SSD까지 확장해, 초장문 컨텍스트와 다중 턴 추론에서 필요한 데이터를 더 넓은 공유 공간에 담고 재활용하도록 한 점이다. 화웨이는 이 구조가 기존의 컴퓨팅 중심 AI 인프라에서 스토리지와 네트워크를 함께 묶는 방향으로의 전환을 보여준다고 설명했다. 또 캐시 접근 효율을 높여 추론 성능을 끌어올리고, 대규모 운영에서 문제로 지적돼 온 저장장치 내구성까지 함께 관리하는 설계를 적용했다고 전했다. 결국 이번 공개는 모델 자체 경쟁을 넘어, 추론 단계의 메모리 구조와 데이터 이동 방식이 AI 인프라 경쟁력의 핵심으로 떠오르고 있음을 드러낸다.

관점

이 사안의 의미는 AI 인프라의 승부처가 단순한 연산 성능에서 추론 중 생성되는 데이터를 어떻게 저장하고 다시 꺼내 쓰느냐로 옮겨가고 있다는 점입니다. 특히 긴 문맥과 복잡한 상호작용이 일반화될수록 병목은 칩 안이 아니라 시스템 전체에서 생기기 쉬운데, 이번 발표는 그 해법을 스토리지까지 넓혀 보겠다는 신호로 읽힙니다. 업계로서는 더 큰 모델을 돌리는 문제만이 아니라, 같은 자원으로 얼마나 안정적이고 경제적으로 추론 서비스를 운영하느냐가 경쟁 기준이 될 가능성이 커졌습니다.

이 관점은 비즈크러시가 작성한 자체 의견이며, 인공지능신문의 보도 내용과 무관합니다.

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.

하드웨어

래티스, ‘프롬프트’ 발표…AI 기반 FPGA 개발 신표준 제시

래티스반도체는 AI 기반 FPGA 개발툴 프롬프트(Prompt)를 발표했다. 프롬프트는 소형 및 중형 FPGA의 전체 설계 주기를 대상으로 하며, 기존 AI 에이전트 툴과 래티스 설계 툴·지식 기반·문서를 연동한다. 래티스는 이를 통해 자연어 입력을…

테크월드뉴스