AI 병목, GPU만의 문제 아니다…모델·칩·인프라 연결이 경쟁력
테크월드뉴스 ·
✦ AI 요약
AI 서비스 확산으로 고성능 모델·GPU 확보만으로는 경쟁력 확보가 어렵고, 모델·AI 반도체·서빙 소프트웨어·애플리케이션을 연결하는 역량과 비용·성능 균형이 중요해지고 있다.
29일 서울 코엑스 패널토크에서는 추론 비용과 인프라 효율, 에이전트 확산에 따른 다양한 서비스 환경 대응이 주요 과제로 제기됐다.
패널들은 모델 개발과 실서비스를 잇는 피드백 구조, 여러 모델과 도구를 함께 운용하는 에이전트 환경의 운영 표준, 하드웨어·워크로드 조합 증가에 따른 인프라 최적화의 필요성을 언급했다.
AI 서비스가 확산하면서 고성능 모델·GPU 확보만으로는 경쟁력 확보가 어려워지고 있다. 이에 따라 모델·AI 반도체·서빙 소프트웨어·애플리케이션을 사용 환경에 맞게 연결하는 역량의 중요성이 커지고 있으며, 비용·성능의 균형 확보 필요성도 함께 부각되고 있다.
이 같은 흐름은 29일 서울 코엑스에서 열린 'lab | up > /conf/6'의 패널토크 'AI 병목을 해결하는 인퍼런스 최적화'에서도 제기됐다. 패널토크는 노정석 비팩토리 대표가 진행했고, 김준기 래블업 CTO, 김태호 노타 CTO, 이진원 하이퍼엑셀 CTO, 이활석 업스테이지 CTO가 패널로 참여했다.
패널들은 AI 활용이 학습 단계에서 실제 서비스로 확대되고 있다고 진단하면서, 주요 과제로 추론 비용과 인프라 효율이 떠오르고 있다고 짚었다. 또 에이전트가 확산하면서 모델 호출 방식과 서비스 환경이 다양해졌고, 이로 인해 모델 또는 반도체 한쪽만 개선하는 방식으로는 한계가 있다고 지적했다.
이진원 하이퍼엑셀 CTO는 추론 시장이 확대되면 비용 효율이 반도체 경쟁력의 판단 기준이 될 것이라고 밝혔다. 이진원 CTO는 시장의 축이 학습에서 추론 중심으로 이동하고 있으며, 이에 따라 비용 절감이 최대 과제로 부상하고 있다고 설명했다. 또 비용 효율이 개선되면 시장 진입 장벽이 낮아질 수 있고, 시장 진입 장벽이 낮아지면 전체 수요가 확대될 수 있다고 전했다.
이진원 CTO는 서비스별로 요구가 다르다고 설명했다. 빠른 응답이 필요한 서비스가 있는 반면 저비용으로 대량 처리가 필요한 서비스도 있어 모든 성능 지표를 동시에 향상하기는 어렵다고 했다. 그는 이메일 요약을 즉각적인 응답이 불필요한 작업의 사례로 제시했고, 낮은 비용을 기반으로 대량 요청을 처리하는 시장이 성장할 수 있다고 밝혔다.
하이퍼엑셀은 이런 흐름에 맞춰 HBM 대신 DDR 계열 메모리를 활용하고 있다. 하이퍼엑셀은 비용·용량 중심의 추론 반도체 전략을 추진하고 있다.
업스테이지는 모델 개발과 실서비스 간의 피드백 연결의 중요성을 강조했다. 이활석 업스테이지 CTO는 성능 향상만으로는 부족하다는 입장을 밝히고, 실제 사용 중 발생하는 데이터와 반응을 모델 개선에 다시 반영할 필요성을 언급했다. 또 모델 개발사의 최대 과제로 실사용자 피드백 확보를 지목했다.
이활석 업스테이지 CTO는 B2B·B2C 구분을 넘는 에이전트 연결 환경을 언급하며, 지속적 실험과 피드백을 축적할 공간이 필요하다고 밝혔다. 업스테이지는 모델 성능 자체보다 실제 서비스에서 얻는 데이터와 반응을 다시 개발에 연결하는 구조가 중요하다고 봤다.
이와 함께 모델 성능이 고도화될수록 학습 데이터와 평가 체계의 난도는 상승하는 것으로 진단됐다. 이활석 업스테이지 CTO는 전문가 수준을 초과하는 모델 학습에는 합성 데이터·강화학습(RL)·평가 체계의 병행 운용이 필요하다고 지적했다. 이어 합성 데이터·강화학습(RL)·평가 체계 운용 역량을 모두 갖춘 인력이 부족하다고 지적했다.
김태호 노타 CTO는 최적화 중심의 이동을 진단했다. 최적화 중심은 모델·커널 단계에서 에이전트 운영 단계로 이동하고 있으며, 기존에는 단일 모델 경량화와 서빙 효율 개선이 중심이었다고 설명했다. 또 에이전트 환경에서는 여러 모델과 도구를 병행 사용하게 되며, 이에 따라 전체 실행 흐름을 점검할 필요가 있다고 밝혔다.
오픈소스 확산으로 개별 모델의 경량화와 서빙 기술은 일정 수준에 도달한 것으로 제시됐다. 김 CTO는 단일 모델 경량화·서빙 기술이 오픈소스로 상향 평준화됐다고 밝혔다.
반면 여러 모델을 함께 운용하는 에이전트 환경에서는 운영 표준이 아직 부족한 상태로 제시됐다. 김 CTO는 여러 모델 복합 구동 에이전트 환경의 효율적 운영 기법은 표준이 미정립된 상태라고 밝혔다.
이런 상황에서 기업별 데이터 보안·비용·업무 특성 차이까지 겹치면서 모델-반도체 연결 최적화 기술의 역할이 커지고 있다. 하나의 모델·반도체 맞춤 방식보다 다양한 환경 대응 기술이 필요하다는 점도 함께 제시됐다.
인프라 단계에서는 하드웨어와 상위 워크로드 조합 증가가 새 병목으로 지목됐다. GPU·NPU 등 가속기가 다양화되고, 가속기 위에서 구동되는 모델·애플리케이션이 급증하면서 미들웨어의 검증 대상 경우의 수가 늘고 있다. 김준기 래블업 CTO는 다양한 가속기 칩·애플리케이션 조합을 검증하는 데 많은 자원이 소모된다고 밝혔고, 단일 GPU를 여러 워크로드가 공유할 때는 실제 자원 사용량을 정밀하게 측정할 필요가 있다고 설명했다. 이를 위해서는 칩 제조사 협력과 인터페이스 표준화가 필요하다고 덧붙였다.
기업 요구 수준이 변화하고 있다. 과거 주요 과제는 GPU 학습 자원 관리였지만, 최근에는 학습 자동화와 모델 서빙, AI 전환(AX), 에이전트 운영에 대한 요구가 늘고 있다.
이와 관련해 김 CTO는 인프라 구축만으로는 고객 요구를 충족하기 어렵다고 밝혔다. 이어 운영 방식과 애플리케이션, 모델 활용까지 대응할 필요가 있다고 설명했다.
이런 변화 속에서 패널토크에서는 AI 코딩 도구와 모델 성능이 빠르게 향상될 것이라는 전망이 나왔다. 이에 따라 기업 경쟁력의 중심이 코드 자체에서 실제 환경 검증 경험과 도메인 지식으로 이동할 가능성이 제기됐다.
김 CTO는 AI가 빠르게 코드를 생성할 수 있다고 봤다. 다만 다양한 기업 환경에서의 장기 검증과 유지보수 경험, 그리고 신뢰는 단기간에 대체되기 어렵다는 견해를 밝혔다.
이활석 CTO는 범용 모델의 성능 향상이 빅테크 중심으로 빠르게 진행되고 있다고 설명했다. 동시에 국가별·산업별 문서 형식과 법률 영역, 내부 업무 절차 영역에는 차별화 여지가 존재한다고 덧붙였다.
AI 추론 경쟁이 본격화되면서 모델의 개별 성능과 반도체의 개별 성능이 중요해지는 가운데, 각 계층의 실제 서비스 맞춤 연결 능력의 중요성도 확대되고 있다. 이에 따라 모델 개발·반도체·인프라·애플리케이션을 연결해 비용·성능 균형을 확보하는 일이 AI 서비스 경쟁의 주요 과제로 부상하고 있다.
출처: 테크월드뉴스 · 김승기 기자
원문: https://www.epnc.co.kr/news/articleView.html?idxno=407510
참고자료
이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.
출처 테크월드뉴스
원문 확인이 기사는 테크월드뉴스 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.