레블업, ‘AI 엔드투엔드’ 로드맵 공개…“에이전트 인프라 정조준”
아이티데일리 (IT DAILY) · · 조회 1
✦ AI 요약
래블업은 29일 '제6회 래블업 컨퍼런스'를 열고 오프닝 키노트를 진행했다.
신정규 대표는 'AI 산업 시대의 엔드투엔드에 대해'를 주제로 지난 1년 성과와 에이전트 시대 개발 계획을 설명했다.
래블업은 Backend.AI Core, Continuum, Backend.AI:GO, 마이크로VM과 컨테이너 결합, 온프레미스 에이전트 운영 플랫폼, 디퓨전 언어 모델과 통계 모델 기술을 소개했다.
인공지능(AI) 기술의 중심이 실무를 자율적으로 수행하는 'AI 에이전트'로 이동하면서 연산 수요가 급증하고 인프라 복잡성도 확대되고 있다. 래블업은 이처럼 급증한 수요와 복잡한 인프라를 단일 관점으로 다루는 로드맵을 공개했다.
래블업은 29일 '제6회 래블업 컨퍼런스'를 개최했다. 이날 신정규 래블업 대표는 오프닝 키노트를 진행했다.
키노트 주제는 'AI 산업 시대의 엔드투엔드에 대해'였다. 신정규 대표는 이 자리에서 지난 1년 성과를 소개하고, 에이전트 시대를 겨냥한 개발 계획도 함께 설명했다.
이 로드맵의 핵심 근거로는 래블업의 핵심 오케스트레이터인 '백엔드닷AI 코어(Backend.AI Core)'가 제시됐다. '백엔드닷AI 코어(Backend.AI Core)'는 올해 초부터 엔비디아 최신 랙 단위 구조를 지원하고 있다.
이 구조는 72개 GPU를 하나의 NVLink 도메인으로 구성한 것이 특징이다. 래블업은 해당 구조와 관련해 일본 기업과의 실증도 완료했다.
지난 3월 업스테이지 모델 개발 과정에 참여하면서 장애 복구 시간을 약 50% 감소시켰고, 사전학습 기간도 예상 120일 안팎에서 약 70일로 단축했다. 이와 함께 GPU 가상화 대상은 엔비디아에 이어 AMD·인텔로 확대됐고, 국산 NPU인 퓨리오사AI·리벨리온 알파 버전도 진행 중이다.
'컨티넘(Continuum)'은 클라우드 장애 시 로컬로 전환하는 폴백 도구에서 출발했다. 이후 다중 클라우드 API 지원과 로컬 서빙 지원을 포함하는 스마트 라우터 방향으로 확장됐으며, 팀별 토큰 사용량 표시와 팀별 절감액 표시를 통해 계량기 역할도 수행한다.
신 대표는 이를 지난해 제시한 계량 가능한 지능의 첫 결과물로 소개했다. 최적화 기준은 '굿풋(Goodput)'이며, 이는 서비스 목표를 지키며 처리 가능한 최대 요청 수를 뜻한다. 서비스 목표 항목으로는 첫 토큰까지의 시간과 토큰당 생성 시간이 제시됐고, 단독 버전은 다음 달 공개될 예정이다.
래블업은 머신러닝 모델 서빙 환경 단순화를 목적으로 자체 추론 엔진을 지난 5월 오픈소스로 공개했다. 사무실 PC를 연합해 단일 AI 환경을 구성하는 '백엔드닷AI 고(Backend.AI:GO)'는 2.0 버전을 준비 중이다.
에이전트 격리 해법·마이크로VM 결합과 관련해 신 대표는 에이전트를 대규모로 운영할 때 병목과 자원 격리 문제가 있다고 설명했다. 그 원인으로는 서버 CPU 코어 수 증가를 들었고, 그 영향으로 코어당 메모리 대역폭이 큰 폭으로 감소한다고 밝혔다.
신 대표는 쿠버네티스 등 컨테이너는 디스크 입출력(I/O)과 네트워크 대역폭을 격리할 수 없어 한 에이전트의 부하가 다른 에이전트에 영향을 준다고 설명했다. 반면 VM은 통제가 용이하다는 장점이 있지만 서버 1대당 수십 개를 구동하기는 어렵다고 밝혔다.
이에 래블업은 마이크로VM과 컨테이너를 2단으로 결합하는 기술을 개발 중이다. 이 구조에서는 VM이 에이전트 단위의 자원 총량을 제한하고, VM 내부의 컨테이너가 서브 에이전트를 유연하게 실행한다. 이 기술은 도커와 호환되며, 공개 목표 시점은 올해 말이다.
래블업은 에이전트 게이트웨이와 에이전트별 ID 발급 기능을 포함한 온프레미스 에이전트 운영 플랫폼을 개발 중이다. 이 회사는 해당 플랫폼의 API만으로 슬랙형 협업 공간인 '스페이스'를 구축했다. '스페이스'는 사람과 에이전트가 한 채널에서 함께 작업하는 특성을 갖는다.
래블업은 소규모 연산 환경에 디퓨전 모델이 더 적합하다고 판단했다. 이에 따라 디퓨전 언어 모델을 개발하고 규모를 확장 중이며, 디퓨전 언어 모델은 연내 공개를 목표로 하고 있다. 이와 함께 GLM 5.2 서빙 가속용 한국어 드래프트 모델도 공개했다. 해당 드래프트 모델은 디퓨전 방식을 활용한다.
래블업은 빠른 직관적 판단이 필요한 영역을 대상으로, 거대 신경망 대신 통계 모델을 사용하는 기술도 소개했다. 이 기술의 실제 데이터 기반 학습 시간은 1분 이내다. 애플 M시리즈 CPU 기준 처리 성능은 초당 약 7만5000 건이며, 건당 판단 시간은 약 13마이크로초다.
이 기술에서는 대부분의 판단이 통계 모델 단계에서 종료된다. 난도 높은 작업만 상위 모델과 LLM으로 전달된다. 이로써 래블업은 즉각적 판단이 필요한 경우에는 통계 모델로 1차 처리하고, 어려운 과제만 상위 모델과 LLM으로 넘기는 흐름을 제시했다.
신 대표는 AI와 이를 뒷받침하는 AI 인프라의 복잡성이 증대하는 상황일수록 래블업의 미션이 더욱 명확해진다고 밝혔다. 이어 누구나 지능을 계량할 수 있도록 하고, 필요할 때 지능을 사용할 수 있도록 추진하는 방향을 통해 인류를 위한 지능의 민주화를 이루겠다는 의지를 강조했다.
출처: 아이티데일리 (IT DAILY) · 권영석 기자
원문: https://www.itdaily.kr/news/articleView.html?idxno=241876
참고자료
이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.
출처 아이티데일리 (IT DAILY)
원문 확인이 기사는 아이티데일리 (IT DAILY) 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.