AI

노타, 멀티모달 AI 경량화 기술 ‘NeurIPS 2026’ 메인트랙 채택

테크월드뉴스 ·

[사진=노타]

✦ AI 요약

노타가 멀티모달 AI 모델 최적화 기술 개발을 발표했다.

이 기술은 전문가혼합(MoE) 기반 멀티모달 모델에서 텍스트·이미지 처리용 전문가 모듈의 중요도를 각각 평가해 상대적 저중요도 모듈을 제거하는 방식이다.

약 310억 개 파라미터 규모 모델에서 전문가 모듈 25% 제거 시 원본 성능의 98%를, 50% 제거 시 91%를 유지했고 GPU 메모리 사용량은 58GB→31GB로 줄었다.

노타는 1일 멀티모달 AI 모델 최적화 기술 개발을 발표했다. 이 기술은 성능 저하를 최소화하면서 GPU 메모리 사용량을 절감하는 내용이다. 관련 논문명은 'Modality-Aware Expert Pruning for MoE-Based Multimodal Large Language Models'이며, 이 논문은 AI 학술대회 'NeurIPS 2026' 메인트랙에 채택됐다.

이 기술은 전문가혼합(MoE) 기반 멀티모달 모델에서 텍스트·이미지 처리용 전문가 모듈의 중요도를 각각 평가한 뒤 상대적 저중요도 모듈을 제거하는 방식이다. 노타의 기술은 MoE 기반 멀티모달 모델에서 텍스트와 이미지별로 전문가 모듈의 필요성을 따져 덜 중요한 모듈을 덜어내는 데 초점을 맞췄다.

MoE 구조는 여러 전문가 모듈 중 입력에 필요한 일부만 선택해 연산한다. 다만 실제 연산에 참여하는 전문가는 일부이지만 전체 모듈을 저장하기 위한 메모리는 필요하다. 이에 따라 모델 규모 확대에 따른 GPU 메모리 부담이 증가하며, 이번 기술은 그 지점을 줄이려는 내용이다.

전문가 프루닝은 활용도 낮은 모듈을 제거해 부담을 줄이는 기능이다. 다만 기존 언어모델용 프루닝 방식을 멀티모달 모델에 직접 적용하면 이미지 이해용 전문가까지 제거될 수 있는 문제가 있다. 이 경우 차트 분석 등 시각 정보가 중요한 작업에서 성능 저하가 생길 가능성이 있다.

이에 노타는 텍스트 기준과 이미지 기준으로 전문가 중요도를 각각 평가하는 방식을 적용했다. 텍스트 처리에 중요한 전문가는 보존하고, 이미지 기준 중요도가 상대적으로 낮은 전문가는 제거하는 기준을 세웠다. 이 방식은 텍스트와 이미지 두 영역의 성능을 동시에 고려한 것이다.

기존 방식이 각 층에서 동일 수의 전문가를 제거했다면, 노타는 모델 전체의 전문가 중요도를 비교해 제거 대상을 정하는 방식으로 바꿨다. 필요한 층에는 더 많은 전문가가 잔존하도록 배치하는 원칙도 적용했다. 이는 성능 저하를 줄이기 위한 조정이다.

노타는 약 310억 개 파라미터 규모 멀티모달 모델을 대상으로 성능을 평가했다. 그 결과 전문가 모듈을 25% 제거했을 때 원본 성능의 98%를 유지했고, 전문가 모듈을 50% 제거했을 때는 원본 대비 91% 성능을 보였다. 회사 측은 50% 제거 시에도 원본 대비 91% 성능을 기록했다고 설명했다.

해당 모델의 GPU 메모리 사용량은 58GB→31GB로 약 47% 감소했다. 이에 따라 해당 모델은 40GB 메모리 GPU 1장 구동 가능 수준이 됐다.

이번 경량화는 별도 추가 학습 없이 1회 압축 과정으로 적용 가능하다. 사용자는 전문가 제거 비율을 설정할 수 있으며, 새 파운데이션 모델 공개 이후에도 별도 재학습 없이 최적화를 진행할 수 있다.

노타는 해당 기술을 AI 최적화 플랫폼 '넷츠프레소(NetsPresso)'에 반영할 계획이다. 지원 범위는 텍스트 중심 LLM에서 비전·언어모델(VLM)로 확대되며, 향후 적용 범위는 영상·음성 등 다른 입력 형태로 확대하는 구상도 갖고 있다.

회사는 '키미 K3'·'솔라 오픈 2' 등 대규모 모델에 전문가 프루닝을 적용한 경험을 축적해 왔다. 올해 ICLR·ICML·EMNLP에 이어 NeurIPS에서도 최적화 관련 연구 성과를 발표했다.

채명수 노타 대표는 AI 모델의 발전 방향과 관련해 텍스트 중심 LLM에서 이미지·영상·음성을 동시에 이해하는 멀티모달 AI로 전환되고 있다고 설명했으며, 멀티모달 AI의 발전에 따라 GPU 메모리 부담이 증가한다고 밝혔다. 이어 초거대 언어모델에서 축적한 최적화 역량을 멀티모달 AI로 확대할 방침이라고 밝혔고, 기업이 보유한 GPU·AI 인프라를 효율적으로 활용할 수 있도록 지원하는 것을 목표로 관련 기술을 고도화할 계획이라고 말했다.

출처: 테크월드뉴스 · 김승기 기자
원문: https://www.epnc.co.kr/news/articleView.html?idxno=407674

참고자료

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.


출처 테크월드뉴스

원문 확인

이 기사는 테크월드뉴스 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.