카카오, 소규모 실험으로 대형 AI 학습률 예측…카나나에 적용
아이티데일리 (IT DAILY) ·
✦ AI 요약
카카오는 소규모 모델 실험을 바탕으로 대규모 AI 모델의 적정 학습률을 예측하는 기술을 개발했고, 이를 자체 언어모델 카나나에 적용했다고 밝혔다.
이번 연구는 전문가 혼합(MoE) 모델 사전학습용 학습률을 적은 연산으로 탐색하고, 입력·출력 구조 변경으로 매개변수 수를 줄이는 경량화 방법도 함께 공개했다.
카카오는 이 연구 성과를 COLM 2026과 TokShop에서 소개할 예정이며, 카나나-2.6-155b-a17b의 안정적 학습과 온디바이스 환경에서의 메모리 부담 완화 가능성도 밝혔다.
카카오는 대규모 AI 모델의 학습 설정을 반복 실험으로 찾는 부담을 줄이기 위해 소규모 모델 실험 기반 대규모 AI 모델 적정 학습률 예측 기술을 개발했다고 밝혔다. 해당 기술은 자체 언어모델 카나나에 적용됐다.
카카오가 공개한 학습 최적화 연구는 전문가 혼합(MoE) 모델 사전학습용 학습률을 적은 연산으로 탐색하는 데 초점을 맞췄다. 학습률은 학습 과정에서 내부 매개변수 조정 폭을 뜻한다. 학습률이 과대하면 학습이 불안정해질 가능성이 있고, 과소하면 학습 속도가 저하될 가능성이 있다.
카카오는 함께 입력·출력 구조 변경 기반 매개변수 수 축소 경량화 연구도 공개했다. 이번 연구는 학습 효율을 높이는 방향과 매개변수 수를 줄이는 방향으로 나뉘어 제시됐다.
카카오는 8일 'COLM 2026'에서 이 같은 학습 최적화·모델 경량화 연구 성과를 소개할 예정이다. 'COLM 2026'은 현지시간 6~9일 미국 샌프란시스코에서 개최된다.
메인 컨퍼런스 논문명은 'Let's Scale Step by Step'이다. 이 논문은 대규모 MoE 학습에서 모델 크기와 데이터량이 달라질 때 학습률을 매번 다시 찾는 부담을 줄이기 위한 흐름을 제시했다. 논문은 작은 모델 설정의 큰 모델 이전과 학습 데이터량별 변화 분석의 방법을 제시했으며, 장기간 학습에 필요한 학습률을 예측하는 것을 목적으로 했다.
MoE 구조는 여러 전문가 모듈 중에서 입력별로 일부를 선택해 계산하는 방식이다. 이 구조는 전체 모델 규모를 확대할 수 있고, 입력마다 사용 연산량을 제한할 수 있는 특성이 있다. 다만 전문가 선택과 배분 등으로 학습 설정이 복잡해지는 한계도 있다.
이 때문에 모델 규모와 학습량에 따라 적절한 학습률도 달라진다. 그 결과 적절한 학습률을 찾기 위한 반복 실험에는 많은 연산이 필요하다.
카카오는 '뮤-매개변수화(μP)' 기법을 MoE 구조에 맞게 적용했다. '뮤-매개변수화(μP)' 기법은 소규모 모델의 학습 설정을 대규모 모델로 이전하는 내용이다. 카카오는 추가로 소규모 실험에서 학습 데이터량별 적정 학습률 변화를 분석했고, 그 결과 목표 학습량에 필요한 학습률 값을 예측했다.
논문은 본학습에 들어가기 전 학습률 설정을 찾기 위한 소규모 실험의 총 연산량이 목표 모델 본학습 연산량의 약 1%라고 설명했다. 이 1% 수치는 본학습 전 설정 탐색에 투입된 연산량을 비교한 기준에 따른 것이다.
카카오는 해당 방법을 '카나나-2.6-155b-a17b' 사전학습에 적용했다고 발표했다. 카카오는 '카나나-2.6-155b-a17b'가 10조 토큰에서 안정적으로 학습됐다고 밝혔다.
'카나나-2.6-155b-a17b'는 전체 매개변수 1550억 개 구조를 갖는다. 이 가운데 입력별 계산에 사용되는 매개변수는 170억 개다.
카카오는 별도 연구인 'BBT: BPE-Guided Byte Transformer'도 공개했다. 이 연구는 텍스트 분할은 유지한 채 텍스트 입·출력 구조를 변경해 매개변수 수를 축소하는 것을 목적으로 한다. 'BBT: BPE-Guided Byte Transformer'는 현지시간 9일 토큰화 워크숍 'TokShop'에서 다뤄졌다.
일반적 BPE 모델 방식은 글을 단어 또는 단어 조각 단위 토큰으로 분할한다. 또 각 토큰에 대응하는 정보를 입력 계층과 출력 계층에 저장한다. 이 때문에 어휘 목록이 확대되면 입력·출력 계층 관련 매개변수가 증가하는 특성이 있다.
BBT는 BPE 기준 분할 경계를 유지하면서 각 구간을 바이트 단위로 표현·생성하고, 짧은 구간 단위 처리의 이점을 활용하는 방식이다. 또 어휘 목록 크기에 비례하는 입력·출력 계층을 대체한다.
연구진은 영어 텍스트 비교 실험과 다국어 실험을 수행했다. 영어 텍스트 비교 실험에서는 모델 규모별 매개변수 수가 20.240.4% 감소했고, 언어 예측 성능 지표인 바이트당 비트 수(BPB)는 2.76.6% 하락했다. BPB 하락은 텍스트 예측 향상을 의미한다. 입력 처리·결과 계산 연산량은 비교 모델과 대체로 유사했고, 문자 삭제·공백 삽입 등 입력 교란 상황에서의 성능 저하는 비교 모델보다 작았다. 다국어 실험에서는 학습 언어와 문자체계를 공유하는 학습 미포함 언어에서도 예측 성능이 개선됐다.
카카오는 이러한 연구 특성으로 온디바이스 환경에서 AI를 실행할 때 메모리 부담이 완화될 것으로 기대한다고 밝혔다.
카카오 측은 이번 연구들이 AI 모델 성능 유지·향상과 학습·운영 비용 절감을 함께 노린 실용적 해법을 제시했다는 점에서 의의가 있다고 설명했다.
카카오는 다양한 모델 구조에 연구 방법을 적용할 계획이다. 또 텍스트·이미지 등 복수 데이터 유형을 동시에 처리하는 멀티모달 환경으로 후속 연구를 진행할 계획이며, 다국어 환경으로도 후속 연구를 이어갈 계획이다.
출처: 아이티데일리 (IT DAILY) · 김병주 기자
원문: https://www.itdaily.kr/news/articleView.html?idxno=242080
참고자료
이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.
출처 아이티데일리 (IT DAILY)
원문 확인이 기사는 아이티데일리 (IT DAILY) 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.