정책

독파모 경쟁서 누가 탈락해도 데이터는 남는다…1.56조 토큰 개방

아이티데일리 (IT DAILY) ·

(AI가 생성한 이미지)

✦ AI 요약

정부는 독자 AI 파운데이션 모델(독파모) 프로젝트로 구축한 AI 학습데이터를 AI허브에 공개해 국내 AI 생태계의 공용 자원으로 전환한다.

과기정통부·NIA는 1차 단계평가에 참여한 5개 정예팀이 확보한 AI 학습데이터 29종, 약 3544만 건·11.3TB, 약 1조5600억 토큰을 공개한다고 27일 밝혔다.

공개 데이터는 LLM 사전학습용 텍스트와 멀티모달 데이터, AI 에이전트 학습데이터, 한국형 레드티밍 데이터, 가정환경 기반 피지컬AI 데이터로 구성되며, 이용은 AI허브 ‘독자AI모델 데이터’ 항목에서 가능하다.

정부가 '독자 AI 파운데이션 모델(독파모)' 프로젝트를 통해 구축된 AI 학습데이터를 국내 AI 생태계의 공용 자원으로 전환한다. 독파모 경쟁 과정에서 생성된 데이터는 평가 결과와 무관하게 기업·연구자에게 잔존하는 구조를 마련하고, 특정 정예팀의 자산에 머무르지 않도록 설계했다.

개방 규모는 1.56조 토큰이다. 공개 데이터는 LLM 사전학습용 텍스트와 영상·음성·이미지 기반 멀티모달 데이터, AI 에이전트 학습데이터, 한국형 레드티밍 데이터, 가정환경 기반 피지컬AI 데이터로 구성된다.

중소 AI 기업과 대학·연구기관은 자체 대규모 데이터 구축이 어려운 상황이다. 이에 따라 공개 데이터는 모델 개발 초기 비용·시간 절감을 기대하게 하는 기반이 된다.

과학기술정보통신부·한국지능정보사회진흥원(NIA)은 독파모 프로젝트 1차 단계평가에 참여한 5개 정예팀이 확보한 AI 학습데이터 29종을 AI허브에 공개한다고 27일 발표했다. 이번 공개는 150억 원을 투입해 구축한 학습데이터를 정예팀 밖으로 확산하는 취지다.

공개 대상 데이터의 구축 주체는 네이버클라우드·업스테이지·SK텔레콤·NC AI·LG AI연구원이다. 공개 데이터 전체 규모는 약 3544만 건·11.3TB이며, 텍스트 토큰으로 환산한 추산치는 약 1조5600억 토큰이다.

정부는 해당 데이터 규모가 이론상 매개변수 700억~800억 개 수준 대형 AI 모델 학습에 활용 가능하다고 설명했다. 다만 실제 모델 구축 가능 여부와 성능은 데이터 양 외에도 중복 제거·정제 수준·학습 목적·데이터 구성·컴퓨팅 자원에 따라 달라질 수 있다고 덧붙였다.

이번 공개 데이터는 독파모 정예팀들이 정부의 2025년 데이터 구축·가공 예산 150억 원을 활용해 구축한 결과물이다. 데이터 기획 기준은 각 팀 모델 개발전략이었으며, 독파모 프로젝트 목적은 국내 기업의 자체 AI 파운데이션 모델 개발 지원이다.

독파모는 단계평가를 통한 참여팀 수 축소 경쟁 방식으로 진행돼 왔다. 이 때문에 사업 효율성 판단 기준 가능 요소로는 평가 탈락 팀 투입 예산 활용 방식과 평가 탈락 팀 개발성과 활용 방식이 함께 거론된다.

이에 따라 이번 개방은 경쟁 생존 모델만 정부 사업 성과로 남기지 않는다는 의미를 가진다. 개발 과정에서 구축된 데이터가 타 기업·연구자 재활용 가능화되며, 이는 특정 정예팀 지원에 그치지 않고 지원 과정에서 형성된 자산을 국내 AI 생태계에 환류시키는 구조적 의미를 갖는다.

사업 참여조건으로는 정부 데이터 구축·가공 예산으로 확보한 데이터의 50% 이상 공개 의무가 걸려 있다. 1차 단계평가 이후 5개 팀이 데이터를 NIA와 한국정보통신기술협회(TTA)에 제출했으며, NIA·TTA는 제출 데이터의 품질, 개인정보, 유해성, 라이선스 제약 여부를 점검해 다른 기업과 연구자가 다시 활용할 수 있게 하는 절차를 맡는다.

참여 기관들은 데이터 공개 방식부터 차이를 보였다. 네이버클라우드·업스테이지·SK텔레콤·NC AI는 품질검증을 통과한 데이터를 전면 공개하는 방침을 세웠다. 반면 LG AI연구원은 의무개방 기준 50% 이상 충족을 목표로 데이터셋별 일정 간격의 표본을 추출해 공개하기로 했다.

LG AI연구원이 공개하는 표본은 통계적 선별 과정을 거치며, 이 과정의 검증 주체는 TTA다. 기관별 공개 방식이 전면 공개와 표본 공개로 나뉘는 가운데, 공개 데이터는 각 정예팀이 우선 개발하는 AI 역량을 확인할 수 있게 한다.

이번 전략 제시는 영상·에이전트·피지컬AI를 포함한 5개 팀을 대상으로 이뤄졌다. 공개된 데이터의 구성과 용도는 각 팀이 어떤 분야의 역량을 먼저 구축했는지를 드러내는 방식으로 제시됐다.

네이버클라우드는 공개 영상 234만 건, 방송 영상 52만 건, 영상클립 기반 텍스트 1550만 건, 음성 질의응답 1200만 건을 구축했다. 이 데이터에는 장면 문장 단위 설명 캡션이 포함됐으며, AI 영상 이해 학습과 이미지 생성 모델 학습에 활용된다.

업스테이지는 1조 토큰 규모의 사전학습 데이터와 50만 건의 사후학습 데이터를 공개했다. 사전학습 데이터는 모델 초기 학습에 쓰이며, 사후학습 데이터는 질의응답을 넘어 추론·판단·실행 능력을 갖춘 AI 에이전트 개발에 초점을 맞췄다.

해당 데이터는 단순한 언어 자연스러움보다 사용자의 의도를 이해하고 후속 행동을 정하는 모델 개발을 목표로 구성됐다. 데이터 구성은 지식·지능 데이터 30만 건, 사용자 선호 반영 데이터 10만 건, 에이전트 행위 능력 데이터 10만 건, 벤치마크 데이터 2084건으로 이뤄졌다.

SK텔레콤은 이를 위해 수학·과학·법률 등 전문영역 고난도 다단계 추론데이터를 구축했고, 음성·이미지 기반 사후학습 데이터도 구축했다. 여기에 국내 법령·한국 사회 보편적 가치관 반영 한국형 레드티밍 데이터 1만 건을 포함했다.

레드티밍 데이터는 AI에 공격적·위험한 질문을 제시해 취약점을 확인하고 유해한 응답 가능성을 확인하는 데 쓰인다. 해외 안전성 데이터는 한국 법률 반영이 부족하고 한국 문화적 맥락 반영도 부족한 한계가 있는데, 한국형 레드티밍 데이터는 해당 한계를 보완하는 자원으로 활용될 가능성이 있다.

NC AI는 제조 기술문서·민원상담 음성 등 산업 현장 실제 데이터 기반 학습용 데이터를 구축했다. 학습 목표는 긴 문맥 이해·단계별 추론·멀티턴 대화·질의응답·멀티모달 역량이다. 공개 대상에는 고품질 멀티턴 데이터, 합성·지시 데이터, 생각과정 학습·검증 데이터, 다국어 사전학습·기계독해 데이터뿐 아니라 제조·의료·민원 분야 이미지·음성 데이터가 포함된다.

이 같은 구성은 범용 대화 성능 향상을 넘어 산업 현장용 전문 AI 확장에 초점을 맞춘 것이다.

LG AI연구원은 한국 실제 가정환경 반영 피지컬AI 멀티모달 데이터셋을 구축했다. 이를 위해 국내 50개 가정을 촬영했고, 50종 이상 가사활동을 대상으로 17만 개 이상 영상클립을 확보했다. 라벨링 항목은 객체·영역 분할·사람 자세·주변 맥락이며, 라벨링 방식은 다층 구조다.

공개 대상에는 휴머노이드 로봇 장면 이해 학습용 데이터가 포함되며, 이미지 약 15만2000건 공개와 텍스트 데이터 공개가 이뤄진다. 이 데이터는 한국 주거공간 구조·생활환경 이해를 위한 활용을 대상으로 하며, 해외 데이터만으로 한국 주거공간 학습 곤란하다는 점을 보완하는 용도다.

이용 가능 주체는 국내 기업·연구자·학생 등 대한민국 국민이며, 제공 경로는 AI허브 '독자AI모델 데이터' 항목이다. 이용 방식은 무료 다운로드·활용이다. 다만 일부 데이터 별도 이용 제한이 있으며, 제한 사유는 보안·개인정보 보호 필요다. 이들 제한 데이터 이용 장소는 AI허브가 제공하는 폐쇄형 온라인 개발환경 '안심존'이며, 제한 데이터 이용 절차는 별도 신청이다.

다만 데이터 공개만으로 AI 모델 경쟁력 즉시 상승 아님이라는 점이 제시됐다. 데이터셋별 이용조건 상이 가능하고, 대규모 데이터 정제·학습에는 상당한 저장공간 필요와 컴퓨팅 자원 필요가 따른다. 사업성과 판단 기준은 공개 이후 실제 다운로드 수, 활용기업 수, 해당 데이터 활용 개발 모델·서비스 사례이며, 발언 요지는 데이터 공개만으로 성과 확정 불가, 후속 활용 실적 필요라는 내용이다.

데이터 구축 성과는 1조5600억 토큰 총량 자체보다 데이터 중복·오류 감소 수준으로 판단해야 하며, 상업적 모델 개발 활용 가능 범위와 기존 공개 데이터로 확보 어려운 한국어·산업 특화 정보 포함 정도도 중요한 기준으로 꼽힌다. 아울러 품질검증을 통과한 뒤에도 실제 모델 학습 단계에서 데이터별 효용을 지속 점검·보완할 필요가 있다.

과기정통부는 독파모 프로젝트 2차 단계평가에서 정부 예산 추가 구축 데이터도 품질검증 후 공개한다는 방침이다. 독파모 프로젝트 진행에 따라 AI허브에 축적되는 공용 학습데이터도 확대될 전망이다.

김경만 과기정통부 인공지능정책실장은 독자 AI 파운데이션 모델 프로젝트가 AI 모델 개발을 넘어 개발 과정에서 축적되는 경험·노하우를 통해 AI 생태계 전반의 질적 성장에 기여한다는 의미가 있다고 밝혔다. 또 개방 데이터가 AI 생태계 성장과 자생력 강화의 기반이라고 설명했다.

출처: 아이티데일리 (IT DAILY) · 이재영 기자
원문: https://www.itdaily.kr/news/articleView.html?idxno=241247

참고자료

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.


출처 아이티데일리 (IT DAILY)

원문 확인

이 기사는 아이티데일리 (IT DAILY) 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.