정책

정예팀 학습데이터 공개, 국내 AI 개발 저변 넓힌다

인공지능신문 ·

이미지:본지DB

✦ AI 요약

3,544만건·1.56조 토큰 규모… 네이버클라우드·업스테이지·SKT·NC AI·LG AI연구원 데이터 공개

인공지능신문에 따르면 과기정통부와 NIA가 8월 27일 독자 AI 파운데이션 모델 프로젝트 정예팀이 확보한 AI 학습 데이터 29종을 AI허브에 공개했다. 공개 규모는 약 3544만건으로, 대규모 사전학습부터 추론·멀티모달·안전성 관련 데이터까지 폭넓게 포함됐다. 이번 개방분은 각 팀이 개발 과정에서 축적한 데이터를 생태계 전체로 확산하겠다는 취지로 추진됐다. 공개 전에는 품질과 개인정보, 유해성 여부를 점검했고 이용 제약이 있는 자료는 대상에서 뺐다. 누구나 무료로 내려받아 활용할 수 있지만 일부는 별도 절차를 거쳐 보안 환경에서 이용해야 한다. 정부는 이번 공개에 이어 다음 단계에서 구축된 데이터도 검증을 거쳐 추가로 풀 계획이다.

관점

이번 조치는 특정 기업의 성과 공개를 넘어 국내 AI 개발의 출발선 자체를 낮춘다는 점에서 중요하다. 그동안 역량 격차를 키우던 요소가 모델만이 아니라 데이터 접근성이었다는 점을 감안하면, 이번 개방은 연구와 서비스 개발의 진입장벽을 완화하는 계기가 될 수 있다. 특히 한쪽에 치우치지 않은 데이터 구성이 이어진다면 모델 성능 경쟁을 넘어 활용성과 안전성 경쟁으로 산업의 무게중심이 옮겨갈 가능성도 있다.

이 관점은 비즈크러시가 작성한 자체 의견이며, 인공지능신문의 보도 내용과 무관합니다.

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.


출처 인공지능신문

원문 확인

이 기사는 인공지능신문 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.