AI

애피어 “AI, 모르는 것도 알아야”…LLM 정보 부족 인식 한계 확인

테크월드뉴스 ·

[사진=애피어]

✦ AI 요약

애피어 AI 연구팀은 LLM의 정보 부족 인식과 다국어 추론 특성과 관련한 연구 논문 2편을 10일 발표했다.

첫 번째 연구에서 28종의 주요 LLM은 '해당 사항 없음'이 정답인 문항에서 일반 문항보다 정확도가 30~50% 낮았고, DPO 적용 시 정답 없는 문제 식별 정확도가 약 30%포인트 상승했다.

두 번째 연구에서는 내부 추론 언어가 성능에 영향을 미쳤으며, 영어 등 고자원 언어는 수학·지식 기반 과업에서 상대적 고성능을 보였고 문화적 맥락이 필요한 문제에서는 현지 언어 추론이 더 잘 맞는 것으로 나타났다.

애피어는 LLM의 정보 부족 인식 능력과 과업별 추론 언어 선택이 성능에 미치는 영향을 분석한 연구 결과를 공개했다. 에이전틱 AI의 기업 업무 적용 범위가 확대되는 가운데, 애피어는 정답 생성 능력뿐 아니라 모르는 상황을 구분하고 적절한 추론 방식을 선택하는 역량이 중요하다고 제시했다.

애피어 AI 연구팀은 LLM의 정보 부족 인식과 다국어 추론 특성과 관련한 연구 논문 2편을 10일 발표했다. 이번 공개는 LLM이 답을 맞히는 능력 외에 답이 없는 상황을 알아차리는 능력과 추론 방식 선택의 중요성을 함께 다룬 것이다.

두 편의 논문 가운데 첫 번째 연구는 정답이 없는 상황에서 모델이 이를 인식할 수 있는지를 주제로 삼았다. 이를 위해 연구팀은 객관식 문항에 '해당 사항 없음' 선택지를 추가하는 방식으로 실험을 설계했다.

실험 대상은 규모가 다른 주요 LLM 28종이었다. 실험 결과 '해당 사항 없음'이 정답인 문항에서 모델 정확도는 일반 문항과 비교해 30~50% 낮게 나타났다.

애피어는 모델들이 관련 지식을 갖고 있더라도 유효한 정답이 없을 때 이를 정보 부족 상황으로 판단하기보다 다른 선택지를 고르는 경향을 보였다고 설명했다.

연구팀은 기존 한계를 보완하기 위해 지도 미세조정(SFT)과 직접 선호 최적화(DPO)를 적용했다. 이 가운데 DPO는 정답·오답을 동시에 학습하는 방식으로 운영됐으며, 이를 적용했을 때 정답 없는 문제를 식별하는 정확도가 약 30%포인트 상승했다.

다만 모든 과업에서 동일한 방식이 효과적인 것은 아니었다. 정답이 명확하고 선택지들이 서로 독립적인 문제에서는 '해당 사항 없음' 방식이 상대적으로 우수했다. 반면 다른 과업에서는 과업 특성에 맞춰 답변을 보류하는 방식과 추가 정보를 요구하는 방식을 함께 설계할 필요가 있는 것으로 나타났다.

이 같은 판단 능력은 기업 환경에서 검색증강생성(RAG)과 결합할 수 있다. 검색 정보가 부족할 경우 AI가 즉시 답변을 생성하는 대신 추가 검색을 수행할 수 있고, 사람에게 판단을 이관하는 방식으로도 이어질 수 있다.

별도의 두 번째 연구에서는 AI의 추론 언어가 결과에 미치는 영향을 분석했다. 연구팀은 대규모 추론 모델(LRM)을 대상으로 분석을 수행했으며, 입력 언어·내부 추론 언어·최종 응답 언어의 관계를 비교 대상으로 삼았다.

이번 실험은 질문 언어와 별개로 모델이 내부적으로 어떤 언어를 택해 추론하는지와 그에 따른 성능 차이를 비교한 결과, 타언어 질문을 수신하더라도 모델이 내부 추론 언어로 영어 등 고자원 언어를 빈번하게 사용하는 것으로 나타났다. 일부 모델에서는 내부 추론 언어와 최종 답변 언어의 불일치 비율이 90%를 초과했다.

연구팀은 '텍스트 프리필링'으로 특정 언어 추론을 유도한 뒤 과업별 성능 변화를 관찰했다. 그 결과 영어 등 고자원 언어는 수학·지식 기반 과업에서 상대적 고성능을 보였다.

반면 문화적 맥락이 필요한 문제에서는 현지 언어로 추론할 때 해당 지역 특성을 더 잘 반영하는 것으로 확인됐다. 안전성 평가에서도 유사한 언어별 차이가 확인됐으며, 유해·불법 질문 판별 과정에서는 현지 언어 추론이 더 효과적인 사례도 확인됐다.

이를 바탕으로 애피어는 과업·지역·문화적 맥락별로 추론 언어를 전환하는 '추론 언어 라우팅' 가능성을 제시했다. 이 방식은 AI가 상황에 맞춰 내부 추론 언어를 선택하고, 최종 답변은 사용자가 원하는 언어로 제공하는 방식이다. 애피어는 이를 모델·도구 선택과 유사한 방식으로 설명했다.

치한 위 애피어 CEO 겸 공동창업자는 AI가 질문 응답 단계를 넘어 자율적 의사결정을 시작한 만큼 AI 평가를 정답 산출 여부만으로 하는 것은 불충분하다고 밝혔다. 그는 이에 따라 평가 대상에는 정보 부족 상황을 인식하고 행동을 조정할 수 있는 가능성과 과업별로 적합한 추론 방식을 선택할 수 있는 가능성도 포함돼야 한다는 취지로 설명했다.

출처: 테크월드뉴스 · 김승기 기자
원문: https://www.epnc.co.kr/news/articleView.html?idxno=406790

참고자료

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.


출처 테크월드뉴스

원문 확인

이 기사는 테크월드뉴스 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.