셀렉트스타, ‘EMNLP 2026’에 AI 신뢰성 연구 5편 채택
테크월드뉴스 ·
✦ AI 요약
셀렉트스타 연구진이 참여한 인공지능 신뢰성·안전성 논문 5편이 EMNLP 2026에 채택됐다.
채택 논문은 메인 콘퍼런스 1편, Findings 1편, 워크숍 3편으로 구성됐다.
연구는 인간-LLM 응답 정렬, 가드 모델 판단 신뢰도, 금융·문화권별 안전성 평가로 확대됐다.
셀렉트스타 연구진이 참여한 인공지능 신뢰성·안전성 논문 5편이 'EMNLP 2026'에 채택됐다. 셀렉트스타는 28일 자사 연구진이 참여한 논문이 총 5편 채택됐다고 발표했다.
이번에 채택된 연구들은 인간-LLM 응답 정렬, 가드 모델 판단 신뢰도, 금융·문화권별 안전성 평가로까지 연구 범위를 넓혔다.
채택된 논문은 메인 콘퍼런스 1편, Findings 1편, 워크숍 3편으로 구성됐다. EMNLP는 전산언어학회(ACL)가 주관하는 자연어처리 분야의 주요 국제학술대회다.
올해 행사는 다음달 24일~29일 헝가리 부다페스트에서 열린다. 셀렉트스타는 올해 메인 콘퍼런스에 약 1만8000편이 제출됐다고 설명했다. 메인 콘퍼런스 채택률은 15.4%다.
셀렉트스타 최혜지 연구원이 공동 주저자로 참여한 'When Accuracy Aligns and Fails: Diagnosing Human–LLM Response Alignment at Population Scale'가 메인 콘퍼런스 채택 논문으로 이름을 올렸다. 이 연구는 단순한 AI의 정오 여부를 초과해 분석하기 위해 진행됐으며, 오답을 낼 때 사람과 유사한 오답을 선택하는지까지 분석하는 것을 주제로 삼았다.
연구진은 표준화 시험 문항에서 사람들의 정답·오답 선택 분포와 LLM 응답 분포를 비교했다. 이를 통해 맞고 틀리는 결과만이 아니라, 사람과 LLM이 어떤 방식으로 성공하고 실패하는지도 함께 평가하는 AI의 인간 유사 성공·실패 정도의 정량 진단 평가 프레임워크를 제시했다.
이 평가 프레임워크의 핵심은 정확도 중심의 기존 평가에 인간과의 응답 유사성을 추가한 데 있다. 같은 문항에서 오답이더라도 사람의 주된 오답 선택과 AI의 오답 선택은 차이가 날 수 있으며, 해당 평가는 모델이 특정 집단의 판단 패턴을 어느 정도 반영하는지도 점검할 수 있게 한다.
셀렉트스타는 해당 연구 결과를 자사 19종 AI 안전성 분류체계·유해성 평가 기술과 결합할 계획이다. 또 국가별 이용자 위험 인식·문화적 특성을 반영한 AI 안전성 벤치마크로 확장하는 구상도 하고 있다.
파인딩스에는 'Guard Models Are Overconfident Where Base Models Are Uncertain' 논문이 채택됐다. 이 논문은 유해·위험 요청을 판별하는 가드 모델의 판단 확신도를 분석한 내용을 다룬다. 연구 결과 일부 가드 모델은 기반 모델의 판단이 불확실한 상황에서도 높은 확신도를 표시하는 것으로 나타났다. 또 일부 가드 모델은 높은 확신에도 오판할 가능성이 있는 것으로 분석됐다.
이번 연구는 가드 모델의 확신과 실제 정확도 사이에 차이가 있음을 드러냈다. 이를 바탕으로 AI 안전성 평가에서는 단순 정확도 외에도 모델의 확신 수준과 실제 판단 정확도의 일치 여부를 함께 검토할 필요가 제시됐다.
실서비스 가드레일 운영과 연결된 문제의 핵심은 비유해 요청을 유해한 것으로 오판할 경우 정상 입력까지 차단할 수 있다는 점이다. 그 결과 서비스의 사용성이 저하될 가능성이 있다.
셀렉트스타는 이에 대한 후속 계획으로 연구 기반 기술 발전을 추진한다. 이 기술은 모델 판단 결과와 오판 가능성을 동시에 반영하는 내용이며, 소형언어모델(sLM) 기반 가드레일의 차단 기준을 조정하는 데 적용된다. 이 연구에는 홍종현 연구원이 주저자로, 정민재 연구원이 공동저자로, 김민우 AI Safety팀 리더가 교신저자로 참여했다.
같은 흐름에서 금융·문화권별 AI 안전성을 주제로 한 공동연구 3편이 워크숍에 채택됐다. 해당 3편에는 김민우 AI Safety팀 리더가 교신저자로 참여했다. 이 가운데 금융보안원과의 공동 연구 2편은 금융 자연어처리 전문 워크숍인 'FinNLP'에 채택됐고, 이화여자대학교와의 공동 연구 1편은 책임 있는 AI 정렬을 주제로 하는 'PANDORA'에 채택됐다.
'Regression-Aware Statistically Gated Policy Updating for Korean Financial LLM Input Guardrails'가 FinNLP에 채택됐다. 이 연구는 금융 분야 레드팀 공격을 대상 공격군으로 삼았으며, 기존 가드레일의 미차단 사례를 학습에 반영해 방어 정책을 반복적으로 개선하는 내용을 제안했다. 또한 정책 갱신 과정은 기존 방어 성능의 저하 여부를 자동으로 검증하도록 설계됐다.
'Hidden Below the Landing Page: Tracking Linked Pages and Relation-Centered DOM Summaries for Financial Phishing Detection'도 같은 워크숍에 채택됐다. 이 연구는 피싱 사이트의 첫 화면뿐 아니라 연결된 페이지까지 분석 범위에 포함했으며, 페이지 간 관계를 공동으로 분석하는 특징을 담았다. 이를 통해 개인정보 입력·전송 등 실제 피싱 행위에 대한 LLM 식별을 다뤘다.
PANDORA 워크숍 채택 논문인 'LatAm-RT: Toward Culturally Adaptive Red Teaming for AI Safety in Latin America'는 멕시코·엘살바도르·코스타리카·칠레를 연구 범위로 삼아 각국 언어·제도·사회적 맥락을 반영했다. 이 연구는 레드팀 공격 데이터를 현지화하고 국가·문화별 안전성 평가 차이를 분석하는 방식으로 수행됐다. 이를 통해 안전성 데이터를 단순 번역하는 수준을 넘어 문화적 맥락 자체를 평가 데이터에 반영했다.
분석 결과 동일 AI 모델도 국가·문화에 따라 안전성 평가 결과가 상이할 수 있는 것으로 나타났다. 이 같은 접근은 PANDORA 워크숍 채택에 이어 구두발표 논문 선정으로도 이어졌다.
셀렉트스타는 이번 연구 성과를 '다투모 플랫폼(Datumo Platform)'에 적용할 계획이다. 다투모 플랫폼은 현재 AI 신뢰성 평가 컨설팅, 자동 레드티밍, sLM 기반 가드레일 기술을 제공하고 있다. 셀렉트스타는 연구 결과를 반영해 국가·산업별 평가 체계를 고도화한다는 방침이다.
김세엽·셀렉트스타 대표는 EMNLP 논문 채택이 자사의 AI 신뢰성 평가와 안전성 연구 역량이 국제 학술 무대에서 확인된 의미를 갖는다고 밝혔다. 이어 김세엽 대표는 해당 연구 성과를 평가, 레드티밍, 가드레일 기술과 연계할 계획이며, 이를 기업의 실제 서비스 환경에서 활용 가능한 AI 신뢰성 검증 체계로 발전시키는 것을 목표로 한다고 설명했다.
출처: 테크월드뉴스 · 김승기 기자
원문: https://www.epnc.co.kr/news/articleView.html?idxno=407422
참고자료
이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.
출처 테크월드뉴스
원문 확인이 기사는 테크월드뉴스 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.