AI

애피어, 기업용 AI 신뢰성 기준을 다시 묻다

인공지능신문 ·

연구 AI 생성 이미지

✦ AI 요약

정보 부족 인식·과업별 추론 언어 선택 역량 분석

인공지능신문에 따르면 애피어는 9월 10일 기업용 에이전틱 AI의 신뢰성을 높이기 위한 연구를 공개하며, 모델이 정보 부족을 스스로 인식하고 과업에 맞는 언어로 추론해야 한다는 기준을 제시했다. 주요 LLM 28종 실험에서는 정답이 없는 상황에서 정확도가 30~50% 하락해, 답을 보류해야 할 때도 그럴듯한 오답을 고르는 경향이 드러났다고 전했다. 연구는 검색 기반 응답 구조에서 정보가 충분한지 먼저 가려내는 능력이 실제 업무 판단의 핵심이라고 봤다. 또 추론에 어떤 언어를 쓰느냐가 논리 문제만이 아니라 안전성 판단과 문화적 맥락 이해에도 영향을 준다고 짚었다. 이에 따라 기업이 AI를 도입할 때는 검색 성능 자체보다 불확실성을 다루는 방식과 과업별 추론 전략까지 함께 평가해야 한다는 문제의식을 내놨다. 애피어는 이런 연구를 바탕으로 에이전틱 AI가 단순 응답 단계를 넘어 실제 비즈니스 의사결정을 더 안정적으로 지원하도록 제품 적용도 모색할 계획이라고 밝혔다.

관점

이 사안은 기업용 AI 경쟁이 답변 성능 비교를 넘어, 언제 멈추고 어떻게 생각할지를 설계하는 단계로 옮겨가고 있음을 보여준다. 특히 글로벌 환경에서는 같은 모델이라도 추론 방식에 따라 결과의 신뢰도와 현장 적합성이 달라질 수 있어, 앞으로는 도입 여부보다 운영 기준과 평가 체계를 누가 먼저 정교하게 세우느냐가 차별점이 될 가능성이 크다.

이 관점은 비즈크러시가 작성한 자체 의견이며, 인공지능신문의 보도 내용과 무관합니다.

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.


출처 인공지능신문

원문 확인

이 기사는 인공지능신문 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.