AI

[현장] “잘못된 일을 자신 있게”…AI 에이전트의 ‘자율성 함정’

아이티데일리 (IT DAILY) ·

래리 헤크 미국 조지아공과대학교 교수가 19일 서울 강남구 코엑스에서 열린 ‘AI 서밋 서울 2026’에서 AI 에이전트의 ‘자율성 함정’을 주제로 기조연설을 하고 있다. (사진=김병주 기자)

✦ AI 요약

래리 헤크 조지아공과대학교 교수는 AI 에이전트의 성패 기준이 자율 작업 지속시간보다 사용자 요구를 정확히 파악하고 필요하면 다시 묻는 능력에 있다고 밝혔다.

그는 기존 벤치마크가 정적 평가에 적합하지만 실제 작업에서는 초기 입력이 모호해 에이전트가 잘못 추정한 뒤 실행하는 문제가 생긴다고 설명했다.

해결 방안으로는 LLM 곁에서 대화 흐름을 제어하는 '사이드카 컨트롤러'를 제시했고, 대화 품질이 43% 향상됐다고 설명했다.

미국 조지아공과대학교 교수인 래리 헤크는 19일 서울 강남구 코엑스 'AI 서밋 서울 2026' 기조연설에서 산업 현장 AI 에이전트의 성패 기준은 자율 작업 지속시간보다 불완전한 사용자 요구의 정확한 파악 능력과 필요 시 재질문 능력에 있다고 밝혔다. 대화형 AI 전문가인 그는 AI 에이전트의 성능을 자율성의 길이로 판단하는 접근에는 한계가 있다고 짚었다.

마이크로소프트(MS) '코타나'·구글 '구글 어시스턴트'·삼성전자 '빅스비' 개발에 참여한 헤크는 이를 AI 에이전트의 '자율성 함정(Autonomy Trap)'으로 규정했다. 그는 사용자 요구를 정확히 이해하고 필요할 때 다시 확인하는 능력을 위해서는 LLM의 유창성에 대화 흐름 통제 기술 결합이 필요하다고 설명했고, 실제 업무 실패 감소와 위 결합의 연관도 강조했다.

헤크는 1990년대 에이전트 연구부터 LLM 기반 에이전트까지 30여 년 기술 변화를 회고하며 이러한 문제의식을 연결했다. 그는 결국 인간과 기계가 서로의 의도를 어떻게 일치시킬 것인가가 다시 핵심 과제라고 제시했다.

19일 서울 강남구 코엑스에서 'AI 서밋 서울 2026'이 개최됐다. 래리 헤크 미국 조지아공과대학교 교수가 AI 에이전트 '자율성 함정'을 주제로 기조연설에 나섰다. 사진은 김병주 기자가 촬영했다.

헤크 교수는 AI 에이전트의 문제를 성능 수치 자체보다 현행 AI 에이전트 성능 평가 방식과 실제 사용 환경 사이의 간극에서 진단했다. 그는 기존 벤치마크가 명확한 질문 제시와 정답 판별을 중심으로 한 정적 평가에 적합하다고 설명했다.

반면 에이전트가 사용자를 대신해 다단계 작업을 수행할 때는 평가 조건이 달라진다고 봤다. 그 이유로 사용자 초기 입력에서 목표와 조건이 완전하게 제시된다고 전제할 수 없다는 점을 들었다.

헤크 교수가 제시한 사례에 따르면 완전하고 명확한 프롬프트에서는 성능이 89%였지만, 실제 사용자와 같은 모호한 요구에서는 성능이 6.7%로 나타났다.

헤크 교수는 첫 프롬프트가 실제 작업이 아니거나 작업의 완전·명확한 진술이 아닌, 첫 제안 수준에 그친다고 설명한다. 인간의 상호 의견 일치도 여러 차례 대화 교환 과정을 통해 이뤄진다고 본다.

그는 첫 요청만으로 작업 의도를 확정하기 어렵기 때문에, 본래는 추가 대화를 통해 목표를 맞춰 가야 한다고 본다. 이와 관련한 문제점으로는 에이전트가 추가 질문을 실행하지 않고, 부족한 정보를 자의 추정한 뒤 실행에 착수하는 점을 들었다.

헤크 교수는 사례로 사용자가 결제 모듈을 정리해 달라고 요청한 경우를 제시했다. 그러나 에이전트는 미사용 임포트 제거와 변수명 변경을 수행했다.

반면 사용자의 실제 의도는 폐기된 결제 경로 삭제였다. 그 결과 작업 수행 자체는 완료됐지만, 원래 목표는 미달성에 그쳤다.

헤크 교수는 해당 현상을 잘못된 일을 자신 있게 수행하는 데 성공한 것이라고 규정했다. 이는 LLM의 유창성 문제를 해결하는 대신 대화 통제가 약화되는 문제와 맞닿아 있다는 것이 소제목의 취지다.

헤크 교수는 해법의 단서로 과거 AI 어시스턴트를 거론했다. 2010년대 대화형 AI 구조는 사용자 의도 파악, 슬롯(Slot) 충전, 애플리케이션프로그래밍인터페이스(API) 호출로 이뤄졌고, 현재 LLM 대비 범용성·표현력 열세라는 한계가 있었지만 사용자의 상태(State)와 대화 흐름의 명시적 관리가 가능했다.

챗GPT 등장 이후 LLM의 유창성은 대폭 개선됐다. 이전 대화형 AI의 고질적 약점은 유창성이었고, 챗GPT 등장 당시 연구자들조차 유창성과 강건성(robustness) 확보로 인식했다고 헤크 교수는 설명했다. 다만 그 과정에서 대화·추론·응답을 거대 모델에 일임하게 됐고, 개발자가 상호작용 과정을 세밀하게 통제하기 어려워졌다고 헤크 교수는 진단했다.

이로 인해 통제력이 약화됐고, 헤크 교수는 그 과정에서 통제력 상실이 있었다고 밝혔다. 이 같은 통제력 약화는 에이전트가 실제 행동을 수행할 때 위험 증대 가능성으로 이어질 수 있다.

이런 문제를 보완하는 방안으로 헤크 교수 연구팀은 '사이드카 컨트롤러(Sidecar Controller)'를 연구하고 있다. 이 접근 방식은 LLM에 모든 역할을 집중하는 대신 별도 제어 구조를 도입해 LLM 곁에서 대화 흐름을 제어하고, 현재 대화 상태를 기반으로 다음 행동을 결정하는 방식이다. 헤크 교수는 이 컨트롤러의 규모가 기반 LLM 대비 약 10만 배 작다고 설명했으며, 실험 결과 대화 품질은 43% 향상됐다.

19일 서울 강남구 코엑스에서 열린 'AI 서밋 서울 2026'에서는 LLM의 유창함을 유지하면서 2010년대에 배운 요소와 필요한 통제력을 복원하는 방법이 제시됐다. 앞선 발언은 LLM의 장점인 표현 능력을 유지하면서도 필요한 통제 가능성을 회복하는 방향을 설명하는 데 초점이 맞춰졌다.

이어 열린 패널 토크에서는 AI 에이전트 발전 방향과 상용화 과제가 논의됐다. 이 자리에는 김윤 트웰브랩스 사장 겸 최고전략책임자(CSO), 래리 헤크 미국 조지아공과대학교 교수, 케이 주 젠스파크 공동창업자 겸 최고기술책임자(CTO)가 참석했다. 사진은 김병주 기자가 촬영했다.

후속 패널 토크 주제는 '슈퍼 AI 에이전트, 어떻게 진화할까'였다. 이후 토론에서도 동일 문제가 지속됐으며, 헤크 교수·케이 주·김윤은 에이전트 상용화의 핵심 과제로 사용자와의 상호작용을 꼽았다.

논의는 사용자와 언제 어떻게 상호작용해야 하는지에 모였고, 쟁점으로는 에이전트의 행동 시점과 재질문 시점이 제시됐다. 이는 앞선 발언에서 제기된 통제 가능성의 문제와 맞닿은 흐름으로 이어졌다.

에이전트 설계의 핵심 쟁점은 자율 행동 시점·사용자 재질문 시점을 어디에 둘지에 맞춰졌다. 헤크 교수는 1990년대 MS 오피스 가상 도우미 '클리피(Clippy)' 사례를 제시했다. 클리피는 사용자 요청 전 도움을 제안했고, 헤크 교수는 이에 대한 반감이 이후 시스템의 선제 개입 기피 요인 중 하나가 됐다고 설명했다.

하지만 에이전트가 실제 행동 수행하는 시대에는 반대 문제가 발생한다고 봤다. 무질문 실행 시 잘못 이해한 목표의 그대로 수행 가능성이 있기 때문이다. 이에 헤크 교수는 시스템이 먼저 사용자에게 다가가 명확화를 요청해야 한다는 취지로 시스템의 선제 접근·사용자 명확화 요청 필요를 강조했다.

김윤 CSO는 에이전트에 즉시 실행만이 아니라 동의 시점·질문 시점을 판단하는 능력이 필요하다는 점을 제기했다. 다만 모든 판단 과정을 일일이 상세히 설명하면 과도한 정보가 다시 사용자의 부담이 될 수 있다는 지적도 함께 나왔다.

결국 상용 에이전트에 요구되는 능력은 자율성과 사용자 개입 사이의 적절한 지점을 탐색하는 데 있다는 흐름이다. 과도한 개입과 과도한 설명을 피하면서도 필요한 시점에 동의와 명확화를 구하는 균형이 요구된다는 것이다.

사용자가 의도를 전부 언어로 표현하지 않는 상황에서 에이전트 활용 정보를 확대할 수 있다는 방안이 제시됐다. 패널들이 주목한 대상은 음성·영상·이미지·시선 동시 처리 멀티모달 AI였다.

멀티모달 AI의 잠재 효과로는 사용자 의도 파악 방식의 변화가 거론됐다. 입력 신호를 늘리면 사용자의 설명이 부족한 경우에도 에이전트가 활용할 수 있는 정보가 확대될 수 있다는 맥락이다.

이를 뒷받침하는 사례로 헤크 교수가 소개한 2014년 음성+시선 추적 결합 실험이 언급됐다. 이 실험에서는 화면 특정 대상 응시 상태의 음성 지시에서 시선 정보 추가만으로 목적 파악이 용이해진 것으로 제시됐다.

헤크 교수는 이와 관련해 소프트웨어 복잡성 증대와 성능 강력화를 함께 언급했다. 또 에이전트의 의도 이해 용이성이 확대된다고 설명했다.

향후 발전 방향으로는 에이전트가 디지털 환경을 넘어 주변 환경의 시청각까지 인식하는 방안이 제시됐다. 이렇게 되면 프롬프트에 명시되지 않은 맥락 활용 여지가 확대될 수 있으며, 첫 프롬프트에 의도를 완전 포함한다고 가정하는 대신 대화와 주변 신호로 목표를 축소하는 대안적 접근이 가능하다는 점이 연결됐다.

기업이 에이전트를 실제 업무에 투입할 수 있을지를 판단하는 변수 중 하나로 경제성이 제시된다. 에이전트 도입 판단에서는 성능뿐 아니라 경제성도 함께 봐야 한다는 설명이다.

에이전트의 작업 완료 과정에서는 여러 차례 추론이 가능하고 외부 도구 호출도 가능하다. 이 때문에 작업 단계가 증가할수록 연산 비용이 누적될 수 있다.

헤크 교수는 개별 모델의 토큰 가격보다 성공적인 결과 1건 획득의 전체 비용을 확인할 필요가 있다고 주장했다. 단순 토큰 단가보다 최종적으로 성공한 결과 1건당 총비용이 더 적절한 기준이라는 취지다.

에이전트 선처리 실패 후 사람 재처리가 이뤄지면 비용 절감이 불가하고, 요청 오해가 발생하면 에이전트 실행 비용과 사람 재작업 비용이 동시에 발생한다. 헤크 교수는 측정 가능 대상은 개선 가능하다고 밝혔으며, 성공적인 결과의 비용을 측정하면 실제 진전 여부와 시스템 과다 지출 여부를 파악할 수 있다고 설명했다.

헤크 교수는 에이전트 지향점으로 인간-AI 간 '지적인 교감(Meeting of the minds)'을 제시했다. 그는 인간과 AI의 관계를 인간의 일방적 목표 입력이나 AI의 인간 의도 임의 추정이 아니라, 상호작용을 통해 수행 목표의 공통 이해에 도달하는 방식으로 설명했다.

이런 관점에서 헤크 교수는 AI 에이전트의 다음 경쟁 기준이 인간 대체 시간에 있지 않다고 봤다. 대신 인간이 원하는 목표를 정확하게 공동 탐색·수행하는 능력이 경쟁력의 기준이 된다고 설명했다.

이에 따라 헤크 교수는 에이전트의 미래를 '로봇'보다 '아이언맨 슈트'에 비유했다. 이는 인간의 통제권 유지, AI의 역할은 인간 보조, 자동기계보다 증강된 인간 지능 지향이라는 발언 요지를 담은 설명이다.

출처: 아이티데일리 (IT DAILY) · 김병주 기자
원문: https://www.itdaily.kr/news/articleView.html?idxno=241077

참고자료

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.


출처 아이티데일리 (IT DAILY)

원문 확인

이 기사는 아이티데일리 (IT DAILY) 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.