구글, 영상 아바타 붙인 실시간 AI 에이전트 출시
인공지능신문 ·
✦ AI 요약
97개 언어 자동 인식·실시간 카메라·화면 공유 이해, 음성 넘어 영상 아바타로 확장…웹·모바일·키오스크서 실시간 에이전트 구현
인공지능신문에 따르면 구글 클라우드는 9월 25일 기업용 플랫폼에서 '제미나이 3.8 라이브'의 라이브 아바타를 정식 제공하며, 음성 AI를 영상 아바타와 실시간 영상 이해를 갖춘 업무형 에이전트로 확장했다. 이 서비스는 97개 언어를 자동 인식하고, 웹·모바일·키오스크 환경에서 대화와 작업 수행을 함께 처리하도록 설계됐다. 핵심은 사람처럼 말하는 수준을 넘어, 사용자가 말을 끊거나 개입해도 대화 맥락을 유지한 채 백엔드 작업을 이어가는 데 있다. 여기에 카메라 영상과 화면 공유를 함께 이해하고 도구 호출까지 연결해, 말로 설명하고 화면이나 현장을 보여주면서 실제 업무를 진행하는 흐름을 노린다. 활용 예시로는 고객 응대와 접수 업무처럼 대화와 판단, 후속 처리가 한 세션 안에서 이어지는 장면이 제시됐다. 다만 아바타 확산에 따른 오용 우려에 대응해 검증 절차와 워터마크 같은 통제 장치도 함께 내세웠다.
관점
이 사안의 의미는 경쟁 축이 답변 성능만 좋은 모델에서 실제 업무를 끝까지 처리하는 인터페이스로 옮겨가고 있다는 점입니다. 음성과 화면, 영상, 도구 호출이 한 흐름으로 묶이면 기업은 별도 단계로 나뉘어 있던 상담과 처리 과정을 다시 설계할 수 있습니다. 반대로 이런 전환은 자연스러운 상호작용 못지않게 신뢰와 통제 장치를 얼마나 촘촘히 갖추느냐가 채택의 조건이 된다는 점도 함께 보여줍니다.
이 관점은 비즈크러시가 작성한 자체 의견이며, 인공지능신문의 보도 내용과 무관합니다.
이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.
출처 인공지능신문
원문 확인이 기사는 인공지능신문 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.