구글, 음성 대화 중 작업하는 AI 내놨다
인공지능신문 ·
✦ AI 요약
97개 이상 언어 지원·실시간 시각 정보 이해...음성 대화 중 API·도구 호출
인공지능신문에 따르면 구글은 9월 15일 음성 대화를 이어가면서도 백그라운드에서 API와 도구를 호출해 실제 작업까지 수행하는 '제미나이 3.8 라이브'를 공개했습니다. 이 모델은 97개 이상 언어를 지원하고, 카메라 등으로 들어오는 시각 정보까지 대화 맥락에 반영해 음성 에이전트 개발 범위를 넓히는 데 초점이 맞춰졌습니다. 단순히 듣고 답하는 음성 비서를 넘어서 대화 흐름을 끊지 않은 채 외부 시스템과 연결되는 구조를 내세운 점이 핵심입니다. 복잡한 다단계 요청에 대한 추론을 강화한 확장 모델도 함께 공개돼, 개발자가 응답과 사고 수준을 조절하며 에이전트를 설계할 수 있도록 했습니다. 구글은 전사, 번역, 음성 생성, 음악 생성까지 묶은 오디오 AI 제품군도 함께 제시하며 개발자 생태계 확장 의도를 분명히 했습니다. 이번 공개는 음성 AI 경쟁의 기준이 인식 정확도 자체보다 실시간 상호작용 속에서 얼마나 많은 일을 처리하느냐로 옮겨가고 있음을 보여줍니다.
관점
이 사안의 의미는 음성 인터페이스가 보조 입력 수단에서 실제 업무를 수행하는 실행 계층으로 올라서고 있다는 데 있습니다. 대화의 자연스러움을 해치지 않으면서 추론과 도구 호출, 시각 맥락 이해를 함께 묶는 흐름이 자리 잡으면, 업계 경쟁도 개별 기능의 성능 비교보다 이를 하나의 경험으로 얼마나 매끄럽게 통합하느냐로 재편될 가능성이 큽니다. 결국 개발자와 기업 입장에서는 모델 선택 기준이 정확도뿐 아니라 연결성, 확장성, 서비스 설계 유연성으로 넓어지게 됩니다.
이 관점은 비즈크러시가 작성한 자체 의견이며, 인공지능신문의 보도 내용과 무관합니다.
이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.
출처 인공지능신문
원문 확인이 기사는 인공지능신문 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.