MS, 가전 AI 대화 지연 줄인다…LG ‘씽큐 온’ 협업 공개
테크월드뉴스 ·
✦ AI 요약
MS·LG전자는 AI 홈 음성 에이전트의 대화 품질 개선을 위해 협업했다.
양사는 발화 인식, 답변 생성, 음성 전달을 연동해 지연을 줄이고, 새 요청이 들어오면 기존 응답을 중단한 뒤 대응하도록 했다.
이 협업 내용은 9월 30일 서울 코엑스 그랜드볼룸에서 열린 '마이크로소프트 인더스트리 서밋' 제조 세션에서 발표됐다.
MS·LG전자가 AI 홈 음성 에이전트의 대화 품질 개선을 위해 협업했다. 양사는 이용자 발화 인식·답변 생성·음성 전달 과정을 연동해 지연을 줄였고, 대화 도중 새 요청이 입력되면 기존 응답을 중단한 뒤 새 요청에 대응하도록 구현했다.
한국마이크로소프트는 9월 30일 서울 코엑스 그랜드볼룸에서 '마이크로소프트 인더스트리 서밋'을 개최했다. 이 행사에서는 금융·리테일·제조·헬스케어·교육 분야의 AI 활용 사례를 공유했고, 업무·고객 서비스·연구개발·생산 현장을 대상으로 한 AI·에이전트 적용 방안을 논의했다.
이 협업 내용은 행사 제조 세션에서 사례로 발표됐다. 김철하 LG전자 HS플랫폼사업센터 팀장과 성민지 한국마이크로소프트 기술전략 매니저는 스마트홈 허브 '씽큐 온' 보이스 에이전트에 애저 보이스 라이브·음성인식(STT)·음성합성(TTS)을 적용한 개발 과정을 소개했고, 관련 시연 영상도 공개했다.
이번 협업은 음성 처리 각 단계 대기시간 축소를 핵심 과제로 삼았다. 기존 구조에서는 음성인식 완료 후 대규모언어모델(LLM) 답변 생성이 시작됐고, 답변 생성 완료 후 음성합성이 시작됐다. 이 같은 순차 구조의 결과로 지연이 누적됐다.
이를 줄이기 위해 보이스 라이브에는 '오버랩드 스트리밍' 기술이 적용됐다. 오버랩드 스트리밍 방식은 중간 처리 결과를 다음 단계로 전달하는 구조다. 보이스 라이브는 이용자 발화를 청취하는 중에도 추론을 시작하도록 동작한다.
또 생성된 답변은 순차적으로 음성 출력된다. 성 매니저는 오버랩드 스트리밍의 핵심이 부분 결과가 준비되는 즉시 다음 단계를 시작하는 데 있다고 설명했다. 이어 듣는 중 추론을 시작하고, 추론 중에도 말하기를 시작하는 구조라고 전했다.
서비스별 호출도 하나의 웹소켓 세션으로 통합됐다. 웹소켓 세션 통합의 목적은 네트워크 왕복 지연 감소다.
아울러 응답 시점 결정 기준도 보완됐다. 침묵 시간만으로 발화 종료를 판단할 경우 이용자가 생각 중 잠시 멈춘 말을 중단한 것으로 볼 수 있는 문제가 있었고, 요청이 끝난 뒤에도 응답이 지연되는 문제가 있었다.
양사는 '시맨틱 VAD'를 적용해 응답 시작 시점과 대화 이력 반영 방식을 조정함으로써 음성 상호작용의 자연스러움과 끼어들기 대응을 개선했다. '시맨틱 VAD'는 문장 완결성과 대화 맥락을 반영하는 방식이다.
이에 따라 명령이 완결되면 응답하고, 연결어·열거 표현 등 후속 발화 가능성이 있으면 대기하도록 했다. 답변 중 이용자 발화가 시작되면 음성 출력을 중단하고 새 요청을 처리하도록 했으며, 미재생 음성은 폐기한다.
대화 이력에는 이용자가 실제로 청취한 내용까지만 반영한다. 답변이 끝까지 재생되지 않은 상태에서 이용자가 다시 말을 시작하는 상황을 고려한 반영 방식이다.
가전 상태 조회·제어에 지연이 있을 때는 짧은 안내를 먼저 제공한다. LG전자는 LLM이 맥락에 맞는 "확인해 볼게요"류 문구를 생성하도록 구현해, 작업 중에도 이용자가 진행 상태를 인지할 수 있게 했다.
이와 관련해 성 매니저는 툴 실행 시간 자체는 동일하다고 밝혔다. 다만 첫 음성을 즉시 출력해 체감 대기를 줄이는 방식이라고 설명했다.
아울러 제품명 인식부터 LG 고유 목소리까지 구현했다. 음성인식에서는 범용 모델이 놓치기 쉬운 제품명·기능명을 보완했으며, LG전자 고유 용어가 일상 단어로 인식되면 요청을 정확하게 처리하기 곤란하다는 점을 고려한 조치다.
음성인식 개발에서는 특정 용어를 별도 학습하지 않고도 반영할 수 있는 '프레이즈 리스트'와 언어·음향 모델을 특화 학습하는 '커스텀 스피치'를 함께 활용했다. 여기에 반복형 가전 제어 명령을 반영하고 실제 음향 환경을 반영했으며, 실사용 데이터 기반 품질 지속 개선 체계도 마련했다.
다국어 확장에는 씽큐 언어팩에 축적된 제품명·기능명을 개발 자원으로 활용했다. 해당 자료에서 추출한 단어·문장을 기반으로 에이전트가 학습용 문장을 생성했고, 생성한 문장을 번역한 뒤 언어별 음성인식 모델 학습에 활용했다.
기존 언어 자산과 학습 데이터 생성 과정을 연계한 점도 개발 속도 향상으로 이어졌다고 설명했다. 김 팀장은 기존 다른 사업부의 10년간 29개 언어 개발 사례와 비교해 이번에는 1년간 16개 언어의 음성인식 성능을 개선했다고 밝혔다.
음성합성은 애저 커스텀 HD와 LG전자의 AI 페르소나를 결합하는 방식으로 구성했다. 성우 후보를 대상으로 테스트 녹음을 실시한 뒤 내부 평가를 거쳐 목소리를 선정했고, 선정한 목소리의 음색·말투·감정을 학습시켜 상황 적합 어조 표현을 구현했다.
LG전자는 음성 합성 전후 단계의 보완책을 더해 발화 정확성과 출력 속도를 함께 개선했다. 숫자·약어의 적절한 발화를 위한 텍스트 변환 전처리를 추가했고, 여러 언어 혼합 문장에 언어 태그를 부여하는 전처리도 추가했다. 이미 합성한 음원을 저장·재사용하는 방식을 적용했고, 해당 방식으로 출력 속도를 보완했다.
이런 전처리와 재사용 구조 위에서 보이스 라이브는 음성인식·LLM·음성합성을 연동하고, 기존 LG AI 에이전트를 도구 호출로 연결하도록 구성됐다. 이를 통해 기존 가전 제어·서비스 기능을 활용하고, 음성 대화 품질 향상을 목적으로 가전 제어와 서비스 수행을 음성 대화로 이어가도록 했다.
공개 시연에서는 앞선 대화 기반의 제어를 연속 수행하는 모습이 제시됐다. 이용자가 아이의 수면에 적합한 온도를 질의한 뒤 그 온도로 침실 에어컨 설정을 요청하자 이를 음성 대화의 문맥에 따라 처리했고, 공기청정기 상태 확인과 조명 제어, 동화 생성도 음성으로 처리했다.
김 팀장은 시연 영상의 촬영일이 9월 4일이었으며 이후 응답 속도를 개선하고 음악 재생 기능도 연동했다고 전했다. 향후 과제로는 주변 환경 영향을 줄이는 일과 사람 간 대화처럼 안정적인 음성 송수신 기술이 제시됐다.
김 팀장은 좋은 에이전트의 조건으로 높은 이해도와 사람과 대화하듯 상호작용하는 방식, 브랜드의 목소리 구현을 제시했다. 이어 마이크로소프트와 협업을 진행하며 보이스 라이브와 STT, TTS를 고도화 대상으로 삼아 음성 경험을 풍부화하는 흐름을 설명했다.
출처: 테크월드뉴스 · 김승기 기자
원문: https://www.epnc.co.kr/news/articleView.html?idxno=407593
참고자료
이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.
출처 테크월드뉴스
원문 확인이 기사는 테크월드뉴스 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.