TOKENPOST

구글, 130개 언어 음성 모델 출시…대사별 감정 조정

토포AI로 이 기사 더 깊이 읽기

음성 녹음 부스에 놓인 스튜디오 마이크 / TokenPost.ai

구글($GOOGL)이 대사별 억양과 감정, 방언을 조정할 수 있는 제미나이 3.8 플래시 TTS(Gemini 3.8 Flash TTS)를 출시했다. 음성 생성 기능을 단순 낭독에서 캐릭터 제작과 다중 화자 콘텐츠 구성으로 확장한 것이 핵심이다.

구글은 23일 제미나이 3.8 플래시 TTS와 제미나이 3.8 플래시 라이트 TTS(Gemini 3.8 Flash-Lite TTS)를 공개했다. 플래시 TTS는 음성 품질과 표현력에, 플래시 라이트 TTS는 대량 생성과 저지연 음성 에이전트에 초점을 맞췄다.

제미나이 3.8 플래시 TTS는 자연어 프롬프트로 새로운 목소리를 만들고 대사 단위로 말투와 속도, 감정, 억양을 지시할 수 있다. 여러 화자가 등장하는 대화에서는 화자별 음색을 유지해 장시간 음성의 일관성을 높이는 기능도 제공한다.

플래시 라이트 TTS는 처리량과 응답 속도가 중요한 작업을 겨냥한다. 대량 콘텐츠 제작과 실시간 음성 에이전트, 읽어주기 기능 등이 주요 활용처로 제시됐다.

두 모델에는 30초 분량의 오디오 샘플을 활용한 음성 복제 기능이 포함됐다. 구글은 음성 복제 과정에서 동의 확인을 요구하고, 생성된 음성에는 인공지능 생성물임을 식별할 수 있는 SynthID 워터마크를 적용한다고 설명했다.

구글 개발자 문서에 따르면 플래시 TTS는 130개 언어, 플래시 라이트 TTS는 101개 언어를 지원한다. 오디오북, 스튜디오 내레이션, 게임 캐릭터, 팟캐스트, 다중 화자 대화와 난도가 높은 발음·지역 방언 처리가 활용 분야로 제시됐다.

발음 벤치마크 수치는 별도로 구분해야 한다. Crypto Briefing은 제미나이 3.8 플래시 TTS가 Artificial Analysis의 ‘Pronunciation Robustness Benchmark’에서 89.5%를 기록해 1위에 올랐다고 보도했다.

Artificial Analysis가 공개한 방법론은 발음이 어려운 문장을 모델에 읽게 한 뒤 독립 평가자가 문장별 발음 정확성을 판단하는 방식이다. 평가 대상에는 문맥에 따라 발음이 달라지는 단어와 숫자·날짜·단위, 코드와 고유명사가 포함된다.

다만 Artificial Analysis의 공개 페이지에서는 제미나이 3.8 플래시 TTS의 89.5% 점수와 순위를 확인할 수 없다. 이 수치는 원자료가 공개되거나 재현될 때까지 Crypto Briefing이 전한 내용으로 구분해야 한다.

구글은 Hume AI의 Voice Design Benchmark에서 제미나이 3.8 플래시 TTS가 종합 71.4점, 억양 모델링 부문 60.8점으로 선두를 기록했다고 밝혔다. Hume AI는 음성 AI를 자연스러움뿐 아니라 지시 이행과 역할 적합성, 억양 등 여러 항목으로 나눠 평가하고 있다.

Hume AI의 공개 자료에서 확인되는 제미나이 3.1 플래시 관련 지표는 감정과 전달 방식, 역할 적합성 등을 평가한 별도 결과다. 따라서 해당 수치를 Artificial Analysis의 발음 견고성 점수와 직접 비교하기는 어렵다.

이번 모델은 앞서 구글이 실시간 음성 대화와 확장 추론을 지원하는 제미나이 3.8 라이브 모델 2종을 공개한 것과는 용도가 다르다. 라이브 계열이 음성 입력을 이해하고 대화형 응답을 수행하는 데 초점을 맞춘다면, TTS는 문자를 음성으로 변환하는 기술이다.

제미나이 3.8 라이브와 TTS가 별도 모델이라는 본지 보도에서도 두 기술의 처리 과정과 활용 목적이 다르다는 점이 확인됐다. 이번 발표는 음성 AI 제품군 안에서 실시간 대화와 음성 제작 기능이 별도 모델로 확장되는 흐름을 보여준다.

구글은 게임·오디오북·팟캐스트·대화형 미디어를 주요 활용처로 제시했다. Figma·HeyGen·Linguana·Wondercraft와의 협력도 공개했지만, 각 협력사의 실제 도입 범위와 상용 성과는 제시되지 않았다.

실제 서비스 경쟁력은 발음 점수 하나만으로 판단하기 어렵다. 다국어와 방언 처리 품질, 응답 지연시간, 생성 비용, 장시간 음성의 안정성, 음성 복제에 대한 동의와 추적 가능성을 함께 확인해야 한다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.