구글이 실시간 음성 대화와 시각 정보 처리를 지원하는 제미나이 3.8 라이브 모델을 공개했다. 다만 영상 아바타 기능인 ‘Live Avatar’의 정식 출시 여부는 구글 공식 자료에서 별도 확인되지 않았다.
구글은 15일 제미나이 3.8 라이브(Gemini 3.8 Live)와 제미나이 3.8 라이브 확장 추론(Gemini 3.8 Live Extended Thinking)을 선보였다. 두 모델은 음성 대화를 이어가면서 시각 정보를 처리하고, 대화 중 백그라운드에서 도구와 API를 호출하도록 설계됐다.
기업용 서비스에서는 제미나이 엔터프라이즈를 대상으로 비공개 프리뷰가 시작됐다. 제미나이 엔터프라이즈 고객 경험 서비스에도 제공될 예정이다.
이번 출시는 구글이 실시간 음성 대화와 확장 추론을 지원하는 제미나이 3.8 라이브 모델 2종을 공개한 내용의 후속 확인 성격이다. 쟁점은 모델 출시와 별개로 영상 아바타 기능이 실제로 함께 공개됐는지 여부다.
크립토브리핑은 24일 구글이 기업용 실시간 영상 아바타 기능인 ‘Live Avatar’를 공개했다고 보도했다. 해당 기능은 음성에 맞춘 아바타의 입 모양과 표정 구현, 기업용 데이터 거버넌스, SynthID 워터마크를 지원하는 것으로 소개됐다.
그러나 구글의 공식 발표문과 개발자 문서에는 ‘Live Avatar’라는 별도 기능이나 제품이 나오지 않는다. 맞춤형 아바타 허용목록과 생성 영상 전체에 적용되는 SynthID, 기업 고객용 영상 아바타 출시 일정도 같은 방식으로 확인되지 않는다.
언어 지원 수치도 자료별로 다르다. 구글의 제미나이 3.8 라이브 발표문은 대화 중 97개 언어를 자동 감지하고 전환한다고 설명했지만, 제미나이 Live API 문서는 지원 언어를 99개로 제시한다.
두 수치는 적용 대상이 다를 수 있다. Live API의 99개 언어 지원이 영상 아바타 기능에 그대로 적용된다는 근거는 제시되지 않았다.
공식 자료에서 SynthID 적용 대상으로 확인되는 것은 AI가 생성한 오디오다. 구글은 음성 출력에 사람이 인식하기 어려운 워터마크를 삽입해 AI 생성 콘텐츠 식별을 돕는다고 설명했다.
따라서 ‘생성 영상 전체에 SynthID가 적용된다’는 설명은 오디오 워터마크와 구분해야 한다. 영상 아바타에 같은 기술이 적용되는지는 별도 발표가 필요한 사안이다.
구글이 기업용 AI 아바타를 제공하지 않는 것은 아니다. Google Vids에는 대본을 바탕으로 발표 영상을 만드는 맞춤형 AI 아바타 기능이 포함돼 있으며, 기업 로고와 배경을 반영한 영상을 만들 수 있다.
Google Vids에서 생성한 영상에는 SynthID 워터마크가 적용된다. 다만 이 서비스는 영상 제작 도구로, 제미나이 3.8 라이브처럼 실시간 음성 대화를 수행하는 아바타 서비스와는 제공 방식이 다르다.
개발자는 제미나이 API와 Google AI Studio에서 제미나이 3.8 라이브를 사용할 수 있다. 구글은 음성 중심의 실시간 상호작용과 시각적 맥락 이해를 주요 기능으로 제시했다.
기업 고객의 실제 사용 사례와 가격, 제공 지역, 영상 아바타의 API 접근 방식은 아직 공개되지 않았다. 관련 기능을 소개한 게시물이 레딧 커뮤니티에 공유됐지만, SNS 게시물만으로 공식 출시나 기술 사양을 확정할 수는 없다.
현재 구글 공식 자료로 확인되는 범위는 제미나이 3.8 라이브와 확장 추론 모델의 공개, 그리고 기업용 음성 AI 비공개 프리뷰다. Live Avatar의 정식 출시와 영상 기능의 세부 사양은 구글의 추가 발표가 있어야 판단할 수 있다.

김하린 기자
댓글0
첫 댓글을 남겨 보세요.