구글, 게임·인터랙티브 미디어용 AI 음성 합성 모델 Gemini 3.8 Flash TTS 출시
구글이 Gemini 3.8 Flash TTS를 출시해 게임·팟캐스트용 고품질 AI 음성 합성 서비스를 시작했어요.
구글이 2026년 9월 23일, Gemini 3.8 Flash TTS와 Flash-Lite TTS를 출시하고 Gemini API 및 AI Studio에서 즉시 사용 가능하도록 했어요. Flash TTS는 게임·오디오북·팟캐스트·인터랙티브 미디어처럼 깊은 캐릭터 표현이 필요한 창작 분야에 특화됐고, Flash-Lite TTS는 더빙·대규모 오디오 콘텐츠 생성처럼 높은 처리량과 낮은 비용이 중요한 영역을 겨냥해요. 두 모델 모두 최대 8,000토큰 텍스트를 입력받아 오디오를 바로 스트리밍으로 출력해요.
텍스트 설명으로 캐릭터 목소리를 직접 디자인하거나 약 30초 분량의 오디오 샘플로 목소리를 복제하는 기능이 핵심이에요. 웃음·한숨 같은 비언어적 표현도 인라인 태그로 제어할 수 있고, 한 번의 요청으로 두 화자가 등장하는 장면도 자연스럽게 생성할 수 있어요. API에는 30개 스튜디오 보이스가 기본 제공되고 확장 라이브러리를 더하면 130개 언어로 2,000개 이상의 보이스를 활용할 수 있어요. 게임 개발자 입장에서는 성우 섭외 없이도 프로젝트당 최대 200개의 커스텀 캐릭터 보이스를 관리할 수 있다는 점이 최대 장점으로, 대규모 AI NPC 대화 시스템 구축에 실질적인 도움이 될 것으로 보여요.