核心事件与关键时间点
2026 年 9 月 23 日,谷歌正式发布 Gemini 家族两款全新文本转语音(TTS)模型:Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS。所有新模型均即日起向开发者开放,具体可用渠道如下:
- 开发者通道:Gemini API 与 Google AI Studio 已上线新模型
- 企业通道:Gemini Enterprise 版 API 将于近期推送
- 消费者产品集成:Gemini Notebook 已集成 Flash TTS;Google Vids 已集成 Flash-Lite TTS
- 语音复制限制:AI Studio 的语音复制功能在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士及印度不可用
功能升级:从静态语音到动态创意工作室
本次更新核心在于将语音生成从预设音色升级为可编程的动态创作流程。两大模型均支持对每一行台词进行精确控制,区别在于定位与优化方向不同。
Gemini 3.8 Flash TTS 面向深度创意场景,如游戏角色设计、沉浸式有声读物等,强调高质量输出与表现力;Gemini 3.8 Flash-Lite TTS 则针对大容量配音与高性价比需求,优化了长文本生成的效率与一致性。
两款模型均支持多项新能力:
- 生成式语音设计:通过自然语言提示,在 100 多种语言及方言中自定义口音、角色与语音特征
- 扩展语音库:可访问 2000 多种现成语音,包含墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体
- 语音复制:仅需 30 秒音频样本即可重现声音特征,内置 SynthID 水印与 C2PA 凭据保护
- 逐行指导表演:允许用户编写舞台指导或依靠 Gemini 提示控制节奏、情绪与方言切换
一项反差数据值得注意:尽管 Flash-Lite 定位成本优化场景,其在 Hume AI 整体质量指数中仍排名第二,仅低于 Flash TTS 的第一位置,表明性能 downgrade 并未牺牲基础表现。
专业对比与性能基准
以下为新老模型核心能力对比:
| 能力维度 | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS | Gemini 3.1 Flash TTS |
|---|---|---|---|
| 定位 | 深度创意角色设计 | 大容量高性价比配音 | 基础 TTS |
| 语音设计自由度 | 自然语言提示创建全新语音 | 音调/节奏/表现力微调 | 预设语音选择 |
| 双扬声器剧本控制 | 支持,Stamp 演化改进显著 | 支持 | 基础支持 |
| Hume AI 整体质量指数 | 1 | 2 | — |
| Hume AI 口音建模分数 | 60.8 | — | — |
| Voice Arena 全球多语言测试 | 领先 | 领先 | — |
Hume AI 基准测试显示,Gemini 3.8 Flash TTS 在总分(71.4 分)及口音建模(60.8 分)两项均居首位。Voice Arena 盲测中,新模型在日本语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语及印地语六种主要语言中全面领先竞品。
产品落地建议
- 适合立即尝试的用户:播客创作者(需长音频连续性)、游戏开发者(需多角色动态配音)、沉浸式内容生产者(需实时生成拟真语音)
- 建议再等等的用户:位于受限地区(伊利诺伊州/德克萨斯州/EU 区域等)需语音复制功能者;企业级需低延迟批量生成场景可等待 Gemini Enterprise 正式推送
写在最后
语音生成技术正从"可用"迈向"可信"与"可控"。 Gemini 3.8 通过 SynthID 水印与同意验证机制,在创意自由度与身份保护间建立新平衡,标志着 TTS 从工具向平台生态的关键跃迁。

