Featured image of post 谷歌发布 Gemini 3.8 Flash TTS 与 Flash-Lite 模型:逐行控制台词演绎,无限语音库上线

谷歌发布 Gemini 3.8 Flash TTS 与 Flash-Lite 模型:逐行控制台词演绎,无限语音库上线

谷歌推出新一代 TTS 模型,支持自然语言创建语音及无限语音库扩展。

核心事件与关键时间点

核心事件与关键时间点
核心事件与关键时间点|新闻截图

2026 年 9 月 23 日,谷歌正式发布 Gemini 家族两款全新文本转语音(TTS)模型:Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS。所有新模型均即日起向开发者开放,具体可用渠道如下:

  • 开发者通道:Gemini API 与 Google AI Studio 已上线新模型
  • 企业通道:Gemini Enterprise 版 API 将于近期推送
  • 消费者产品集成:Gemini Notebook 已集成 Flash TTS;Google Vids 已集成 Flash-Lite TTS
  • 语音复制限制:AI Studio 的语音复制功能在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士及印度不可用

功能升级:从静态语音到动态创意工作室

本次更新核心在于将语音生成从预设音色升级为可编程的动态创作流程。两大模型均支持对每一行台词进行精确控制,区别在于定位与优化方向不同。

Gemini 3.8 Flash TTS 面向深度创意场景,如游戏角色设计、沉浸式有声读物等,强调高质量输出与表现力;Gemini 3.8 Flash-Lite TTS 则针对大容量配音与高性价比需求,优化了长文本生成的效率与一致性。

两款模型均支持多项新能力:

  • 生成式语音设计:通过自然语言提示,在 100 多种语言及方言中自定义口音、角色与语音特征
  • 扩展语音库:可访问 2000 多种现成语音,包含墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体
  • 语音复制:仅需 30 秒音频样本即可重现声音特征,内置 SynthID 水印与 C2PA 凭据保护
  • 逐行指导表演:允许用户编写舞台指导或依靠 Gemini 提示控制节奏、情绪与方言切换

一项反差数据值得注意:尽管 Flash-Lite 定位成本优化场景,其在 Hume AI 整体质量指数中仍排名第二,仅低于 Flash TTS 的第一位置,表明性能 downgrade 并未牺牲基础表现。

专业对比与性能基准

以下为新老模型核心能力对比:

能力维度Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTSGemini 3.1 Flash TTS
定位深度创意角色设计大容量高性价比配音基础 TTS
语音设计自由度自然语言提示创建全新语音音调/节奏/表现力微调预设语音选择
双扬声器剧本控制支持,Stamp 演化改进显著支持基础支持
Hume AI 整体质量指数12—
Hume AI 口音建模分数60.8——
Voice Arena 全球多语言测试领先领先—

Hume AI 基准测试显示,Gemini 3.8 Flash TTS 在总分(71.4 分)及口音建模(60.8 分)两项均居首位。Voice Arena 盲测中,新模型在日本语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语及印地语六种主要语言中全面领先竞品。

产品落地建议

  • 适合立即尝试的用户:播客创作者(需长音频连续性)、游戏开发者(需多角色动态配音)、沉浸式内容生产者(需实时生成拟真语音)
  • 建议再等等的用户:位于受限地区(伊利诺伊州/德克萨斯州/EU 区域等)需语音复制功能者;企业级需低延迟批量生成场景可等待 Gemini Enterprise 正式推送

写在最后

语音生成技术正从"可用"迈向"可信"与"可控"。 Gemini 3.8 通过 SynthID 水印与同意验证机制,在创意自由度与身份保护间建立新平衡,标志着 TTS 从工具向平台生态的关键跃迁。