谷歌 9 月 23 日宣布,Gemini 家族新增两款文本转语音模型:Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。前者面向深度创意方向和角色设计,可用自然语言提示从头创建语音,并对表演提示、节奏、方言转换等进行精细控制;后者面向大容量、高性价比的场景,针对大容量配音、音频内容创作和富有表现力的语音代理做了优化,可调节音调、节奏和表现力的细微差别。

在语音资源上,用户可从原有的 30 种原始语音扩展到不限数量的语音库。生成式语音设计支持在 100 多种语言和方言中自定义角色、口音和语音特征;扩展语音库提供 2000 多种现成语音,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。语音复制只需 30 秒音频样本即可重现一致的声音特征,并配有同意验证、SynthID 水印和 C2PA 凭据。自定义语音可以保存和管理,语音混音功能即将推出。
两款模型都支持对每一行台词的演绎方式做控制。用户可以自行编写舞台指导,也可以让 Gemini 依据脚本提示引导交付。长篇生成能在数小时连续音频中保持语音质量、自然节奏和角色音色,适合播客和有声读物。原生双声音场景编排可从单个脚本中引导多轮对话,并保持两种声音清晰分离;脚本里还能加入非语言提示和 mhm、yeah 之类的倾听插入语。
据谷歌公布的数据,Gemini 3.8 Flash TTS 在 Hume AI 语音设计基准测试中得 71.4 分,位列总体第一,口音建模得分 60.8 分,同样处于领先。两款模型在 Hume AI 整体质量指数中分列第一和第二。在 Voice Arena 的盲法人类偏好评估中,它们在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等主要语言上处于领先位置。
安全方面,语音复制要求用户提供语音所有者的口头同意记录,与参考说话者匹配后才能创建;生成的音频带有难以察觉的 SynthID 水印。两款模型已推送至 Gemini API 和 Google AI Studio,开发者即日起可在 Google AI Studio 中体验。










