
Gemini 3.8 TTS能用30秒复制声音:同意验证仍是前提

Google在2026年9月23日的发布公告中介绍Gemini 3.8 Flash TTS和Flash-Lite TTS:Flash可凭30秒参考音频复制本人或有权使用的声线,但创建前必须提交由原声说话人录制、且与参考音频匹配的口头同意录音。新模型开始面向Gemini API和Google AI Studio开发者推出;声音混音及Gemini Enterprise中的API接入仍标为即将推出。
这次更新让创作者可以设计新声线、安排角色对白和制作长篇旁白,也让开发者能够把这些能力接入应用。独立网站Coursium的声音复制安全分析指出,合成音频中的水印需要主动检测,听众在通话中不会自行听出核验结果。因此,复制真人声线时的同意验证是创建阶段的一道关口,不能由事后的水印检测代替。
设计新声音与复制真人声线走不同路径
声音设计从文字描述开始。创作者可以指定角色气质、口音和音色,再保存生成的声音,用于后续台词或同一角色的其他片段。这适合需要稳定角色声音的游戏、播客和有声书:声音身份先确定,具体句子的情绪与节奏随后再调整。Flash-Lite也支持声音设计,并非只能从预设音色中选择。
声音复制的输入则是真人说话的参考录音,以及另一段口头同意录音。参考音频决定要保留哪些声线特征,同意录音用于核对授权者是否为同一说话人;只有一段可供模仿的声音素材,并不满足创建条件。这里的秒数指参考素材的长度,不是复制所需时间,更不能当作取得声音使用权的方式。
生成的Gemini Audio音频嵌有听不见的SynthID水印,复制声音的保护安排还包括C2PA内容凭证。这些机制服务于合成内容的识别与溯源,作用不同于创建声线前的同意核对。对于使用真人配音的项目,参考音频、授权录音和最终生成的旁白因此处在制作流程的不同环节,不能混为一项输入。
逐句控制如何用于对白与长篇旁白
新模型允许创作者按台词指定表演方式,包括语气、语速、口音变化和角色间的接话。笑声、叹息与短暂的应答声可以放在相应句子中,使对白不必始终保持平直朗读。整句持续的表演风格与句中某一刻发生的声音事件分开处理,剧本便能保留原本要读出的文字,同时交代角色怎样说出它。
双人场景可以从一份按角色分段的脚本生成轮流发言的音频,适合有明确主持人和嘉宾、或两个叙事角色的内容。但单次请求中的双说话人生成使用预设声音;若要让自行设计或复制的声线共同出演,就需要分别合成各角色的台词,再衔接音频。这个边界会影响对白中的停顿、重叠发言和后期编辑安排。
长篇生成强调连续内容里的声线、节奏和角色特征保持稳定,面向有声书及篇幅较长的播客。Flash侧重细致表演、复杂对白和地域口音;Flash-Lite则面向大批量朗读、配音和语音代理等工作负载。两者采用相同的请求结构,取舍主要在作品所需的表现细节与生产规模,而非是否能够设计或复制声音。
API接入与旧版迁移的关键变化
Gemini API的TTS开发指南列出gemini-3.8-flash-tts和gemini-3.8-flash-lite-tts:前者支持130余种语言,后者支持100余种,并说明从gemini-3.1-flash-tts-preview迁移时需要调整请求结构。开发者可以在请求中选择预设声音、已设计的声音或经验证复制的声音,但输入正文应是要实际读出的台词。
旧版脚本中写在正文里的持续性表演说明,应移到speech_metadata的style字段;多说话人请求还要为每段台词标明与声音配置相符的speaker。笑声、叹息和短暂停顿这类发生在句中某一刻的事件,仍可用内联标签表示。只替换模型名称而沿用旧提示词,可能使制作指令进入照读的文本,或让角色标注与实际配置脱节。
音频文件的默认处理方式也变了。普通非流式请求返回带文件头的WAV,流式请求则默认返回不带文件头的原始PCM片段。若旧应用曾为收到的原始音频自行添加WAV文件头,迁移后的非流式输出便不能继续照此处理;需要原始PCM的流水线可以在响应格式中明确指定。对已有配音或播放系统而言,这是接入新模型时直接影响文件能否正常读取的兼容性变化。
已推出的能力与仍待开放的入口
目前面向开发者的Gemini API和Google AI Studio包含声音设计、经同意验证的声音复制,以及按台词控制表演的能力。Google AI Studio提供试听和创建声音的入口;Flash也进入Gemini Notebook,Flash-Lite用于Google Vids。声音混音仍列为即将推出:从现有声音继续调整音色、音高、语速和口音的流程,不能视作当前已开放的功能。Gemini Enterprise中的API接入同样处于待推出状态。
可用范围还要按具体入口区分。Google AI Studio中的声音复制暂不向美国伊利诺伊州、得克萨斯州,以及欧洲经济区、英国、瑞士和印度开放;这项限制针对AI Studio的复制体验,不能直接推定所有接入方式的地域规则相同。对于需要固定真人声线的制作项目,实际使用路径取决于能否取得说话人的同意录音,以及所选入口是否提供复制功能。
相关阅读:
相关文章
订阅我们的新闻通讯
将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。




