一到两位独立说话人
可在一次输出中生成单人旁白或双人场景。为每位说话人设置音色、声音画像、口音、风格和节奏,再将每轮台词分配给对应角色。
直接在 Img2Vid 中完成 AI 视频草稿。选择兼容模型,查看价格和套餐资格,然后在同一工作区生成。
Gemini 3.1 Flash TTS 是 Google 推出的预览版可控语音生成模型,适合旁白和对话。在 Img2Vid 中,你可以定义一到两位说话人,从 30 种音色中选择声音,分别设置风格、节奏、口音与角色特征,再通过有序台词和音频标签完成表演。它提供的是结构化语音创作,而不是一个含义模糊的提示词输入框。
以下案例的音频均由 Gemini 3.1 Flash TTS 通过已配置的 KIE 任务接口真实生成。为适配当前统一的展示播放器,Img2Vid 将原始语音封装为 16:9 动态声波视频,便于对比旁白、双语表达、角色区分、戏剧表演与产品引导等能力。
生成指导
Zephyr 音色、美式口音、Promo/Hype 风格与自然节奏。高端产品发布旁白从沉稳自信逐步过渡到更有能量的行动邀请。
核心能力
Gemini 3.1 Flash TTS 将精确台词朗读与自然语言表演指导结合起来。Google 官方文档列出了 30 种音色、70 多种语言、最多两位说话人以及行内音频标签。Img2Vid 将这些能力拆成明确、可复用的配置项。
可在一次输出中生成单人旁白或双人场景。为每位说话人设置音色、声音画像、口音、风格和节奏,再将每轮台词分配给对应角色。
当前 Gemini 3.1 Flash TTS 配置完整提供 Google 文档中的 30 种音色,包括 Zephyr、Puck、Kore、Fenrir、Aoede 和 Charon。音色名称不能代表全部表现,正式使用前应实际试听。
模型可根据输入文本自动识别语言并生成多语言语音。人名、缩写、数字和混合语言仍应由母语使用者审核。
可以在台词中使用 [whispers]、[laughs]、[gasp] 等表达指导,让 Gemini 3.1 Flash TTS 改变局部表现,而不必重设整个角色的全局风格。
将地点、人物关系、情绪变化和整体语气与精确台词分开描述。场景上下文会与每位说话人的独立配置共同作用。
Google 表示 Gemini 3.1 Flash TTS 生成的音频包含 SynthID。创作者仍需完成授权、权利、披露和内容审核。
制作流程
高质量语音应先完成选角和表演指导。Img2Vid 将这些决策保持为可见配置,让每次修改只针对一个变量。
选择一到两种音色,并通过角色、能量、年龄感和表达方式定义声音画像,避免模仿真实人物。
选择口音、风格、节奏和随机度,补充场景与整体语气。生成指导应与台词一致,不要给模型相互矛盾的要求。
将每轮台词分配给已定义的说话人。Img2Vid 当前允许八轮、每轮 250 个字符,这是产品保护边界,并非宣称的 Google 模型上限。
检查发音、角色区分、节奏和情绪。每次只修改一个 Gemini 3.1 Flash TTS 参数,才能判断具体哪项指导真正改善了结果。
适用场景
Gemini 3.1 Flash TTS 适合有明确脚本和角色关系的可控朗读,不是开放麦克风式实时对话。以下场景都能从清晰的台词与可重复的表演设置中受益。
创建脚本化开场、回顾、讲解或双主持原型。不同声音画像能避免对话听起来只是一个通用音色在轮流说话。
对话 · 内容制作
生成指导
两位录音室主持人,能量差异清晰,交流自然,不过度使用播音腔。
通过氛围、节奏和局部标签指导旁白或短角色场景,在投入完整制作前先验证文字被朗读后的实际效果。
旁白 · 故事
生成指导
克制的近距离旁白,较慢节奏,有控制地建立悬念。
将新手引导和帮助文档转换为清晰语音,在保持整体语气稳定的同时,用标签强调关键操作。
新手引导 · 培训
生成指导
具有共情感的引导者,表达简洁,在每项操作之间停顿。
使用差异明确的说话人测试游戏对话、互动叙事和提案场景。正式选角仍需创意和权利审核。
游戏 · 预演
生成指导
疲惫守卫与焦急旅人,紧张感清晰,最后以耳语揭示信息。
创建多语言审核样稿或混合语言课程。模型可以生成多语言文本,但发音与文化语气应由母语使用者确认。
本地化 · 学习
生成指导
耐心的老师、清晰中文短句和自然英文回应。
为天气、无障碍或应用内状态生成具有稳定声音画像的脚本语音,动态事实必须在进入语音步骤前得到验证。
产品 · 无障碍
生成指导
沉稳中性的表达,事实清晰,不添加戏剧化强调。
模型定位
合理的比较应关注工作流匹配,而不是未经证实的绝对排名。Gemini 3.1 Flash TTS 强调 Google 原生的表现控制和多语言脚本语音,其他平台可能更侧重声音克隆或低延迟流式处理。
| 决策维度 | Gemini 3.1 Flash TTS | ElevenLabs | PlayHT |
|---|---|---|---|
| 主要定位 | 可控脚本旁白和双人场景 | 广泛音色平台与声音设计工作流 | 流式和对话式语音工作流 |
| 当前 Img2Vid 控制项 | 30 种音色、声音画像、口音、风格、节奏与标签 | 本页面未配置 | 本页面未配置 |
| 说话人结构 | 一次有序请求支持一到两位说话人 | 取决于所选产品与模型 | 取决于所选模型与接口 |
| 本页面声音克隆 | 当前集成不提供 | 其完整平台提供相关能力 | 其完整平台提供相关能力 |
常见问题
了解 Gemini 3.1 Flash TTS 以及 Img2Vid 当前提供的准确配置和能力边界。