
Gemini 3.1 Flash TTS
直接在 Img2Vid 中完成 AI 视频草稿。选择兼容模型,查看价格和套餐资格,然后在同一工作区生成。
输入需要朗读的脚本,选择当前可用的语音模型,配置模型真正支持的声音、语言和节奏参数,在 Img2Vid 中试听并下载生成结果。
模型
这里会自动展示已启用且配置了 text-to-audio 能力的音频模型。声音、语言、语速、格式等选项只会在对应模型明确支持时出现。

AI 语音生成
文字转语音把书面语言转换为可播放的声音表现,适用于旁白、对话草稿、无障碍朗读、产品语音提示和多语言内容。Img2Vid 把模型选择、模型参数、生成历史和音频下载放在同一条工作流中,方便用户在真实制作流程里比较和复用结果。
粘贴需要被准确朗读的文案,并提前整理标点、缩写和数字表达,因为这些内容会直接影响停顿与发音。
根据模型配置选择声音、语言、语速、风格或输出格式,不向用户展示供应商实际不支持的虚假控制项。
发布前检查发音、节奏、情绪、重音和音频伪影,不能只根据开头几秒判断整段结果。
下载生成音频,同时在历史中保留脚本、模型和参数,方便后续追踪与复现通过审核的版本。
能力
具体设置取决于当前模型配置。Img2Vid 根据配置动态渲染参数,因此可以持续接入新的 TTS 供应商,同时保证页面只表达模型的真实能力。
从模型公开的声音中选择,并比较音色、年龄感、表达方式以及与目标受众的匹配程度。
使用模型支持的语言或地区设置,并逐一确认姓名、缩写、数字和专业术语的实际读法。
如果模型支持,可通过语速、风格、稳定性或情绪参数,使声音更适合旁白、对话、培训或产品提示。
模型可以返回 MP3、WAV、AAC、OGG 或 WebM 等格式;Img2Vid 在保存结果时会保留供应商返回的真实 MIME 类型。
当供应商存在输入长度限制时,可按自然段落拆分脚本,并保持模型与参数一致,减少相邻片段的声音差异。
登录用户可以在历史中回看生成音频及其上下文,便于跨会话试听、比较和下载。
工作流
把文字转语音当作一段小型制作流程:先整理语言,再选择声音系统,生成完整版本,最后通过真实试听完成审核。
按听觉而不是视觉来写作,用标点控制停顿,消除数字歧义,并移除不应该被读出的画面指令。
选择可用的文字转音频模型,并评估它提供的语言、声音、语速、风格和输出格式。
生成音频后从头到尾检查。开场自然不代表后文的人名、数字和专业词汇也一定正确。
根据问题调整脚本或模型支持的控制项,重新生成需要修改的版本,并下载最适合项目的结果。
使用场景
当项目强调快速迭代、一致表达、无障碍体验或多语言制作时,文字转语音尤其有价值。任何准备公开使用的声音仍然需要人工试听。
为讲解视频、产品演示、社交内容和视觉原型制作可快速修改的旁白音轨。
从经过审核的教学文案生成课程朗读、员工入职内容、发音示例与内部培训音频。
为偏好听取内容或需要另一种信息获取方式的用户提供书面材料的声音版本。
在正式录音前试听翻译后的脚本,并检查姓名、地名和文化相关表达是否自然。
在投入正式录制前,用临时声音验证对白长度、场景节奏和整体结构。
为电话流程、交互原型、自助设备和语音产品生成风格一致的操作提示。
质量审核
AI 声音即使听起来很流畅,也可能读错姓名、弱化关键重音或包含细微伪影。人工试听仍然是负责任的文字转语音流程的一部分。
重点检查姓名、日期、价格、单位、缩写、网址和专业术语,存在歧义时应先改写脚本。
广告、安全说明、医学解释和故事朗读需要不同的语速与语气,不能用同一种表达方式处理。
未经适当许可不要模仿或克隆真人声音,商业发布前应检查供应商条款和相关授权。
正式制作中还应处理响度、静音、混音和输出规格,而不是把模型原始结果直接视为最终母带。
常见问题
关于 AI 声音模型、脚本、格式、质量和配置方式的常见问题。