关于声音克隆
什么是 AI 声音克隆?
AI 声音克隆通过分析一段简短录音,创建说话者的数字语音模型。该模型捕捉音色、音高、节奏与口音特征。创建完成后,可朗读任意文本 — 听起来如同原始说话者本人。在 SpeechGen 上,一个克隆声音支持全部 15种语言。
如何用 AI 克隆声音?
上传音频样本(10 至 60 秒)或直接在浏览器中录音。系统分析语音特征,约 30 秒内完成语音模型构建。之后,输入或粘贴任意文本,选择语言并转换 — 输出音频即采用您的克隆声音。
声音克隆支持粤语(广东话)吗?
目前 SpeechGen 的声音克隆功能支持普通话(中文),对粤语的支持正在规划中。稳定版中文支持普通话语音合成,克隆的声音可在标准中文输入下自然发音。如有粤语需求,可持续关注功能更新。
克隆一个声音需要多长时间?
上传音频样本后,处理时间约为 30 至 45 秒。语音模型随即可用 — 输入任意文本即可用克隆声音朗读。无排队等待,无需人工审核。
声音克隆支持哪些语言?
共 15种语言 — 9 种稳定版(英语、西班牙语、德语、法语、意大利语、葡萄牙语、中文、韩语、荷兰语)和 6 种实验版(日语、俄语、阿拉伯语、印地语、希伯来语、波兰语)。实验版语言效果可能略逊,正在持续改进中。
质量与使用
克隆声音可以用于文字转语音吗?
可以 — 这正是主要应用场景。创建语音模型后,它将与 SpeechGen 5,000 余款内置声音一同出现在文字转语音编辑器中。选择克隆声音,输入文本,转换。输出格式:MP3、WAV、OGG。
如何获得最佳克隆声音质量?
在安静环境中录音,尽量减少背景噪音。以正常语速自然说话,避免单调朗读。12 至 30 秒的样本效果最佳。USB 麦克风最为理想,在安静房间中使用笔记本自带麦克风也可达到良好效果。
需要什么格式和时长的音频?
支持格式:MP3、WAV、M4A、AAC、OGG、WebM。推荐时长:12 至 60 秒。最大文件大小:每个文件 25 MB,最多 3 个文件。录音应包含单一说话者的清晰语音 — 无背景音乐或混叠人声。
价格
克隆声音的费用是多少?
创建一个克隆声音需要 2,000 积分(一次性费用)。保存一个启用的克隆声音每天消耗 250 积分。语音合成采用 SpeechGen 标准费率 — 与 HD 声音相同。随时删除克隆声音即可停止存储扣费。
声音克隆是付费功能吗?
是的,声音克隆是高级功能。SpeechGen 采用按需付费模式:无月度订阅,无最低消费。按需购买积分,用于克隆、合成或其他任何功能。
使用声音克隆需要注册账号吗?
需要 — 声音克隆须登录账号,因为语音模型存储在您的私人账户中。注册快捷,无需信用卡。语音合成可试用,但克隆声音的创建按积分计费(每个声音 2,000 积分)。
可以删除克隆声音吗?
可以。删除克隆声音即时生效,并立即停止所有存储扣费(250 积分/天)。语音模型将从 SpeechGen 服务器上永久删除 — 删除后无法恢复。
隐私与法律
AI 声音克隆合法吗?
在大多数司法管辖区,克隆自己的声音是合法的。克隆他人声音须获得其明确的书面同意。SpeechGen 禁止将克隆声音用于冒充、欺诈或欺骗。AI 生成的音频在发布时应进行适当标注。
我的语音数据安全吗?
语音模型为私密数据 — 仅对您的账户可见和可访问。音频样本在安全服务器上处理,不与第三方共享。您可以随时在个人资料设置中删除克隆声音及所有相关数据。