声音服务商与 API 密钥
Audio Estudio 用语音合成(TTS)引擎生成音频。选择你偏好的服务商,在设置中配置好,再为每个角色分配一个声音。
可用的服务商
Kokoro:浏览器内的语音合成
Kokoro 直接在浏览器里生成声音,不会把任何内容发送到服务器。它免费、私密,模型下载完成后还能离线使用。它支持多语言:提供英语、西班牙语、法语、意大利语、葡萄牙语和印地语的声音(由 espeak-ng 音素转换器把文本转成各语言的发音)。需要较新的浏览器:支持 WebGPU 时运行很快;不支持时改用 WASM(速度较慢)。首次使用会下载模型(WASM 下约 90 MB;用 WebGPU 时约 330 MB,音质更好)和音素转换器(约 18.5 MB),它们会缓存下来供以后使用。
Kokoro 中文:浏览器内的语音合成
Kokoro 中文直接在浏览器里生成普通话声音,不会把任何内容发送到服务器。它免费、私密,模型下载完成后还能离线使用。它需要较新的浏览器,并且以兼容模式运行,不使用显卡加速,因此生成速度比 Kokoro 慢。首次使用会下载模型(约 339 MB,完整精度:只有这样这个模型在浏览器里才能发音正确)和 espeak 音素转换器(约 18.5 MB,与 Kokoro 共用),它们会缓存下来供以后使用。
为每个角色分配声音和服务商
在项目设置中,每个角色都有各自分配的声音和服务商。因此你可以在同一档播客里混用不同引擎:比如一个角色用 Gemini,另一个用 ElevenLabs。
项目语言与界面语言
项目语言在创建项目时选定,用来指导声音的生成。界面语言与它无关,在设置中更改;它只影响应用里的文字,不影响音频。
情绪标签
分配声音时,你可以在声音描述里插入 [whispers]、[excited] 这类情绪标签。它们是风格上的建议,表现力强的模型在生成时会加以体现。
自定义提示词模板
每个服务商都有一份提示词模板,你可以用 {text} 和 {voiceDescription} 这两个占位符来自定义它。如果你想精确控制请求的组装方式就用它;不改动的话就使用默认模板。
更换语音合成后端
你可以在项目的声音设置中更换每个角色使用的服务商,已经写好的文本不会丢失。