AUDIO ESTUDIO
登录免费创建账户

声音服务商与 API 密钥

Audio Estudio 用语音合成(TTS)引擎生成音频。选择你偏好的服务商,在设置中配置好,再为每个角色分配一个声音。

可用的服务商

Gemini
Google 的语音合成服务。需要一个 Google Cloud 的 API 密钥,在设置中填入。
ElevenLabs
ElevenLabs 的高品质声音。需要一个 ElevenLabs 的 API 密钥,在设置中填入。
TTS Local
运行在你自己电脑上的语音合成服务器。它不需要 API 密钥,只要在设置中填写服务器 URL。
Kokoro(浏览器内)
完全在你的浏览器里运行的语音合成引擎。免费、私密、可离线:既不需要 API 密钥,也不需要服务器。
Kokoro 中文(浏览器内)
专攻中文普通话的语音合成引擎,完全在你的浏览器里运行。免费、私密、可离线:既不需要 API 密钥,也不需要服务器。

Kokoro:浏览器内的语音合成

Kokoro 直接在浏览器里生成声音,不会把任何内容发送到服务器。它免费、私密,模型下载完成后还能离线使用。它支持多语言:提供英语、西班牙语、法语、意大利语、葡萄牙语和印地语的声音(由 espeak-ng 音素转换器把文本转成各语言的发音)。需要较新的浏览器:支持 WebGPU 时运行很快;不支持时改用 WASM(速度较慢)。首次使用会下载模型(WASM 下约 90 MB;用 WebGPU 时约 330 MB,音质更好)和音素转换器(约 18.5 MB),它们会缓存下来供以后使用。

Kokoro 中文:浏览器内的语音合成

Kokoro 中文直接在浏览器里生成普通话声音,不会把任何内容发送到服务器。它免费、私密,模型下载完成后还能离线使用。它需要较新的浏览器,并且以兼容模式运行,不使用显卡加速,因此生成速度比 Kokoro 慢。首次使用会下载模型(约 339 MB,完整精度:只有这样这个模型在浏览器里才能发音正确)和 espeak 音素转换器(约 18.5 MB,与 Kokoro 共用),它们会缓存下来供以后使用。

为每个角色分配声音和服务商

在项目设置中,每个角色都有各自分配的声音和服务商。因此你可以在同一档播客里混用不同引擎:比如一个角色用 Gemini,另一个用 ElevenLabs。

项目语言与界面语言

项目语言在创建项目时选定,用来指导声音的生成。界面语言与它无关,在设置中更改;它只影响应用里的文字,不影响音频。

情绪标签

分配声音时,你可以在声音描述里插入 [whispers]、[excited] 这类情绪标签。它们是风格上的建议,表现力强的模型在生成时会加以体现。

自定义提示词模板

每个服务商都有一份提示词模板,你可以用 {text} 和 {voiceDescription} 这两个占位符来自定义它。如果你想精确控制请求的组装方式就用它;不改动的话就使用默认模板。

更换语音合成后端

你可以在项目的声音设置中更换每个角色使用的服务商,已经写好的文本不会丢失。

隐私:你的密钥和音频只保存在你的浏览器里,绝不存储在我们的服务器上
API 密钥只保存在这个浏览器里,绝不会发送到我们的数据库。生成的音频默认也只保存在这个浏览器里;如果你想长期保留,或者在别的设备上使用,可以连接你自己的云端(见“你的音频存放在哪里”)。音频绝不会存储在我们的服务器上:使用 Gemini 和 ElevenLabs 时,音频会经过服务器再传回你的浏览器,但不会留存;使用 Kokoro 引擎和 TTS Local 服务商时,音频连经过都不会经过,因为它就在你自己的设备上生成。
用你自己的脚本试试

Free 套餐用 AI 声音生成音频,无需信用卡,也不用安装任何东西。