AUDIO ESTUDIO
EntrarCriar conta grátis

Provedores de voz e API keys

O Audio Estudio gera áudio com motores de texto para voz (TTS). Escolha o provedor que preferir, configure-o em Configurações e atribua uma voz a cada personagem.

Provedores disponíveis

Gemini
TTS do Google. Requer uma API key do Google Cloud, que é informada em Configurações.
ElevenLabs
Vozes de alta qualidade da ElevenLabs. Requer uma API key da ElevenLabs, que é informada em Configurações.
Local
Um servidor de TTS que roda na sua própria máquina. Em vez de uma API key, você informa a URL do servidor em Configurações.
Kokoro (no navegador)
Motor de TTS que roda inteiramente no seu navegador. É gratuito, privado e funciona sem conexão: não precisa de API key nem de servidor.
Kokoro Chinês (no navegador)
Motor de TTS especializado em chinês mandarim que roda inteiramente no seu navegador. É gratuito, privado e funciona sem conexão: não precisa de API key nem de servidor.

Kokoro: TTS no navegador

O Kokoro gera voz no próprio navegador, sem enviar nada ao servidor. É gratuito, privado e funciona sem conexão depois de baixado. É multilíngue: oferece vozes em inglês, espanhol, francês, italiano, português e hindi (um fonemizador espeak-ng converte o texto em sons para cada idioma). Requer um navegador moderno: com WebGPU é rápido; sem WebGPU usa WASM (mais lento). Na primeira vez baixa o modelo (~90 MB em WASM, ~330 MB com WebGPU para melhor qualidade) mais o fonemizador (~18,5 MB), que ficam salvos em cache para os usos seguintes.

Kokoro Chinês: TTS no navegador

O Kokoro Chinês gera voz em mandarim diretamente no navegador, sem enviar nada ao servidor. É gratuito, privado e funciona sem conexão depois de baixado. Requer um navegador moderno e funciona em modo compatível, sem aceleração por placa de vídeo, então gera mais devagar que o Kokoro. Na primeira vez baixa o modelo (~339 MB, em precisão total: é a única forma de este modelo soar correto no navegador) mais o fonemizador espeak (~18,5 MB, compartilhado com o Kokoro), que ficam salvos em cache para os usos seguintes.

Atribuir voz e provedor a cada personagem

Na configuração do projeto, cada personagem tem uma voz e um provedor atribuídos. Assim você pode misturar motores dentro de um mesmo podcast: um personagem com Gemini e outro com ElevenLabs, por exemplo.

Idioma do projeto e idioma da interface

O idioma do projeto é escolhido ao criá-lo e orienta a geração de voz. O idioma da interface é independente e é alterado em Configurações; afeta apenas os textos do aplicativo, não o áudio.

Tags de emoção

Ao atribuir vozes, você pode inserir tags de emoção como [whispers] ou [excited] na descrição de voz. São sugestões de estilo que os modelos expressivos interpretam ao gerar.

Modelo de prompt personalizado

Cada provedor tem um modelo de prompt que você pode personalizar com os marcadores {text} e {voiceDescription}. Use-o se quiser controlar exatamente como o pedido é montado; se não mexer nele, é usado o padrão.

Alterar o backend de voz

Você pode alterar o provedor com o qual cada personagem é gerado nas configurações de voz do projeto, sem perder o texto já escrito.

Privacidade: suas chaves e seu áudio ficam no seu navegador, nunca nos nossos servidores
As API keys vivem apenas neste navegador e nunca são enviadas ao nosso banco de dados. O áudio gerado, por padrão, também vive apenas neste navegador; se quiser preservá-lo ou usá-lo em outro dispositivo, você pode conectar sua própria nuvem (consulte «Onde vive seu áudio»). O áudio nunca é armazenado nos nossos servidores: com Gemini e ElevenLabs ele passa por eles a caminho do seu navegador, sem ficar guardado; com os motores Kokoro e com o provedor Local nem sequer passa, porque é gerado na sua própria máquina.
Experimente com o seu próprio roteiro

O plano gratuito gera áudio com vozes de IA sem cartão e sem instalar nada.