Provedores de voz e API keys
O Audio Estudio gera áudio com motores de texto para voz (TTS). Escolha o provedor que preferir, configure-o em Configurações e atribua uma voz a cada personagem.
Provedores disponíveis
Kokoro: TTS no navegador
O Kokoro gera voz no próprio navegador, sem enviar nada ao servidor. É gratuito, privado e funciona sem conexão depois de baixado. É multilíngue: oferece vozes em inglês, espanhol, francês, italiano, português e hindi (um fonemizador espeak-ng converte o texto em sons para cada idioma). Requer um navegador moderno: com WebGPU é rápido; sem WebGPU usa WASM (mais lento). Na primeira vez baixa o modelo (~90 MB em WASM, ~330 MB com WebGPU para melhor qualidade) mais o fonemizador (~18,5 MB), que ficam salvos em cache para os usos seguintes.
Kokoro Chinês: TTS no navegador
O Kokoro Chinês gera voz em mandarim diretamente no navegador, sem enviar nada ao servidor. É gratuito, privado e funciona sem conexão depois de baixado. Requer um navegador moderno e funciona em modo compatível, sem aceleração por placa de vídeo, então gera mais devagar que o Kokoro. Na primeira vez baixa o modelo (~339 MB, em precisão total: é a única forma de este modelo soar correto no navegador) mais o fonemizador espeak (~18,5 MB, compartilhado com o Kokoro), que ficam salvos em cache para os usos seguintes.
Atribuir voz e provedor a cada personagem
Na configuração do projeto, cada personagem tem uma voz e um provedor atribuídos. Assim você pode misturar motores dentro de um mesmo podcast: um personagem com Gemini e outro com ElevenLabs, por exemplo.
Idioma do projeto e idioma da interface
O idioma do projeto é escolhido ao criá-lo e orienta a geração de voz. O idioma da interface é independente e é alterado em Configurações; afeta apenas os textos do aplicativo, não o áudio.
Tags de emoção
Ao atribuir vozes, você pode inserir tags de emoção como [whispers] ou [excited] na descrição de voz. São sugestões de estilo que os modelos expressivos interpretam ao gerar.
Modelo de prompt personalizado
Cada provedor tem um modelo de prompt que você pode personalizar com os marcadores {text} e {voiceDescription}. Use-o se quiser controlar exatamente como o pedido é montado; se não mexer nele, é usado o padrão.
Alterar o backend de voz
Você pode alterar o provedor com o qual cada personagem é gerado nas configurações de voz do projeto, sem perder o texto já escrito.
O plano gratuito gera áudio com vozes de IA sem cartão e sem instalar nada.