Fournisseurs de voix et clés API
Audio Estudio génère l'audio avec des moteurs de synthèse vocale (TTS). Choisissez le fournisseur que vous préférez, configurez-le dans Paramètres et assignez une voix à chaque personnage.
Fournisseurs disponibles
Kokoro : le TTS dans le navigateur
Kokoro génère la voix directement dans le navigateur, sans rien envoyer au serveur. Il est gratuit, privé et fonctionne hors connexion une fois téléchargé. Il est multilingue : il propose des voix en anglais, espagnol, français, italien, portugais et hindi (un phonétiseur espeak-ng convertit le texte en sons pour chaque langue). Il nécessite un navigateur moderne : avec WebGPU, c'est rapide ; sans WebGPU, il utilise le WASM (plus lent). La première fois, il télécharge le modèle (~90 MB en WASM, ~330 MB avec WebGPU pour une meilleure qualité) plus le phonétiseur (~18,5 MB), qui restent en cache pour les utilisations suivantes.
Kokoro Chinois : le TTS dans le navigateur
Kokoro Chinois génère la voix en mandarin directement dans le navigateur, sans rien envoyer au serveur. Il est gratuit, privé et fonctionne hors connexion une fois téléchargé. Il nécessite un navigateur moderne et fonctionne en mode compatible, sans accélération graphique : il génère donc plus lentement que Kokoro. La première fois, il télécharge le modèle (~339 MB, en pleine précision : c'est la seule façon dont ce modèle sonne correctement dans le navigateur) plus le phonétiseur espeak (~18,5 MB, partagé avec Kokoro), qui restent en cache pour les utilisations suivantes.
Assigner une voix et un fournisseur à chaque personnage
Dans la configuration du projet, chaque personnage a une voix et un fournisseur assignés. Vous pouvez ainsi mélanger les moteurs au sein d'un même podcast : un personnage avec Gemini et un autre avec ElevenLabs, par exemple.
Langue du projet et langue de l'interface
La langue du projet se choisit à sa création et oriente la génération de la voix. La langue de l'interface est indépendante et se change dans Paramètres ; elle affecte uniquement les textes de l'application, pas l'audio.
Balises d'émotion
Lors de l'assignation des voix, vous pouvez insérer des balises d'émotion comme [whispers] ou [excited] dans la description de la voix. Ce sont des suggestions de style que les modèles expressifs interprètent lors de la génération.
Modèle de prompt personnalisé
Chaque fournisseur dispose d'un modèle de prompt que vous pouvez personnaliser avec les emplacements {text} et {voiceDescription}. Utilisez-le si vous voulez contrôler exactement comment la requête est construite ; si vous n'y touchez pas, le modèle par défaut est utilisé.
Changer de fournisseur de voix
Vous pouvez changer le fournisseur qui génère chaque personnage depuis les paramètres de voix du projet, sans perdre le texte déjà écrit.
Le plan gratuit génère de l'audio avec des voix IA, sans carte et sans rien installer.