AUDIO ESTUDIO
Se connecterCréer un compte gratuit

Fournisseurs de voix et clés API

Audio Estudio génère l'audio avec des moteurs de synthèse vocale (TTS). Choisissez le fournisseur que vous préférez, configurez-le dans Paramètres et assignez une voix à chaque personnage.

Fournisseurs disponibles

Gemini
TTS de Google. Nécessite une clé API Google Cloud, à saisir dans Paramètres.
ElevenLabs
Voix haute qualité d'ElevenLabs. Nécessite une clé API ElevenLabs, à saisir dans Paramètres.
Local
Un serveur TTS qui tourne sur votre propre machine. Au lieu d'une clé API, vous indiquez l'URL du serveur dans Paramètres.
Kokoro (dans le navigateur)
Moteur TTS qui s'exécute entièrement dans votre navigateur. Il est gratuit, privé et fonctionne hors connexion : pas besoin de clé API ni de serveur.
Kokoro Chinois (dans le navigateur)
Moteur TTS spécialisé en chinois mandarin qui s'exécute entièrement dans votre navigateur. Il est gratuit, privé et fonctionne hors connexion : pas besoin de clé API ni de serveur.

Kokoro : le TTS dans le navigateur

Kokoro génère la voix directement dans le navigateur, sans rien envoyer au serveur. Il est gratuit, privé et fonctionne hors connexion une fois téléchargé. Il est multilingue : il propose des voix en anglais, espagnol, français, italien, portugais et hindi (un phonétiseur espeak-ng convertit le texte en sons pour chaque langue). Il nécessite un navigateur moderne : avec WebGPU, c'est rapide ; sans WebGPU, il utilise le WASM (plus lent). La première fois, il télécharge le modèle (~90 MB en WASM, ~330 MB avec WebGPU pour une meilleure qualité) plus le phonétiseur (~18,5 MB), qui restent en cache pour les utilisations suivantes.

Kokoro Chinois : le TTS dans le navigateur

Kokoro Chinois génère la voix en mandarin directement dans le navigateur, sans rien envoyer au serveur. Il est gratuit, privé et fonctionne hors connexion une fois téléchargé. Il nécessite un navigateur moderne et fonctionne en mode compatible, sans accélération graphique : il génère donc plus lentement que Kokoro. La première fois, il télécharge le modèle (~339 MB, en pleine précision : c'est la seule façon dont ce modèle sonne correctement dans le navigateur) plus le phonétiseur espeak (~18,5 MB, partagé avec Kokoro), qui restent en cache pour les utilisations suivantes.

Assigner une voix et un fournisseur à chaque personnage

Dans la configuration du projet, chaque personnage a une voix et un fournisseur assignés. Vous pouvez ainsi mélanger les moteurs au sein d'un même podcast : un personnage avec Gemini et un autre avec ElevenLabs, par exemple.

Langue du projet et langue de l'interface

La langue du projet se choisit à sa création et oriente la génération de la voix. La langue de l'interface est indépendante et se change dans Paramètres ; elle affecte uniquement les textes de l'application, pas l'audio.

Balises d'émotion

Lors de l'assignation des voix, vous pouvez insérer des balises d'émotion comme [whispers] ou [excited] dans la description de la voix. Ce sont des suggestions de style que les modèles expressifs interprètent lors de la génération.

Modèle de prompt personnalisé

Chaque fournisseur dispose d'un modèle de prompt que vous pouvez personnaliser avec les emplacements {text} et {voiceDescription}. Utilisez-le si vous voulez contrôler exactement comment la requête est construite ; si vous n'y touchez pas, le modèle par défaut est utilisé.

Changer de fournisseur de voix

Vous pouvez changer le fournisseur qui génère chaque personnage depuis les paramètres de voix du projet, sans perdre le texte déjà écrit.

Confidentialité : vos clés et votre audio sont stockés dans votre navigateur, jamais sur nos serveurs
Les clés API vivent uniquement dans ce navigateur et ne sont jamais envoyées à notre base de données. L'audio généré, par défaut, vit lui aussi uniquement dans ce navigateur ; si vous voulez le conserver ou l'utiliser sur un autre appareil, vous pouvez connecter votre propre cloud (consultez « Où vit votre audio »). L'audio n'est jamais stocké sur nos serveurs : avec Gemini et ElevenLabs, il transite par eux en route vers votre navigateur, sans y rester ; avec les moteurs Kokoro et le fournisseur Local, il n'y transite même pas, car il est généré sur votre propre machine.
Essayez-le avec votre propre script

Le plan gratuit génère de l'audio avec des voix IA, sans carte et sans rien installer.