Fornitori di voce e API key
Audio Estudio genera l'audio con motori di sintesi vocale (TTS). Scegli il fornitore che preferisci, configuralo in Impostazioni e assegna una voce a ogni personaggio.
Fornitori disponibili
Kokoro: il TTS nel browser
Kokoro genera la voce direttamente nel browser, senza inviare nulla al server. È gratuito, privato e funziona senza connessione una volta scaricato. È multilingue: offre voci in inglese, spagnolo, francese, italiano, portoghese e hindi (un fonemizzatore espeak-ng converte il testo in suoni per ogni lingua). Richiede un browser moderno: con WebGPU è veloce; senza WebGPU usa WASM (più lento). La prima volta scarica il modello (~90 MB in WASM, ~330 MB con WebGPU per una qualità migliore) più il fonemizzatore (~18,5 MB), che restano salvati in cache per gli usi successivi.
Kokoro Cinese: il TTS nel browser
Kokoro Cinese genera la voce in mandarino direttamente nel browser, senza inviare nulla al server. È gratuito, privato e funziona senza connessione una volta scaricato. Richiede un browser moderno e funziona in modalità compatibile, senza accelerazione grafica, quindi genera più lentamente di Kokoro. La prima volta scarica il modello (~339 MB, a precisione piena: è l'unico modo in cui questo modello suona corretto nel browser) più il fonemizzatore espeak (~18,5 MB, condiviso con Kokoro), che restano salvati in cache per gli usi successivi.
Assegnare voce e fornitore a ogni personaggio
Nella configurazione del progetto, ogni personaggio ha una voce e un fornitore assegnati. Così puoi mescolare motori all'interno dello stesso podcast: un personaggio con Gemini e un altro con ElevenLabs, per esempio.
Lingua del progetto e lingua dell'interfaccia
La lingua del progetto si sceglie alla creazione e orienta la generazione della voce. La lingua dell'interfaccia è indipendente e si cambia in Impostazioni; interessa solo i testi dell'applicazione, non l'audio.
Tag di emozione
Quando assegni le voci puoi inserire tag di emozione come [whispers] o [excited] nella descrizione della voce. Sono suggerimenti di stile che i modelli espressivi interpretano in fase di generazione.
Modello di prompt personalizzato
Ogni fornitore ha un modello di prompt che puoi personalizzare con i segnaposto {text} e {voiceDescription}. Usalo se vuoi controllare esattamente come viene composta la richiesta; se non lo tocchi, viene usato quello predefinito.
Cambiare il backend vocale
Puoi cambiare il fornitore con cui viene generato ogni personaggio dalle impostazioni voce del progetto, senza perdere il testo già scritto.
Il piano gratuito genera audio con voci IA senza carta e senza installare nulla.