AUDIO ESTUDIO
AccediCrea un account gratuito

Fornitori di voce e API key

Audio Estudio genera l'audio con motori di sintesi vocale (TTS). Scegli il fornitore che preferisci, configuralo in Impostazioni e assegna una voce a ogni personaggio.

Fornitori disponibili

Gemini
TTS di Google. Richiede una API key di Google Cloud, da inserire in Impostazioni.
ElevenLabs
Voci di alta qualità di ElevenLabs. Richiede una API key di ElevenLabs, da inserire in Impostazioni.
Local
Un server TTS che gira sul tuo stesso computer. Invece di una API key, indichi l'URL del server in Impostazioni.
Kokoro (nel browser)
Motore TTS che viene eseguito interamente nel tuo browser. È gratuito, privato e funziona senza connessione: non serve API key né server.
Kokoro Cinese (nel browser)
Motore TTS specializzato in cinese mandarino che viene eseguito interamente nel tuo browser. È gratuito, privato e funziona senza connessione: non serve API key né server.

Kokoro: il TTS nel browser

Kokoro genera la voce direttamente nel browser, senza inviare nulla al server. È gratuito, privato e funziona senza connessione una volta scaricato. È multilingue: offre voci in inglese, spagnolo, francese, italiano, portoghese e hindi (un fonemizzatore espeak-ng converte il testo in suoni per ogni lingua). Richiede un browser moderno: con WebGPU è veloce; senza WebGPU usa WASM (più lento). La prima volta scarica il modello (~90 MB in WASM, ~330 MB con WebGPU per una qualità migliore) più il fonemizzatore (~18,5 MB), che restano salvati in cache per gli usi successivi.

Kokoro Cinese: il TTS nel browser

Kokoro Cinese genera la voce in mandarino direttamente nel browser, senza inviare nulla al server. È gratuito, privato e funziona senza connessione una volta scaricato. Richiede un browser moderno e funziona in modalità compatibile, senza accelerazione grafica, quindi genera più lentamente di Kokoro. La prima volta scarica il modello (~339 MB, a precisione piena: è l'unico modo in cui questo modello suona corretto nel browser) più il fonemizzatore espeak (~18,5 MB, condiviso con Kokoro), che restano salvati in cache per gli usi successivi.

Assegnare voce e fornitore a ogni personaggio

Nella configurazione del progetto, ogni personaggio ha una voce e un fornitore assegnati. Così puoi mescolare motori all'interno dello stesso podcast: un personaggio con Gemini e un altro con ElevenLabs, per esempio.

Lingua del progetto e lingua dell'interfaccia

La lingua del progetto si sceglie alla creazione e orienta la generazione della voce. La lingua dell'interfaccia è indipendente e si cambia in Impostazioni; interessa solo i testi dell'applicazione, non l'audio.

Tag di emozione

Quando assegni le voci puoi inserire tag di emozione come [whispers] o [excited] nella descrizione della voce. Sono suggerimenti di stile che i modelli espressivi interpretano in fase di generazione.

Modello di prompt personalizzato

Ogni fornitore ha un modello di prompt che puoi personalizzare con i segnaposto {text} e {voiceDescription}. Usalo se vuoi controllare esattamente come viene composta la richiesta; se non lo tocchi, viene usato quello predefinito.

Cambiare il backend vocale

Puoi cambiare il fornitore con cui viene generato ogni personaggio dalle impostazioni voce del progetto, senza perdere il testo già scritto.

Privacy: le tue chiavi e il tuo audio restano nel tuo browser, mai sui nostri server
Le API key vivono solo in questo browser e non vengono mai inviate al nostro database. L'audio generato, per impostazione predefinita, vive anch'esso solo in questo browser; se vuoi conservarlo o usarlo su un altro dispositivo, puoi collegare il tuo cloud personale (consulta «Dove vive il tuo audio»). L'audio non viene mai archiviato sui nostri server: con Gemini ed ElevenLabs passa attraverso di essi mentre viaggia verso il tuo browser, senza restarci; con i motori Kokoro e con il fornitore Local non ci passa nemmeno, perché viene generato sul tuo stesso computer.
Provalo con il tuo copione

Il piano gratuito genera audio con voci IA senza carta e senza installare nulla.