AUDIO ESTUDIO
EntrarCrear cuenta gratis

Ver en vídeo

Lo mismo que cuenta esta página, explicado en pantalla.

4 formas de poner voz: cuál te conviene
Ver en YouTube
Voz gratis, sin claves y sin internet
Ver en YouTube
Genera voz en chino en tu navegador
Ver en YouTube
Conecta tu clave de ElevenLabs
Ver en YouTube
Dirige la interpretación con Gemini
Ver en YouTube
Usa tu propio motor de voz
Ver en YouTube
Asigna una voz a cada personaje
Ver en YouTube

Proveedores de voz y API keys

Audio Estudio genera audio con motores de texto a voz (TTS). Elige el proveedor que prefieras, configúralo en Ajustes y asigna una voz a cada personaje.

Proveedores disponibles

Gemini
TTS de Google. Requiere una API key de Google Cloud, que se introduce en Ajustes.
ElevenLabs
Voces de alta calidad de ElevenLabs. Requiere una API key de ElevenLabs, que se introduce en Ajustes.
Local
Un servidor de TTS que corre en tu propia máquina. En lugar de una API key, indicas la URL del servidor en Ajustes.
Kokoro (en el navegador)
Motor de TTS que se ejecuta íntegramente en tu navegador. Es gratis, privado y funciona sin conexión: no necesita API key ni servidor.
Kokoro Chino (en el navegador)
Motor de TTS especializado en chino mandarín que se ejecuta íntegramente en tu navegador. Es gratis, privado y funciona sin conexión: no necesita API key ni servidor.

Kokoro: TTS en el navegador

Kokoro genera voz en el propio navegador, sin enviar nada al servidor. Es gratis, privado y funciona sin conexión una vez descargado. Es multilingüe: ofrece voces en inglés, español, francés, italiano, portugués e hindi (un fonemizador espeak-ng convierte el texto a sonidos para cada idioma). Requiere un navegador moderno: con WebGPU va rápido; sin WebGPU usa WASM (más lento). La primera vez descarga el modelo (~90 MB en WASM, ~330 MB con WebGPU para mejor calidad) más el fonemizador (~18,5 MB), que quedan guardados en caché para los usos siguientes.

Kokoro Chino: TTS en el navegador

Kokoro Chino genera voz en mandarín directamente en el navegador, sin enviar nada al servidor. Es gratis, privado y funciona sin conexión una vez descargado. Requiere un navegador moderno y funciona en modo compatible, sin aceleración por gráfica, así que genera más lento que Kokoro. La primera vez descarga el modelo (~339 MB, en precisión completa: es la única forma en que este modelo suena correcto en el navegador) más el fonemizador espeak (~18,5 MB, compartido con Kokoro), que quedan guardados en caché para los usos siguientes.

Asignar voz y proveedor a cada personaje

En la configuración del proyecto, cada personaje tiene una voz y un proveedor asignados. Así puedes mezclar motores dentro de un mismo podcast: un personaje con Gemini y otro con ElevenLabs, por ejemplo.

Idioma del proyecto e idioma de la interfaz

El idioma del proyecto se elige al crearlo y orienta la generación de voz. El idioma de la interfaz es independiente y se cambia en Ajustes; afecta solo a los textos de la aplicación, no al audio.

Etiquetas de emoción

Al asignar voces puedes insertar etiquetas de emoción como [whispers] o [excited] en la descripción de voz. Son sugerencias de estilo que los modelos expresivos interpretan al generar.

Plantilla de prompt personalizada

Cada proveedor tiene una plantilla de prompt que puedes personalizar con los huecos {text} y {voiceDescription}. Úsala si quieres controlar exactamente cómo se arma la petición; si no la tocas, se usa la de por defecto.

Cambiar el backend de voz

Puedes cambiar el proveedor con el que se genera cada personaje desde los ajustes de voz del proyecto, sin perder el texto ya escrito.

Privacidad: tus claves y tu audio se guardan en tu navegador, nunca en nuestros servidores
Las API keys viven solo en este navegador y nunca se envían a nuestra base de datos. El audio generado, por defecto, también vive solo en este navegador; si quieres conservarlo o usarlo en otro dispositivo, puedes conectar tu propia nube (consulta «Dónde vive tu audio»). El audio nunca se almacena en nuestros servidores: con Gemini y ElevenLabs pasa por ellos de camino a tu navegador, sin quedarse; con los motores Kokoro y con el proveedor Local ni siquiera pasa, porque se genera en tu propio equipo.
Pruébalo con tu propio guion

El plan gratuito genera audio con voces de IA sin tarjeta y sin instalar nada.