✨︎ Resumen (TL;DR):
- Google lanzó el 23 de septiembre de 2026 Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS para la API de Gemini y Google AI Studio.
- Flash TTS crea voces desde instrucciones en lenguaje natural, en más de 100 idiomas y dialectos, y replica una voz con 30 segundos de audio y consentimiento.
- Google pasó de 30 voces originales a más de 2,000 voces, pero la réplica en AI Studio no está disponible en España ni en el resto del Espacio Económico Europeo.
Google lanzó el 23 de septiembre de 2026 Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos modelos de texto a voz que llegan a la API de Gemini y Google AI Studio. Flash TTS diseña voces desde instrucciones en lenguaje natural y puede replicar una voz con 30 segundos de audio, siempre que el dueño grabe su consentimiento.
Gemini 3.8 Flash TTS es un modelo de texto a voz que diseña voces desde cero, permite dirigir su actuación y replica una voz con una muestra autorizada. Gemini 3.8 Flash-Lite TTS es un modelo de texto a voz orientado al volumen, la producción de audio y los agentes de voz.

Dos modelos para trabajos distintos
Google separa los modelos por tipo de uso:
- Flash TTS: apunta a la dirección creativa y al diseño de personajes para videojuegos, audiolibros, podcasts y medios interactivos. Cada línea puede incluir indicaciones sobre actuación, ritmo, cambios de dialecto e interjecciones de escucha activa.
- Flash-Lite TTS: está pensado para el doblaje a gran escala, la producción de audio y los agentes de voz. Ofrece control sobre el tono, el ritmo y los matices expresivos.
Ambos pueden montar una conversación de dos hablantes desde un solo guion, sostener horas de audio continuo con poca deriva en la voz y responder a señales no verbales como risas, suspiros y jadeos. También aceptan muletillas como “mhm” o “yeah” para marcar reacciones.
Más voces y variantes regionales
Google pasó de 30 voces originales a una biblioteca de más de 2,000 voces listas para producción. El catálogo incluye variantes regionales como el español de México, el francés de Quebec y el inglés de Escocia.
Las voces creadas se pueden guardar para proyectos largos. La compañía también anuncia como “próximamente” una función de remezcla que permitirá ajustar el timbre, el tono, la velocidad y el acento de voces existentes.
La réplica exige consentimiento
Flash TTS puede recrear un perfil vocal a partir de 30 segundos de audio de la propia voz del usuario o de una voz sobre la que tenga derechos. Antes de crearla, el sistema exige una grabación verbal de consentimiento del dueño y comprueba que coincida con el hablante de la muestra.
Todo clip generado por los modelos de Gemini Audio lleva SynthID, la marca de agua imperceptible de Google DeepMind, pensada para que el habla sintética siga siendo detectable. Las voces replicadas también suman credenciales de contenido C2PA.
La réplica de voz mediante AI Studio no está disponible en Illinois, Texas, el Espacio Económico Europeo, Reino Unido, Suiza e India. España forma parte del Espacio Económico Europeo, por lo que esa función tampoco llega a AI Studio en ese país.
Google no explica el motivo de la restricción. El anuncio tampoco describe la misma limitación para el resto de las funciones.
Los benchmarks necesitan contexto
Google presenta a Flash TTS como el número uno en el Voice Design Benchmark de Hume AI, con 71.4 puntos, y como líder en modelado de acentos, con 60.8. También afirma que Flash TTS y Flash-Lite TTS ocupan el primero y segundo lugar del Overall Quality Index de la misma firma.
En evaluaciones ciegas de preferencia humana de Voice Arena, Google dice que ambos modelos aparecen en posiciones destacadas en japonés, portugués de Brasil, vietnamita, árabe estándar moderno, hindi y español de México.
Los resultados de Hume AI tienen una relación institucional relevante. Alan Cowen, uno de los dos firmantes del anuncio, es hoy director de investigación científica del equipo de Gemini Audio. Antes era CEO de Hume AI, cuando Google DeepMind lo incorporó en enero de 2026 junto con unos siete ingenieros mediante un acuerdo de licencia.
TechCrunch reportó que Hume AI siguió operando por separado y vendiendo su tecnología a otros laboratorios. Esa relación no invalida por sí misma los resultados, pero identifica el vínculo entre Google y uno de los evaluadores citados en el anuncio.
Una medición publicada el mismo día por Artificial Analysis colocó a Flash TTS en el primer lugar de su Pronunciation Robustness Benchmark y en el segundo del Provider Voice Arena Leaderboard.
La misma firma midió 44.1 caracteres por segundo para Flash TTS y 40.2 para Flash-Lite TTS. Eso equivale a unas 2.7 y 2.4 veces la velocidad del tiempo real, respectivamente. Ambos quedan por detrás de modelos que Artificial Analysis rastrea, como Falcon 2, con 204.9 caracteres por segundo.
API, AI Studio e integraciones
Los dos modelos se despliegan para desarrolladores en la API de Gemini y en Google AI Studio. La plataforma estrena un espacio de pruebas de audio con editor de guion para dos hablantes.
Flash TTS también llega a Gemini Notebook y Flash-Lite TTS a Google Vids. El acceso empresarial por API en Gemini Enterprise aparece como “próximamente”. Google no detalla los precios de uso de los nuevos modelos.
Google enumera a Agora, LiveKit, Pipecat y Vercel entre las plataformas que ya permiten construir sobre estos modelos. Figma, HeyGen, Linguana, Wondercraft, 99.co y Ollang los integran para doblaje, localización y agentes de voz.
El lanzamiento llega mientras ElevenLabs y Murf AI ya compiten en este espacio. Adobe añadió generación de voz a Firefly en agosto, según The Next Web.
El dato práctico para el audio en español
Para quien produce audio en español, el cambio tiene dos partes: el catálogo incluye español de México entre sus variantes regionales y la réplica incorpora consentimiento verificable, SynthID y credenciales C2PA.
La segunda función no está disponible en AI Studio para España ni para el resto del Espacio Económico Europeo. Tampoco se ofrece allí en Illinois, Texas, Reino Unido, Suiza e India, y Google no ha explicado la razón de esas restricciones.
