Gemini 3.8 TTS Playground
· Fuente: Simon Willison
Google ha puesto a disposición dos nuevos modelos de texto a voz de la familia Gemini, denominados gemini‑3.8‑flash‑tts y gemini‑3.8‑flash‑lite‑tts. Cada uno incluye una biblioteca con más de 2 000 voces predefinidas y permite generar una voz personalizada a partir de una muestra de audio de apenas 30 segundos, siempre que el usuario cuente con los derechos de uso. Simon Willison creó un “playground” que funciona como una interfaz web donde se pueden introducir claves de API propias y experimentar con los modelos mediante la política CORS abierta de la API de Gemini. La herramienta permite diseñar conversaciones entre varios personajes, asignando a cada uno una voz distinta y especificando estilos de entonación, lo que facilita la producción de diálogos complejos sin necesidad de programar. En una demostración, Willison utilizó el modelo gemini‑3.8‑flash‑tts para generar más de un minuto de audio de una charla entre dos pelícanos; el proceso tardó unos 20 segundos y tuvo un coste de 2,74 centavos.
Esta noticia es relevante porque muestra cómo la generación de audio de alta calidad está cada vez más al alcance de desarrolladores y creadores de contenido, reduciendo tanto el tiempo como el gasto asociado a la producción de voces sintéticas. La facilidad para crear voces personalizadas abre nuevas posibilidades en aplicaciones de accesibilidad, educación y entretenimiento.
Leer artículo original en Simon Willison
Este resumen es una síntesis informativa elaborada por dataqbs.com. Todos los derechos sobre el contenido original pertenecen a su autor y al medio de comunicación citado. Nosotros solo actuamos como curadores de noticias tecnológicas, sin reclamar autoría alguna.