dataqbs

Gemini audio en vivo

· Fuente: Simon Willison

Google ha puesto a disposición dos nuevos modelos de IA conversacional orientados al habla: Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking. Estos sistemas convierten voz a voz de forma continua, ofreciendo una experiencia similar a la familia GPT‑Live de OpenAI. Para facilitar su prueba, el autor ha utilizado un modelo de lenguaje avanzado (GPT‑6 Astra Extra High) que generó una interfaz web sencilla, sin dependencias externas, que permite escoger el modelo y el preset de voz, introducir un prompt de sistema opcional y mantener una conversación en tiempo real desde el navegador. La herramienta emplea un WebSocket proporcionado por la API de Gemini y la Web Audio API para capturar y reproducir audio, lo que posibilita interrumpir al modelo mientras responde. El código fuente está disponible en GitHub y el tutorial oficial de Gemini Live describe cómo iniciar la conexión mediante WebSockets.

Esta noticia es relevante porque amplía el abanico de opciones para desarrolladores y usuarios que buscan integrar interacciones habladas impulsadas por IA, reduciendo la necesidad de bibliotecas externas y simplificando la implementación de aplicaciones de asistencia vocal o de atención al cliente. Además, la disponibilidad de un modelo de “pensamiento extendido” sugiere mejoras en la capacidad de razonamiento y coherencia de las respuestas generadas en tiempo real.

Leer artículo original en Simon Willison

Este resumen es una síntesis informativa elaborada por dataqbs.com. Todos los derechos sobre el contenido original pertenecen a su autor y al medio de comunicación citado. Nosotros solo actuamos como curadores de noticias tecnológicas, sin reclamar autoría alguna.

Lee esto en English · Deutsch