Gemini 3.8 TTS Playground
· Quelle: Simon Willison
Google hat zwei neue Text‑zu‑Sprache‑Modelle der Gemini‑Familie veröffentlicht: gemini‑3.8‑flash‑tts und gemini‑3.8‑flash‑lite‑tts. Jedes Modell wird mit einer Bibliothek von über 2 000 vorinstallierten Stimmen ausgeliefert und ermöglicht die Erstellung einer individuellen Stimme aus einer 30‑Sekunden‑Audioprobe, sofern der Nutzer die Nutzungsrechte besitzt. Simon Willison hat ein „Playground“ eingerichtet, das als Web‑Interface dient und es erlaubt, eigene API‑Schlüssel einzugeben und die Modelle über die offene CORS‑Policy der Gemini‑API auszuprobieren. Damit lassen sich Dialoge zwischen mehreren Charakteren entwerfen, jedem eine eigene Stimme zuweisen und Tonfall‑Stile festlegen – ohne dass Programmierkenntnisse erforderlich sind. In einer Demo generierte Willison mit gemini‑3.8‑flash‑tts mehr als eine Minute Audio einer Unterhaltung zweier Pelikane. Der Vorgang dauerte etwa 20 Sekunden und kostete 2,74 Cent.
Die Meldung ist bedeutsam, weil sie zeigt, dass hochwertige Audio‑Generierung zunehmend für Entwickler und Content‑Creator zugänglich wird. Zeit und Kosten für die Produktion synthetischer Stimmen sinken, was neue Einsatzmöglichkeiten in den Bereichen Barrierefreiheit, Bildung und Unterhaltung eröffnet.
Originalartikel lesen auf Simon Willison
Diese Zusammenfassung ist eine informationelle Synthese von dataqbs.com. Alle Rechte am Originalinhalt liegen beim Autor und dem genannten Medienunternehmen. Wir handeln ausschließlich als Kuratoren von Technologie-Nachrichten und beanspruchen keine Urheberschaft.