Google je lansirao novu verziju svog umjetno-inteligentnog modela za tekst u govor pod nazivom Gemini 3.8 Flash TTS, koja značajno unapređuje način na koji računala sintetiziraju ljudski glas. Novi model ne samo da može kreirati originalne glasove prema prirodnom opisu, nego može i precizno replicirati bilo čiji glas na temelju samo 30 sekundi snimke, pod uvjetom da korisnik ima dozvolu za takvu upotrebu.
Ova tehnologija podržava preko 100 jezika i dijalekata, a dostupno je više od 2.000 gotovih glasova spremnih za produkciju. Gemini 3.8 Flash TTS omogućuje detaljnu kontrolu izgovora – uključujući naglaske, tempo, emocije, šaputanje, smijeh, uzdahe i druge govorničke znakove. Zahvaljujući tome, sintetizirani glasovi više ne zvuče robotski, već prirodno i autentično.
Nove mogućnosti izvođenja i dijaloga
Posebno zanimljiva mogućnost je izvođenje skripti s dvije osobe, gdje tehnologija može održavati glasove konzistentnima kroz duže audio sadržaje poput podkasta, audioknjiga ili dubbinga. Time se otvaraju nove perspektive za produkciju multimedijskih sadržaja s višestrukim likovima bez potrebe za dodatnim snimanjem ljudi.
Google je rezultate Gemini 3.8 modela testirao na relevantnim benchmarkovima, uključujući Hume AI’s Voice Design, gdje je Flash TTS postigao prvo mjesto, posebno ističući visoku kvalitetu u području naglasaka. Model je dostupan korisnicima kroz Gemini Notebook i Google Vids, a developeri ga mogu integrirati putem Gemini API-ja i AI Studija.
Kako bi spriječio zloupotrebu, Google je uveo stroge mjere za repliciranje glasova. Potrebna je provjera pristanka, a kopije sadržaja dobivaju digitalne oznake SynthID i C2PA vjerodajnice. Također, repliciranje glasova putem AI Studija blokirano je u pojedinim regijama, uključujući Veliku Britaniju, Europski gospodarski prostor, Indiju te saveznu državu Teksas i Illinois u SAD-u.

