Google introduceert nieuwe Gemini stemmodellen voor audio

Google heeft twee nieuwe spraakgeneratiemodellen uitgebracht onder de naam Gemini Flash TTS. Deze systemen zijn ontwikkeld voor grootschalige audioproductie en interactieve toepassingen.
De nieuwe stemmodellen zijn specifiek ontworpen om spraak te synthetiseren voor toepassingen zoals interactief entertainment, videogames en het voorlezen van lange teksten. De release omvat twee varianten die zijn afgestemd op verschillende typen productiewerk, variërend van creatieve aansturing tot kostenefficiëntie.
Spraaksynthese en spraakgestuurde kunstmatige intelligentie ontwikkelen zich snel en vinden steeds vaker hun weg naar de entertainmentindustrie. Waar traditionele voice-overs veel studiowerk vereisen, bieden dit soort modellen makers de mogelijkheid om snel en flexibel geluid te genereren via tekstaanwijzingen.
Deze samenvatting is gebaseerd op een origineel artikel van AI News. Lees het volledige, originele bericht bij de bron.
Lees het originele artikel