Nieuw spraakmodel van Cartesia voert ranglijsten aan
Cartesia heeft Sonic-3.6 uitgebracht, een geavanceerd model voor spraaksynthese dat gebaseerd is op state space-modellen in plaats van traditionele transformers. De software scoort momenteel het hoogst op onafhankelijke benchmarks en levert spraak vrijwel direct na invoer.
Het technologiebedrijf Cartesia heeft een nieuw model voor spraaksynthese gelanceerd onder de naam Sonic-3.6. Deze software is ontworpen om geschreven tekst snel om te zetten in gesproken taal en bereikt momenteel de hoogste positie op onafhankelijke prestatietests binnen dit vakgebied.
Alternatief voor traditionele architecturen
Wat deze technologie onderscheidt van veel andere hedendaagse AI-systemen, is de onderliggende techniek. Waar de meeste taal- en spraakmodellen leunen op de transformer-architectuur, maakt Cartesia gebruik van state space-modellen. Deze wiskundige benadering is specifiek geschikt voor het verwerken van opeenvolgende data, zoals audiostromen, met aanzienlijk minder rekenkracht.
De ontwikkeling past in een bredere trend binnen de kunstmatige intelligentie waarin onderzoekers zoeken naar efficiëntere alternatieven voor de transformer. Doordat het model spraak direct na de invoer genereert, wordt de wachttijd voor toepassingen zoals real-time vertalingen en spraakgestuurde assistenten aanzienlijk verkort.
Deze samenvatting is gebaseerd op een origineel artikel van MarkTechPost. Lees het volledige, originele bericht bij de bron.
Lees het originele artikel