Nvidia brengt model uit voor real-time sprekerherkenning

Nvidia heeft een nieuw AI-model uitgebracht dat in staat is om in een gesprek te herkennen welke spreker aan het woord is. Het systeem kan tot acht verschillende stemmen gelijktijdig uit elkaar houden.
Chipontwikkelaar Nvidia heeft een compact model beschikbaar gesteld dat specifiek is ontworpen om sprekers in een audiofragment van elkaar te onderscheiden. De software richt zich op het real-time labelen van stemmen tijdens groepsgesprekken.
Context rond spraaktechnologie
Het herkennen van individuele stemmen in een geluidsstroom is een complexe taak binnen de spraakherkenning. Dit soort technologieën worden doorgaans ingezet bij vergadertools en transcriptiediensten om automatisch bij te houden wie wat zegt, wat de leesbaarheid van notulen aanzienlijk vergroot.
Deze samenvatting is gebaseerd op een origineel artikel van The Decoder. Lees het volledige, originele bericht bij de bron.
Lees het originele artikel