Meta brengt Muse Voice Transcribe uit voor real-time spraakverwerking
Meta Superintelligence Labs heeft Muse Voice Transcribe geïntroduceerd, een model dat spraakherkenning, sprekerherkenning en het detecteren van stilte combineert. Traditioneel vereisen deze taken meerdere afzonderlijke systemen die met elkaar moeten samenwerken.
Meta heeft een nieuw model gepresenteerd dat spraakverwerking in realtime mogelijk maakt. Waar systemen voor spraakherkenning, het onderscheiden van verschillende sprekers en het bepalen van het einde van een zin tot voor kort uit meerdere losse componenten bestonden, brengt deze nieuwe software al die functies samen in één enkel autoregressief model.
Minder vertraging in spraaktechnologie
Het combineren van meerdere systemen leidt in de praktijk vaak tot vertragingen en extra storingspunten bij elke stap. Door deze handelingen te integreren in één model, kan de techniek efficiënter werken. Dit past in de bredere trend binnen kunstmatige intelligentie waarbij complexere architecturen worden vereenvoudigd tot compacte, veelzijdige systemen.
Deze samenvatting is gebaseerd op een origineel artikel van MarkTechPost. Lees het volledige, originele bericht bij de bron.
Lees het originele artikel