Apple verbetert spraakherkenning voor meertalige invoer
Onderzoekers van Apple hebben een nieuwe methode ontwikkeld om spraakherkenningssystemen beter te laten omgaan met het afwisselen tussen Mandarijn en Engels binnen één zin. Door gebruik te maken van iteratieve pseudo-labels kunnen modellen trainen op grote hoeveelheden ongemarkeerde audio, wat de nauwkeurigheid van meertalige spraakverwerking aanzienlijk vergroot.
Ontwikkelaars van Apple hebben een vernieuwde techniek gepresenteerd om spraakherkenning te verbeteren bij het door elkaar gebruiken van verschillende talen. Het onderzoek richt zich specifiek op situaties waarin sprekers wisselen tussen Mandarijn en Engels in eenzelfde zin. Om dit soepeler te laten verlopen, is een trainingsaanpak ontworpen die gebruikmaakt van automatisch gegenereerde labels voor niet-geannoteerd geluidsmateriaal.
Meertalige uitdagingen in spraaktechnologie
Automatische spraakherkenning heeft traditioneel moeite met meertalige invoer, met name wanneer talen binnen een enkel gesprek of zelfs binnen dezelfde zin worden afgewisseld. Dit fenomeen komt veel voor in meertalige gemeenschappen. Verbeteringen op dit gebied dragen bij aan natuurlijkere interacties met virtuele assistenten en dicteersystemen, die hierdoor beter aansluiten bij menselijk taalgebruik.
De ontwikkelingen passen in een bredere trend binnen de kunstmatige intelligentie, waarbij de nadruk steeds meer ligt op het benutten van onbewerkt trainingsmateriaal. Omdat het handmatig labelen van audio arbeidsintensief is, zoeken laboratoria naar manieren om systemen zelfstandig te laten leren van grote hoeveelheden ongelabelde data, wat de prestaties van spraakmodellen vergroot.
Deze samenvatting is gebaseerd op een origineel artikel van Apple Machine Learning. Lees het volledige, originele bericht bij de bron.
Lees het originele artikel