Alibaba introduceert Qwen-Audio-3.1-Realtime stemmodel
Het Qwen-team van Alibaba heeft Qwen-Audio-3.1-Realtime uitgebracht, een full-duplex spraakmodel dat ontworpen is om te redeneren en zelfstandig te bepalen wanneer het spreekt. Het model is direct beschikbaar via QwenCloud als API.
De Qwen-divisie van het Chinese technologiebedrijf Alibaba heeft een nieuw spraakmodel gepresenteerd onder de naam Qwen-Audio-3.1-Realtime. Het betreft een zogeheten full-duplex audiosysteem dat niet alleen luistert, maar ook actief redeneert, externe hulpmiddelen kan aanroepen en zelfstandig beslist op welk moment het antwoord geeft.
Realtime interactie en spraakverwerking
Spraakmodellen evolueren in hoog tempo van eenvoudige transcriptietools naar interactieve systemen die natuurlijke gesprekken kunnen voeren. Waar oudere systemen vaak moeite hadden met achtergrondgeluiden of onnodig reageerden op omgevingsgeluiden, focust de nieuwste generatie zich op vloeiende en contextbewuste communicatie.
De release via een API maakt het voor ontwikkelaars eenvoudig om de spraaktechnologie te integreren in eigen applicaties. Dit soort multimodale toepassingen, waarbij tekst en audio door elkaar heen worden verwerkt, vormen een belangrijk aandachtsgebied binnen de bredere markt voor kunstmatige intelligentie.
Deze samenvatting is gebaseerd op een origineel artikel van MarkTechPost. Lees het volledige, originele bericht bij de bron.
Lees het originele artikel