Terug naar nieuws
Onderzoek

Ovis-Embedding combineert tekst, beeld, video en audio in één model

23 september 2026Samengevat door AI Dagblad-redactieBron: arXiv (cs.AI)

Ovis-Embedding is een nieuwe familie van multimodale embeddings die meerdere datatypen integreert in één gedeelde representatieruimte. Het systeem gebruikt een gezamenlijke backbone in plaats van afzonderlijke modules per medium.

Er is een nieuwe methode ontwikkeld voor het genereren van universele omni-modale embeddings, genaamd Ovis-Embedding. Deze technologie brengt verschillende datatypen zoals tekst, afbeeldingen, video en audio samen binnen één gemeenschappelijke representatieruimte.

Gezamenlijke verwerking van datatypen

Waar eerdere systemen vaak afzonderlijke netwerken inzetten voor elk type invoer, maakt dit nieuwe model gebruik van een geïntegreerde aanpak. Door een bestaand basismodel als uitgangspunt te nemen en dit aan te passen via contrastieve training, kunnen diverse media gezamenlijk worden verwerkt.

Deze ontwikkeling past binnen de algemene verschuiving naar multimodale AI-systemen die de wereld op een menselijke manier kunnen waarnemen. Door verschillende zintuiglijke vormen te combineren in één architectuur, kunnen systemen verbanden leggen over de grenzen van afzonderlijke media heen.

Deze samenvatting is gebaseerd op een origineel artikel van arXiv (cs.AI). Lees het volledige, originele bericht bij de bron.

Lees het originele artikel

Van de makers van AI Dagblad

Wil je AI inzetten in je eigen bedrijf?

Van een slimme assistent tot een agent die je administratie doet — wij bouwen het betaalbaar. Stel vrijblijvend je vraag.