H Company introduceert NeoMME multimodale encoders

H Company heeft NeoMME uitgebracht, een nieuwe reeks multimodale encoders die tekst en beeld verwerken binnen een enkele Transformer. Deze methode gebruikt geen traditionele visuele toren of causale decoder, wat efficiënte documentzoektoepassingen mogelijk maakt.
H Company heeft een serie bidirectionele encoders gepresenteerd onder de naam NeoMME. Deze modellen, beschikbaar in verschillende groottes, zijn ontworpen om zowel meertalige tekst als visuele data te verwerken in één enkele neurale architectuur.
Efficiëntere multimodale verwerking
Door het weglaten van een afzonderlijke visuele toren en een causale decoder, richt de architectuur zich op een compacte en directe verwerking van multimodale informatie. Dit type onderzoek richt zich op het optimaliseren van zoekalgoritmen voor documenten en afbeeldingen, waarbij snelheid en efficiëntie bij het indexeren van grote hoeveelheden data centraal staan.
Deze samenvatting is gebaseerd op een origineel artikel van MarkTechPost. Lees het volledige, originele bericht bij de bron.
Lees het originele artikel