Onderzoek verbetert betrouwbaarheid van tekstherkenning in visuele AI
Wetenschappers presenteren een methode om te voorkomen dat visuele taalmodellen afwijkende tekst in afbeeldingen eigenmachtig corrigeren. Door het aanpassen van de sturing tijdens de training blijft de oorspronkelijke tekstgetrouwheid beter behouden.
Visuele taalmodellen hebben de neiging om ongebruikelijke of fout gespelde tekst in afbeeldingen automatisch te herschrijven naar logisch klinkende taal. Dit gedrag is onwenselijk voor toepassingen die nauwkeurige tekstherkenning, oftewel OCR, vereisen. Onderzoekers hebben nu gekeken naar hoe de begeleiding van modellen tijdens de training kan worden geoptimaliseerd om dit probleem tegen te gaan.
Uit de analyse blijkt dat vaste begeleiders gedurende het leerproces minder effectief worden naarmate het studentmodel zelf beter presteert. Door de aansturing dynamisch aan te passen, kan de betrouwbaarheid van de transcriptie worden verhoogd. Dit soort optimalisaties is relevant binnen de brede ontwikkeling van multimodale systemen die feitelijk juist moeten omgaan met visuele data.
Deze samenvatting is gebaseerd op een origineel artikel van arXiv (cs.AI). Lees het volledige, originele bericht bij de bron.
Lees het originele artikel