Slechte scans blijken taalmodellen te hinderen bij het leren

Veel trainingsdata bestaat uit ingescande boeken met fouten uit tekstherkenning. Een nieuw project pakt die vervuiling grootschalig aan, wat de kwaliteit van toekomstige modellen merkbaar zou moeten verbeteren.
De ontwikkeling van taalmodellen loopt tegen een hardnekkig kwaliteitsprobleem aan doordat veel historische trainingsdata bestaat uit gedigitaliseerde boeken vol fouten. Bij het automatisch inscannen en omzetten van gedrukte pagina's naar digitale tekst ontstaan door imperfecte herkenning regelmatig spelfouten en verminkingen. Een nieuw initiatief richt zich specifiek op het grootschalig opschonen van deze vervuilde bronbestanden om de onderliggende datakwaliteit te verhogen.
De impact van ruis op kunstmatige intelligentie
Grote taalmodellen worden getraind op enorme hoeveelheden tekst om menselijk taalgebruik te analyseren en nabootsen. Wanneer die basisdata veel fouten bevat, nemen de algoritmen deze onjuistheden over in hun eigen taalbegrip. Het corrigeren van deze OCR-fouten is een logische stap in een bredere verschuiving binnen de AI-sector, waar de focus verschuift van simpelweg meer data verzamelen naar het kritisch selecteren en verbeteren van bestaande trainingssets.
Deze samenvatting is gebaseerd op een origineel artikel van The Decoder. Lees het volledige, originele bericht bij de bron.
Lees het originele artikel