Amazon vernietigt zeldzame boeken om taaimodellen te voeden met unieke data
Omdat openbare internetbronnen inmiddels grotendeels zijn uitgeput, grijpt de techgigant naar waardevolle fysieke literatuur. Deze zeldzame werken worden ontleed en vernietigd om LLM's te trainen met exclusieve tekst.
Techbedrijf Amazon past een drastische methode toe om taalmodellen te voorzien van nieuwe trainingsdata door fysieke boeken, waaronder zeldzame exemplaren, uit elkaar te halen en te vernietigen. Deze praktijk komt voort uit de zoektocht naar unieke tekstbronnen die nog niet eerder op het internet zijn verschenen.
De jacht op exclusieve trainingsdata
Large language models vereisen enorme hoeveelheden tekst om menselijke taal effectief te kunnen begrijpen en nabootsen. Aangezien de makkelijk toegankelijke online bronnen voor een groot deel zijn opgebruikt, ontstaat er een schaarste aan kwalitatief hoogwaardige trainingsdata onder ontwikkelaars van kunstmatige intelligentie.
De stap van Amazon illustreert hoe ver techbedrijven inmiddels moeten gaan om de prestaties van hun systemen te blijven verbeteren. Waar eerdere generaties modellen vrijwel uitsluitend werden getraind op gedigitaliseerde internetpagina's en openbare archieven, verschuift de focus nu naar fysiek materiaal om concurrentievoordeel te behouden in de markt voor taaltechnologie.
Deze samenvatting is gebaseerd op een origineel artikel van TechCrunch AI. Lees het volledige, originele bericht bij de bron.
Lees het originele artikel