Wat is modelcollaps?
Het probleem in één zin
Modellen worden getraind op tekst van internet. Steeds meer tekst op internet is door modellen gemaakt. Train je op je eigen uitvoer, dan versterken fouten zich en verschraalt de variatie — dat verschijnsel heet modelcollaps.
Hoe het verloopt
Een model leert een verdeling: welke formuleringen komen hoe vaak voor. Wat het genereert ligt gemiddeld dichter bij het midden van die verdeling dan echte menselijke tekst — het is per definitie het meest waarschijnlijke, niet het meest bijzondere. Train de volgende generatie daarop, en de uitersten verdwijnen verder. Na een paar rondes blijft er een steeds vlakkere, gemiddeldere taal over.
Het effect treft vooral zeldzame onderwerpen. Veelvoorkomende feiten blijven overeind; nichekennis, streektaal en ongebruikelijke schrijfstijlen verdwijnen het eerst.
Waarom het nog geen ramp is
Laboratoria weten hiervan en mengen bewust menselijke bronnen bij: boeken, gelicentieerde archieven, gesprekken met betaalde experts. Ook wordt AI-tekst steeds beter herkend en gefilterd. Het is een reëel probleem met tegenmaatregelen, geen onafwendbaar verval.
Wat het voor jou betekent
Twee dingen. Menselijk geschreven materiaal wordt waardevoller — dat verklaart de licentiedeals tussen AI-bedrijven en uitgevers. En voor wie zelf publiceert: eigen ervaring, eigen cijfers en eigen voorbeelden zijn precies wat modellen niet kunnen verzinnen, en dus wat je onderscheidt.