Het risico van modelinstorting bij het trainen op synthetische data
Generatieve kunstmatige intelligentie haalt veel gegevens van het web, maar door schaarste groeit de neiging om door AI gegenereerde data te gebruiken voor nieuwe trainingen. Onderzoek toont aan dat een dergelijke zelfconsumptie kan leiden tot modelinstorting, wat de betrouwbaarheid van systemen onder druk zet.
Generatieve kunstmatige intelligentie heeft de afgelopen jaren een sterke groei doorgemaakt, mede dankzij de enorme hoeveelheden data die beschikbaar zijn op het internet. Om aan de aanhoudende vraag naar trainingsmateriaal te voldoen, overwegen ontwikkelaars steeds vaker om door AI gemaakte data in te zetten voor de volgende generatie modellen.
De risico's van een gesloten cyclus
Uit onderzoek blijkt echter dat dit praktijkrisico's met zich meebrengt. Wanneer AI-modellen worden getraind op output van eerdere systemen, ontstaat er een gesloten cyclus waarin de kwaliteit geleidelijk kan afnemen. Dit fenomeen, bekend als modelinstorting, roept fundamentele vragen op over de betrouwbaarheid en de langetermijnstabiliteit van generatieve technologieën.
Deze samenvatting is gebaseerd op een origineel artikel van arXiv (cs.AI). Lees het volledige, originele bericht bij de bron.
Lees het originele artikelAchtergrond bij dit bericht
- Synthetische data: AI die zijn eigen lesmateriaal maaktWat het is, waarom het nodig werd en welk risico eraan kleeft.
- Wat is synthetische data?Kunstmatig gemaakte trainingsgegevens: waarom AI-bedrijven ze in toenemende mate gebruiken en waar de grens ligt.
- Wat is generatieve AI?Het verschil tussen AI die iets beoordeelt en AI die iets maakt, en waarom die tweede soort alles veranderde.