Terug naar kennisbank
Kennisbank · Gevorderd

Wat is synthetische data?

5 min lezenUitleg door de AI Dagblad-redactie

Gegevens die niemand heeft meegemaakt

Synthetische data zijn trainingsgegevens die niet uit de echte wereld komen maar door een computer zijn gemaakt. Voor beeldherkenning bijvoorbeeld: duizenden gerenderde foto's van een onderdeel in elke denkbare belichting en hoek. Voor taal: door een sterk model gegenereerde voorbeelden om een kleiner model mee te trainen.

Waarom het aan populariteit wint

Drie redenen. Echte gegevens zijn op — het bruikbare deel van internet is grotendeels verwerkt. Echte gegevens zijn juridisch beladen, met rechtszaken over auteursrecht als gevolg. En echte gegevens zijn scheef: zeldzame gevallen komen te weinig voor om goed van te leren, terwijl je die juist wilt herkennen.

Waar het goed werkt

  • Zeldzame situaties. Een zelfrijdende auto die een omgevallen boom moet herkennen; die beelden verzamel je niet zomaar.
  • Privacygevoelige domeinen. Medische gegevens nabootsen met dezelfde statistische eigenschappen maar zonder echte patiënten.
  • Kleinere modellen trainen. Een groot model laat een klein model meekijken; dat heet destillatie.

Waar de grens ligt

Synthetische data kunnen alleen bevatten wat de maker erin stopt. Blinde vlekken in het bronmodel worden overgenomen en soms uitvergroot. En te veel van je eigen uitvoer terugvoeren leidt tot modelcollaps: steeds vlakkere, gemiddeldere resultaten.

De praktijk is daarom altijd een mengsel: echte gegevens als fundament, synthetische als aanvulling voor precies de gevallen die ontbreken.

Lees ook

Persoonlijke hulp

Vragen na het lezen?

Onze AI-experts leggen het je persoonlijk uit en helpen je het toe te passen in je eigen bedrijf. Plan een vrijblijvende afspraak.

Boek een afspraak met een expert