Terug naar kennisbank
Kennisbank · Gevorderd

Synthetische data: AI die zijn eigen lesmateriaal maakt

5 min lezenUitleg door de AI Dagblad-redactie

Synthetische data is kunstmatig gegenereerd trainingsmateriaal, gemaakt door AI in plaats van verzameld uit de echte wereld. Het speelt een steeds grotere rol bij het trainen van modellen.

Waarom het nodig is

De voorraad hoogwaardige menselijke tekst op internet is eindig, en veel bronnen sluiten zich af voor AI-verzamelaars. Tegelijk vragen nieuwe modellen om steeds meer materiaal. Zelf data genereren vult dat gat.

Waar het goed werkt

  • Zeldzame situaties: voorbeelden maken van gevallen die in het echt bijna nooit voorkomen.
  • Privacy: nepgegevens die statistisch lijken op echte, zonder herleidbare personen.
  • Robotica: duizenden gesimuleerde varianten van één echte oefening.
  • Balans: ondervertegenwoordigde groepen aanvullen om scheefheid te verminderen.

Het risico: modelverval

Traint een model te veel op uitvoer van andere modellen, dan verschraalt de kwaliteit geleidelijk — als een kopie van een kopie. Onderzoekers noemen dit model collapse. De oplossing is menselijke data blijven mengen en de gegenereerde data streng filteren.

De kern

Synthetische data is een krachtig hulpmiddel, geen vervanging van de werkelijkheid. De beste resultaten ontstaan uit een mengsel van beide.

Lees ook

Persoonlijke hulp

Vragen na het lezen?

Onze AI-experts leggen het je persoonlijk uit en helpen je het toe te passen in je eigen bedrijf. Plan een vrijblijvende afspraak.

Boek een afspraak met een expert