Hoe werkt AI-beeldgeneratie?
Tekst-naar-beeld-modellen zoals Midjourney, DALL·E en Stable Diffusion maken uit een zin een volledig nieuwe afbeelding. Hoe kan dat?
Leren wat woorden er visueel uitzien
De modellen zijn getraind op enorme verzamelingen afbeeldingen met bijschriften. Zo leerden ze het verband tussen woorden ("een rode auto in de regen") en hoe zoiets eruitziet.
Van ruis naar beeld: diffusie
De meeste beeldmodellen werken met diffusie. Tijdens de training leerden ze afbeeldingen te herstellen die steeds verder met ruis waren "vervuild". Bij het genereren draaien ze dat om: ze beginnen met pure ruis en verwijderen die stap voor stap, gestuurd door jouw beschrijving, tot een scherp beeld overblijft.
Waarom de prompt zo bepalend is
Omdat het model op jouw woorden stuurt, maakt de formulering enorm verschil. Details over stijl, licht, camerastandpunt en sfeer leiden tot heel andere resultaten. Beeld-prompten is een vak apart.
Grenzen en aandachtspunten
Beeldmodellen worstelen soms met tekst in beeld, handen en exacte tellingen. Daarnaast spelen er vragen rond auteursrecht van de trainingsdata — iets om zakelijk rekening mee te houden.