Terug naar kennisbank
Kennisbank · Basis

Wat is multimodale AI?

5 min lezenUitleg door de AI Dagblad-redactie

Multimodale AI kan meerdere soorten input tegelijk begrijpen en combineren: tekst, afbeeldingen, geluid en video. De nieuwste modellen zijn vrijwel allemaal multimodaal.

Wat het concreet betekent

Je kunt een foto uploaden en er vragen over stellen, een grafiek laten uitleggen, een handgeschreven notitie laten overtypen of een gesprek voeren via spraak. Het model schakelt naadloos tussen de vormen.

Waarom dit een grote stap is

De wereld is niet alleen tekst. Door beeld en geluid te begrijpen, kan AI veel meer praktische taken aan: een defect apparaat herkennen van een foto, een document met tabellen doorgronden, of een video samenvatten.

Voorbeelden uit de praktijk

  • Een klant stuurt een foto van een probleem; de AI herkent het en geeft advies.
  • Een medewerker spreekt een vraag in en krijgt gesproken antwoord.
  • Een model leest een ingescand contract en beantwoordt vragen erover.

De kern

Multimodaliteit maakt AI toegankelijker en breder inzetbaar. Voor bedrijven betekent het dat AI kan aansluiten op hoe mensen écht communiceren — met woorden, beelden én stem.

Lees ook

Persoonlijke hulp

Vragen na het lezen?

Onze AI-experts leggen het je persoonlijk uit en helpen je het toe te passen in je eigen bedrijf. Plan een vrijblijvende afspraak.

Boek een afspraak met een expert