Wat is een embedding?
Betekenis als coördinaten
Een embedding is een reeks getallen die de betekenis van een stuk tekst vastlegt. Meestal enkele honderden tot enkele duizenden getallen, samen een punt in een ruimte met even zoveel richtingen. Teksten die hetzelfde betekenen, komen dicht bij elkaar te liggen — ook als er geen enkel woord overeenkomt.
Zo liggen "de auto is stuk" en "mijn wagen doet het niet meer" dicht bij elkaar, terwijl "de auto is nieuw" verderop ligt, ondanks dat die laatste twee woorden delen.
Hoe die getallen ontstaan
Een apart model wordt getraind met een simpel principe: teksten die in dezelfde context voorkomen, moeten dicht bij elkaar uitkomen. Doe dat op miljarden voorbeelden en er ontstaat een ruimte waarin richtingen betekenis krijgen. Het klassieke voorbeeld: de afstand tussen "koning" en "koningin" lijkt op die tussen "man" en "vrouw".
Waar het voor gebruikt wordt
- Zoeken op betekenis in plaats van op exacte woorden — de basis van elke moderne bedrijfszoekfunctie.
- RAG: de relevante passages uit je eigen documenten opzoeken voordat je het model laat antwoorden.
- Aanbevelingen: producten of artikelen vinden die lijken op wat iemand eerder koos.
- Groeperen: duizenden klantreacties automatisch op thema sorteren.
- Dubbelingen opsporen: twee berichten over hetzelfde onderwerp herkennen, ook bij verschillende bewoordingen.
Waar het misgaat
Embeddings zijn slecht in precisie. Productcodes, artikelnummers, namen en datums vangen ze niet goed, omdat die geen betekenis in de gewone zin hebben. Voor die gevallen blijft ouderwets exact zoeken beter. De beste systemen doen daarom allebei en voegen de uitkomsten samen.
Ook belangrijk: embeddings van verschillende modellen zijn onderling onvergelijkbaar. Wissel je van model, dan moet je alles opnieuw omzetten. Zie ook vectordatabases.