Google DeepMind introduceert agentic video understanding voor Gemini
Google DeepMind heeft nieuwe functionaliteiten gepresenteerd rondom videoanalyse voor het Gemini-model. Hierbij ligt de nadruk op autonoom en handelend begrip van videobeelden.
Google DeepMind heeft een nieuwe ontwikkeling aangekondigd voor het Gemini-ecosysteem, gericht op het verrijken van videoanalyse. Het gaat hierbij om technologie die videobronnen niet alleen kan bekijken, maar ook 'agentic' gedrag vertoont.
Dit betekent dat de software in staat is om autonoom taken uit te voeren op basis van visuele informatie. Dergelijke toepassingen zijn nuttig voor complexe vraagstukken waarin software zelfstandig conclusies moet trekken uit bewegend beeld.
Binnen de kunstmatige intelligentie is er momenteel veel aandacht voor systemen die verder gaan dan passieve patroonherkenning. Multimodale modellen die naadloos overweg kunnen met tekst, audio en video vormen een belangrijk fundament voor deze volgende generatie slimme assistenten.
Deze samenvatting is gebaseerd op een origineel artikel van Google DeepMind. Lees het volledige, originele bericht bij de bron.
Lees het originele artikel