AI-agenten kunnen foto's omzetten naar 3D-scènes, maar ontberen zelfkritiek

Een nieuwe methode genaamd LEGO-Anything kan afzonderlijke foto's vertalen naar bewerkbare driedimensionale scènes in Blender-code. Hoewel de reconstructies tot stand komen met behulp van geavanceerde modellen, blijkt uit tests dat de systemen zelf niet kunnen beoordelen of hun geometrische werk correct is.
Onderzoekers hebben een techniek ontwikkeld die stilstaande foto's automatisch omzet in driedimensionale computermodellen. Het systeem maakt hierbij gebruik van programmeertaal om scènes op te bouwen die direct door ontwerpers kunnen worden aangepast. Uit de bijbehorende tests blijkt dat de gebruikte modellen behoorlijke nauwkeurigheid behalen bij deze reconstructies.
Het ontbreken van ruimtelijk inzicht
Een hardnekkig probleem bij dit soort toepassingen is dat de systemen blind opereren. De gebruikte agenten zijn niet in staat om de geometrische betrouwbaarheid van hun eigen werk te controleren; hun inschatting van de juistheid is vaak niet beter dan een willekeurige gok. Dit laat zien dat visuele creatie op basis van AI nog sterk leunt op statistische patroonherkenning in plaats van echt ruimtelijk begrip.
Binnen de computergeneratie is het controleren van de eigen output een belangrijk actueel thema. Fabrikanten proberen de betrouwbaarheid van generatieve systemen te vergroten door extra controlelagen toe te voegen, zodat gegenereerde objecten ook daadwerkelijk natuurgetrouw en bruikbaar zijn voor professionele toepassingen.
Deze samenvatting is gebaseerd op een origineel artikel van The Decoder. Lees het volledige, originele bericht bij de bron.
Lees het originele artikel