FreeToken maakt lokaal draaien van enorme taalmodellen mogelijk
Een nieuwe inferentie-engine genaamd FreeToken maakt het mogelijk om grote Mixture-of-Experts modellen lokaal uit te voeren op een enkele werkstation-gpu. De software verdeelt de belasting slim over de beschikbare hardwarebronnen.
Met FreeToken is een techniek ontwikkeld waarmee geavanceerde taalmodellen lokaal kunnen draaien op standaard hardware. De engine splitst de cache-uitwisselingen op tussen geheugenoverdrachten en computerberekeningen, waardoor het mogelijk wordt om omvangrijke systemen op een enkele werkstation-gpu te benaderen.
Lokaal rekenen aan AI
Het lokaal uitvoeren van grote modellen wint aan populariteit binnen de techwereld, omdat het gebruikers meer controle geeft over hun data en minder afhankelijkheid van clouddiensten vereist. Door efficiënter gebruik te maken van bestaande hardware wordt geavanceerde technologie toegankelijker voor ontwikkelaars en onderzoekers die geen gebruik willen maken van zware datacenter-infrastructuur.
Deze samenvatting is gebaseerd op een origineel artikel van MarkTechPost. Lees het volledige, originele bericht bij de bron.
Lees het originele artikelAchtergrond bij dit bericht
- Wat is inferentie? Het verschil tussen een model bouwen en gebruikenTrainen gebeurt één keer en kost een vermogen. Inferentie gebeurt bij elke vraag, en dat is waar de rekening echt ontstaat.
- Wat is een AI-datacenter, en waarom staat het overal in het nieuws?Gebouwen vol chips die stroom en water vragen op een schaal die lokale discussies losmaakt. Wat er binnen gebeurt en waarom de locatie zo vaak de kern van het nieuws is.