Meta Muse Glimmer draait offline op één GPU, maar heeft 24 GB VRAM nodig

Meta heeft op 10 augustus Muse Glimmer uitgebracht, een taalmodel met ongeveer 30 miljard parameters. Wat opvalt, is niet zozeer het model zelf als wel de licentie en de doelcomputer. De gewichten staan op Hugging Face onder Apache 2.0, zodat u ze kunt downloaden, aanpassen en commercieel kunt gebruiken. En dit is niet ontworpen om in een datacenter te draaien, maar op een enkele grafische kaart onder uw bureau.
Het model is afkomstig van het Meta Superintelligence Lab en is afgeleid van het grotere Muse Spark, wat betekent dat een groot model een klein model heeft geleerd hoe het antwoorden moet geven. Het verwerkt tekst en afbeeldingen als invoer, maar produceert uitsluitend tekst, ondersteunt meer dan 100 talen en werkt met een contextvenster van meer dan 131.000 tokens. De kennis van het model is bijgewerkt tot en met 4 januari 2026. De meest recente releases van Meta waren de Muse Code-agent en de Muse Image-generator.
24 GB VRAM is de minimale vereiste
Bij volledige precisie zou het model 64 GB videogeheugen nodig hebben. Meta comprimeert dit tot ongeveer 4-bit door middel van kwantisering, een grovere manier om getallen op te slaan die veel minder ruimte in beslag neemt. Hierdoor krimpt het taalgedeelte tot minder dan 20 GB, wat ruimte overlaat voor de beeldencoder en de cache voor het lopende gesprek.
Er worden twee kant-en-klare varianten meegeleverd. K-Quant-Dynamic is afgestemd op 32 GB en verliest gemiddeld 0,2 procent aan nauwkeurigheid over 15 benchmarks, terwijl K-Quant-17GB binnen 24 GB past en 1,0 procent verliest. In de praktijk betekent dit een GeForce RTX 5090, RTX 4090, RTX 3090 of een Mac met een M4 Max. Een middenklassekaart met 12 GB is geen optie. Als u over minder geheugen beschikt, vindt u in onze gids informatie over kleinere modellen voor uw eigen laptop, en zelfs de iPhone kan nu een bruikbaar taalmodel draaien.
Eén versneller maakt het drie keer zo snel
Om te voorkomen dat een lokaal model traag aanvoelt, levert Meta een hulpprogramma mee dat DFlash heet. Dit stelt 16 tokens tegelijk voor, en het grote model controleert het hele blok in één doorloop en corrigeert alleen wat fout is. Volgens Meta’s eigen metingen stijgt de doorvoersnelheid op een RTX 5090 van 74,9 naar 233,4 tokens per seconde, een factor 3,1. Een MacBook met een M5 Max gaat van 26,6 naar 50,2 tokens, de M4 Max van 23,7 naar 37,8.
AMD publiceerde diezelfde dag zijn eigen cijfers. Een mini-pc met een Ryzen AI Max+ 395 haalt tot 24 tokens per seconde en een Radeon AI PRO R9700 tot 53, gemeten op Windows met llama.cpp. AMD bestempelt de cijfers als voorlopig.
Sterk in planning, zwakker in de interface
Meta vergelijkt Muse Glimmer met Gemma4-31B van Google en Qwen3.6-27B van Alibaba. Wanneer het model tools inroept en plannen opstelt die meerdere stappen omvatten, loopt het duidelijk voorop. Het scoort 75,5 op MCP Atlas tegenover 54,2 en 62,5, en 74,6 op DeepSearch QA tegenover 61,7 en 71,1.
Qwen wint op andere vlakken. Bij het aansturen van een daadwerkelijke desktopinterface ligt de score tussen 65,9 en 75,6, in de terminal tussen 51,7 en 60,7. En bij de Siren AgentDojo-beveiligingstest, die meet hoe gemakkelijk een model kan worden gemanipuleerd door instructies die verborgen zijn in externe documenten, verslaat het succespercentage van 28,4 procent bij aanvallen van Muse Glimmer dat van Qwen, maar blijft het achter bij Gemma4 met 25,6 procent. Dit is het waard om in gedachten te houden voordat u het model op uw eigen bestanden en e-mail richt.
Hoe kunt u het verkrijgen?
Op Hugging Face staan vier pakketten klaar: het basismodel met volledige BF16-gewichten, GGUF-bestanden voor llama.cpp, ExecuTorch-builds voor Apple-apparaten en de DFlash-helper. De eenvoudigste manier is via LM Studio, waar het model te vinden is via de zoekfunctie. AMD adviseert hiervoor meer dan 32 GB videogeheugen of een gelijkwaardige toewijzing van systeemgeheugen. Indien u over minder beschikt, bieden providers zoals Unsloth kleinere kwantisaties aan, maar dan moet u een deel van het model naar het gewone systeemgeheugen verplaatsen, wat merkbaar ten koste gaat van de snelheid. De community reageerde snel. Minder dan een dag na de release waren er al 57 aanvullende kwantisaties en zes verfijningen beschikbaar. Het is hier niet mogelijk om het model in een browser uit te proberen, zoals dat bij Kimi K3 wel het geval was. Zonder de juiste hardware blijft Muse Glimmer buiten bereik.
Bron(nen)
Top 10 Testrapporten
» Top 10 Multimedia Notebooks
» Top 10 Gaming-Notebooks
» Top 10 Budget Gaming Laptops
» Top 10 Lichtgewicht Gaming-Notebooks
» Top 10 Premium Office/Business-Notebooks
» Top 10 Budget Office/Business-Notebooks
» Top 10 Workstation-Laptops
» Top 10 Subnotebooks
» Top 10 Ultrabooks
» Top 10 Notebooks tot €300
» Top 10 Notebooks tot €500
» Top 10 Notebooks tot € 1.000
» De beste notebookbeeldschermen
» Top Windows Alternatieven voor de MacBook Pro 13
» Top Windows Alternatieven voor de MacBook Pro 15
» Top Windows alternatieven voor de MacBook 12 en Air
» Top 10 best verkopende notebooks op Amazon
» Top 10 Convertible Notebooks
» Top 10 Tablets
» Top 10 Tablets tot € 250
» Top 10 Smartphones
» Top 10 Phablets (>90cm²)
» Top 10 Camera Smartphones
» Top 10 Smartphones tot €500
» Top 10 best verkopende smartphones op Amazon






