Notebookcheck Logo

Wat zit er werkelijk achter de recordcijfers van de Kimi K3?

Startscherm van de Kimi-webinterface met invoerveld en K3-logo
ⓘ Screenshot: Kimi.com / Moonshot AI
Achter de eenvoudige interface schuilt het grootste open AI-model
Het nieuwe vlaggenschipmodel van China breekt records op het gebied van omvang, en de krantenkoppen volgen elkaar in rap tempo op. Moonshot zelf rangschikt Kimi K3 achter Claude en GPT. Wij zullen uitleggen wat de cijfers werkelijk betekenen, of u het model ooit zelf zult kunnen gebruiken, wat het daadwerkelijk kost en wat er met uw invoer gebeurt.

Kimi K3 is sinds 16 juli online en de krantenkoppen doen het lijken alsof China zojuist de VS heeft ingehaald. Met 2,8 biljoen parameters is het het grootste model waarvan de gewichten openbaar zullen worden gemaakt. Sommige waarnemers noemen het nu al het volgende „DeepSeek-moment“.

De meest interessante uitspraak over dit model staat echter niet in de krantenkoppen. Deze is te vinden op de eigen technische blog van Moonshot. Daar schrijft de maker dat de algehele prestaties nog steeds achterblijven bij de sterkste propriëtaire modellen, namelijk Claude Fable 5 en GPT-5.6 Sol. Het komt zelden voor dat een bedrijf zijn eigen product presenteert en tegelijkertijd aangeeft dat het niet het beste is. Juist daarom verdienen de recordcijfers nadere aandacht.

We hebben het algemene nieuws dat K3 beschikbaar is en gratis kan worden uitgeprobeerd, al behandeld. Dit artikel gaat over wat daarna komt.

De eerste plaats, en wat deze werkelijk meet

K3 wint wel één belangrijke vergelijking. In de Frontend Code Arena, waar mensen twee resultaten naast elkaar te zien krijgen en het betere resultaat kiezen zonder te weten welk model het heeft geproduceerd, komt K3 als beste uit de bus. Zelfs vóór Claude en GPT.

Het addertje onder het gras: deze test meet smaak. Gebruikers beoordelen welke webinterface zij het prettigst vinden. Dat zegt veel over het ontwerp en weinig over de juistheid. Wie hieruit concludeert dat „Kimi de Amerikaanse modellen verslaat”, heeft het verschil tussen een voorkeursranglijst en een nauwkeurigheidstest over het hoofd gezien.

Waarom benchmarktabellen zorgvuldig moeten worden gelezen

Moonshot publiceert zijn meetresultaten, en het interessante deel staat in de voetnoten. Afhankelijk van de benchmark werd elk model uitgevoerd in een andere agent-harness: soms KimiCode, soms Claude Code, soms Codex. Dat zijn verschillende startvoorwaarden; het is geen eerlijke race op hetzelfde parcours.

In een van de coderingstests geeft Moonshot zelf toe dat Claude Fable 5 bij 35 procent van de taken op fallbacks stuitte, wat de score mogelijk naar beneden heeft gehaald. In een andere test bereikt K3 zijn topscore alleen met een techniek die de context bij 300.000 tokens comprimeert. Zonder dat contextbeheer daalt het cijfer.

Hoe gemakkelijk dergelijke cijfers kunnen omslaan, blijkt uit een evaluatie van het onafhankelijke analysebureau Artificial Analysis. Daar scoort Kimi K3 49 procent op een hallucinatiemaatstaf. Dat klinkt als een zwakke score. De schaal is echter omgekeerd: er wordt geteld hoe vaak het model geen fouten maakt. Hoger is beter, en op dezelfde lijst staat Claude Fable 5 met 45 procent onder K3, terwijl verschillende GPT-5.6-varianten ver achterblijven.

Een regel die u in gedachten moet houden: voordat u een kop over een benchmark gelooft, moet u controleren wat er precies is gemeten en welke kant de schaal opgaat.

Kunt u K3 zelf draaien?

Voor onze lezers is dat de echte vraag. Het eerlijke antwoord: voor gewone gebruikers zal dit praktisch geen verschil maken, zelfs niet zodra de gewichten beschikbaar zijn. De reden is simpelweg de omvang.

Reken het maar eens uit. Moonshot traint K3 vanaf het begin in een compact getalformaat genaamd MXFP4, dat ongeveer vier bits per gewicht gebruikt. Gewichten, ook wel parameters genoemd, zijn de aangeleerde numerieke waarden waaruit een AI-model bestaat. Bij 2,8 biljoen parameters komt u uit op ongeveer 1,4 terabyte alleen al voor het modelbestand. Geen gigabytes. Terabytes. Ter vergelijking: een typisch model met acht miljard parameters, het soort dat op een goed uitgeruste laptop draait, neemt ongeveer vijf gigabyte in beslag.

Een modelbestand van 1,4 terabyte: K3 is veel te groot voor welke thuis-pc dan ook

Moonshot raadt zelf aan om K3 uit te voeren op supernode-opstellingen met 64 of meer versnellers. Dat is geen overdreven voorzichtigheid, maar het logische gevolg van deze omvang. Een enkele professionele grafische kaart met 96 gigabyte geheugen schiet er met meer dan een factor tien bij in de buurt.

„Open weights“ betekent daarom niet dat u dit model thuis zult draaien. Het betekent dat onderzoekers, bedrijven en cloudproviders het kunnen downloaden, inspecteren en op hun eigen infrastructuur kunnen draaien in plaats van het alleen via de servers van Moonshot te huren. Dat is waardevol, maar het is iets anders dan wat veel mensen zich voorstellen.

Als u daadwerkelijk AI zonder de cloud op uw eigen computer wilt gebruiken, zijn de kleine modellen die voor dat doel zijn ontwikkeld de juiste keuze. In een apart artikel hebben wij laten zien hoe dat werkt en welke hardware u daarvoor nodig hebt.

Een kanttekening voor de technisch nieuwsgierigen: omdat K3 vanaf dag één met deze lage precisie is getraind, is het compacte formaat de oorspronkelijke toestand, en niet een model dat achteraf is verkleind. De gebruikelijke vraag in hoeverre de kwaliteit lijdt onder de verkleining, stelt zich hier niet op dezelfde manier.

Wat het in de praktijk kost

De facturering werkt op basis van tokens, kleine tekstfragmenten van doorgaans slechts enkele tekens. Via de API brengt Moonshot 3 dollar per miljoen invoertokens en 15 dollar per miljoen uitvoertokens in rekening. Herhaalde invoer wordt gefactureerd tegen 30 cent, wat aanzienlijk goedkoper is.

Daardoor is K3 geen koopje meer. Het kost ongeveer drie keer zoveel als zijn eigen voorganger, die iets minder dan een dollar in rekening bracht voor invoer. In vergelijking met Claude Fable 5, met prijzen van $10 en $50, is K3 duidelijk goedkoper. Claude Sonnet 5 onderbiedt het echter nog steeds met zijn huidige introductieprijs van $2 en $10 en evenaart K3 pas in september. Het tijdperk waarin Chinese modellen voornamelijk op prijs concurreerden, loopt bij Moonshot ten einde.

K3 kost drie keer zoveel als zijn voorganger, maar blijft onder Fable 5

Er is nog een punt dat gemakkelijk over het hoofd wordt gezien. K3 denkt momenteel altijd op het hoogste inspanningsniveau. Moonshot is van plan om later zuinigere modi toe te voegen. Dat zorgt voor grondige antwoorden, maar het betekent ook dat zelfs een eenvoudige vraag het kostbare redeneerwerk in gang zet. Onafhankelijke metingen wijzen uit dat het model ongeveer 62 output-tokens per seconde produceert, wat qua snelheid in het midden van het veld ligt.

Wat gebeurt er met uw invoer?

Voor iedereen die K3 in de app of op de website uitprobeert, is dit het belangrijkste onderdeel. In het privacybeleid van Moonshot staat duidelijk vermeld dat invoer, audio, afbeeldingen, video’s en bestanden worden verwerkt om de diensten te leveren en te verbeteren, waarbij expliciet de training en optimalisatie van de eigen modellen worden genoemd.

Een speciale schakelaar om het trainen op uw inhoud uit te schakelen, is nergens in het beleid te vinden. Er wordt verwezen naar algemene rechten van betrokkenen, die u kunt uitoefenen via uw accountinstellingen of door een e-mail te sturen naar het privacycontact. ChatGPT en Claude hebben daarentegen een schakelaar direct in de instellingen opgenomen.

Ook in het beleid staat vermeld dat verzamelde gegevens onder meer bestaan uit IP-adressen, apparaat-ID’s, sessie- en gespreks-ID’s en, indien de apparaatinstellingen dit toestaan, gegevens uit het klembord. Wat de opslaglocatie betreft, vermeldt het beleid alleen dat gegevens kunnen worden overgedragen naar servers buiten het land waar u woont. Er wordt geen specifiek land genoemd. De aanbieder is Moonshot AI PTE. LTD., gevestigd in Singapore, en het beleid is gedateerd op 7 juli 2025.

Voor een test met onschadelijke taken is dat aanvaardbaar. Voor bedrijfsinterne gegevens, klantgegevens of privédocumenten geldt dezelfde regel als bij elke clouddienst, alleen in dit geval bij een aanbieder wiens eigen voorwaarden expliciet voorzien in training.

Voor wie is Kimi K3 het meest geschikt?

Het uitproberen kost niets. Twee groepen hebben er het meest baat bij: iedereen die ontwikkelt of ontwerpt, en iedereen die regelmatig met zeer lange documenten werkt. K3 is sterk op het snijvlak van code en beeldmateriaal, in webinterfaces, 3D en animatie. Het contextvenster van één miljoen tokens is een sterk argument voor lange teksten, en beeldverwerking is ingebouwd.

Als u de beste antwoordkwaliteit of de soepelste gebruikerservaring wenst, blijven de toonaangevende Amerikaanse modellen de betere keuze. Dat zegt Moonshot zelf ook. En iedereen die hoopt binnenkort een geavanceerd model op zijn eigen computer te kunnen draaien, moet die 1,4 terabyte in gedachten houden.

Het opmerkelijke aan K3 is niet zozeer de rangschikking als wel het tempo. Een Chinees bedrijf levert een model dat zich kan meten met de wereldtop en stelt de modelgegevens openbaar. Twee jaar geleden zou dat nog moeilijk voorstelbaar zijn geweest.

Google LogoAdd as a preferred source on Google
Mail Logo
> Overzichten en testrapporten over laptops en mobieltjes > Nieuws > Nieuws Archief > Nieuws archieven 2026 07 > Wat zit er werkelijk achter de recordcijfers van de Kimi K3?
Steffen Zahn, 2026-07-20 (Update: 2026-07-20)