Xiaomi heeft op 21 september MiMo-V2.6-Distill-Qwen-9B gepubliceerd, een downloadbaar AI-model met ongeveer negen miljard parameters: de getallen die tijdens training worden aangepast. Het bouwt voort op Qwen3.5-9B en is verder getraind met door MiMo gemaakte voorbeelden. Xiaomi richt zich onder meer op programmeren en taken met hulpmiddelen. De release is een opgeslagen resultaat van begeleide training, bedoeld als vertrekpunt voor verder onderzoek. Het is dus nog geen volledig ingerichte assistent. Voor studenten en jonge makers is vooral interessant hoe kennis uit een groter systeem bruikbaar kan worden in een kleiner model.
Leren van een leraar
Die aanpak valt onder kennisdistillatie. Het idee is ouder dan de huidige chatbots: Geoffrey Hinton, Oriol Vinyals en Jeff Dean beschreven in 2015 hoe een kleiner netwerk kan leren van een groter netwerk of een groep modellen. In hun methode krijgt de leerling informatie over meerdere mogelijke antwoorden, inclusief de kansen die de leraar daaraan toekent. Dat bevat meer nuance dan alleen één antwoord dat als goed wordt aangemerkt. Het kleinere model leert zo gedrag na te bootsen; de parameters van het grote model worden niet simpelweg overgekopieerd. De auteurs laten ook zien dat een kleine leerling niet alles exact kan overnemen. Dat is de algemene achtergrond, geen bewijs dat Xiaomi precies deze oorspronkelijke methode gebruikt.
Kleiner opslaan is een andere ingreep
Distillatie gaat over leren. Kwantisatie gaat over de getallen waarin modelgewichten worden opgeslagen en waarmee wordt gerekend. De documentatie van Transformers beschrijft hoe minder bits per gewicht de geheugenbehoefte kunnen verlagen, met mogelijke gevolgen voor nauwkeurigheid en ondersteuning door hardware. De grafiek rekent dat uitsluitend voor de gewichten door. Bij precies negen miljard waarden vraagt zestien bits theoretisch achttien gigabyte; vier bits vraagt viereneenhalf. Dat is geen meting van deze download en geen belofte dat een laptop met zoveel RAM voldoende is. Ook volgt er niet uit dat iedere genoemde precisie voor deze release beschikbaar of geschikt is.
- 16 bits per waarde18 GB
- 8 bits per waarde9 GB
- 4 bits per waarde4,5 GB
GB = 9 × bits ÷ 8. Exclusief cache, metadata en overige geheugenkosten. Geen gemeten RAM-verbruik. Principe: Transformers-kwantisatiedocumentatie.
Ook een gesprek kost geheugen
Tijdens het beantwoorden gebeurt meer dan gewichten inladen. Bij modellen die tekst stap voor stap genereren, kunnen eerdere berekeningen voor aandacht worden bewaard in een zogenoemde KV-cache. Zo hoeft de software bij ieder volgend stukje tekst niet alles opnieuw uit te rekenen. De Transformers-documentatie laat zien dat die opslag bij lange invoer en lange antwoorden aanzienlijk kan worden. Hoe dat uitpakt, hangt af van de architectuur en de gekozen cache. Verplaatsen naar werkgeheugen van de computer kan videogeheugen besparen, maar ook snelheid kosten. Voor een project met lange cursusdocumenten is daarom de praktische vraag hoeveel ruimte tijdens het hele gesprek nodig blijft. Een bestandsformaat of downloadgrootte geeft daarop alleen geen antwoord.
Een verzoek is nog geen uitgevoerde taak
Ook het woord agent verdient uitleg. Een model kan aangeven dat het een hulpmiddel wil gebruiken, bijvoorbeeld een functie om een bestand te lezen. Volgens de Transformers-uitleg voert het model die functie niet zelf uit. De omliggende toepassing leest het verzoek, voert de functie uit en geeft het resultaat terug aan het gesprek. Daarna kan het model verder antwoorden. Wie voor een schoolproject een programmeerassistent bouwt, heeft dus ook software nodig die dat verkeer afhandelt. De functienaam en argumenten moeten passen bij wat de toepassing aanbiedt. Een tekst die zegt dat een bestand is aangepast, bewijst nog niet dat die wijziging op de computer heeft plaatsgevonden. Daarvoor moet de uitvoering werkelijk zijn ingericht.
Wat een benchmark werkelijk meet
Xiaomi meldt voor SWE Verified een score van 61,1 tegenover 60,0 voor het basismodel; dit zijn eigen resultaten, geen Nxt-test. De officiële SWE-bench-site maakt duidelijk wat voor opdrachten achter zulke cijfers zitten: bestaande problemen uit softwareprojecten op GitHub, waarvoor een systeem code moet aanpassen. De Verified-versie is een door mensen gecontroleerde selectie van vijfhonderd opgaven. De site onderscheidt bovendien testomgevingen; in de Bash Only-weergave gebruiken modellen dezelfde compacte softwareomgeving. Zo wordt een vergelijking beter te interpreteren. Een score hoort bij een concrete verzameling opdrachten én bij de manier waarop het systeem mag werken. Zij vertelt niet rechtstreeks hoe goed jouw Nederlandse projectbeschrijving wordt begrepen, of hoeveel hulp je bij een ander programmeerproject nodig hebt.
Test of het werk af is
Een op 21 september verschenen uitleg van NVIDIA trekt die gedachte door naar toepassingen. Het bedrijf onderscheidt de beoordeling van losse stappen van de controle op het eindresultaat. Een geldige aanroep kan onderdeel zijn van een mislukte taak; andersom kan een omweg toch een goed eindresultaat opleveren. Voor je eigen project kun je daarom vooraf vastleggen wat voltooiing betekent: bijvoorbeeld dat de aangepaste code de relevante tests doorstaat. Bekijk daarnaast hoeveel stappen, tijd en kosten succesvolle pogingen vragen, en of herhaalde pogingen vergelijkbaar presteren. NVIDIA heeft als leverancier een eigen belang bij AI-gebruik, maar deze methode helpt wel om een demonstratie te beoordelen op aantoonbaar werk in plaats van overtuigende uitleg.
Lokaal vraagt om een complete inrichting
Voor wie met eigen documenten wil experimenteren, is offlinegebruik een afzonderlijke keuze. De installatiehandleiding van Transformers beschrijft dat modelbestanden vooraf moeten zijn gedownload of gecachet. Daarna kan de bibliotheek lokaal laden; een offline-instelling voorkomt daarbij HTTP-verzoeken aan de Hugging Face Hub. Die instelling gaat over deze bibliotheek en haar modelbestanden. Je kunt er niet uit afleiden dat een hele assistent geen internet gebruikt: een aangesloten zoekfunctie of andere toepassing kan nog steeds verbinding maken. Voor een Nederlandse of Belgische studiegroep is daarom het hele gegevenspad relevant. Waar staan de documenten, welke software leest ze en welke hulpmiddelen worden aangeroepen? Een downloadbare basis geeft ruimte om dat zelf in te richten; de inrichting bepaalt wat er daadwerkelijk lokaal blijft.
Verder bij de bron
Lees zelf de onderzoeken, uitleg en aankondigingen achter dit verhaal.
- [1] Xiaomi MiMo — modelkaart en releasegeschiedenis, 21 september 2026
- [2] Hinton, Vinyals en Dean — Distilling the Knowledge in a Neural Network (2015)
- [3] Hugging Face Transformers — kwantisatie, versie 5.17.0
- [4] Hugging Face Transformers — KV-cache, versie 5.17.0
- [5] Hugging Face Transformers — toolgebruik, versie 5.17.0
- [6] SWE-bench — officiële benchmark en testomgeving
- [7] NVIDIA — van toolaanroep naar voltooide taak, 21 september 2026
- [8] Hugging Face Transformers — offlinegebruik, versie 5.17.0
