Op een gewone laptop met 16 GB beantwoordt qwen3.5:4b-q4_K_M je vragen al volledig offline. Het is hetzelfde model als in deel twee van deze reeks en een degelijke algemene assistent. Voor het doorzoeken van je bestanden of een programmeerklus kies je beter een ander model. Wie één model voor alles inzet, vraagt er te veel van. Drie kleine modellen verdelen het werk en bewijzen ieder hun nut.
Wie zelf wil bepalen hoe lokale AI werkt, moet bewust kiezen: welk model je gebruikt, met welke software je het draait, welke licentie geldt en welke gegevens waar blijven. Heb je nog niet gecontroleerd hoeveel RAM of VRAM je laptop heeft? Lees dan eerst hoeveel RAM je laptop nodig heeft voor lokale AI. Heb je Ollama nog niet geïnstalleerd? In de gids voor je eerste lokale AI-provider lees je hoe dat moet. Deze gids gaat ervan uit dat je beide stappen hebt gezet. Dan blijven twee vragen over: welke modellen kies je, en hoe weet je of ze goed zijn?
Een bruikbare lokale AI-toolkit combineert drie modellen met elk een eigen taak, in plaats van alles aan één model over te laten.
Een algemene assistent voor chats, eerste versies van teksten en snelle vragen: qwen3.5:4b-q4_K_M. De download is 3,4 GB groot. De tag is dezelfde als in deel twee.
Een compacte specialist voor een afgebakende taak, zoals antwoorden in een vast formaat geven of een gerichte redeneeropdracht uitvoeren: granite4.2:3b. De download is 2,2 GB groot; het model verscheen in augustus 2026 en valt onder de Apache 2.0-licentie. Paragraaf 6 bespreekt andere specialisten voor programmeerwerk, wiskunde, vragen over beelden en vertalingen. Je kunt dit model dus vervangen door een specialist die bij je taak past.
Een embeddingmodel om je eigen documenten te doorzoeken: embeddinggemma:300m, een download van 622 MB. Het voert geen gesprekken, maar zet tekst om in vectoren die een zoekapp kan doorzoeken. In paragraaf 8 lees je hoe dat werkt.
De drie downloads nemen samen ongeveer 6,2 GB schijfruimte in. Schijfruimte is iets anders dan het geheugen dat je nodig hebt om de modellen te draaien: als je alle drie tegelijk geladen houdt, kan dat meer vrij geheugen vragen dan je laptop heeft. Laad liever één model per taak, test het met echt werk en verwijder wat niet nuttig blijkt.
Wat kwantisatie doet, zie je goed als je modellen uit dezelfde familie vergelijkt. Volgens de Ollama-catalogus is de download van qwen3.5:9b-q4_K_M 6,6 GB groot, die van qwen3.5:9b-q8_0 11 GB en die van qwen3.5:9b-bf16 19 GB. Het zijn dezelfde modelgewichten, in drie precisieniveaus en met drie verschillende downloadgroottes.
Die downloadgroottes vertellen je niet rechtstreeks hoeveel geheugen het model gebruikt zodra het geladen is. Bij een lagere precisie wordt het bestand kleiner en is vaak ook minder geheugen nodig. Of en hoeveel de uitvoerkwaliteit achteruitgaat, hangt af van het model, de kwantisatiemethode en de taak. Ga er dus niet bij voorbaat van uit dat je ruimte bespaart zonder op kwaliteit in te leveren.
De modelgewichten zijn niet het enige waarvoor je geheugen nodig hebt. Ook het contextvenster en de bijbehorende key-value-cache nemen geheugen in beslag, net als alles wat verder op je laptop draait. Zelfs als kwantisatie geheugen vrijmaakt, is niet gegarandeerd dat een groter model past. De kans daarop is wel groter dan wanneer je meteen het bestand op volledige precisie probeert te draaien.
Twee aanduidingen in deze catalogus zijn makkelijk verkeerd te lezen. Lees je ze verkeerd, dan download je iets anders dan je van plan was.
Valkuil één. Google noemt Gemma 4 E2B op de eigen modelkaart een model met 2,3 miljard “effectieve” taalparameters. Dat klinkt als een klein bestand. Toch is de download bij Ollama 7,2 GB, bijna net zo groot als de Q4-tag gemma4:12b van 7,6 GB. Wil je weten wat op je laptop past, ga dan af op de downloadgrootte, niet op het vermelde aantal parameters.
Valkuil twee. Zonder volledige tag kun je ongemerkt bij een ander model uitkomen. Download je alleen granite4.2, dan krijg je het 8B-model van 5,3 GB in plaats van de 3B-tag van 2,2 GB uit paragraaf 2. Download je alleen qwen3-embedding, dan krijg je het 8B-model van 4,7 GB in plaats van de 0,6B-tag van 639 MB uit paragraaf 8.
De oplossing is in beide gevallen dezelfde: gebruik bij het downloaden altijd de volledige, specifieke tag, nooit alleen de familienaam. Controleer ook de grootte van het bestand dat je downloadt voordat je ervan uitgaat dat je het bedoelde model gaat testen.
Een catalogusmaximum van bijvoorbeeld 128K of 256K tokens geeft aan wat een model in principe aankan, niet of je laptop met 16 GB daarvoor genoeg geheugen heeft.
Ollama gebruikt standaard een contextvenster van 4.096 tokens. Je kunt het vergroten, maar zowel een langer contextvenster als meer gelijktijdige verzoeken vragen extra geheugen. De instelling num_ctx: 4096 uit deel twee is dan ook diezelfde voorzichtige standaard, geen willekeurig gekozen rond getal.
Stel de context voor een nieuw model eerst in op 4K tot 8K tokens en draai één sessie tegelijk. Houd daarbij het geheugengebruik van je systeem in de gaten. Vergroot het contextvenster pas als je hebt gezien dat je systeem stabiel blijft, niet alleen omdat de catalogus zegt dat het technisch kan.
Er is geen specialist die overal de beste in is. Wel zijn er een paar kleine modellen die je voor je eigen taak kunt testen:
Programmeren: qwen2.5-coder:3b (1,9 GB) of de grotere qwen2.5-coder:7b (4,7 GB). Beide vallen onder Apache 2.0.
Afgebakende wiskunde- of logicaopgaven: phi4-mini:3.8b (2,5 GB) van Microsoft.
Vragen over afbeeldingen en screenshots: gemma4:e2b (7,2 GB) of gemma4:12b in Q4 (7,6 GB). Beide vallen onder Apache 2.0 en ondersteunen volgens de vermelde specificaties tekst- en beeldinvoer.
Meertalig schrijven of vertalen: aya-expanse:8b (5,1 GB), ontwikkeld voor 23 talen.
Let bij het laatste model wel op de licentie. Voor Aya Expanse 8B geldt CC-BY-NC-4.0 met aanvullende voorwaarden. Het model is bedoeld voor niet-commercieel gebruik. Zie het dus niet als een vrij te gebruiken standaardkeuze naast de Apache-modellen hierboven. Past geen van deze vier bij je taak, dan blijft granite4.2:3b uit paragraaf 2 de algemene keuze voor redeneerwerk.
Probeer een specialist eerst uit op je eigen taak. Net als bij de algemene assistent telt of het model je helpt met wat je gedaan wilt krijgen, niet hoe hoog het op andermans ranglijst staat.
Vijf korte tests zeggen meer over een model dan welke cataloguspagina ook. Geef elke kandidaat dezelfde vijf opdrachten, met je eigen materiaal.
1. Samenvatten met onderbouwing. Geef het model een notitie van 250 woorden en vraag om drie actiepunten. Laat het bij elk punt aangeven op welke zin uit de notitie het zich baseert. Markeer elke bewering die de tekst niet onderbouwt.
2. Gegevens in een vast formaat. Bedenk vijf afspraken met namen en datums. Vraag het model om die in JSON weer te geven, met precies de velden die je opgeeft. Controleer daarna alle vijf afspraken aan de hand van je oorspronkelijke tekst.
3. Een codefout herstellen. Geef het model een kleine functie met een test die niet slaagt. Noteer of die test na de voorgestelde aanpassing wel slaagt. Gebruik voor elk model dat je vergelijkt dezelfde repository en context.
4. Vertalen tussen twee talen. Laat iemand die de doeltaal vloeiend spreekt controleren of namen, getallen en nuances in de vertaling van een realistische alinea behouden blijven. Beoordeel de meertalige kwaliteit van een model nooit met alleen een Engelstalige opdracht.
5. Een vraag over een afbeelding, alleen voor modellen die beeld kunnen verwerken. Gebruik een grafiek of screenshot en stel er een vraag over met een controleerbaar antwoord. Controleer of je de afbeelding zelf hebt meegestuurd en niet alleen de bestandsnaam.
Noteer per test of het antwoord overeenkomt met wat je weet, of het model je instructies opvolgt en of het iets verzint. Meet hoe lang het duurt tot de eerste uitvoer zichtbaar is, de totale duur en het aantal tokens. Schrijf ook op of het model op de CPU of GPU draaide. Beoordeel bruikbaarheid en snelheid afzonderlijk: een model dat eerst redeneert, kan tijd kwijt zijn aan tokens die je nooit te zien krijgt.
Het embeddingmodel uit paragraaf 2 heeft één taak: tekst omzetten in vectoren waarin een zoekapp kan zoeken. Vragen beantwoorden kan het zelf niet.
Zo werkt het: eerst deel je je bestanden op in tekstfragmenten. Het embeddingmodel zet elk fragment om in een vector, die in een lokale vectoropslag terechtkomt. Ook je zoekvraag wordt een vector. Daarna worden de best passende fragmenten opgehaald. Pas dan formuleert een chatmodel op basis van die fragmenten een antwoord, met bronverwijzingen.
Het chatmodel is niet op je documenten getraind. Wanneer je een vraag stelt, ziet het van die documenten alleen de fragmenten die op dat moment worden opgehaald.
Test dit zonder veel voorbereiding: indexeer vijf notities die je al hebt. Stel twee vragen: één waarop een van de notities antwoord geeft, en één waarop geen van de vijf antwoord geeft. Als de opzet werkt, krijg je bij de eerste vraag de juiste passage met een bronverwijzing. Bij de tweede geeft het systeem aan dat er geen onderbouwing is, in plaats van een antwoord te verzinnen. Beoordeel het ophalen van de passages en het uiteindelijke antwoord apart.
Controleer ook hier vóór het downloaden de volledige tag: embeddinggemma:300m of qwen3-embedding:0.6b. Met alleen de familienaam loop je hetzelfde risico als in paragraaf 4.
Een model met een aanduiding als “26B A4B” gebruikt per gegenereerd token slechts een deel van zijn parameters. Alle 26B modelgewichten moeten wel ergens opgeslagen zijn of tijdens het draaien worden ingelezen. Een deel activeren levert dus niet vanzelf een kleiner bestand of lager geheugengebruik op.
Je vindt in deze toolkit geen cijfers uit nieuwe benchmarkmetingen. Een cijfer uit een andere bron moet je lezen als het resultaat van één specifieke opstelling. Zo meldde één gebruiker ongeveer 18,5 tokens per seconde op een ongebruikelijke 26B-mixture-of-experts-opstelling met een oudere CPU en een GPU met 6 GB geheugen. Die snelheid op de hardware van die gebruiker mag je niet van elk model met dat label verwachten.
We hebben deze toolkit getest op twee laptops uit het huidige aanbod, dezelfde als in deel twee: een instapmodel met Apple Silicon en een Windows-workstation met eigen videogeheugen. Beide zijn refurbished: professioneel getest, gereinigd en opgeknapt. Op refurbed geldt voor beide 12 maanden garantie. Elk van beide kan de drie-modellen-toolkit hierboven zonder moeite aan, één model tegelijk.
De MacBook Air (2026) van 13 inch met M5-chip heeft standaard 16 GB geheugen dat de CPU en GPU delen. Je kunt hem configureren met maximaal 32 GB. De Dell Precision 7730 heeft 32 GB systeemgeheugen en daarnaast 6 GB eigen NVIDIA-videogeheugen. Het gaat om twee afzonderlijke geheugens, niet om één gedeeld geheugen.
We noemen deze laptops niet om ze aan te prijzen. Het zijn de machines waarop de toolkit is getest. Zo kun je je eigen laptop vergelijken met concrete voorbeelden in plaats van alleen met de specificaties uit een verkoopfolder.
Een licentie geldt per model, niet automatisch voor de hele modelfamilie. Qwen3.5 4B, Qwen2.5-Coder, Granite 4.2 3B en Gemma 4 E2B vallen onder Apache 2.0. Aya Expanse 8B valt onder CC-BY-NC-4.0 met aanvullende voorwaarden voor niet-commercieel gebruik, zoals in paragraaf 6 al stond. Dat je modelgewichten kunt downloaden, betekent niet dat je toestemming van de rechthebbende hebt om ze te gebruiken of dat je het onderliggende model “bezit”. Controleer daarom de actuele modelkaart van precies het model dat je downloadt; de familienaam alleen is niet genoeg.
Een toolkit houd je klein door geregeld op te ruimen. Een download die je niet blijkt te gebruiken, verwijder je met ollama rm. Weet je dat je Aya Expanse niet nodig hebt, dan gebruik je bijvoorbeeld ollama rm aya-expanse:8b. ollama ls laat zien welke modellen op je schijf staan; ollama ps welke op dat moment geladen zijn. Catalogi veranderen, dus bekijk je selectie later opnieuw in plaats van blind te vertrouwen op een keuze van maanden geleden.
Ook kleine modellen kunnen een passage verzinnen, een nuance in een andere taal missen of code schrijven die op het eerste gezicht klopt, maar de test niet haalt. Zie elke aanbeveling hier als iets om zelf te testen, nooit als vervanging van deskundige controle wanneer het erop aankomt.
Kan ik alle drie de modellen tegelijk draaien? Op een laptop met 16 GB gaat dat waarschijnlijk niet soepel. Laad het model dat je voor je taak nodig hebt en wissel daarna van model. Houd de algemene assistent, de specialist en het embeddingmodel niet tegelijk in het geheugen.
Heb ik een GPU nodig voor het embeddingmodel? Nee. embeddinggemma:300m is klein genoeg om met alleen een CPU te testen. Meet wel hoe lang het duurt; ga er niet van uit dat het meteen klaar is.
Geeft een groter model altijd een beter antwoord? Nee. Of een 4B- of een 9B-model het beter doet, hangt af van de taak. Daarom gebruiken we de vijf tests uit paragraaf 7 in plaats van af te gaan op één score uit een ranglijst.
Is een Q4-download goed genoeg? Dat hangt af van de taak. Als je genoeg geheugen hebt om beide te draaien, vergelijk dan de Q4- en Q8-variant van hetzelfde model met je eigen drie tests, zoals in paragraaf 3.
Kan ik Aya Expanse voor een commercieel project gebruiken? Niet zonder meer. De CC-BY-NC-4.0-licentie dekt niet-commercieel gebruik; daarnaast gelden aanvullende voorwaarden. Controleer de actuele modelkaart voordat je aanneemt dat commercieel gebruik is toegestaan.
Heeft het embeddingmodel na het downloaden nog internet nodig? Nee. Zodra de modelgewichten op je schijf staan, draait het offline, net als de andere modellen in deze toolkit.
Installeer de 4B-assistent en één specialist voor een taak die je wilt uitvoeren. Doe dat op de laptop waarvan je in deel één de capaciteit hebt beoordeeld en die je in deel twee hebt ingesteld. Maak van de test uit paragraaf 7 je eigen versie met drie vragen. Houd het model waar je iets aan hebt. Verwijder het andere met ollama rm. Overweeg pas extra geheugen te kopen als een echte taak laat zien dat het geheugen je beperkt, niet omdat een specificatielijst dat suggereert.
Daarmee sluiten we deze driedelige reeks af. Blijkt je eigen laptop eerst meer ruimte nodig te hebben, dan is de categorie laptops een goed startpunt.
Meld je aan voor onze nieuwsbrief en ontvang €15 korting!
Mis nooit meer een aanbieding.
Informatie over het gebruik van persoonsgegevens vind je in ons privacybeleid.
Bevestig aanmelding
Klik op de link in onze bevestigingsmail om je voucher te ontvangen. Deze is geldig bij aankopen vanaf € 200.