Open modellen

Vijf modelfamilies die je kunt downloaden en op je eigen hardware draaien. De licentie telt hier net zo zwaar als de benchmark: open gewichten is niet hetzelfde als open source, en twee van deze vijf hebben een andere licentie afhankelijk van welk formaat je kiest.

Welke past bij jouw situatie

Op een laptop

Gemma 4, met afstand. De 12B op ruwweg 7–8 GB is de allrounder; de E2B en E4B passen bij lichte hardware; en op een machine met 32 GB gedeeld geheugen geeft de 26B-A4B je 25B aan kennis op ongeveer 4B-snelheid. Heb je specifiek Europese talen nodig, dan is Ministral 3 8B het alternatief op circa 5 GB.

Op één videokaart van 24 GB

Qwen3.8-27B op Q4, circa 17 GB aan gewichten, onder ongewijzigde Apache 2.0 en met meer community-quantisaties dan wat dan ook hier. Reken wel op je context: 64k brengt het naar circa 22 GB en 128k naar circa 26 GB, wat niet meer op de kaart past. Gemma 4 31B volgt kort daarachter op ruwweg 18–19 GB.

Op een kleine server

GLM-5.3-Flash of DeepSeek-V4-Flash. Beide MIT, beide sparse, en beide met zeer weinig actieve parameters, dus de doorvoer is veel beter dan hun totale omvang doet vermoeden. Kies GLM voor agentisch werk en programmeren; kies DeepSeek voor lange context, waar de veel kleinere key-value cache doorslaggevend is — mits je het ontbrekende chatsjabloon kunt opvangen.

Beste kwaliteit, hardware geen bezwaar

DeepSeek-V4-Pro, met GLM-5.3 kort erachter. V4-Pro is het sterkste model hier met een schone MIT-licentie, en die combinatie is zeldzaam. Ga ervan uit dat al deze modellen bij zwaar agentisch werk achterblijven op de beste gesloten modellen — het verschil is het kleinst bij programmeren en het grootst bij langlopende zelfstandigheid.

Voor Nederlands en ander niet-Engels werk

Mistral, met Gemma 4 als sterk alternatief. Mistral is de enige familie waarvan de model cards Nederlands expliciet noemen, en het is een EU-uitgever. Gemma heeft de bredere basis met meer dan 140 voorgetrainde talen, en wint als het ook nog op een laptop moet draaien. Geen van beide publiceert Nederlandse benchmarkscores, dus test op je eigen teksten in plaats van een van beide claims te geloven.

Over de cijfers hier

Geheugencijfers zijn schattingen op basis van parameteraantallen en quantisatie, behalve waar een gemeten cijfer uit de gemeenschap beschikbaar was. Beschouw ze als richtlijn voor wat past, niet als specificatie — en controleer de model card voordat je hardware koopt.

Qwen 3.8

Gemengd — lees de licentieGeverifieerd 2026-09-01

Het best ondersteunde model op één consumentenvideokaart, en het model waarvan je de licentie twee keer moet lezen.

Uitgever: Alibaba

VariantParametersContext
Qwen3.8-27B28B dense262K
Qwen3.8-Flash-Next125B total / 6B active (MoE)262K
Qwen3.8-2.4T-A95B2.4T total / 95B active (MoE)262K

Licentie — Split: Apache 2.0 (27B) · Qwen Community License 1.0 (Flash-Next) · qwen3.8-max (2.4T)

Deze familie heeft drie verschillende licenties, en dat is de makkelijkste fout die je ermee kunt maken. De 27B is ongewijzigde Apache 2.0 — echt open source, zonder voorwaarden. De twee grotere zijn open gewichten mét voorwaarden: commercieel gebruik mag, maar een model-as-a-service- of AI-werkassistentbedrijf erop draaien vereist boven gepubliceerde omzetdrempels een aparte licentie van Alibaba, en naamsvermelding wordt op schaal verplicht.

Hardware

27B op Q4_K_M: ongeveer 17 GB aan gewichten (door de community gemeten), circa 19 GB in gebruik.

Reken op context, niet alleen op gewichten. Gemeten gebruik loopt op tot circa 22 GB bij 64k context en 26 GB bij 128k, dus een kaart van 24 GB kan het volledige contextvenster niet vasthouden. De gewichten alleen zijn al meer dan 16 GB, dus 16GB-kaarten vallen af bij Q4.

Promptformaat — ChatML

Beurten gemarkeerd met <|im_start|> en <|im_end|>, en opvallend genoeg zonder BOS-token. Denken staat standaard aan en verschijnt in <think>-blokken, gestuurd door een reasoning_effort-parameter.

Let op: Het houdt zijn denkblokken in de gespreksgeschiedenis, dus naïef geschiedenis afkappen breekt het. Ook de sampling-instellingen verschillen tussen denk- en instructmodus.

Goed in

Ondersteuning is het echte voordeel: de 27B is het meest gedownloade serieuze open model op Hugging Face met honderden community-quantisaties, dus welke runtime je ook kiest, iemand heeft het al werkend gekregen. Echt multimodaal over tekst, beeld en video.

Zwakker in

Alibaba heeft de onderkant losgelaten — er is geen Qwen van de huidige generatie onder 27B, dus voor een algemeen 4B- of 8B-model val je terug op de vorige generatie. Bovendien zijn juist de sterkste modellen in de familie de licentiebeperkte.

Bronnen en onderbouwing

  1. 1Qwen3.8-27B model cardAlibaba (Hugging Face)
  2. 2Qwen3.8-Flash-Next model cardAlibaba (Hugging Face)

DeepSeek V4

MITGeverifieerd 2026-09-01

De meest permissieve licentie op dit niveau, en de lastigste om te integreren.

Uitgever: DeepSeek

VariantParametersContext
DeepSeek-V4-Flash284B total / 13B active (MoE)1M
DeepSeek-V4-Pro1.6T total / 49B active (MoE)1M

Licentie — MIT

De model card stelt onomwonden dat de repository en de gewichten onder MIT vallen. Echt open source: onbeperkt commercieel gebruik, geen gebruikersdrempels, geen omzetgrenzen, geen uitzondering voor het als dienst aanbieden. Op dit niveau is dat ongebruikelijk.

Hardware

Flash op Q4: ruwweg 150–160 GB (schatting) — twee kaarten van 80 GB of vier van 48 GB. Pro is multi-node.

Niets in deze familie draait op consumentenhardware; de kleinste is 284B. Het voordeel is het lage aantal actieve parameters, waardoor de doorvoer eenmaal geladen veel beter is dan de totale omvang doet vermoeden.

Promptformaat — Python-encoder, geen Jinja-sjabloon

DeepSeek levert bewust geen chatsjabloon. In plaats daarvan bevat de repository Python-scripts die je aanroept om berichten in de invoertekst om te zetten en de uitvoer weer te ontleden.

Let op: Dit telt zwaar in de praktijk: elk hulpmiddel dat de standaard apply_chat_template-aanroep veronderstelt, faalt ofwel meteen ofwel bouwt stilletjes een verkeerde prompt. Reken op integratietijd.

Goed in

Efficiëntie bij lange context is het echte onderscheid — het aandachtsontwerp brengt de key-value cache terug tot ongeveer een tiende van de vorige generatie, wat verandert wat een contextvenster van een miljoen tokens werkelijk kost. Zeer sterk in agentisch werk en programmeren.

Zwakker in

Je hebt een server nodig voordat je kunt beginnen. DeepSeek publiceert bovendien minder over meertaligheid dan Mistral of Google, dus de prestaties buiten het Engels zijn relatief slecht onderbouwd.

Bronnen en onderbouwing

  1. 1DeepSeek-V4-Flash model cardDeepSeek (Hugging Face)
  2. 2DeepSeek V4 release noteDeepSeek

GLM-5.x

Gemengd — lees de licentieGeverifieerd 2026-09-01

Het sterkste zelf te hosten agentische model — mits je de juiste puntrelease kiest, want de licentie verschilt per versie.

Uitgever: Z.ai (Zhipu)

VariantParametersContext
GLM-5.3-Flash320B total / 18B active (MoE)~1M
GLM-5.2753B (MoE)1M
GLM-5.3753B (MoE)~1M

Licentie — MIT (GLM-5.2 and GLM-5.3-Flash) · custom GLM-5.3 License (GLM-5.3 753B)

GLM-5.2 en GLM-5.3-Flash zijn MIT — schoon, OSI open source. De 753B GLM-5.3 niet: die heeft een eigen Z.AI-licentie met naamsvermeldingsplicht en een veiligheidsbeoordeling door Z.AI vóór commercieel gebruik door organisaties die een model-as-a-service-bedrijf draaien boven een zeer hoge gepubliceerde omzetdrempel. Voor een gewoon bedrijf is dat in de praktijk ruim, maar het is geen MIT en moet ook niet zo genoemd worden.

Hardware

GLM-5.3-Flash op Q4: ruwweg 170–180 GB (schatting). De 753B-modellen zijn circa 380–400 GB op Q4.

Flash is de versie om echt te draaien: die heeft zowel de ruimere licentie als het beter hostbare formaat. Beweringen dat de 753B-modellen op vier kaarten draaien, kloppen niet met hun omvang — ga uit van acht.

Promptformaat — ChatGLM

Eigen scheidingstekens — <|system|>, <|user|>, <|assistant|> en <|observation|> voor toolresultaten — voorafgegaan door een [gMASK]<sop>-prefix. Tool-aanroepen gebruiken geneste tags in plaats van JSON.

Let op: Twee standaardinstellingen werken stilletjes tegen je in een chattoepassing: de redeneerinspanning staat standaard op maximaal, en de instelling die eerder denkwerk wist staat standaard uit, terwijl de documentatie zegt dat je die bij chatgebruik juist aan moet zetten.

Goed in

Langlopend agentisch werk en software-engineering, tegen een fractie van de kosten van de vorige generatie dankzij een zeer laag aantal actieve parameters. MIT-gelicentieerde varianten op dit niveau zijn echt ongebruikelijk.

Zwakker in

De documentatie is de zwakste van de vijf: het contextvenster en het aantal actieve parameters staan niet duidelijk op de 5.3-kaart. En een licentie die per puntrelease verandert is een echt governance-risico als je op "GLM" als familie standaardiseert.

Bronnen en onderbouwing

  1. 1GLM-5.2 model cardZ.ai (Hugging Face)
  2. 2GLM-5.3 model cardZ.ai (Hugging Face)

Gemma 4

Apache 2.0Geverifieerd 2026-09-01

De enige familie hier die geloofwaardig op een laptop draait, en inmiddels echt Apache 2.0.

Uitgever: Google

VariantParametersContext
Gemma 4 E2B / E4B5B / 8B dense256K
Gemma 4 12B12B dense, multimodal256K
Gemma 4 26B-A4B25B total / 3.8B active (MoE)256K
Gemma 4 31B31B dense256K

Licentie — Apache 2.0

Gemma 4 is de eerste Gemma onder Apache 2.0, ter vervanging van de oude eigen voorwaarden die herdistributie beperkten. Commercieel gebruik is onbeperkt en er zijn geen gebruikersdrempels. Eén eerlijke kanttekening: Google publiceert daarnaast een Prohibited Use Policy in verplichtende bewoordingen, en geen van beide documenten legt uit hoe dat beleid zich verhoudt tot een permissieve licentie. Beschouw dat als onopgelost in plaats van één lezing aan te nemen.

Hardware

E2B/E4B ruwweg 3–5 GB op Q4; 12B circa 7–8 GB; 26B-A4B circa 15 GB; 31B circa 18–19 GB. Allemaal schattingen.

De 26B-A4B is de slimme keuze op een laptop met 32 GB gedeeld geheugen: 25B aan kennis op ongeveer 4B-snelheid, omdat per token maar 3,8B parameters actief zijn.

Promptformaat — Gemma 4-beurtmarkeringen — gewijzigd ten opzichte van Gemma 3

Gemma 4 liet de start_of_turn- en end_of_turn-markeringen van de vorige generatie vallen voor een nieuw paar, en kreeg native ondersteuning voor systeemprompts die Gemma 2 miste. Denken staat standaard uit en moet in de systeemprompt worden aangezet.

Let op: Promptcode geschreven voor Gemma 2 of 3 levert op Gemma 4 stilletjes slechte uitvoer op. Gebruik de eigen chatsjabloonfunctie van de bibliotheek in plaats van de tokens met de hand te schrijven.

Goed in

Onverslaanbaar aan de onderkant — niets anders hier draait geloofwaardig op een laptop of telefoon. Voorgetraind op meer dan 140 talen met directe ondersteuning voor 35 of meer, volledig multimodaal, en permissief gelicentieerd in alle formaten.

Zwakker in

Het plafond ligt laag. Met 31B kan de grootste Gemma 4 eenvoudigweg niet op tegen de sparse modellen van 300B en meer bij zwaar langlopend werk. Het is de beste kleine familie, geen frontier-kandidaat.

Bronnen en onderbouwing

  1. 1Gemma 4: expanding the Gemmaverse with Apache 2.0Google Open Source Blog
  2. 2Gemma 4 31B model cardGoogle (Hugging Face)

Mistral 3 / Small 4

Apache 2.0Geverifieerd 2026-09-01

De enige familie die Nederlands op de eigen model cards noemt, van een EU-uitgever, Apache 2.0 tot en met de grootste.

Uitgever: Mistral AI

VariantParametersContext
Ministral 3 8B8B dense256K
Mistral Small 4119B total / ~6B active (MoE)256K
Mistral Large 3675B total / 41B active (MoE)256K

Licentie — Apache 2.0

Apache 2.0 over de hele reeks, inclusief de 675B Large 3. Dat is een echte verandering: Mistral hield zijn grootste modellen vroeger onder een beperkende onderzoekslicentie. Onbeperkt commercieel gebruik, geen drempels, geen uitzondering voor dienstverlening.

Hardware

Ministral 3 8B ruwweg 5 GB op Q4 — laptopklasse. Small 4 circa 65–70 GB. Large 3 circa 350 GB. Schattingen.

Small 4 zit in een lastig middengebied: te groot voor een kaart van 24 GB, niet groot genoeg om de sparse modellen van 300B en meer te verslaan op een server die je toch al hebt. Ministral 3 8B is wat de meesten echt zullen draaien.

Promptformaat — Mistral-bracketformaat — geen ChatML

Gebruikersbeurten staan tussen [INST] en [/INST], systeemprompts in [SYSTEM_PROMPT], redeneren in [THINK], met verdere brackettags voor tools. Het lijkt in niets op de ChatML die de meeste andere families gebruiken.

Let op: Historisch het vaakst verkeerd geïmplementeerde formaat van alle grote families: zowel de spaties rond de brackets als de plaats van het begin-of-sequence-token doen ertoe. Mistrals openbare promptgids gaat over formulering, niet over deze tokens — het chatsjabloonbestand is de bron.

Goed in

Europese talen. Mistral is de enige familie hier waarvan de model cards Nederlands expliciet noemen, en een EU-uitgever telt mee voor gegevenslocatie en de positie onder de AI-verordening. Small 4 voegt bovendien wat vroeger drie aparte modellen waren — redeneren, multimodaal en programmeren — samen in één installatie.

Zwakker in

Het leidt de benchmarks niet. In ranglijsten voor open modellen op programmeren en agentisch werk bestaat de kopgroep uit DeepSeek, GLM en Qwen; Mistral zit daarachter. Kies het om taal, licentie en rechtsgebied, niet om rauwe capaciteit.

Bronnen en onderbouwing

  1. 1Mistral Small 4 announcementMistral AI
  2. 2Mistral Small 4 model cardMistral AI (Hugging Face)