Meta
Open gewichten, en historisch de familie die zelf hosten gangbaar maakte. De moeite van het begrijpen waard — maar Llama 4 is sinds mei 2025 niet bijgewerkt, dus zie het als een bekende grootheid en niet als actuele aanbeveling.
Hoe je het prompt
Wees gedetailleerd en expliciet. Meta’s eigen richtlijn is dat expliciete instructies beter werken dan open instructies.
Combineer vier dingen: een roldefinitie, de regels, de beperkingen en uitgewerkte voorbeelden.
Verbied extra uitvoer expliciet — "geef alleen het JSON-object terug, geen inleiding en geen uitleg".
Houd blijvende regels in het systeembericht en het verzoek in het gebruikersbericht.
Volg exact het promptsjabloon van jouw modelversie, inclusief witruimte, bij het aanroepen van het kale model.
Vraag om bronnen of lever context aan om hallucinatie te beperken; Meta noemt dit als aparte techniek.
Sterke punten
- Open gewichten: zelf te hosten, dus prompts en data hoeven je eigen infrastructuur nooit te verlaten.
- Zeer grote context bij Scout, handig voor werk aan hele repositories of archieven.
- Mixture-of-experts-ontwerp houdt de inferentiekosten dicht bij een veel kleiner dense model.
- Native multimodale invoer, gezamenlijk getraind op tekst en beeld.
Zwakke punten
- Het promptformaat is modelspecifiek en onvergeeflijk — Meta merkt op dat voorgeschreven regeleindes echt aanwezig moeten zijn.
- Voegt inleidingen en commentaar toe tenzij je dat expliciet verbiedt.
- Gedrag verschilt per host en quantisatie, dus een prompt die op de ene installatie is afgesteld werkt elders anders.
- Heeft baat bij technieken die de gesloten frontier-modellen grotendeels hebben opgenomen, zoals expliciete chain-of-thought en self-consistency.
Modellen
Meta heeft sinds mei 2025 niets nieuwers dan Llama 4 Scout en Maverick gepubliceerd. De promptrichtlijnen hieronder gelden nog steeds voor die modellen, maar kies je vandaag een open model om te draaien, dan behandelt de pagina met open modellen families die wel actief worden onderhouden.
Llama 4 Scout
17B actieve parameters over 16 experts (109B totaal), met een contextvenster van 10M tokens.
- Context
- 10M
- Max uitvoer
- —
Goed voor: Zeer lange invoer — complete codebases, archieven, transcripties — op hardware die je zelf beheert.
Let op: Een enorm contextvenster is niet hetzelfde als aandacht voor alles erin; zet de instructie alsnog achteraan.
Llama 4 Maverick
17B actieve parameters over 128 experts (400B totaal).
- Context
- —
- Max uitvoer
- —
Goed voor: Algemeen assistent- en redeneerwerk waarbij je het sterkere open model wilt.
Let op: Het totale parameteraantal bepaalt het geheugengebruik, ook al is maar een deel actief.
Bronnen en onderbouwing
- 1Prompt engineering (how-to guide)Meta (Llama developer docs)Meta’s prompttechnieken, waaronder expliciete instructie, rollen en beperkingen, en het begrenzen van overtollige uitvoer.
- 2Llama 4 — model cards and prompt formatsMetaHet exacte promptsjabloon en de speciale tokens per modelversie.
- 3Developer docs and resourcesMetaStartpunt voor de Llama-documentatie.