Peer-reviewedGeverifieerd 2026-09-01

TELeR

Turn · Expressie · Detailniveau · Rol — Geen sjabloon maar een meetlat: een peer-reviewed antwoord op "hoe gedetailleerd moet een prompt zijn", met zeven treden in plaats van een bijvoeglijk naamwoord.

Gebruik het voor

Benchmarken en kwaliteitsbewaking. Als je modellen of promptversies vergelijkt en moet aantonen dat de vergelijking eerlijk was, of als je promptkwaliteit binnen een team wilt standaardiseren.

Vermijd het bij

Je eerste prompt schrijven. TELeR zegt hoevéél je moet specificeren, niet wát je moet zeggen, dus alleen levert het niets op. De auteurs beperken het bovendien expliciet tot complexe taken.

De velden

Elke letter is een vraag die de prompt moet beantwoorden.

Turn Optioneel processtap

Eén bericht, of een dialoog?

Kies één beurt als de run herhaalbaar en vergelijkbaar moet zijn, meerdere beurten als de taak echt heen-en-weer vraagt. Noteer daarna welke, want het verandert wat een resultaat betekent.

Voorbeeld: Eén beurt: de hele briefing gaat in één bericht zodat alle drie de kandidaat-modellen identieke invoer krijgen.

Expressie Optioneel processtap

Vragen of instructies?

Kies één stijl en houd die constant in elke prompt van de vergelijking. De twee mengen vertroebelt het resultaat.

Voorbeeld: Overal instructiestijl: "Noem elke functie die gedeelde state wijzigt", nooit "Welke functies wijzigen gedeelde state?"

Detailniveau Optioneel processtap

Hoe gespecificeerd is de opdracht, op een schaal van nul tot zes?

Klim de ladder op: één is een doel van één regel; twee voegt toe wat de uitvoer moet behandelen; drie splitst het in benoemde deeltaken; vier voegt criteria voor een goed antwoord toe; vijf voegt opgehaald bronmateriaal toe; zes vraagt om verantwoording.

Voorbeeld: Niveau vier: doel benoemd, de review gesplitst in vijf benoemde deeltaken, plus "een goede review benoemt de ernst en noemt bij elke bevinding een regelnummer, onder 600 woorden".

Rol Optioneel processtap

Is er een systeemrol ingesteld, ja of nee?

Binair. Noteer het, want geen rol is een geldige controleconditie en geen vergissing.

Voorbeeld: Rol gedefinieerd: systeembericht ingesteld op "Je bent een senior reviewer die de stijlgids van het team handhaaft."

Sterke punten

  • Het enige citeerbare, peer-reviewed antwoord op hoeveel detail een prompt nodig heeft, waardoor promptkwaliteit toetsbaar wordt in plaats van een kwestie van smaak.
  • De detailladder is cumulatief en ondubbelzinnig, dus twee mensen die dezelfde prompt beoordelen komen meestal op hetzelfde cijfer uit.
  • Het legt twee variabelen bloot die de populaire sjablonen volledig negeren: of de prompt één bericht of een dialoog is, en of er überhaupt een systeemrol is ingesteld.

Zwakke punten

  • Het levert geen prompttekst op. Alleen gebruikt is het inert — je hebt er nog steeds een sjabloon onder nodig.
  • De auteurs beperken het tot complexe taken en zeggen dat de niveaus niet gelden voor eenvoudige, en dat is het meeste dagelijkse werk.
  • Het dateert van vóór de redeneermodellen. De hoogste trede is het model om verantwoording vragen, wat een denkmodel nu standaard doet, dus de bovenkant van de schaal is deels weggevallen.

Bronnen en onderbouwing

  1. 1TELeR: A General Taxonomy of LLM Prompts for Benchmarking Complex TasksSantu & Feng, Findings of the ACL: EMNLP 2023De peer-reviewed publicatie van record.
  2. 2TELeR (preprint)arXivVolledige tekst, inclusief de definities van niveau nul tot zes.