ReAct
Gedachte · Actie · Waarneming — Geen bericht maar een lus. Het model redeneert, roept een tool aan, leest wat terugkomt en plant opnieuw — de voorouder van elk agentraamwerk dat vandaag wordt gebruikt.
Er circuleren twee versies
De lus herhaalt zich tot de redeneerstap een definitief antwoord kan geven. Begrens altijd het aantal iteraties: een model dat de taak niet kan oplossen herhaalt zichzelf anders tot het budget op is.
Gebruik het voor
Alles waarbij je halverwege moet opzoeken of handelen: facturen afstemmen op een grootboek, beweringen toetsen aan een dossier, controleren of een concept botst met iets dat al gepubliceerd is.
Vermijd het bij
Een gewoon chatvenster zonder tools. Zonder echt actiekanaal doet het model alsof het tools aanroept en verzint het de resultaten, en dat is slechter dan een gewone prompt.
De velden
Elke letter is een vraag die de prompt moet beantwoorden.Gedachte Optioneel processtap
Wat weet ik, en wat heb ik nu nodig?
Eén korte redeneerzin die het concrete gat benoemt — geen herhaling van de taak.
Voorbeeld: Deze factuur is 4.180 euro maar het maximum van de inkooporder is onbekend, dus ik moet PO-2291 ophalen voordat ik kan goedkeuren of markeren.
Actie Optioneel processtap
Welke toolaanroep haalt dat ontbrekende stuk op?
Eén concrete aanroep met parameters. Eén feit per actie, nooit een samengesteld verzoek.
Voorbeeld: lookup_purchase_order("PO-2291")
Waarneming Optioneel processtap
Wat kwam er werkelijk terug?
De echte uitvoer van de tool, letterlijk, inclusief fouten. Geen parafrase, en geen gok als de tool faalt — een verzonnen waarneming ondermijnt het hele idee.
Voorbeeld: PO-2291 — goedgekeurd bedrag 3.500 euro, leverancier Kestrel Ltd, status OPEN.
Sterke punten
- Het enige raamwerk hier dat verzonnen antwoorden structureel vermindert, omdat de waarnemingsstap externe feiten tussen de redeneerstappen brengt in plaats van achteraf.
- Het spoor is controleerbaar: je leest precies welk feit tot welke conclusie leidde, wat telt bij alles met een compliancekant.
- Het is de daadwerkelijke woordenschat van de tools die je team tegenkomt, dus het leren ervan werkt direct door naar agentraamwerken en tool-use-API’s.
Zwakke punten
- Het vereist echte toolkoppelingen. Voor wie in een consumentenchat werkt is het een streven en geen bruikbaar middel.
- Kosten en wachttijd vermenigvuldigen zich, want elke cyclus is een volledige modelaanroep, en een vastgelopen lus verbrandt tokens zonder resultaat.
- De faalmodi zijn lelijk: het model kan blijven hangen in dezelfde gedachte en actie, en één verkeerde vroege waarneming vergiftigt al het vervolg.
Bronnen en onderbouwing
- 1ReAct: Synergizing Reasoning and Acting in Language ModelsYao et al., ICLR 2023 (arXiv)Het oorspronkelijke artikel, van Princeton University en Google Research.
- 2ReAct project pageYao et al.Door de auteurs onderhouden pagina die laat zien hoe gedachte, actie en waarneming elkaar afwisselen.