We hadden een proces dat rapporten automatisch uitleest met AI, gebouwd in Power Automate met een custom prompt in AI Builder. Maandenlang deed het precies wat we wilden: we controleerden de uitkomsten en die zaten op 100%. Tot we er bij toeval achter kwamen dat het er nog maar 30 tot 40% goed uithaalde. We hadden niets aan het proces veranderd, en de prompt was nog exact dezelfde. En toch was de kwaliteit gekelderd, en bleef daar hangen.

Grafiek van de score over de tijd: maandenlang rond 100 procent en dan een scherpe daling naar 30 tot 40 procent
Maandenlang rond 100%, daarna een stille terugval naar 30 tot 40 procent. Aan het proces en de prompt veranderde niets.

Een AI-model is geen vaste afspraak

De makkelijke aanname is dat je een custom prompt één keer goed zet en dat het model daarna blijft doen wat het deed. Zo werkt het niet. In AI Builder kies je een model, maar je kiest geen vaste versie. De prompts draaien op modellen die Microsoft host op Azure OpenAI Service, en die worden door Microsoft beheerd en periodiek bijgewerkt. De naam in het dropdownmenu blijft gelijk, de versie eronder hoeft dat niet te zijn. Microsoft schrijft het zelf op: de versies van de modellen achter een prompt kunnen veranderen, en een nieuwe modelversie kan het gedrag en het antwoord op dezelfde prompt veranderen. Je kiest het model en je schrijft de prompt, maar het grootste deel van wat de uitkomst bepaalt ligt bij de leverancier. Wordt daar iets bijgewerkt, dan kan jouw resultaat meebewegen zonder dat je zelf iets hebt aangeraakt.

Bij ons stond GPT-5 chat ingesteld en aan onze kant was er niets veranderd, en toch zakte de kwaliteit structureel in. Een model "slijt" niet van lang draaien; zo werken deze systemen niet. Juist de chat-modellen worden regelmatig ververst, en van buitenaf kunnen we niet hard aanwijzen welke verversing onze run trof. Maar het patroon klopt: het enige wat bewoog, was het model dat we niet zelf in de hand hadden.

Waarom je het pas bij toeval merkt

Het venijnige is dat er niets stukgaat. Het proces blijft draaien, er komt netjes een antwoord uit, geen foutmelding, geen rood lampje. Het model weet zelf niet dat het ernaast zit. Op 30% levert het met hetzelfde gemak een antwoord als op 100%, alleen klopt het vaker niet. Daardoor stuit je erop in plaats van dat je gewaarschuwd wordt. Bij ons was het letterlijk toeval: iemand keek een geval beter na en het rijmde niet.

Voor een proces dat bij een klant terechtkomt, zit het echte risico in die stilte. Het werkt maandenlang minder goed terwijl alles eruitziet alsof het klopt, en juist daardoor blijft het onder de radar. Een losse misser valt nog op. Een proces dat langzaam wegzakt, schuift ongemerkt door.

Onze keuze: een mens in de loop, en blijven meten

Hier hebben we vooraf een keuze in gemaakt, niet als pleister achteraf. Bij dit soort processen zit bij ons altijd een mens in de loop, met een vaste controle op afwijkingen. Dat is ook wat Microsoft zelf adviseert bij AI Builder-prompts: bouw menselijk toezicht in, juist omdat de uitkomst kan variëren. Het punt is dat de AI niet uit zichzelf stopt. Op 30% laat hij het proces gewoon doorlopen, en het is de mens die ingrijpt.

Dat toezicht is je vangnet op het moment zelf. Het vangt de losse misser op, alleen ziet het een structurele verschuiving van het model niet aankomen. Daar hebben we de meting voor. Het idee is simpel: we halen periodiek een vaste set bekende rapporten door het proces en vergelijken de uitkomst met wat we zeker weten dat klopt. Zakt de score, dan zien we dat bij de eerstvolgende controle in plaats van pas als het al ergens is misgegaan. Houd die set klein maar representatief, dan kost de controle weinig en zegt hij toch genoeg. In Copilot Studio zit zo'n controle inmiddels ingebouwd, met testsets die je kunt herhalen en naast elkaar leggen. Voor een custom prompt in een los Power Automate-proces richt je het zelf in als een terugkerende controle.

Een terugkerende controle die de uitkomst van het proces vergelijkt met bekende juiste resultaten
Een vaste set bekende rapporten periodiek door het proces halen maakt een terugval zichtbaar binnen dagen.

Wat voor ons werkt:

  • Kies bewust welk model je achter je prompt zet en blijf niet automatisch op de standaard hangen.
  • Leg vast met welk model en welke instellingen je werkt, zodat je een verschil later kunt terugzoeken.
  • Draai de controle periodiek, ook als je zelf niets wijzigt. De wijziging komt juist van de andere kant.
  • Houd een mens in de loop voor het moment zelf.

Een AI-stap vertelt je nooit dat hij gestopt is met werken. Op 30% antwoordt hij even soepel als op 100%. De oorzaak ligt bijna altijd buiten je eigen proces, bij een model dat je niet in de hand hebt. Je kunt dat niet voorkomen, je kunt het wel zien aankomen. Of een mens merkt het, of je meting slaat aan. Anders kom je erachter zoals wij: bij toeval, en niet op tijd. Dat vangnet is het eerste wat we inrichten voordat we AI op een proces loslaten.

Dit betreft een echte praktijkervaring, maar de opdracht waar het om ging is geanonimiseerd.

Verder lezen