De vraag komt in bijna elk gesprek een keer langs, meestal in de vorm van "moeten wij iets met AI?" Het eerlijke antwoord is dat de vraag te breed is om te beantwoorden. Ik las de afgelopen maanden AI Snake Oil van Arvind Narayanan en Sayash Kapoor (Princeton University Press, 2024). Snake oil is de Amerikaanse uitdrukking voor een middeltje dat als medicijn wordt verkocht en niets doet; gebakken lucht dus, met een prijskaartje. Het boek geeft precies de woordenschat die in die gesprekken ontbreekt. Het kernpunt: "AI" is een parapluterm, net als "voertuig". Een fiets, een vrachtwagen en een raket zijn alle drie voertuigen, maar je zegt niets zinnigs over alle drie tegelijk. Voor AI geldt hetzelfde. Een chatbot en het algoritme waarmee een bank een lening beoordeelt heten allebei AI, maar ze werken anders, worden anders gebruikt en falen anders.

Hieronder de indeling die wij sindsdien gebruiken, met de afwegingen die we in de praktijk maken. Geschreven voor wie AI wil gebruiken op de plekken waar dat kan, en wil weten waar het ophoudt.

Eerst de vraag: over welke AI hebben we het?

Het boek onderscheidt drie soorten. Voorspellende AI (predictive AI) gebruikt historische data om een uitkomst te voorspellen: wie wordt een goede werknemer, welke klant vertrekt, welke patiënt verslechtert. Generatieve AI (generative AI) maakt nieuwe tekst, beeld of code op basis van een opdracht. En AI voor contentmoderatie, waarmee platforms berichten filteren. Die laatste laten we hier verder liggen; de eerste twee komen we dagelijks tegen.

Dat onderscheid bepaalt of een toepassing kans van slagen heeft, nog voordat je er een euro in stopt.

Voorspellende AI: hier zit de meeste gebakken lucht

De stelling van de auteurs is scherp: voorspellende AI over menselijk gedrag werkt niet zoals het wordt verkocht, en gaat dat waarschijnlijk ook nooit doen. Dat ligt niet aan de wiskunde. Mensen laten zich niet voorspellen uit een dataset van vorig jaar. Een model leert patronen uit het verleden en werkt zolang de wereld op dat verleden lijkt. Zodra de context verschuift, verschuift de betrouwbaarheid mee, en dat merk je pas achteraf.

Twee voorbeelden uit het boek blijven hangen. Een model dat het risico bij longontsteking voorspelde, concludeerde dat astmapatiënten een lager risico liepen. In de data klopte dat: astmapatiënten werden direct op de intensive care gelegd en overleefden daardoor vaker. Het model leerde het effect van de zorg, niet het risico van de ziekte. En bij een Amerikaanse zorgverzekeraar moesten medewerkers AI-beslissingen over vergoedingen volgen; van de weigeringen die klanten aanvochten, werd het overgrote deel achteraf teruggedraaid.

Wij krijgen deze vraag ook. "Kunnen we voorspellen welke aanvragen fout gaan?" of "welke klanten gaan opzeggen?" De grens die we trekken ligt bij menselijk gedrag als te voorspellen uitkomst. Hoeveel voorraad je in november nodig hebt, wanneer een machine onderhoud nodig heeft, hoe de omzet met het seizoen meebeweegt: dat zijn voorspellingen over systemen met genoeg regelmaat, en die bouwen we in Power BI en AI Builder. Wie gaat opzeggen, wie gaat frauderen: dat zijn voorspellingen over mensen. Die zetten we alleen in als signaal, met een mens die de beslissing neemt en het model als één van de inputs ziet.

Generatieve AI: werkt, maar niet zoals de demo

Over generatieve AI zijn de auteurs positiever, met kanttekeningen. Een taalmodel produceert de statistisch meest waarschijnlijke tekst bij een opdracht. Dat levert verrassend bruikbare resultaten op, maar het model heeft geen begrip van waar of onwaar. Het geeft een antwoord dat klinkt alsof het klopt, en meestal klopt het ook. Meestal.

Waar het in onze praktijk waarde oplevert: samenvatten, herschrijven, classificeren, informatie ophalen uit eigen documenten, een eerste opzet maken van iets dat een mens daarna afmaakt. Het gemeenschappelijke kenmerk: een fout is goedkoop, en er kijkt iemand naar voordat het effect heeft.

Waar het tegenvalt: feiten zonder bron, rekenwerk, redeneren over dingen die niet in de aangeleverde context staan en consistentie over tijd. Dat laatste onderschatten organisaties het meest. We schreven eerder over een AI Builder-prompt die zonder één wijziging aan onze kant terugzakte van vrijwel honderd procent nauwkeurigheid naar dertig à veertig. Het onderliggende model was bijgewerkt, en onze prompt reageerde daar anders op. Als je de output niet periodiek meet, kom je daar pas achter als iemand klaagt.

Waarom de wereldovername met de huidige architectuur gebakken lucht is

Dan het punt waar ik een uitgesproken mening over heb. De verhalen over AI die de mensheid overvleugelt of aan menselijke controle ontsnapt, beschouw ik als hype. Met één afbakening vooraf: mijn argument gaat over de architectuur die we vandaag hebben. Het boek besteedt er een hoofdstuk aan en de argumenten zijn overtuigend.

Wat is die architectuur? De taalmodellen achter ChatGPT, Microsoft 365 Copilot en Copilot Studio zijn systemen die, gegeven een stuk tekst, het meest waarschijnlijke vervolg berekenen. De nieuwste generatie doet dat beter dan de vorige, ook bij redeneer- en programmeertaken; die vooruitgang is echt. Maar het blijft hetzelfde soort systeem. Na de training staat het model vast. Het leert niets blijvend van de gesprekken die het voert; een geheugenfunctie of een database ernaast slaat feiten op, het model zelf verandert niet. Het heeft geen eigen belangen. En het doet niets zolang niemand het aanroept. Een model dat niet wordt aangeroepen, bestaat als een bestand op een schijf.

Over doelen ligt het ingewikkelder. Apollo Research en Anthropic lieten in 2024 en 2025 in testopstellingen zien dat modellen binnen een opdracht gedrag kunnen vertonen dat lijkt op zelfbehoud of misleiding, bijvoorbeeld door ongewenst gedrag te verbergen als ze afleiden dat ze getest worden. Dat gedrag is alleen gezien in kunstmatige opstellingen die het doel zelf aanreiken; buiten zulke tests is het niet waargenomen. Een doel dat het model zelf van gesprek naar gesprek meeneemt, is er niet. Wat er wél in zit, zijn de voorkeuren die de training heeft aangebracht, en die zijn in elk gesprek hetzelfde. Dat is aangeleerd gedrag; een eigen wil zit er niet achter. En het is de reden waarom je een agent geen bevoegdheden geeft die hij niet nodig heeft.

Een "agent" verandert namelijk niets aan het bovenstaande. Een agent is een besturingslaag die mensen om zo'n model heen bouwen: een lus die het model steeds opnieuw aanroept, met toegang tot tools en bevoegdheden die mensen toekennen. Als een agent iets doms doet, is dat omdat iemand die lus heeft gebouwd en die bevoegdheid heeft gegeven.

De doemscenario's veronderstellen dat de vooruitgang van "handige chatbot" naar "superintelligentie" een rechte lijn is die je kunt doortrekken door meer data en meer rekenkracht toe te voegen. Wat er voor een echte algemene intelligentie nodig is, zit alleen niet in deze architectuur. Een kind valt één keer van de trap en doet het daarna anders. Niemand heeft dat kind opnieuw getraind; het heeft begrepen wat hoogte is en wat vallen doet, en het heeft dat meegenomen. Een taalmodel kan een miljoen teksten over vallen gelezen hebben en weet nog steeds niet wat hoogte is. Het weet welke woorden meestal in de buurt van "hoogte" staan. Zolang een systeem niet begrijpt waar het over gaat, en niet blijvend leert van wat het zelf meemaakt zonder dat een mens er een trainingsronde voor draait, is het geen AGI, hoeveel rekenkracht je er ook tegenaan gooit. Meer van hetzelfde levert een betere tekstvoorspeller op.

En dit vind ik het belangrijkste: de angst en de hype komen uit dezelfde hoek. Als je product de wereld kan overnemen, is het kennelijk krachtig genoeg voor jouw klantenservice. Dezelfde presentaties waarin Microsoft 365 Copilot je organisatie gaat veranderen, komen van een bedrijf dat miljarden in OpenAI heeft gestoken en dus belang heeft bij het beeld van een technologie die alles kan. Dat is marketing, en het is dezelfde gebakken lucht in een andere verpakking.

Met een fundamenteel andere architectuur, een systeem dat wel begrijpt waar het over gaat en wel blijvend leert van wat het meemaakt, liggen de vragen anders. Ik sluit dat niet uit. Maar die architectuur bestaat vandaag niet, en niemand kan zeggen of en wanneer die komt. Daarom plannen we op wat er is.

Wat dit betekent voor Microsoft 365 Copilot en Copilot Studio

De indeling uit het boek helpt ook om Microsofts Copilot-aanbod nuchter te bekijken, en om te bepalen waar je wel en niet moet beginnen.

Microsoft 365 Copilot is generatieve AI over je eigen mail, documenten en vergaderingen. Het doet wat generatieve AI goed doet: ophalen, samenvatten, een eerste opzet maken. Daar ligt de waarde, en die is concreet: minder tijd kwijt aan zoeken en terugkijken, sneller een bruikbaar concept. Twee grenzen die we steeds benoemen. Copilot ziet alleen wat de gebruiker zelf ook mag zien, dus je rechtenstructuur bepaalt de kwaliteit én de risico's; wie te veel mag zien, krijgt dat nu ook netjes samengevat. En als je SharePoint een rommel is, krijg je een goed geformuleerde samenvatting van rommel. Beide dingen los je op vóór de uitrol, niet erna.

Copilot Studio gaat een stap verder: je bouwt er agents mee die kennisbronnen raadplegen en acties uitvoeren via connectors en flows. Daar wordt het onderscheid uit het boek praktisch. Een agent die vragen beantwoordt uit het personeelshandboek of de productdocumentatie is laag risico: fout antwoord, mens corrigeert. Daar begin je. Een agent die zelf een verlofaanvraag goedkeurt of een order aanpast, vraagt om beperkte bevoegdheden en een menselijke bevestiging op de stap die ertoe doet. Dat kan, maar het is ontwerpwerk. En een agent die op basis van een taalmodel "voorspelt" of een klant gaat betalen, bouwen we niet; dat is voorspellende AI in een generatief jasje, met dezelfde problemen.

De vuistregels die we hanteren voordat we iets bouwen:

  • Gaat het om voorspellen wat een mens gaat doen? Dan alleen als signaal, met een mens die beslist.
  • Krijgt de agent bevoegdheden? Beperk ze tot wat nodig is en laat de onomkeerbare stap bevestigen.
  • Meet de output periodiek met een vaste testset. Wat vandaag werkt, werkt over drie maanden niet vanzelf.

Het risico dat we bij klanten tegenkomen is zelden spectaculair. Het is een vlot geformuleerd antwoord dat niemand meer controleert. Dat is minder spannend dan een robotopstand, en het gebeurt vandaag al.