Risico's en beheersing

AI-risico's: welke zijn er, hoe groot zijn ze, en wat doe je eraan

Hallucinaties, blind vertrouwen, datalekken via prompts en shadow AI — met de cijfers erbij en mitigaties van goedkoop naar duur.

Bijgewerkt 21 augustus 2026 · leestijd ongeveer 20 minuten

1. Vier cijfers die het beeld bepalen

Over AI-risico's wordt veel gezegd en weinig gemeten. Deze pagina doet het omgekeerde: per risico staat er wat het is, hoe het er in een kantoor uitziet, wat het onderzoek erover zegt, en wat je eraan doet. Vier metingen bepalen de rest van het verhaal.

17–33%Hoe vaak vakspecifieke juridische AI-tools mét eigen kennisbank tóch iets verzinnen (Stanford)
19% langzamerTerwijl de deelnemers dachten 20% sneller te zijn (METR, gerandomiseerd experiment)
4,7%Van de medewerkers heeft vertrouwelijke bedrijfsdata in een publieke chatbot geplakt (Cyberhaven)
78–80%Van de AI-gebruikers neemt eigen, niet-goedgekeurde AI-tools mee naar het werk — bij het mkb het hoogst (Microsoft, n=31.000)

De conclusie die daaruit volgt is niet "gebruik geen AI". Het is: de effectiefste maatregelen zijn bijna allemaal goedkoop, en het zijn bijna allemaal afspraken en ontwerpkeuzes in plaats van software. Wie begint met inkopen in plaats van met afspreken, betaalt het meest en krijgt het minst.

2. Verzinsels: hoe vaak gaat AI de fout in?

Wat er gebeurt

Een taalmodel voorspelt plausibele tekst, niet ware tekst. Ontbreekt de kennis, dan vult het de leegte met iets wat statistisch klopt: een wetsartikelnummer met de juiste vorm, een btw-tarief dat aannemelijk klinkt, een jaarrekeningpost met een geloofwaardige naam. Het Amerikaanse normalisatie-instituut NIST gebruikt bewust een ander woord: confabulatie — "zelfverzekerd gepresenteerde maar onjuiste inhoud". Dat woord is beter, want het neemt de zelfverzekerde toon mee, en die toon is precies wat de reviewer misleidt.

Voor een kantoor zijn er vier fouttypen die je moet leren onderscheiden:

  • Verzinsel — het artikel, de uitspraak of de post bestaat niet.
  • Verkeerde toepassing — het artikel bestaat, maar zegt iets anders.
  • Verouderd — het klopte tot een tariefwijziging.
  • Meegaandheid — het model neemt de premisse van je vraag over. Vraag je "waarom is dit tarief 9%?", dan legt het uit waarom het 9% is. Ook als het 21% is.

Hoe dat er in de praktijk uitziet

Een btw-vraag. Een assistent vraagt: welk btw-tarief geldt voor de levering en installatie van zonnepanelen bij een particuliere woning, en wat is de grondslag? Het model geeft een tarief, een verwijzing naar Tabel I van de Wet OB en een uitleg. Twee van de drie elementen kloppen; het onderdeelnummer is verzonnen. Het memo gaat naar de klant, de klant factureert er een jaar naar, en bij een controle volgt naheffing plus rente — en de vraag wie dat betaalt.

Een toelichting bij de jaarrekening. Het model schrijft een vloeiende toelichting op basis van de kolommenbalans, inclusief een post "Vooruitbetaalde acquisitiekosten" die niet in de balans staat en een vergelijkend cijfer dat het heeft geïnterpoleerd. Perfect Nederlands, verkeerde cijfers.

Een verzonnen uitspraak. Bij een discussie over een bestuurdersbeloning citeert het model een uitspraak van Hof Arnhem-Leeuwarden met ECLI-nummer en datum. Het ECLI bestaat niet. Komt dat memo in een bezwaarprocedure terecht, dan is het niet alleen inhoudelijk fout maar procedureel schadelijk.

De cijfers

Vakspecifieke tools met eigen kennisbank. Het RegLab van Stanford onderzocht, in een voorgeregistreerde studie, drie juridische AI-tools van gevestigde vakuitgevers: Lexis+ AI, Westlaw AI-Assisted Research en Ask Practical Law AI. Allemaal verkocht met de belofte dat hallucinaties waren uitgebannen, allemaal met retrieval over een gecureerde eigen database. Uitkomst: ze hallucineerden 17% tot 33% van de tijd. De conclusie van de onderzoekers: de claims van de leveranciers waren "overdreven".

Samenvatten — de "veilige" taak. De Vectara-ranglijst meet hoe vaak modellen bij het samenvatten van een meegeleverd document feiten introduceren die er niet in staan. Stand 11 mei 2026: de beste modellen zitten rond de 1,8–4,1%, maar veelgebruikte grote modellen rond de 9,6–10,4%. Het is een levende ranglijst, dus check de actuele stand voordat je het cijfer overneemt. Dus zelfs bij de meest gecontroleerde taak die er is — "vat samen wat hier staat, verzin niets" — introduceert een topmodel in ongeveer één op de tien tot één op de vijfentwintig gevallen iets wat er niet staat. Voor een kantoor dat 200 samenvattings- of extractieacties per week doet, betekent 5% al ongeveer tien stille fouten per week.

Hoe vaak het écht misgaat. De database AI Hallucination Cases houdt rechterlijke uitspraken bij waarin partijen op AI-verzinsels leunden. Stand augustus 2026: 1.934 zaken in meer dan 52 jurisdicties. Verzonnen jurisprudentie in 1.739 gevallen, valse citaten in 522, verkeerd weergegeven materiaal in 806. Sancties variëren van symbolische boetes tot ruim 46.000 dollar, plus tuchtrechtelijke doorverwijzingen en proceskostenveroordelingen.

Dat is een ondergrens van een ondergrens: het zijn alleen gevallen die tot een procedure leidden, die de rechter opmerkte, en die in een uitspraak zijn vastgelegd. Voor een boekhoudkantoor is de vergelijkbare populatie — memo's, aangiftes, adviezen met een verzonnen onderbouwing — per definitie onzichtbaar. Er is geen rechter die het opschrijft.

En het gebeurt niet alleen bij kleine kantoren. In oktober 2025 werd breed gerapporteerd dat Deloitte Australië een deel van een overheidsopdracht moest terugbetalen omdat een opgeleverd rapport verzonnen literatuurverwijzingen en een verzonnen citaat uit een uitspraak bevatte. Dat is een Big Four-firma met een reviewproces. Glipt het daar door, dan glipt het bij een kantoor van dertig man ook.

Wat je eraan doet

Middelduur: retrieval over je eigen, gecureerde kennisbank (kantoorhandboek, vaktechnische notities, actuele tarieventabellen) in plaats van over modelkennis — dat verlaagt de foutkans, maar zoals Stanford aantoonde: het elimineert die niet. Daarnaast: laat code, geen model, controleren of elk genoemd ECLI, wetsartikel of btw-tarief in een geldige referentietabel staat. Dat vangt precies het geval "de vorm klopt, de inhoud bestaat niet".

Duur: een eigen gemeten evaluatieset per gebruiksdoel, en een vaktechnisch bureau dat AI-output steekproefsgewijs toetst zoals het nu dossiers toetst.

3. Blind vertrouwen: het risico dat alle andere risico's vermenigvuldigt

Wat er gebeurt

Automation bias is de neiging om een geautomatiseerd advies te aanvaarden zonder eigen verificatie, en om je eigen tegenstrijdige bevindingen te negeren. Het komt in twee vormen: je doet iets fout omdat het systeem het zei, of je mist iets omdat het systeem niets zei. De tweede is erger, want die zie je nooit.

Concreet: de AI stelt bij het inboeken automatisch een grootboekrekening en btw-code voor. De eerste twee weken controleert de assistent alles. Vanaf week drie klopt het "eigenlijk altijd", en het tempo gaat omhoog — van veertig naar honderdtwintig facturen per uur. Vanaf dat moment is de assistent geen controleur meer maar een klikker. De ene factuur van een nieuwe leverancier met een afwijkende btw-behandeling gaat mee in het ritme.

Tweede variant, subtieler: een senior die een AI-memo reviewt. Een goed geschreven memo met correcte structuur en zelfverzekerde toon activeert minder kritische leesmodus dan een rommelig memo van een junior. De kwaliteit van de vorm verlaagt de intensiteit van de review.

Het cijfer dat je moet kennen

Het onderzoeksinstituut METR deed in juli 2025 een gerandomiseerd experiment met zestien ervaren open-source ontwikkelaars op 246 echte taken in hun eigen codebases, met schermopnames erbij.

MomentVerwachting of uitkomst
Vooraf, eigen schatting24% sneller met AI
Gemeten resultaat19% langzamer met AI
Achteraf, ná het zelf te hebben ervarennog steeds 20% sneller

Dat is het cruciale punt. Dit waren experts in hun eigen materiaal, en ze zaten er ná de ervaring nog 39 procentpunten naast. De onderzoekers waarschuwen zelf tegen overgeneralisatie — het is één setting en één periode — maar de richting is duidelijk: zelfrapportage over AI-productiviteit is onbruikbaar als bestuurlijke informatie. Baseer je besluit over AI-investeringen niet op "de medewerkers zeggen dat het veel sneller gaat". Dat is een meetinstrument waarvan bekend is dat het kapot is.

Er is ook goed nieuws. In een Stanford-experiment schreven deelnemers met een AI-assistent minder veilige code én dachten ze vaker dat hun code veilig was — maar de deelnemers die de AI minder vertrouwden en meer met hun prompts worstelden, leverden werk met minder fouten. Scepsis is dus een meetbaar effectieve beheersmaatregel. En scepsis kost niets.

Wat je eraan doet

  • Begrens het tempo, niet alleen de kwaliteit. Daalt de doorlooptijd per factuur of dossier na AI-invoering met een factor drie, dan is dat een rood signaal, geen groen. Meet het en bespreek het.
  • Blindtest, één op de twintig. Eén op de twintig AI-voorstellen doet de medewerker eerst zelf, dán vergelijken. Dat houdt de eigen vaardigheid en het eigen ijkpunt in stand.
  • Zaai bewust fouten in de instructie. Laat mensen bij het inwerken tien AI-outputs beoordelen waarvan drie fout zijn, en bespreek wie welke miste. Niets geneest oververtrouwen zo snel als zelf gezakt zijn.
  • Sorteer de reviewwachtrij op onzekerheid, niet chronologisch. Dan gaat menselijke aandacht naar waar die iets toevoegt.
  • Begrens het aantal goedkeuringen per persoon per dag. Boven de twintig is menselijke controle feitelijk geen controle meer, alleen weet niemand dat.
  • Draai de reviewvraag om. Niet "keur dit goed?" maar "vind de fout in dit stuk". Actief zoeken in plaats van passief bevestigen.

4. Vooroordeel, eenvormigheid en Amerikaanse begrippen

Bias in AI gaat over twee dingen die vaak op één hoop gaan. Het eerste is discriminatie: het model versterkt historische en maatschappelijke vooroordelen. Het tweede is eenvormigheid: als alle adviezen door hetzelfde model worden geschreven, convergeren ze naar hetzelfde middelmatige standaardadvies, en verdwijnt de variatie die vakinhoudelijke tegenspraak oplevert. Dat tweede wordt in AI-risicostukken bijna nooit genoemd, maar het is voor een kantoor reëel.

Waar het in een kantoor kan spelen:

  • Cliëntacceptatie. Een AI die helpt bij het bepalen van een Wwft-risicoscore op basis van vrije tekst en bedrijfsgegevens. Signalen als vestigingsland, de naam van de UBO of de wijk waarin het bedrijf zit, correleren met beschermde kenmerken. Een model dat op historische acceptatiebeslissingen is geleerd, herhaalt de historische vooroordelen van je kantoor.
  • Personeelsselectie. De meest gedocumenteerde bias-toepassing die er is, en onder de AI-verordening hoog risico (bijlage III 4(a) en 4(b)).
  • Continuïteits- of kredietbeoordeling waarin het model in de onderbouwing leunt op branchestereotypen.

Kans op aantoonbare discriminatie bij een boekhoudkantoor: laag, omdat de meeste toepassingen geen beslissingen over personen zijn. Kans op stille bias in cliëntacceptatie, personeelsselectie en risicoclassificatie: reëel zodra die processen worden geautomatiseerd. De schade is asymmetrisch: onder de AVG en de gelijkebehandelingswetgeving is dit reputationeel en toezichtsmatig zwaar.

De goedkoopste maatregel: verbied AI bij beslissingen over personen — aannemen, ontslaan, een cliënt weigeren — zonder expliciete directiegoedkeuring, en leg vast dat AI daar hoogstens voorbereidend werk doet met een eigen, gemotiveerd menselijk besluit erna. Laat gevoelige velden (naam, nationaliteit, adres, geslacht) niet in de prompt.

5. Klantdata in een chatbot: hoe vaak dat gebeurt

Wat er gebeurt

Een medewerker plakt klantgegevens in een publieke chatbot om er iets mee te laten doen. Op dat moment verlaten persoonsgegevens en vertrouwelijke bedrijfsgegevens je verwerkersketen, richting een partij zonder verwerkersovereenkomst, mogelijk buiten de EER, mogelijk in trainingsdata.

Vier voorbeelden die in elk kantoor voorkomen:

  • Een assistent plakt een volledige loonjournaalpost met namen, BSN's en bruto-nettoberekeningen in een gratis chatbot, met de vraag waarom de aansluiting niet klopt.
  • Een adviseur plakt een intentieverklaring van een aandelenoverdracht in een chatbot voor een samenvatting. Koopprijs, partijnamen en bedingen gaan mee.
  • Iemand uploadt een concept-jaarrekening naar een gratis pdf-samenvattingssite die achter de schermen een AI-dienst aanroept.
  • Een controlemedewerker plakt een bevindingenlijst inclusief namen van medewerkers van de klant in een chatbot om er nette zinnen van te maken.

Voor een accountantskantoor telt hier niet alleen de AVG, maar ook de geheimhoudingsplicht. Een BSN in een publieke chatbot is meteen een kandidaat-datalek met meldplicht.

De cijfers

Het securitybedrijf Cyberhaven meet dit met telemetrie — dus daadwerkelijk gedrag, geen enquête. Over de periode vanaf de introductie van ChatGPT tot medio 2023:

MetingUitkomst
Kenniswerkers die ChatGPT op het werk gebruikten10,8%
Die bedrijfsdata hadden geplakt8,6%
Die vertrouwelijke data hadden geplakt4,7%
Aandeel van alle geplakte data dat vertrouwelijk is11%
Incidenten met klantdata per 100.000 medewerkers per week260
Aandeel medewerkers dat 80% van alle incidenten veroorzaakt0,9%

Twee dingen zijn hier belangrijk. Reken die 260 klantdata-incidenten per 100.000 medewerkers per week om naar een kantoor van vijftig man: dat is ongeveer zeven incidenten per jaar — en dat is gerekend met een adoptiegraad van 10,8% uit 2023. Bij een realistische adoptie van 60 tot 80% in 2026 loopt dat naar tientallen per jaar.

En dan die 0,9% die 80% veroorzaakt. Dat maakt gerichte interventie extreem efficiënt: je hoeft niet iedereen te trainen, je moet de zware gebruikers vinden en daar één gesprek mee voeren.

Over de kosten van een datalek: het jaarlijkse IBM-rapport komt voor 2026 uit op een wereldwijd gemiddelde van 4,99 miljoen dollar, een record. Gebruik dat cijfer voor richting en trend, niet als kostenmodel — het wordt zwaar getrokken door grote Amerikaanse zorg- en financiële instellingen. Voor een Nederlands kantoor van vijftig fte is de realistische directe schade van een prompt-datalek eerder tienduizend tot honderdvijftigduizend euro (onderzoek, melding, informeren van betrokkenen, juridische bijstand, herstel), plus een boeterisico en — het belangrijkste — klantverlies.

Wat je eraan doet

  1. Bied een goed, goedgekeurd alternatief — dit is maatregel nummer één. Verbieden zonder alternatief produceert shadow AI. Een zakelijk abonnement met verwerkersovereenkomst en trainingsverbod kost tientallen euro's per medewerker per maand en haalt het grootste deel van de prikkel weg.
  2. Eén A4 met drie regels die iedereen kent: geen persoonsgegevens, geen klantnamen of identificerende gegevens, alleen via het goedgekeurde account.
  3. Blokkeer de bekende consumenten-endpoints op het netwerk en op beheerde apparaten, en stuur bij een blokkade door naar het goedgekeurde alternatief in plaats van naar een foutmelding.
  4. Zoek de 0,9%. Eén gesprek met de zware gebruikers doet meer dan een kantoorbrede training.
  5. Maak anonimiseren een gewoonte. Namen worden "Klant A", BSN's worden gemaskeerd, bedragen mogen meestal blijven staan. Maak er een sneltoets of tekstsjabloon van.

Daarboven op, als het volume dat rechtvaardigt: uitgaande promptfiltering die BSN- en IBAN-patronen en klantnamen uit je CRM detecteert en blokkeert, en verwerkersovereenkomsten met EER-hosting contractueel dichtgezet. Zie AI-leveranciers kiezen en vastleggen.

6. Gratis versus zakelijk: geen gradueel maar een categorisch verschil

Bij vrijwel alle grote aanbieders geldt hetzelfde patroon:

Consumenten- of gratis abonnementZakelijk of enterprise
Training op je invoerVaak standaard aan, met een opt-out die je zelf moet vindenContractueel uitgesloten
VerwerkersovereenkomstGeenJa
BewaartermijnBeperkt inzichtelijkInstelbaar; meestal nog 30 dagen voor misbruikdetectie
DatalocatieNiet te kiezenVaak EU-regio mogelijk
Menselijke inzageMogelijk voor kwaliteit en veiligheidBeperkt, contractueel geregeld
Single sign-on en loggingNeeJa

Het verschil is niet gradueel maar categorisch. Een gratis of persoonlijk abonnement betekent: geen verwerkersovereenkomst, dus geen enkele rechtsgeldige basis om klantdata te verwerken — plus training op je invoer. Voor een kantoor met een geheimhoudingsplicht is dat geen risico maar een overtreding. Dit is het eerste dat je dichtzet, en het beste met technische middelen in plaats van met een gedragsregel.

En zet in je wijzigingsprocedure dat "leverancier voegt AI-functie toe" een beoordelingsmoment is. Je boekhoudpakket zet er bij een update een AI-assistent bij, niemand heeft daar een besluit over genomen, en de verwerkersovereenkomst van vorig jaar dekt de nieuwe subverwerker niet. Dat is de meest voorkomende bron van onbedoelde doorgifte.

7. Stille modelwijzigingen en afhankelijkheid

Drie risico's die vaak op één hoop gaan.

Beschikbaarheid. De dienst valt uit en je proces staat stil. Bij een AI-afhankelijke factuurstroom kan dat op de twintigste van de maand duur zijn.

Stille modelwijziging. Dit is het lastigste, omdat er geen changelog is die jouw specifieke uitkomsten dekt. Een voorbeeld dat precies laat zien waarom:

Je hebt een prompt die uit een inkoopfactuur leverancier, factuurnummer, datum, bedrag en btw-code haalt, met 98% juistheid. De leverancier stapt over op een nieuwe modelversie. De uitvoer verandert subtiel: datums komen ineens als maand-dag-jaar in plaats van dag-maand-jaar. Facturen van 3 mei worden 5 maart. Er komt geen foutmelding — het zijn geldige datums. Drie weken later blijkt de btw-periodetoedeling verstoord.

Dat een modelwissel geen neutrale infrastructuurwijziging is, blijkt ook uit de hallucinatiecijfers: die verschillen per modelversie van 1,8% tot boven de 10%. Een modelwissel is dus een kwaliteitswijziging.

Prijs en voorwaarden. Prijs per zetel, per token of per credit verandert; functies verhuizen naar een duurder pakket; een model wordt uitgefaseerd.

Verder: houd een handmatige terugvalprocedure die je twee keer per jaar écht uitvoert, niet alleen documenteert. Als de kennis weg is, is het geen terugvaloptie. En leg per proces vast wat er gebeurt als de AI-dienst een dag uit is.

8. Shadow AI: bij het mkb is dit de norm, niet de uitzondering

Medewerkers gebruiken AI-tools die niet zijn goedgekeurd, meestal op een privé-account, meestal met goede bedoelingen, en meestal zonder het te vertellen. Het is de verzamelplaats waar alle risico's op deze pagina samenkomen zonder enige beheersing.

De Work Trend Index van Microsoft en LinkedIn ondervroeg 31.000 kenniswerkers in 31 landen:

MetingUitkomst
AI-gebruikers die eigen tools meenemen naar het werk78%
Idem, bij kleine en middelgrote bedrijven80%
Terughoudend om toe te geven dat ze AI voor hun belangrijkste taken gebruiken52%
Vreest dat AI-gebruik hen vervangbaar doet lijken53%
Worstelt met het tempo en volume van het werk68%

Twee inzichten. Ten eerste: 80% bij het mkb betekent dat shadow AI in een boekhoudkantoor de norm is, niet de uitzondering. Ten tweede — en dit is het belangrijkste — die 52% en 53% verklaren waarom het verborgen blijft. Het is angst voor vervangbaarheid, niet onwil. Een beleid dat straft, verdiept de geheimhouding. Dit is een cultuurinterventie, geen technische.

9. Alles op één rij: risico, maatregel, kosten

RisicoGoedkoopste effectieve maatregelKostenEffect
Verzinsels in normen en tarievenModel mag nooit de bron van een norm zijn; verificatieplichtvrijwel nulhoog
Stille fouten in factuurherkenningVier ogen op cijfers, gescheiden van de tekstreviewvrijwel nulhoog
Blind vertrouwenGoedkeuringen per persoon per dag begrenzen; diff tonen, geen dumpvrijwel nulmiddelhoog
Klantdata in een chatbotZakelijk abonnement met verwerkersovereenkomst plus drie regels plus endpoints blokkerenlaaghoog
Shadow AIAmnestie plus één goed goedgekeurd alternatieflaaghoog
Niet-gecontracteerde AI-datastroomZes inkoopvragen per tool; AI-functie in een update is een beoordelingsmomentlaaghoog
Stille modelwijzigingWekelijkse automatische run van de set bekende antwoordenlaaghoog
Uitval van de dienstHandmatige terugvalroute die je twee keer per jaar echt uitvoertlaagmiddelhoog
Vooroordeel bij besluiten over personenAI daar alleen voorbereidend; mens beslist en motiveert schriftelijkvrijwel nulhoog
Eenvormige adviezenBewust vaktechnische tegenspraak organiseren; niet alles door hetzelfde modellaagmiddel

Gaat je kantoor van "AI die antwoord geeft" naar "AI die zelf handelt" — mail versturen, boeken, betalingen klaarzetten — dan verandert het risicoprofiel wezenlijk. Dat is het onderwerp van Agentic AI. En hoe je dit alles in een werkend systeem giet, staat in het stappenplan.

10. Bronnen

Twee gevallen in deze tekst zijn gebaseerd op persberichtgeving die we niet in een primaire bron hebben kunnen nalezen: de terugbetaling door Deloitte Australië (oktober 2025) en de eerdere waarschuwing van de Autoriteit Persoonsgegevens over datalekken via AI-chatbots. Beide worden breed gerapporteerd; verifieer ze zelf voordat je ze in een eigen publicatie citeert.

Zie hoe Accountee dit oplost

Regelgeving, risico's en beroepsregels zijn één ding. Accountee helpt je kantoor AI veilig en praktisch in te zetten — zonder dubbel werk.

Start gratis

Deze pagina geeft algemene informatie over regelgeving en risico's en is geen juridisch, fiscaal of vaktechnisch advies. Wet- en regelgeving rond AI verandert snel; de stand van zaken is die van 21 augustus 2026. Laat besluiten met gevolgen voor je kantoor of je cliënten altijd toetsen door een deskundige.