1. Tien dingen die de meeste mensen niet weten
"Waar gaat mijn data naartoe?" is de meest gestelde vraag over AI, en meestal wordt hij beantwoord met een leveranciersbelofte. Deze pagina doet het anders: hij volgt een prompt van je toetsenbord tot het antwoord terug is, en laat per stap zien wat er gebeurt en wat er blijft staan. Wie dat begrijpt, kan zelf beoordelen of een tool geschikt is voor een klantdossier.
2. Stap 1: op je eigen laptop, vóór verzending
Voordat er iets verstuurd is, staat je tekst al ergens. De webinterfaces van de grote AI-diensten zijn applicaties die in je browser draaien; wat je typt staat in het werkgeheugen, en het blijft in de meeste apps staan als je van tabblad wisselt of de pagina opnieuw laadt. Dat betekent dat er iets lokaal wordt weggeschreven.
Er zijn bovendien lokale sporen die niets met de AI-leverancier te maken hebben en die vrijwel niemand meeweegt: de spellingcontrole en het automatisch invullen van je browser, sessieherstel na een crash, de woordvoorspelling van je mobiele toetsenbord, en de synchronisatie van je browsergeschiedenis naar een cloudaccount. Een prompt met een klantnaam kan dus op je laptop staan én in een back-up van je browserprofiel.
3. Stap 2: over de lijn — en wie er meekijkt
Het verzoek gaat versleuteld over het internet, met de gebruikelijke transportversleuteling. Een netwerkbeheerder onderweg ziet dan wél naar welke dienst je verbinding maakt en hoe groot het verzoek is, maar niet de inhoud.
Aan de andere kant komt het verzoek binnen bij een reeks systemen die authenticeren, verkeer verdelen en snelheidslimieten toepassen. Dat is standaard clouddienstverlening en op zichzelf niet interessant — behalve dat elk van die lagen logregels genereert.
4. Stap 3: je tekst wordt in stukjes gehakt
Een taalmodel werkt niet met woorden maar met tokens: stukjes tekst uit een vast woordenboek die het model als één eenheid verwerkt. Volgens de documentatie van OpenAI kan een token "zo kort zijn als één teken en zo lang als een volledig woord". De vuistregels die daar staan gelden voor Engels: ongeveer vier tekens per token, ongeveer driekwart woord per token, honderd tokens is ongeveer vijfenzeventig woorden.
5. Stap 4: het hele gesprek gaat elke keer opnieuw mee
Dit is het punt dat vrijwel niemand kent en dat de meeste praktische gevolgen heeft.
Het contextvenster is alle tekst waarnaar het model kan verwijzen bij het maken van een antwoord, inclusief dat antwoord zelf. De documentatie beschrijft het als een werkgeheugen, en zet het expliciet tegenover de enorme hoeveelheid data waarop het model is getraind. Alles telt mee: de systeeminstructie, elk bericht in het gesprek, elk toolresultaat, elke afbeelding, elk document, de definities van de beschikbare tools, en het antwoord dat het model genereert.
En dan de kern: het model heeft geen geheugen tussen twee verzoeken. Bij elke nieuwe vraag wordt het gesprek opnieuw voorgelezen. De documentatie noemt dat "progressieve tokenaccumulatie" waarbij eerdere ronden volledig bewaard blijven; de invoerfase van elke ronde bevat de volledige gespreksgeschiedenis plus je nieuwe bericht.
6. Stap 5: de cache die ook bij "wij bewaren niets" bestaat
Om het sneller en goedkoper te maken, bewaren aanbieders tussenresultaten van het rekenwerk. Begint een volgend verzoek met exact dezelfde tekst, dan kan dat hergebruikt worden. Dat heet prompt caching, en het betekent dat er tijdelijk een bewerkte representatie van je prompt bestaat buiten het verzoek zelf.
| Aanbieder | Hoe lang blijft zo'n cache staan |
|---|---|
| Anthropic, standaard | 5 minuten, verlengd bij elk hergebruik |
| Anthropic, verlengde variant | 1 uur, tegen een hogere prijs |
| OpenAI, recentere modellen | 30 minuten, verlengd bij hergebruik |
| OpenAI, eerdere modellen | 5 tot 10 minuten inactiviteit, tot maximaal een uur; op sommige oudere modellen tot 24 uur |
| Google Gemini | Impliciete caching staat standaard aan; geen bewaartijd gedocumenteerd op de pagina die wij ophaalden |
Twee dingen zijn hier expliciet toegezegd en die zijn belangrijk. Caches worden niet gedeeld tussen organisaties — alleen leden van dezelfde organisatie kunnen bij een cache van identieke prompts, en bij één aanbieder geldt op sommige platformen zelfs isolatie per werkomgeving. En caching overleeft zero data retention in afgezwakte vorm: de aanbieder bewaart dan niet de ruwe tekst, maar houdt de cacherepresentaties en cryptografische hashes alleen in het geheugen en niet in opslag.
7. Stap 6: het rekenen zelf — en waar versleuteling stopt
Het model draait op gespecialiseerde rekenkaarten in datacenters. Die datacenters zijn niet van de AI-aanbieder zelf: die huurt capaciteit bij cloudpartijen, in meerdere landen. Eén aanbieder publiceert een lijst met infrastructuurpartijen in twintig-plus landen; een andere zegt meerdere cloudleveranciers te gebruiken en standaard te routeren naar geselecteerde landen in de VS, Europa, Azië en Australië.
Het antwoord komt daarna stukje bij stukje terug — dat "typen" dat je ziet is niet het model dat nadenkt, maar tokens die één voor één arriveren. Twee bijkomstigheden: de verbinding blijft minuten open, wat sommige bedrijfsproxy's afkappen, en als het model een intern redeneerspoor produceert, gaat dat óók over de lijn en valt het onder dezelfde bewaarregels als de rest.
8. Wat er daarna blijft staan
Dit is het deel dat je nodig hebt voor je verwerkersovereenkomst en je bewaarbeleid. De termijnen verschillen per aanbieder en per abonnementsvorm, en ze veranderen — dus verifieer ze bij contractsluiting. Het patroon is wel stabiel.
| Wat | Termijn |
|---|---|
| Verwijderde gesprekken, zakelijk | Binnen 30 dagen uit de systemen, tenzij er een wettelijke plicht is om ze te bewaren |
| API-invoer en -uitvoer, standaard | Tot 30 dagen, voor dienstverlening en misbruikdetectie |
| Misbruikdetectielogs | Tot 30 dagen |
| Gesprekken waar je feedback op gaf (duimpje) | Het hele gesprek, tot 5 jaar, losgekoppeld van je identiteit |
| Voor veiligheid gemarkeerde in- en uitvoer | 2 jaar; de classificatiescores 7 jaar |
| Bij consumentenabonnement mét modelverbetering aan | Tot 5 jaar in gede-identificeerde vorm in trainingspijplijnen |
| Bestanden en containers van agent- en codefuncties | Tot 30 dagen, of "tot je het zelf verwijdert" |
| Vectoropslag en assistent-objecten | Vaak onbeperkt tot je ze handmatig verwijdert of een vervaltermijn instelt |
| AI in de Microsoft-omgeving | Volgens je eigen bewaarbeleid; prompts staan in een verborgen map in de mailbox van de gebruiker |
| AI in de Google-omgeving | Instelbaar van 90 dagen tot onbepaald — zet dit actief op een termijn |
Zero data retention: wat het is en wat het níet dekt
Zero data retention betekent dat de aanbieder je invoer en uitvoer niet opslaat, behalve waar de wet dat eist of waar het nodig is tegen misbruik. Drie dingen die je moet weten:
- Het is geen vinkje in de interface. Je moet het aanvragen, het is onderworpen aan goedkeuring en het wordt per organisatie beoordeeld.
- Het geldt niet voor consumentenabonnementen.
- Het vervalt per functie. Dit is het belangrijkste punt van deze hele paragraaf: code-uitvoering, bestandsopslag, batchverwerking, agentvaardigheden en connectoren naar externe systemen zijn expliciet níet geschikt voor zero retention. Zodra je agentachtige functies aanzet, verlies je dus je zero-retentiepositie voor precies die functies.
Misbruikdetectie: wie kan er meelezen
Technisch zijn dit kleinere modellen die elke in- en uitvoer scoren op categorieën uit het gebruiksbeleid. Wat gedocumenteerd is:
- Bij één aanbieder kunnen medewerkers standaard niet bij je gesprekken, tenzij je feedback deelt of er een beleidsbeoordeling nodig is; dan mogen alleen aangewezen medewerkers erbij, op need-to-know-basis. Gemarkeerde inhoud wordt losgekoppeld van je identiteit — met de kanttekening dat de aanbieder zich het recht voorbehoudt die koppeling terug te maken om zijn voorwaarden te handhaven.
- Bij een andere aanbieder is de toegang beperkt tot bevoegde medewerkers plus gespecialiseerde externe contractanten die uitsluitend op misbruik beoordelen. Die contractanten staan met naam en land in het register van onderaannemers — onder andere in de Filipijnen, de Verenigde Staten en Canada.
- Bij een gratis API-variant staat het onomwonden: menselijke beoordelaars mogen je invoer en uitvoer lezen, annoteren en verwerken. Met de bijbehorende instructie om er geen gevoelige, vertrouwelijke of persoonlijke informatie in te zetten.
9. Leert het model van jouw gesprek?
Drie dingen worden hier constant door elkaar gehaald, en het onderscheid is precies waar de angst zit.
| Wat het is | Verandert het model? | |
|---|---|---|
| In-context leren | Het model "leert" binnen één verzoek, uitsluitend doordat de tekst in het contextvenster staat | Nee. Sluit je het gesprek, dan is het weg |
| Geheugenfuncties | Lijkt op leren, maar is gewone databaseopslag die vóór je prompt wordt geplakt | Nee. Alleen de invoer is aangevuld |
| Echte training of fine-tuning | Een batchproces bij de aanbieder, los van je gesprek | Ja — en dit is het enige waar de gewichten veranderen |
Dat de derde categorie losstaat van jouw gesprek, blijkt uit de manier waarop de opt-out werkt: uitzetten geldt alleen vóóruit, en je data blijft zitten in modellen die al getraind zijn of waarvan de training al is begonnen. Een model dat live zou leren, zou zo'n formulering niet nodig hebben.
De trainingsregels per abonnementsvorm
- Consument, standaard: ja, er wordt op getraind. Er is een instelling om het uit te zetten, en de aanwezigheid van die opt-out zegt genoeg over de standaardstand. Let op: training uitzetten verwijdert je geschiedenis níet.
- Zakelijk, standaard: nee. Bij de grote aanbieders is dit contractueel dichtgezet — bij één in de commerciële voorwaarden zelfs in de vorm "de aanbieder mag geen modellen trainen op klantinhoud".
- Het lek dat vrijwel niemand kent: ook als je training hebt uitgezet, kan het hele gesprek dat je van feedback voorziet worden gebruikt om modellen te trainen. Eén duimpje omlaag onder een antwoord over een cliëntdossier stuurt dus dat hele dossierfragment de pijplijn in — en bij één aanbieder blijft zo'n gesprek vijf jaar bewaard.
Kan er data uit een model worden teruggehaald?
Ja, aantoonbaar — maar het gaat om data die in de trainingsset zat, niet om jouw prompt van vanmiddag. Onderzoekers hebben honderden letterlijke tekstfragmenten uit trainingsdata van een model gehaald, waaronder namen, telefoonnummers en e-mailadressen, ook als die maar in één document voorkwamen. Memorisatie neemt toe met de grootte van het model, met hoe vaak iets in de data voorkomt, en met de lengte van het aanknopingspunt dat je geeft. Bij productiemodellen is aangetoond dat een aanval die het model uit zijn gespreksrol duwt de emissie van trainingsdata sterk verhoogt.
En het punt dat direct raakt aan zoekende assistenten: uit embeddings alleen — de getallenreeksen in een vectordatabase — is 92% van korte teksten exact te reconstrueren, inclusief volledige namen uit medische dossiers. Een vectordatabase is dus geen anonimiseringsmaatregel.
Juridisch sluit dat aan bij het standpunt van de Europese privacytoezichthouders: een model dat op persoonsgegevens is getraind kan niet in alle gevallen als anoniem worden beschouwd. Zie Wat de Europese toezichthouders hebben vastgesteld.
10. Wat er gebeurt als je een gesprek verwijdert
Het verdwijnt direct uit je geschiedenis en binnen dertig dagen uit de opslag aan de achterkant. Wat er niet verdwijnt:
- Voor veiligheid gemarkeerde in- en uitvoer (twee jaar) en de classificatiescores (zeven jaar).
- Gesprekken waar je feedback op gaf (vijf jaar).
- Data die al in een trainingsronde is meegegaan.
- Wat er in de systemen aan de achterkant staat, naast wat jij in de interface ziet.
- Geheugenfuncties. Een aanbieder zegt het expliciet: de opslag van bewaarde herinneringen staat los van je chatgeschiedenis, en ook als je een gesprek verwijdert kunnen de daaruit bewaarde herinneringen in latere gesprekken worden gebruikt. Om iets echt kwijt te raken moet je élke plek opruimen waar het voorkomt.
- Back-ups. Geen enkele aanbieder publiceert een concrete back-upbewaartermijn. De standaardformulering in contracten is dat vertrouwelijke informatie op verzoek wordt vernietigd, "behalve kopieën in geautomatiseerde back-upsystemen". Dat betekent: back-ups vallen buiten de verwijderbelofte tot ze zelf verlopen.
- Bij de betaalde API van één aanbieder: verwijderen op verzoek is niet ondersteund. Je wacht de bewaartermijn uit.
11. De zes varianten, en waarom het verschil enorm is
| Variant | Wat blijft er staan | Wie is verwerker |
|---|---|---|
| a. Gratis consumenten-chatbot | Geschiedenis tot je wist; met training aan tot 5 jaar gede-identificeerd; gemarkeerd 2 jaar plus scores 7 jaar | Niemand namens jou. De aanbieder handelt voor eigen doeleinden. Geen verwerkersovereenkomst, dus geen rechtsgeldige basis voor cliëntgegevens |
| b. Zakelijk abonnement | Standaard onbeperkt tenzij je een termijn instelt; verwijderd binnen 30 dagen; kopieën aan de achterkant naast wat je ziet | Aanbieder is verwerker, jij verantwoordelijke. Geen training |
| c. Directe API-koppeling | 30 dagen standaard — maar assistent-objecten en vectoropslag blijven "tot je ze verwijdert", dus onbeperkt bij nalatigheid | Aanbieder is verwerker; zero retention mogelijk maar aan te vragen en niet voor alle functies |
| d. AI in bestaande software | In je eigen omgeving, volgens je eigen bewaarbeleid; verwijdering opgeschort bij een bewaarplicht of een juridisch beslag | De softwareleverancier is verwerker; de modelaanbieders zijn onderaannemers — en één van hen valt buiten de EU-datagrens |
| e. Model via cloudplatform in eigen EU-regio | Wat je zelf logt, plus misbruiklogging van het platform | Cloudleverancier is verwerker; met afgeschermd rekenen kan zelfs die worden buitengesloten |
| f. Open model op eigen hardware | Alleen wat je zelf bewaart. Geen misbruiklogs, geen classificatiescores | Jij, volledig. Geen verwerkersovereenkomst nodig — maar ook geen certificeringen, en de beveiliging is jouw probleem |
12. Als de AI in je eigen documenten zoekt
Zodra een assistent je eigen dossiers kan doorzoeken, verandert het verhaal wezenlijk. Er wordt namelijk een tweede kopie van je informatie gemaakt: je documenten worden in stukken gehakt, omgezet in getallenreeksen en geïndexeerd. Bij één aanbieder gaat dat standaard in stukken van 800 tokens met 400 tokens overlap.
Drie gevolgen:
- De inhoud van je dossiers verlaat de bestandsserver en komt in een tweede opslagsysteem met een eigen levensduur en een eigen back-upregime. Bij één aanbieder valt die bestandsopslag expliciet buiten zero retention en blijft de data staan tot je die zelf verwijdert.
- De vectoren zijn geen versleuteling. Zie paragraaf 9: het overgrote deel van korte teksten is eruit te reconstrueren.
- Autorisatie is het echte probleem. Een goed ingerichte assistent respecteert de bestaande rechten: hij kan geen data zien waar de gebruiker geen toegang tot heeft. Dat klinkt beruhigend, maar het gevolg is dat te ruime rechten die jarenlang onopgemerkt bleven, ineens exploiteerbaar worden. Niemand merkte het, omdat handmatig zoeken nooit efficiënt genoeg was. Een zoekende assistent maakt bestaande over-autorisatie in één keer vindbaar.
En bij agenten met gereedschap
Zodra het model tools mag gebruiken, gaat er data naar meer partijen dan je denkt. Een webzoekopdracht — mogelijk met een cliëntnaam erin — gaat naar een zoekmachine buiten de aanbieder. Een opgevraagde website ziet dat er een verzoek komt, met de bewaartermijnen van die derde partij. Bestanden die je laat analyseren belanden in een container die tot dertig dagen blijft staan. En elke connector naar een extern systeem is een extra partij in de keten met eigen logs. Wat dat verder betekent staat in Agentic AI.
13. Wie er bij een leverancier technisch bij kan
| Partij | Wie | Waarborg volgens de documentatie |
|---|---|---|
| Aanbieder A | Aangewezen medewerkers van het veiligheidsteam | Medewerkers kunnen standaard niet bij gesprekken; toegang op need-to-know-basis. Of die toegang wordt gelogd en geaudit, staat niet in de documentatie |
| Aanbieder B | Bevoegde medewerkers plus externe contractanten voor misbruikbeoordeling | Contractanten staan met naam en land in het openbare register van onderaannemers |
| Aanbieder B, bij juridisch beslag | "Een klein, geaudit juridisch en securityteam" | Expliciet geaudit; data apart opgeslagen in een beveiligd systeem |
| Kantoorsoftware in de EU | Beheerpersoneel buiten de EU, op gepseudonimiseerde logs | Voor storingsanalyse, fraudepreventie en security; pseudonimisering via versleuteling, maskering of tokenisatie |
| Gratis API-variant | Menselijke beoordelaars | Geen — vandaar de expliciete instructie om er niets vertrouwelijks in te zetten |
| Je eigen IT-afdeling | Bij inspectie van versleuteld verkeer: de volledige prompttekst | Alleen je eigen beleid |
14. En dan komt er een rechter langs
Dit is het leerzaamste praktijkgeval dat er is, en het zet alle bewaarbeloftes in perspectief.
In een civiele procedure tussen een Amerikaanse krant en een AI-aanbieder werd die aanbieder bevolen consumenten- en API-inhoud onbeperkt te bewaren. De aanbieder noemde de eis "veel te ruim". De verplichting eindigde in september 2025, maar bepaalde historische data uit de maanden daarvoor moet nog bewaard blijven. Getroffen: de gratis en betaalde consumentenvarianten, de teamvariant en de standaard-API. Niet getroffen: de enterprise- en onderwijsvarianten, en API-klanten met zero data retention. De bewaarde data staat apart in een beveiligd systeem, onder juridisch beslag, toegankelijk voor een klein geaudit team, en wordt niet automatisch met de tegenpartij gedeeld.
Ter kalibratie van de orde van grootte: een grote clouddienst rapporteerde over een half jaar ruim 27.000 verzoeken van rechtshandhaving bij consumentendiensten, waarvan ongeveer 5% tot verstrekking van inhoud leidde en ruim 20% werd afgewezen. Transparantierapporten met aantallen van de AI-aanbieders zelf hebben wij niet kunnen vinden.
15. Wat je hiermee doet
En één ding om tegen jezelf te herhalen: de vraag is nooit "is AI veilig?" maar "welke variant, met welke instellingen, voor welke gegevens?". Diezelfde tool is in de ene configuratie een AVG-overtreding en in de andere een verdedigbare keuze. Het verschil zit in tien minuten configuratie en één contract. De uitwerking daarvan staat in AI-leveranciers kiezen, vastleggen en beveiligen.
16. Bronnen
- Over tokens en het tellen ervan — help.openai.com en ai.google.dev
- Petrov e.a., over tokenisatieverschillen tussen talen (NeurIPS 2023) — arxiv.org/abs/2305.15425
- Over het contextvenster en het opnieuw meesturen van eerdere berichten — platform.claude.com
- Prompt caching en de bewaartijden ervan — platform.claude.com en developers.openai.com
- Bewaartermijnen en zero data retention per functie — platform.claude.com, privacy.claude.com, openai.com en developers.openai.com
- Training op invoer en het feedback-lek — help.openai.com en privacy.claude.com
- Geheugenfuncties overleven het verwijderen van een gesprek — help.openai.com
- Wie er bij een aanbieder toegang heeft — privacy.claude.com en het register van onderaannemers openai.com
- Voorwaarden van de gratis API-variant, met menselijke beoordeling — ai.google.dev
- Microsoft 365 Copilot: privacy, onderaannemers en de EU-datagrens — learn.microsoft.com, learn.microsoft.com en learn.microsoft.com
- Waar Copilot-prompts worden bewaard — learn.microsoft.com
- Bewaartermijnen in de Google-omgeving — knowledge.workspace.google.com
- Hoe een zoekende assistent indexeert en rechten respecteert — developers.openai.com en learn.microsoft.com
- Afgeschermd rekenen ("confidential computing") — learn.microsoft.com
- Extractie van trainingsdata: arxiv.org/abs/2012.07805, 2202.07646 en 2311.17035
- Reconstructie van tekst uit embeddings (EMNLP 2023) — arxiv.org/abs/2310.06816
- NIST, aanvalscategorieën op generatieve AI — nvlpubs.nist.gov
- EDPB, Opinie 28/2024 over anonimiteit van modellen — edpb.europa.eu
- De bewaarplicht onder juridisch beslag en welke varianten waren uitgezonderd — openai.com
- Verzoeken van rechtshandhaving, als referentiekader — microsoft.com
Bewaartermijnen, cachetijden en voorwaarden veranderen regelmatig en verschillen per product en per regio; verifieer ze bij contractsluiting. De factor voor Nederlandse tekst ten opzichte van Engelse tekst in paragraaf 4 is een onderbouwde schatting en geen meting. Over wat er precies lokaal in browser en app wordt opgeslagen hebben wij geen leveranciersdocumentatie gevonden; die passage is vakkennis. Of aanbieders hun productieomgeving in een afgeschermde rekenomgeving uitvoeren, en of de toegang van medewerkers tot prompts wordt gelogd, staat niet in de documentatie die wij konden inzien. Waar wij aanbieders in dit stuk niet met naam noemen, is dat omdat de betreffende voorwaarde snel kan wijzigen — de bronlinks staan erbij.
Meer uit deze reeks
Regels en verplichtingen
Risico's en beheersing
Techniek en leveranciers
Beroepsorganisaties en AI
Zie hoe Accountee dit oplost
Regelgeving, risico's en beroepsregels zijn één ding. Accountee helpt je kantoor AI veilig en praktisch in te zetten — zonder dubbel werk.
Deze pagina geeft algemene informatie over regelgeving en risico's en is geen juridisch, fiscaal of vaktechnisch advies. Wet- en regelgeving rond AI verandert snel; de stand van zaken is die van 21 augustus 2026. Laat besluiten met gevolgen voor je kantoor of je cliënten altijd toetsen door een deskundige.