EU AI-verordening compliance

AI-verordening synthetische data: wanneer telt jouw datapijplijn als AI-gebruik?

Synthetische data genereren klinkt technisch en neutraal, maar onder de EU AI-verordening kan het gewoon als AI-gebruik tellen, met alle verplichtingen van dien. Zo bepaal je wat voor jouw organisatie geldt.

· 5 min leestijd · Door

Afgestudeerd in Europees recht (Universiteit Maastricht) · MSc Internationaal Belastingrecht (AI & technologie). Bouwt AI-systemen en adviseert MKB over naleving van de EU AI-verordening.

Synthetische data en de AI-verordening: dat lijkt misschien een ver-van-mijn-bed-show voor een gemiddeld Nederlands bedrijf. Maar als jij tools gebruikt die automatisch trainingsdata, testdata of profieldata aanmaken op basis van bestaande datasets, dan ben je waarschijnlijk al deployer onder de EU AI-verordening. En dat brengt concrete verplichtingen mee.

Wat telt als AI-systeem onder de verordening?

De definitie staat in Artikel 3 van de AI-verordening. Een AI-systeem is een op machines gebaseerd systeem dat is ontworpen om met variërende mate van autonomie te werken, en dat op basis van input inferenties maakt om outputs te genereren, zoals voorspellingen, aanbevelingen, beslissingen of gegenereerde content. Die outputs beïnvloeden dan weer echte of virtuele omgevingen.

Dat klinkt abstract. Kijk, in de praktijk betekent het dit: als een tool op basis van jouw bestaande klantdata automatisch nieuwe, synthetische klantprofielen aanmaakt, dan maakt die tool inferenties op basis van input. Dat is vrijwel altijd een AI-systeem in de zin van de verordening.

Een simpele spreadsheetformule valt er niet onder. Een generatief model dat statistische patronen leert en vervolgens nieuwe datapunten produceert, wel.

Synthetische data: drie vormen, drie risicoprofielen

Niet alle synthetische data is hetzelfde. Grofweg zijn er drie vormen:

1. Statistische synthetische data — gegenereerd via traditionele statistische methoden zoals bootstrapping of parametrische modellen. Denk aan een tool die op basis van bestaande verkoopdata nieuwe scenario's simuleert voor een financiële stresstest. Of dit onder de verordening valt, hangt af van hoe de tool is gebouwd. Veel moderne tools gebruiken onderliggend toch ML-modellen, ook als de interface er simpel uitziet.

2. Synthetische data via generatieve AI — GANs (Generative Adversarial Networks), VAEs, of grote taalmodellen die nieuwe data aanmaken die lijkt op de trainingsset. Dit valt bijna altijd onder de definitie van Artikel 3. Een HR-tool die synthetische cv's genereert voor het testen van een recruitmentalgoritme? Dat is een AI-systeem.

3. Augmentatie van bestaande data — bestaande records worden licht aangepast, geanonimiseerd of uitgebreid. Afhankelijk van de methode kan dit wel of niet onder de definitie vallen.

Voor jouw compliance-inventarisatie geldt: twijfel je of een tool AI-systeem is? Vraag de leverancier om de technische documentatie. Onder Artikel 13 en Artikel 26 heb je als deployer recht op die informatie, en de leverancier is verplicht die te verstrekken.

Wat betekent dit voor jouw organisatie?

De meeste bedrijven die synthetische data genereren, doen dat voor drie doelen:

Marketinganalyse — je genereert synthetische klantprofielen om campagnes te testen zonder echte persoonsgegevens te gebruiken. Goed idee vanuit AVG-perspectief. Maar als de tool daarvoor een AI-systeem gebruikt, ben jij de deployer en gelden de verplichtingen van Artikel 26.

Productontwikkeling — je gebruikt synthetische productdata of gebruikersgedragdata om nieuwe features te testen. Zeker als het gaat om gedragsdata van mensen, wordt het snel interessant vanuit zowel de AI-verordening als de AVG.

Training van andere AI-modellen — je genereert synthetische data om een ander model mee te trainen. Hier moet je goed opletten: de synthetische data-generator is één AI-systeem, het model dat je ermee traint is een ander. Beide kunnen aparte verplichtingen meebrengen.

Risicocategorieën: waar val je?

De AI-verordening werkt met risicolagen. Voor synthetische data-tools geldt doorgaans:

Verboden praktijken (Artikel 5) — synthetische data-generatie komt hier zelden direct in terecht, tenzij je synthetische data gebruikt om iets te bouwen of te ondersteunen dat wél verboden is. Denk aan het genereren van synthetische biometrische data voor een toepassing die realtime gezichtsherkenning in de openbare ruimte mogelijk maakt.

Hoog-risico AI (Bijlage III) — als de synthetische data wordt gebruikt om een hoog-risico systeem te trainen of te evalueren, moet je goed nadenken. Gebruik jij synthetische cv-data om een recruitmenttool te testen die uiteindelijk beslissingen neemt over kandidaten? Dan valt die recruitmenttool onder Bijlage III, categorie 4 (werkgelegenheid en toegang tot zelfstandige arbeid). De synthetische data-generator zelf is dan waarschijnlijk geen hoog-risico AI, maar de eindtoepassing wel.

Algemeen risico / minimaal risico — de meeste synthetische data-tools voor marketing of productontwikkeling vallen hier. Dat betekent niet dat er geen verplichtingen zijn, maar de lat ligt lager.

De deployer-verplichtingen die je niet kunt negeren

Als deployer van een AI-systeem dat synthetische data genereert, heb je onder Artikel 26 een aantal basisverplichtingen:

  • Gebruik het systeem alleen voor het beoogde doel zoals beschreven door de aanbieder
  • Zorg voor voldoende AI-geletterdheid bij de mensen die het systeem bedienen (dit staat ook in Artikel 4)
  • Houd toezicht op het systeem tijdens gebruik
  • Meld ernstige incidenten aan de toezichthouder

Artikelen 4 en 26 zijn al van kracht. De verplichting om je medewerkers voldoende AI-kennis bij te brengen geldt nu, niet pas over een jaar.

Voor hoog-risico toepassingen komt daar nog bij: bijhouden wie het systeem gebruikt, logboeken, een grondrechten-impactbeoordeling (FRIA) als de overheid dat verplicht, en in veel gevallen een DPIA onder de AVG.

AVG en AI-verordening: twee sets regels tegelijk

Even serieus: als jouw synthetische data ook maar iets te maken heeft met persoonsgegevens, heb je niet alleen de AI-verordening maar ook de AVG aan je broek. De Autoriteit Persoonsgegevens heeft expliciet aangegeven dat AI-toepassingen die persoonsgegevens verwerken onder beide regimes vallen.

Synthetische data wordt vaak ingezet juist om de AVG te omzeilen: je gebruikt toch geen echte persoonsdata? Maar het genereren van die synthetische data begint wel met echte persoonsdata als trainingsset. De AP kijkt daar kritisch naar. Als de synthetische data herleidbaar is naar individuen, of als de methode om die data te genereren persoonsgegevens verwerkt, dan geldt de AVG gewoon.

De combinatie van beide verordeningen betekent concreet: als je een DPIA moet doen voor de AVG, neem dan meteen de AI-verordening-risico's mee. Dat scheelt werk en voorkomt dat je twee aparte trajecten opzet voor hetzelfde systeem.

Praktisch: hoe inventariseer je dit?

Stap één is weten wat je in huis hebt. Maak een lijst van alle tools en diensten die in jouw organisatie data aanmaken, simuleren of augmenteren. Vraag per tool aan de leverancier: valt dit product onder de EU AI-verordening, en zo ja, in welke risicocategorie?

Leveranciers die hun zaakjes op orde hebben, kunnen je dat vertellen. Leveranciers die dat niet kunnen, zijn een risico op zich. Artikel 26 stelt namelijk dat jij als deployer verantwoordelijk bent voor correct gebruik, ook als je de tool van een ander afneemt.

Stap twee: bepaal voor elke tool het gebruik. Hetzelfde synthetische data-systeem kan voor de ene toepassing minimaal risico zijn, en voor een andere toepassing raken aan hoog-risico categorieën.

Stap drie: zorg dat de mensen die met deze tools werken weten wat ze doen. Artikel 4 over AI-geletterdheid is geen soft vereiste. Het betekent dat jij als organisatie aantoonbaar investeert in kennis bij de mensen die AI-systemen bedienen.

Eén actie voor deze week

Pak je lijst van data-tools erbij, of maak die lijst nu als je hem nog niet hebt. Zet er per tool bij: genereert dit systeem nieuwe data op basis van bestaande data? Als het antwoord ja is, vraag dan deze week aan de leverancier of het product onder de AI-verordening valt en in welke categorie. Dat gesprek hoort nu plaats te vinden, niet als de deadline nadert.

Wil je weten hoe jouw organisatie er nu voor staat? De gratis 2-minuten compliance-check op comply.khairos.ai geeft je een eerste beeld van waar je staat en wat de volgende stap is.

Hulp nodig bij compliance?

De gratis 2-minuten compliance-check laat je direct zien waar je gaten zitten. Geen e-mailadres nodig om je score te zien.

Start de gratis check →