Boris.
AI DAGELIJKS

AI-trainingsdata: Microsoft noemt scraping 'grootste diefstal'

18 september 2026 | Boris Kusters
Inhoud
AI-trainingsdata: Microsoft noemt scraping 'grootste diefstal'

Microsoft noemde AI-scraping intern niet een zakelijk geschil, maar diefstal. Nieuwe onverzegelde rechtbankstukken laten zien dat een topman van Microsoft de manier waarop trainingsdata voor ChatGPT werd verzameld omschreef als de grootste diefstal van arbeid in de menselijke geschiedenis. En dat terwijl Microsoft zelf meedeed: beide bedrijven haalden artikelen achter de betaalmuur van The New York Times weg om er datasets mee te bouwen, en wisten intern dat dit uitgevers financieel kon slopen.

Voor jou als ondernemer is dit geen ver-van-je-bedshow. Gebruik je ChatGPT, Copilot of een ander AI-model in je bedrijf, dan werk je met software die gebouwd is op data waarover de makers zelf twijfelden of het wel mocht. Dat raakt aan auteursrecht, aan aansprakelijkheid van jouw kant als je AI-content commercieel inzet, en aan het vertrouwen dat klanten hebben in wat je met AI maakt.

In dit artikel: wat er precies uitlekte, waarom het meer is dan een welles-nietes tussen twee techreuzen, en wat je er praktisch mee doet in je eigen bedrijf.

Wat staat er precies in de vrijgegeven rechtbankstukken?

De rechtszaak zelf loopt al sinds eind 2023: The New York Times klaagde OpenAI en Microsoft aan wegens auteursrechtinbreuk, met als kern dat beide bedrijven miljoenen artikelen zonder toestemming gebruikten om ChatGPT te trainen. Deze week werden delen van de rechtbankstukken die eerst zwartgelakt waren, alsnog openbaar. Daaruit blijkt dat interne Microsoft-communicatie veel verder ging dan de nette juridische taal die het bedrijf publiekelijk gebruikt.

Een Microsoft-directeur noemde de schaal van het datascrapen door AI-bedrijven letterlijk de grootste diefstal van arbeid in de menselijke geschiedenis, blijkt uit interne mails en chats die nu zijn vrijgegeven. Tegelijkertijd tonen dezelfde stukken dat Microsoft zelf meewerkte aan het opbouwen van datasets uit betaalde New York Times-content, en intern besefte dat dit uitgevers financieel zou kunnen ruineren.

Waarom dit meer is dan een welles-nietes tussen techbedrijven

Dit is meer dan een pittige interne opmerking die nu genant uitpakt. Het toont dat beide bedrijven wisten dat hun aanpak juridisch en ethisch risicovol was, er toch mee doorgingen, en er vervolgens producten mee bouwden die ze aan miljoenen bedrijven verkopen. Vergelijk het met een leverancier die weet dat een onderdeel niet legaal is ingekocht, het toch verwerkt, en het eindproduct daarna gewoon aan jou factureert.

Het past ook in een breder patroon van wantrouwen. Onderzoek van Pew Research, besproken door The Verge, laat zien dat mensen in 34 van de 37 onderzochte landen eerder verwachten dat AI de komende twintig jaar banen kost dan dat het ze oplevert. Een Microsoft-exec die scraping zelf diefstal van arbeid noemt, bevestigt precies die angst, met de eigen woorden van de bedrijven die de modellen bouwen.

Wat betekent dit voor jouw MKB als ChatGPT- of Copilot-gebruiker

Gebruik je zelf ChatGPT, Copilot of een vergelijkbaar model om teksten, code of afbeeldingen te maken voor je bedrijf, dan ben je niet automatisch aansprakelijk omdat de onderliggende trainingsdata omstreden is. Maar het juridische landschap rond eigendom en gebruik van AI-output is nog volop in beweging, en dat is precies het probleem: niemand kan je vandaag garanderen hoe rechters hier over vijf jaar over oordelen.

Microsoft biedt zakelijke Copilot-klanten wel een vorm van bescherming via de Copilot Copyright Commitment: bij een auteursrechtclaim over Copilot-output neemt Microsoft in veel gevallen de juridische kosten voor zijn rekening, mits je de ingebouwde veiligheidsfilters gebruikt. OpenAI kent vergelijkbare toezeggingen voor zakelijke klanten. Check dus of jouw contract zo'n vrijwaring bevat voordat je blind op AI-output vertrouwt.

AVG, EU AI Act en wat dit voor Nederlandse ondernemers betekent

Deze zaak speelt zich af onder Amerikaans auteursrecht, maar heeft ook een Europese kant. De EU AI Act verplicht aanbieders van general-purpose AI-modellen om een samenvatting te publiceren van de content waarmee ze trainen, juist om dit soort verborgen praktijken zichtbaarder te maken. En als er persoonsgegevens tussen die gescrapete data zaten, raakt dit ook aan de AVG: data van EU-burgers verwerken zonder rechtsgrond is en blijft een probleem, ongeacht wie het doet.

Voor een Nederlandse MKB'er, of je nu in Enschede zit of ergens anders, betekent dit vooral: wees kritisch op de AI-tools die je inzet en durf je leverancier vragen te stellen over waar de data vandaan komt. Klanten en toezichthouders accepteren steeds minder het antwoord dat je het gewoon niet weet.

Wat kun je nu concreet doen

Bouw niet je hele marketing of dienstverlening op een AI-leverancier, laat AI-gegenereerde content altijd door een mens controleren voordat die naar buiten gaat, en vraag je AI-leverancier expliciet naar een auteursrechtelijke vrijwaring. Blijf ook de ontwikkelingen in deze rechtszaak volgen: de uitkomst kan gevolgen hebben voor prijzen, beschikbaarheid en functies van de tools die je nu gebruikt.

Wat dit betekent voor jou

Dit nieuws verandert niets aan wat ChatGPT of Copilot morgen voor je kan doen. Het verandert wel hoeveel vertrouwen je blind aan die tools mag geven. De bedrijven die deze modellen bouwen wisten zelf dat hun databronnen op zijn minst twijfelachtig waren, en bouwden er producten mee die ze nu aan jou verkopen als vanzelfsprekend en veilig.

Als MKB'er hoef je AI niet te laten liggen. Je moet wel volwassen met de risico's omgaan: contracten checken, output laten controleren, en niet je hele bedrijfsvoering op een leverancier bouwen. Dat is precies het soort strategisch werk waar ik bedrijven in Enschede en daarbuiten mee help.

Werkt deze AI-ontwikkeling door in jouw bedrijf? een korte sparring boeken.

Veelgestelde vragen
Wat is er precies uitgelekt in de rechtszaak tegen Microsoft en OpenAI?

Onverzegelde rechtbankstukken uit de auteursrechtzaak van The New York Times tonen interne Microsoft-communicatie waarin een topman de schaal van AI-datascraping de grootste diefstal van arbeid in de menselijke geschiedenis noemt, terwijl Microsoft zelf meewerkte aan het scrapen van betaalde NYT-content voor trainingsdata.

Mag ik ChatGPT-output commercieel gebruiken als de trainingsdata omstreden is?

Ja, in de praktijk gebruiken bedrijven wereldwijd AI-output al commercieel. Je bent niet automatisch aansprakelijk voor hoe een model getraind is. Wel is het verstandig te checken of je AI-leverancier een auteursrechtelijke vrijwaring biedt, zodat jij niet het risico draagt bij een eventuele claim.

Wat houdt de Copilot Copyright Commitment van Microsoft in?

Dit is een toezegging waarbij Microsoft de juridische kosten op zich neemt als een zakelijke Copilot-klant wordt aangeklaagd wegens auteursrechtinbreuk door Copilot-output, mits de klant de ingebouwde beveiligingsfilters van de tool gebruikt.

Hoe verhoudt dit zich tot de rechtszaak van Sony en Warner tegen Anthropic?

Beide zaken draaien om dezelfde kernvraag: mogen AI-bedrijven auteursrechtelijk beschermd materiaal gebruiken om modellen te trainen zonder toestemming of vergoeding. Bij Anthropic ging het om muziek en songteksten, bij Microsoft en OpenAI om journalistiek van The New York Times.

Valt AI-datascraping ook onder de AVG?

Als de gescrapete data persoonsgegevens van EU-burgers bevat, zoals namen in artikelen of reacties, dan geldt de AVG wel degelijk. Verwerking zonder geldige rechtsgrond blijft een probleem, los van of het om Amerikaans auteursrecht of Europese privacywetgeving gaat.

Wanneer wordt deze rechtszaak waarschijnlijk beslist?

Er is nog geen uitspraak. Dit soort auteursrechtzaken tegen grote techbedrijven duurt vaak jaren, en eindigt regelmatig in een schikking in plaats van een rechterlijk vonnis. Houd de ontwikkelingen in de gaten als je zwaar leunt op ChatGPT of Copilot.

Lees ook
Bronnen
  1. techcrunch.com
  2. theverge.com

Liever wekelijks een ruimere samenvatting? Lees ook de wekelijkse AI Quickread.

Gepubliceerd 2026-09-18T06:05:33+02:00