AI-trainingsdata diefstal: risico's voor jouw MKB
Inhoud
Deze week doken er nieuwe, ongecensureerde rechtbankstukken op in de auteursrechtzaak van The New York Times tegen Microsoft en OpenAI. Daaruit blijkt dat een Microsoft-topman intern sprak over "de grootste diefstal van arbeid in de geschiedenis van de mensheid", terwijl zijn eigen bedrijf gewoon meewerkte aan het scrapen van betaalde Times-content om er AI-modellen mee te trainen.
Dat is geen slordige uitspraak van een junior medewerker. Het komt van iemand binnen een bedrijf dat miljarden heeft geïnvesteerd in OpenAI en tot op de dag van vandaag ChatGPT-technologie in Copilot verwerkt. Intern werd gewaarschuwd dat deze praktijk uitgevers financieel kon slopen. Extern bleef het gewoon doorgaan.
Voor jou als ondernemer is dit meer dan een spektakel tussen twee techreuzen. Elke AI-tool die je gebruikt, van ChatGPT tot Copilot tot de contentgenerator in je marketingsoftware, is getraind op data waarvan de herkomst nu openlijk ter discussie staat. Dat raakt aan auteursrecht, aan vertrouwen, en aan de vraag hoe veilig het is om AI-output commercieel in te zetten.
Elke dag AI begrijpen, zonder de hype?
Ontvang de gratis MKB AI Quickstart-gids en mijn nuchtere AI-updates. Uitschrijven met 1 klik.
Wat de vrijgegeven stukken precies laten zien
De zaak loopt al langer: The New York Times klaagt Microsoft en OpenAI aan omdat beide bedrijven volgens de krant miljoenen artikelen zonder toestemming hebben gebruikt om taalmodellen te trainen. Grote delen van de rechtbankstukken waren tot voor kort afgeschermd. Nu zijn ze alsnog openbaar gemaakt, en daaruit blijkt dat medewerkers binnen Microsoft zelf grote twijfels hadden over de aanpak.
Uit interne communicatie blijkt dat er woorden werden gebruikt als 'diefstal', en dat men zich bewust was van de impact op uitgevers en journalisten wier werk zonder vergoeding in trainingsdata belandde. Tegelijkertijd bleven beide bedrijven paywalled content van de Times verzamelen en verwerken in datasets voor eigen modellen.
Dat maakt dit geen incident, maar een patroon: winst en schaalvoordeel wogen intern zwaarder dan de eigen zorgen over de gevolgen voor de makers van de content.
Waarom dit verder reikt dan een rechtszaak tussen techreuzen
Dit is niet de eerste keer dat een AI-bedrijf onder vuur ligt over trainingsdata. Eerder dit jaar sleepten Sony en Warner concurrent Anthropic voor de rechter met vergelijkbare verwijten. Het patroon is steeds hetzelfde: bedrijven bouwen eerst een model met zoveel mogelijk data, en pas achteraf volgt de discussie over wie daar recht op had.
Voor jouw bedrijf is de kern van het probleem dit: als de trainingsdata achter een AI-model juridisch omstreden is, is onduidelijk wat dat betekent voor de output die jij gebruikt. Kun je een tekst die ChatGPT of Copilot voor je schrijft zonder zorgen publiceren, gebruiken in een offerte, of verwerken in klantcommunicatie? Juridisch is dat nog volop in beweging, en dat is precies het probleem: onzekerheid is nooit goed voor iemand die er zakelijk op vertrouwt.
Grote techbedrijven kunnen dit soort rechtszaken jarenlang uitvechten en de kosten absorberen. Een Nederlandse MKB-ondernemer die AI-content publiceert, heeft die luxe niet. Als er ooit een uitspraak komt die zegt dat bepaalde output inbreuk maakt, ben jij degene die het risico droeg terwijl je alleen maar een tool gebruikte.
Wat dit concreet betekent voor jouw AI-gebruik
Dit is geen reden om per direct te stoppen met ChatGPT, Copilot of vergelijkbare tools. Die blijven waardevol voor productiviteit, klantenservice en contentproductie. Wel is het een goed moment om kritischer te kijken naar hoe je AI-output gebruikt, vooral als die dicht tegen bestaand, beschermd werk aan zit.
Let op bij letterlijke overname: laat AI nooit tekst produceren die dicht bij een specifiek bestaand artikel, boek of ander werk ligt en publiceer dat niet zonder controle. Vraag om samenvattingen en eigen bewerkingen in plaats van reproducties.
Check de voorwaarden van je AI-leverancier. Sommige aanbieders bieden inmiddels een vorm van vrijwaring als hun model per ongeluk beschermd materiaal reproduceert. Weet jij of jouw leverancier dat regelt, en onder welke voorwaarden?
Houd een mens in de lus bij content die naar buiten gaat namens je bedrijf. Niet omdat AI per se fout zit, maar omdat jij degene bent die verantwoordelijk blijft als het misgaat.
Een breder patroon: AI-bedrijven onder toenemende druk
Deze zaak staat niet op zichzelf. OpenAI meldde recent zelf zes nieuwe gevallen van onverwacht of zorgwekkend gedrag van zijn modellen, en kondigde aan voortaan zulke incidenten actiever bij te houden en openbaar te maken. Dat is deels reputatiemanagement, maar het laat ook zien dat de druk om transparant te zijn over hoe AI-modellen zich gedragen en zijn gebouwd, flink is toegenomen.
Onderzoek van Pew Research onder ruim 42.000 mensen in 37 landen laat bovendien zien dat in 34 van die landen mensen eerder verwachten dat AI banen kost dan dat het banen oplevert. Onthullingen zoals deze rechtszaak voeden dat wantrouwen: als zelfs de bedrijven die deze modellen bouwen intern spreken over 'diefstal', is het logisch dat het publieke vertrouwen onder druk staat.
Voor jou als ondernemer is dat relevant omdat vertrouwen direct doorwerkt in hoe klanten reageren op AI-gebruik in jouw communicatie. Transparant zijn over waar en hoe je AI inzet, is geen overbodige luxe meer, het wordt een concurrentievoordeel.
Wat je nu concreet kunt doen
Je hoeft niet te wachten tot rechters een definitief oordeel vellen. Een paar praktische stappen beperken je risico nu al aanzienlijk.
Documenteer je eigen contentproces: welk deel is AI-gegenereerd, welk deel is menselijk bewerkt of gecontroleerd. Dat helpt niet alleen juridisch, het maakt je workflow ook overzichtelijker.
Volg de ontwikkelingen rond de EU AI Act. Die verplicht aanbieders van AI-modellen stapsgewijs tot meer transparantie over trainingsdata en risicobeheer. Voor jou als gebruiker betekent dit dat de informatie waarop je keuzes kunt baseren, de komende tijd toeneemt.
En tot slot: bouw niet je hele contentstrategie op één AI-leverancier zonder alternatief. Mocht er onverhoopt een uitspraak komen die het gebruik van bepaalde output beperkt, dan wil je kunnen schakelen zonder dat je bedrijf stilvalt.
Wat dit betekent voor jou
Mijn insteek hierin is nuchter. AI-tools zijn te goed en te nuttig om nu massaal te laten liggen, en dat ga ik ook niet adviseren. Maar deze zaak is wel een signaal dat de fundering onder die tools minder stevig is dan de marketing je doet geloven. Grote techbedrijven wisten donders goed wat ze deden, en bleven toch doorgaan omdat schaal en snelheid zwaarder wogen dan zorgvuldigheid.
Als Nederlandse MKB-ondernemer heb jij niet het juridische budget van Microsoft om zo'n zaak jarenlang uit te vechten. Dus is de praktische les simpel: gebruik AI, maar bouw bewust in waar de grenzen liggen. Controleer output, leg vast wat je doet, en wacht niet tot een rechter je dat leert op het moment dat het je al geld of reputatie heeft gekost. Dat is precies het soort werk waar ik ondernemers in Enschede en daarbuiten mee help: AI slim en verantwoord inzetten zonder dat het een gok wordt.
Werkt deze AI-ontwikkeling door in jouw bedrijf? een korte sparring boeken.
Wat houdt de rechtszaak van The New York Times tegen Microsoft en OpenAI in?
De Times klaagt beide bedrijven aan omdat ze zonder toestemming miljoenen artikelen zouden hebben gebruikt om AI-modellen te trainen. Nieuwe, vrijgegeven rechtbankstukken tonen dat een Microsoft-topman deze praktijk intern zelf 'diefstal' noemde, terwijl het bedrijf er ondertussen aan meewerkte.
Kan ik als MKB aansprakelijk zijn als ik AI-content gebruik die op auteursrechtelijk beschermd materiaal is getraind?
Juridisch is dit nog in ontwikkeling, maar het risico ligt in de praktijk vooral bij letterlijke of zeer herkenbare overname van bestaand werk. Laat AI-output altijd controleren voordat je het publiceert, en vermijd content die te dicht tegen een specifieke bron aanligt.
Wat is het verschil met de rechtszaak van Sony en Warner tegen Anthropic?
Zelfde thema, andere partijen: bij Anthropic ging het om muziekrechten, bij Microsoft en OpenAI om journalistieke content van The New York Times. In beide zaken draait het om de vraag of trainingsdata zonder toestemming van rechthebbenden gebruikt mocht worden.
Moet ik stoppen met ChatGPT of Copilot gebruiken voor mijn bedrijf?
Nee, maar gebruik ze bewuster. Zet AI in voor productiviteit en eerste concepten, houd altijd menselijke controle op wat er daadwerkelijk naar buiten gaat, en check de voorwaarden van je leverancier over aansprakelijkheid.
Wat verandert de EU AI Act aan deze situatie?
De EU AI Act verplicht aanbieders van AI-modellen stapsgewijs om transparanter te zijn over trainingsdata en risico's. Dat lost lopende rechtszaken niet meteen op, maar geeft MKB-ondernemers op termijn meer houvast bij het kiezen van een betrouwbare AI-leverancier.
Hoe herken ik of AI-gegenereerde content een auteursrechtelijk risico vormt?
Let op tekst die opvallend dicht bij een specifiek bestaand artikel, boek of ander werk ligt, vooral bij letterlijke zinnen of unieke feiten zonder eigen bewerking. Laat AI samenvatten en herschrijven in plaats van reproduceren, en controleer opvallende passages handmatig.
Grip op AI, zonder de hype
Ontvang de gratis MKB AI Quickstart-gids plus mijn nuchtere AI-updates. Uitschrijven kan altijd met 1 klik.