OpenAI zet onzichtbaar watermerk in ChatGPT- en Codex-tekst in de EU
OpenAI gaat onzichtbare watermerken toevoegen aan tekst die ChatGPT en Codex in de Europese Unie produceren. Het bedrijf kondigde dat aan in een uitleg over zijn aanpak van de EU-regels rond tekstherkomst; BleepingComputer berichtte er op 5 oktober over.
Geen onzichtbare tekens, maar woordkeuze
Het watermerk is niet te zien als je de tekst leest of kopieert. De techniek, die OpenAI textGrain noemt, verstopt geen speciale tekens in de uitvoer. In plaats daarvan stuurt het model zijn eigen woordkeuze: staan er meerdere woorden die even goed passen, dan kiest textGrain er stelselmatig een op zo'n manier dat er een statistisch patroon ontstaat. Een detector kan later in een stuk tekst naar dat patroon zoeken.
"Over the coming weeks, we will add an invisible watermark to eligible ChatGPT and Codex text output in the European Union", schrijft OpenAI. Dat Codex er expliciet bij staat is relevant voor ontwikkelaars: ook gegenereerde code valt onder de maatregel.
Wereldwijd wordt het voorlopig geen standaard. API-klanten kunnen het vanaf nu zelf aanzetten voor ondersteunde modellen, maar in de API staat watermerken standaard uit. OpenAI opent daarnaast een aanmeldprocedure voor zijn detector. Die toegang blijft in eerste instantie beperkt tot goedgekeurde onderzoekers en vakorganisaties die kunnen helpen de techniek te beoordelen en verbeteren.
De directe aanleiding is de AI-verordening van de EU, die aanbieders van generatieve AI verplicht gegenereerde tekst machinaal herkenbaar te maken.
OpenAI is zelf open over de zwakke plek
Het opvallendste aan de aankondiging is hoe uitdrukkelijk OpenAI de grenzen van de techniek benoemt. Uit eigen tests blijkt dat vrij alledaags bewerken de herkenbaarheid flink aantast. "In an evaluation of 400-token passages, replacing 10% of words with synonyms reduced detection from about 92% to 66%. Replacing 25% of words reduced it to 17%", meldt het bedrijf.
Ook de lengte van een fragment telt zwaar mee. Bij een nagestreefde fout-positieve score van één procent vond OpenAI het watermerk in ongeveer 80 procent van de antwoorden van 200 tokens op psychologievragen, tegen ruwweg 95 procent bij 400 tokens. Voor onderwerpen als wiskunde is de detectie nog zwakker, simpelweg omdat het model daar minder ruimte heeft om tussen gelijkwaardige woorden te kiezen. Dat laatste is een aandachtspunt voor code en technische documentatie, waar de formulering vaak vastligt.
OpenAI waarschuwt dan ook tegen het omgekeerde gebruik van de detector: "The absence of a detected watermark does not prove human authorship." Tekst kan te kort zijn, bewerkt of vertaald, en dan werkt de detectie niet betrouwbaar. Een aangetroffen watermerk zegt bovendien niets over wie de tekst maakte, via welk account, met welke prompt of in welk gesprek. Het laat ook niet zien welk deel een mens zelf heeft geschreven of herschreven.
Kwaliteit blijft volgens OpenAI gelijk
Een voor de hand liggende zorg bij het sturen van woordkeuze is dat de uitvoer slechter wordt. Volgens OpenAI gebeurt dat niet in betekenende mate bij GPT-6 Astra: de benchmarkresultaten blijven grotendeels vergelijkbaar met textGrain aan.
Daarmee staat er een maatregel die vooral als herkomstsignaal werkt voor wie niets probeert te verhullen, en die juist faalt bij wie wel moeite doet. Voor het aantonen van AI-gebruik in bijvoorbeeld schoolwerk of sollicitaties is het dus geen sluitend bewijsmiddel.