ChatGPT teksts Eiropā iegūst neredzamu ūdenszīmi, lai atbilstu ES AI likumam. Lūk, kā tas darbojas

OpenAI pievieno neredzamas ūdenszīmes piemērotajam ChatGPT un Codex tekstam Eiropas Savienībā, lai nodrošinātu atbilstību jaunajām pārredzamības prasībām saskaņā ar ES AI likumu.

Izlaišana sāksies nākamo nedēļu laikā un attieksies uz visiem ChatGPT un Codex plāniem ES. OpenAI citur pēc noklusējuma saglabā teksta ūdenszīmes izslēgtas, lai gan API klienti visā pasaulē var izvēlēties atsevišķus modeļus, sākot no šodienas.

Pārcelšanās notiek mazāk nekā divus mēnešus pēc tam, kad Anthropic ieviesa neredzamās ūdenszīmes atbalstītajiem Kloda modeļiem saskaņā ar tiem pašiem ES noteikumiem. Anthropic saka, ka tā ūdenszīme ir iegulta tieši ģenerētajā tekstā, ļaujot signālam pārvietoties kopā ar tekstu, kad tas tiek kopēts un ielīmēts citur, un, iespējams, izturēs dažas rediģēšanas iespējas.

“Mēs paplašinām savu pieeju satura izcelsmei, iekļaujot tekstu, reaģējot uz ES normatīvajām prasībām, vienlaikus atzīstot pašreizējās teksta ūdenszīmju tehnoloģijas būtiskos ierobežojumus,” teikts OpenAI ziņā X.

Uzņēmums tehnoloģiju sauc par tekstuGrauds. Tā vietā, lai ievietotu redzamas etiķetes, slēptās rakstzīmes vai metadatus, textGrain maina statistisko vārdu izvēli, ko modelis veic ģenerēšanas laikā. Pēc tam detektors var analizēt fragmentu un novērtēt, vai tajā ir OpenAI ūdenszīme.

Atslēgas vārds ir aplēse.

“Mūsu rīki jau palīdz pārbaudīt, vai ar mūsu modeļiem tika izveidots attēls vai audio fails. Šis darbs ir balstīts uz šiem centieniem, lai palīdzētu cilvēkiem labāk saprast, kad saturs, iespējams, ir ģenerēts vai rediģēts, izmantojot OpenAI modeli. ES mēs sāksim lietot ūdenszīmes piemērotu tekstu no ChatGPT un Codex tuvāko nedēļu laikā, lai nodrošinātu atbilstību ES AI likumam. Klienti, kas izmanto mūsu API, jau šodien var ieslēgt teksta ūdenszīmes atsevišķiem modeļiem visā pasaulē.

Tomēr OpenAI saka, ka teksta ūdenszīmēm joprojām ir lieli ierobežojumi, it īpaši, ja teksts ir saīsināts, pārrakstīts, tulkots vai smagi rediģēts. Tas padara ieviešanu tikpat daudz par AI izcelsmes eksperimentu, kā arī atbilstības pasākumu.

Pēc rediģēšanas ūdenszīme var ātri pazust

OpenAI testi parāda, cik trausls var kļūt signāls.

400 marķieru fragmentiem tā detektors aptuveni 92% gadījumu testa apstākļos identificēja tekstu ar ūdenszīmi. Aizstājot tikai 10% vārdu ar sinonīmiem, noteikšanas līmenis samazinājās līdz 66%. Aizstājot 25%, tas samazinājās līdz 17%.

Arī teksta garumam ir nozīme. Ar mērķa viltus pozitīvo likmi 1%, detektors atrada ūdenszīmes aptuveni 80% 200 marķieru psiholoģijas fragmentu un aptuveni 95% no 400 marķieru fragmentiem.

Matemātikas sniegums bija daudz vājāks, jo modeļiem ir mazāka brīvība izvēlēties alternatīvus vārdus un frāzes.

Šim ierobežojumam ir daudz vairāk nekā akadēmiskās pārbaudes. Lietotāji, redaktori, tulkošanas rīki un citas AI sistēmas pirms publicēšanas regulāri pārraksta AI ģenerētu tekstu. Ūdenszīme, kas labi darbojas uz neskartas izvades, pēc vairākām pārskatīšanas kārtām var izskatīties pavisam citādi.

Rezultātā OpenAI izmanto piesardzīgu pieeju noteikšanai. Uzņēmums atver lietojumprogrammas savam detektoram, taču sākotnēji piekļuve būs ierobežota ar apstiprinātiem pētniekiem un ekspertu organizācijām.

Sabiedrība palaišanas laikā nesaņems OpenAI teksta ūdenszīmju pārbaudītāju.

OpenAI saka, ka lēmums atspoguļo gan viltus pozitīvu, gan viltus negatīvu risku.

Ūdenszīme nepierāda, kurš uzrakstīja tekstu

OpenAI velk asu līniju ap to, ko tā ūdenszīme var noteikt.

Atklāts signāls var norādīt, ka OpenAI sistēma ģenerēja vai apstrādāja fragmenta daļu. Tas nevar atklāt, kas izmantoja modeli, kurš konts ģenerēja tekstu, kāda uzvedne tika ievadīta vai kurā sarunā tas tika izveidots.

Tas nevar noteikt autortiesību īpašumtiesības vai juridisku atbildību. Tas nevar noteikt, vai teksts ir precīzs. Tas nevar izmērīt, cik liela daļa gala darba ir no cilvēka rakstnieka vai redaktora.

Arī otrādi ir nozīme.

Ja OpenAI detektors neatrod ūdenszīmi, tas nepierāda, ka tekstu ir uzrakstījis cilvēks. Rakstu fragments varēja būt rediģēts, tulkots, saīsināts, ģenerēts ar neatbalstītu modeli, izveidots pirms ūdenszīmju sākšanas vai arī to ir sagatavojis cits AI nodrošinātājs.

OpenAI saka, ka textGrain nav izraisījis nozīmīgu kritumu tās jaunākā modeļa Astra iekšējā etalonpārbaudē. Rezultāti nedaudz mainījās abos virzienos atkarībā no etalona.

Uzņēmums plāno publicēt vairāk tehniskas detaļas un galu galā izlaist ūdenszīmju tehnoloģiju kā atvērtā koda.

Pagaidām ES ieviešana rada neparastu sadalījumu OpenAI ģenerētā teksta apstrādē. ChatGPT un Codex lietotāji Eiropā sāks saņemt piemērotu tekstu ar iebūvētu neredzamo signālu. Lietotāji citur to nesaņems, ja vien izstrādātāji neizvēlēsies ieslēgt ūdenszīmes, izmantojot API.

Šī atšķirība atspoguļo AI regulējuma virzību.

Eiropa pāriet no lūguma AI uzņēmumiem atklāt, kā darbojas to sistēmas, un pieprasa mašīnlasāmus signālus dažā no šo sistēmu radītā satura.

OpenAI atbilst prasībām, taču tā skaitļi skaidri parāda vienu lietu: neredzama ūdenszīme var palīdzēt atbildēt, vai modelis, iespējams, pieskārās teksta daļai. Tas ir tālu no galīga testa par to, kurš to patiesībā uzrakstīja.