Anthropic pievieno neredzamas ūdenszīmes Kloda AI ģenerētajam tekstam, ko var noteikt pat pēc tā kopēšanas un ielīmēšanas

Vai tas ir AI ģenerētā teksta beigu sākums, kā mēs to zinām?

Kopš ChatGPT palaišanas pirms gandrīz četriem gadiem AI ģenerētā teksta apjoms ir strauji pieaudzis, veicinot prognozes, ka mašīnu ģenerēts saturs galu galā varētu pārspēt cilvēku radīto tekstu visā internetā. Viena no šīs izaugsmes noteicošajām iezīmēm ir bijusi tas, cik viegli AI rakstīšana var atstāt tērzēšanas robotu un saplūst ar visu pārējo tiešsaistē. Nokopējiet atbildi no Kloda, ielīmējiet to e-pastā, rakstā, dokumentā vai vietnē, un savienojums ar AI, kas to ģenerēja, varētu faktiski pazust.

Anthropic gatavojas apstrīdēt šo pieņēmumu.

Kopējiet tekstu no Kloda un ielīmējiet to kaut kur citur, un tagad kopā ar to varētu nākt kaut kas neredzams.

Anthropic šodien paziņoja, ka tā pievieno mašīnlasāmas ūdenszīmes tieši tekstam, ko ģenerē atbalstītie Claude modeļi, radot neredzamu signālu, kas var pārvietoties kopā ar vārdiem pēc tam, kad tie atstāj Claude. Uzņēmums saka, ka ūdenszīme nemaina atbildes nozīmi, kvalitāti vai lasāmību un var izturēt dažus rediģēšanas darbus.

Šis solis ir daļa no Anthropic īstenotās pārredzamības prasības, kas saistītas ar Eiropas Savienības AI likumu. Tomēr tā sasniedzamība sniedzas tālu ārpus Eiropas. Anthropic saka, ka marķējumi attieksies uz atbalstītajiem Claude modeļiem visur, kur tie tiek piedāvāti visā pasaulē.

“Jaunie modeļi iezīmēs AI radīto saturu jau no pirmās dienas,” sacīja Anthropic. “Claude modeļi, kas ES izlaisti 2026. gada 2. augustā vai vēlāk, atbalstīs mašīnlasāmu marķējumu izlaišanas brīdī. Ģenerētajā tekstā būs iegultas ūdenszīmes, un ģenerētajos failos tiks iekļauti digitāli parakstīti izcelsmes metadati, ja tie tiks atbalstīti.”

Marķējumi attieksies uz Claude Platform, Anthropic’s API, Claude, Claude Code, Claude Cowork un Claude Tag. Saskaņā ar Anthropic sniegtajiem atbalstītajiem Claude modeļiem, kuriem var piekļūt, izmantojot AWS, Google Cloud vai Microsoft Foundry, būs arī iegultas teksta ūdenszīmes.

Tas padara to vairāk nekā etiķeti, kas ievietota Claude saskarnē. Anthropic saka, ka ūdenszīme tiek lietota modeļa līmenī, ļaujot tai palikt daļai no ģenerētā teksta neatkarīgi no tā, kurš atbalstītais Claude produkts to radījis.

Neredzama ūdenszīme, kas seko tekstam

Anthropic satura atzīmēšanai izmanto divas dažādas metodes. Teksts saņem iegultu ūdenszīmi. Atbalstītie faili, tostarp PNG, JPG un SVG faili, var saņemt digitāli parakstītus izcelsmes metadatus, kuru pamatā ir satura izcelsmes un autentiskuma koalīcija jeb C2PA, atvērtais standarts.

“Kad atbalstīts Kloda modelis ģenerē tekstu, tas ieauž nemanāmu ūdenszīmi tieši pašā tekstā,” sacīja Anthropic. “Jūs to neredzēsit, un tas nemaina Kloda atbildes nozīmi, kvalitāti vai lasāmību.”

Kopēšanas un ielīmēšanas darbība padara sistēmu īpaši interesantu.

“Tā kā ūdenszīme ir daļa no teksta, tā tiks pārvietota kopā ar tekstu, kad tā tiks kopēta un ielīmēta citur, un tā var saglabāties dažu rediģēšanas laikā,” sacīja uzņēmums.

Antropiskie plāni sniegt lietotājiem un trešajām pusēm veidu, kā noteikt tā zīmes. Tehniskā informācija par šiem noteikšanas mehānismiem joprojām tiek sniegta, atstājot neatbildētu vienu galveno jautājumu: kā tieši Anthropic iestrādā ūdenszīmi ģenerētajā valodā.

Ir ierobežojumi, un tiem ir nozīme.

Kloda ūdenszīmes atrašana nepierāda, ka Klods sākotnēji rakstīja materiālu. Cilvēks var kaut ko uzrakstīt pats un izmantot Klodu, lai to labotu, tulkotu, apkopotu vai pārformatētu. Iegūtais teksts varētu saturēt Kloda zīmi, neskatoties uz idejām un oriģinālajiem rakstiem, kas nāk no cilvēka.

Ir arī otrādi. Ja ūdenszīme netiek atklāta, tas nepierāda, ka kaut ko ir uzrakstījusi persona.

Anthropic saka, ka smaga rediģēšana, pārfrāzēšana, tulkošana, Kloda izvades sajaukšana ar citiem rakstiem vai pārāk īsu fragmentu izmantošana var padarīt ūdenszīmi grūti vai neiespējamu noteikt. Vecākiem Claude modeļiem var nebūt marķēšanas atbalsta. Failu izcelsme var pazust, izmantojot ekrānuzņēmumus, formātu konvertēšanu vai citus procesus, kas noņem metadatus.

Šie brīdinājumi atšķir Anthropic pieeju no pretrunīgi vērtētajiem AI rakstīšanas detektoriem, kas mēģina uzminēt, vai teksts nāk no mašīnas. Anthropic rada signālu savā izvadē, nevis lūdz detektoram secināt autorību tikai no rakstīšanas modeļiem.

Šī politika izriet no ES MI likuma 50. panta 2. punkta prakses kodeksa par mākslīgā intelekta radīta satura pārskatāmības parakstīšanas antropiski. Claude modeļi, kas ES izlaisti 2026. gada 2. augustā vai vēlāk, tiek segti no izlaišanas brīža, un Anthropic saka, ka tā strādā, lai nodrošinātu marķēšanas atbalstu modeļiem, kas izlaisti pirms šī datuma.

Miljoniem cilvēku, kuri izmanto mākslīgā intelekta ģenerētu tekstu, šīs izmaiņas var padarīt vienu no visparastākajām skaitļošanas darbībām daudz nozīmīgāku. Kloda vārdu kopēšana drīzumā var nozīmēt arī kaut kā cita kopēšanu: neredzamu taku, kas parāda, ka teksts ir izgājis cauri AI.

Nokrišņi: kā Anthropic neredzamās ūdenszīmes varētu sagraut AI noteikšanas nozari

Lielāka nokrišņu ietekme var būt jūtama ārpus Antropiskā laika. AI teksta noteikšanas jomā ir izveidojusies vesela nozare, kurā uzņēmumi pārdod programmatūru skolām, izdevējiem, darba devējiem un citām organizācijām, kas vēlas noteikt, vai rakstīšanu veidoja AI. Šīs sistēmas parasti analizē tekstu un novērtē iespējamību, ka mašīna to ir ģenerējusi.

Kloda ūdenszīmju pieeja varētu mainīt šo vienādojumu. Tā vietā, lai lūgtu trešās puses detektoram secināt, vai Klods ir iesaistīts, lietotāji galu galā varēja pārbaudīt, vai nav mašīnlasāma signāla, ko apzināti ir iegulusi pati Anthropic.

Šī atšķirība kļūst īpaši nozīmīga organizācijām, kuru standarts ir tāds, ka iesniegtajam darbam jābūt pilnībā cilvēka rakstītam bez ģeneratīvas AI palīdzības. Antropiski brīdina, ka tās ūdenszīmes noteikšana nepierāda, ka materiāla sākotnēji bija Klods. Klods varēja labot, tulkot, apkopot vai rediģēt cilvēka rakstītu tekstu. Tomēr saskaņā ar stingru politiku bez AI šī atšķirība var būt mazāk svarīga. Ja Klods apstrādāja galīgo tekstu, bija iesaistīts mākslīgais intelekts.

Tiešos draudus AI noteikšanas uzņēmumiem ierobežo pašas ūdenszīmes nepilnības. Anthropic saka, ka intensīva rediģēšana, pārfrāzēšana, tulkošana un citas izmaiņas var padarīt signālu nenosakāmu, un vecākiem Claude modeļiem var nebūt marķēšanas atbalsta. Atklāšanas uzņēmumi joprojām varētu analizēt neatzīmētu tekstu vai attīstīties par pakalpojumiem, kas pārbauda vairākas izcelsmes sistēmas.

Lielāks jautājums ir par to, kas notiek, ja Anthropic ir tikai sākums. Ja OpenAI, Google, Meta un citi lielākie mākslīgā intelekta nodrošinātāji izmantos salīdzināmus mašīnlasāmus teksta marķējumus, AI rakstīšanas noteikšana varētu pāriet no varbūtības minējumiem uz signālu pārbaudi, ko tur ievietojuši paši modeļu veidotāji.

Tas varētu likt mūsdienu AI noteikšanas uzņēmumiem no jauna izgudrot sevi kā izcelsmes platformas, nevis AI rakstīšanas detektorus.

Gandrīz četrus gadus internets kopētu AI tekstu ir izturējis tāpat kā jebkuru citu tekstu. Antropisks ir derības, ka vārdiem var būt līdzi vēsture. Ja šī ideja kļūs par nozares standartu, sekas varētu sasniegt daudz tālāk par Klodu.