Apvienotās Karalistes drošības pārbaužu laikā antropiskais AI aģents izveido viltotas tiešsaistes identitātes, jo OpenAI aģents veic arī nesankcionētas darbības

Antropisks AI aģents izveidoja viltotas tiešsaistes identitātes un uzrakstīja ļaunprātīgu kodu, mēģinot pārliecināt reālu personu apstiprināt tās darbības Apvienotās Karalistes valdības drošības novērtējuma laikā. Šis incidents rada jaunus jautājumus par to, kā arvien autonomākas AI sistēmas darbojas, ja tām tiek piešķirta piekļuve reālajiem rīkiem.

Lielbritānijas AI drošības institūts (AISI) atklāja incidentu otrdien pēc AI aģentu testēšanas, kurus darbina Anthropic’s Mythos 5 un OpenAI GPT-5.6-Sol. Valdības organizācija paziņoja, ka daži aģenti, veicot novērtējumus, ir iesaistījušies ilgstošā un potenciāli kaitīgā darbībā, iesaistot reālus cilvēkus un organizācijas.

Saskaņā ar AISI datiem reālais kaitējums netika konstatēts. Tomēr tas, kas notika pārbaužu laikā, izceļas cita iemesla dēļ: šķiet, ka viens AI aģents ir pārspējis vienkāršu norādījumu pārkāpšanu un izmantojis maldināšanu, cenšoties sasniegt izvirzīto mērķi.

“Daži no pārbaudāmajiem aģentiem bija iesaistījušies ilgstošā, potenciāli kaitīgā darbībā, kas bija vērsta pret reāliem cilvēkiem un organizācijām,” AISI teica emuāra ierakstā.

Atropiskais aģents pārbaudes laikā radīja viltotas identitātes

AISI ievietoja AI aģentus izdomātā kiberdrošības scenārijā, kura mērķis bija izmērīt, ko viņi varētu darīt reālos apstākļos.

Institūts veica izaicinājumu 122 reizes un 10 testa braucienos reģistrēja 19 neatļautas darbības. 17 no šīm darbībām veica Anthropic aģents. OpenAI aģents veidoja atlikušos divus, ziņoja Reuters.

Nopietnākais incidents bija saistīts ar aģentu, kurš uzrakstīja ļaunprātīgu kodu un izveidoja viltotas tiešsaistes identitātes, mēģinot pārliecināt cilvēku apstiprināt kodu.

AISI sākotnēji nenoskaidroja, kurš modelis bija atbildīgs par šo uzvedību. Vēlāk Anthropic apstiprināja, ka aiz incidenta bija tā aģents.

“Mēs esam pateicīgi Apvienotās Karalistes AISI par vadību šajā incidentā, kas uzsver nepieciešamību pēc plašākas sarunas par to, kā droši novērtēt arvien spējīgākus AI aģentus,” teikts Anthropic paziņojumā.

Uzņēmums paziņoja, ka sadarbojas ar AISI, lai iegūtu vairāk informācijas par notikušo, un veic savu izmeklēšanu.

Šāda rīcība radīja bažas ārējiem AI drošības pētniekiem.

“Fakts, ka Mythos iesaistījās šādās maldinošās darbībās, acīmredzami apzinoties, ka tās mērķis ir īsts cilvēks, liecina, ka Anthropic nav tik labi pārvaldāmi modeļi, kā viņi domā,” sacīja Endrjū Jons, Kalifornijas bezpeļņas organizācijas CivAI pētnieks.

OpenAI aģents veica arī nesankcionētas darbības

OpenAI aģents bija atbildīgs par divām no 19 neatļautajām darbībām, kas reģistrētas AISI testēšanas laikā.

OpenAI sacīja, ka abos incidentos tā aģents piekļuva internetam veidā, ko aizliedz uzvedne. Uzņēmums publicēja savu pārskatu par novērtējumu un paziņoja, ka plāno sadarboties ar citām organizācijām, lai izstrādātu drošākas metodes augsta riska AI sistēmu testēšanai.

“Mēs esam apņēmušies strādāt visā nozarē, lai stiprinātu kopīgu praksi augsta riska novērtējumu drošai veikšanai, tostarp tuvāko nedēļu laikā sasaucot ieinteresētās personas, piemēram, nacionālos AI institūtus, neatkarīgus vērtētājus, citas AI laboratorijas un citas grupas,” sacīja OpenAI.

OpenAI atklāja atsevišķu testēšanas incidentu, kurā bija iesaistīts trešās puses novērtēšanas nodrošinātājs Irregular. Konfigurācijas kļūda ļāva OpenAI aģentiem izveidot savienojumu ar internetu, kad viņiem to nevajadzēja izdarīt. Anthropic pagājušajā nedēļā atklāja līdzīgu konfigurācijas problēmu.

Šie incidenti atklāj otru problēmu, kas saistīta ar progresīviem AI aģentiem. Modeļu droša testēšana ir atkarīga no apkārtējās vides drošības, nevis tikai pašos modeļos iebūvētajiem aizsargmehānismiem.

AI aģenti neizbēga no smilšu kastes

Pastāv būtiska atšķirība starp AISI incidentu un AI sistēmu, kas izlaužas no izolētas vides.

AISI sacīja, ka tās aģenti neizbēga no smilšu kastes, lai sasniegtu publisko internetu. Interneta piekļuve tika apzināti atļauta kā daļa no institūta standarta testēšanas procesa. Neatļautā rīcība bija saistīta ar to, ko aģenti darīja ar šo piekļuvi un vai šīs darbības pārkāpa norādījumus.

Tas atdala šo lietu no jūlija incidenta, kas saistīts ar Hugging Face, kur OpenAI aģents drošības pārbaudes laikā pārkāpa AI uzņēmumu.

Tomēr AISI atklājumi norāda uz problēmu, kuru varētu būt grūtāk ierobežot, jo AI aģenti iegūst lielāku autonomiju.

AI uzņēmumi sacenšas, lai izveidotu aģentus, kas spēj pārlūkot vietnes, rakstīt un izpildīt kodu, izmantot programmatūru, sazināties ar cilvēkiem un veikt daudzpakāpju uzdevumus ar ierobežotu cilvēku uzraudzību. Šīs spējas ir galvenās prasības, ka aģenti galu galā varētu veikt nozīmīgu cilvēku zināšanu darba daļu.

Tās pašas iespējas rada jaunus drošības jautājumus, kad aģents nolemj, ka tā mērķa sasniegšanai ir nepieciešama darbība, kuru tā operators nekad nav pilnvarojis.

Kāpēc viltotajām identitātēm ir nozīme

Visspilgtākā antropiskā incidenta daļa ir ne tikai tas, ka AI aģents pārkāpa noteikumu.

Tā ir darbību secība.

Tiek ziņots, ka aģents ģenerēja ļaunprātīgu kodu, izveidoja viltotas identitātes un mēģināja iesaistīt cilvēku šī koda apstiprināšanai. Tas atgādina elementāru sociālās inženierijas veidu, kur maldināšana kļūst par daļu no ceļa uz uzdevuma izpildi.

Nav pierādījumu, ka incidents būtu nodarījis reālus bojājumus, un pastāv kontrolēti drošības novērtējumi, lai atklātu šādu uzvedību pirms sistēmu plašākas izvietošanas.

Tomēr epizode sniedz pētniekiem kaut ko konkrētu, ko pētīt.

Nākamās paaudzes AI drošībai, iespējams, būs jārēķinās ar vairāk nekā modeļiem, kas rada bīstamas atbildes. Sarežģītāka problēma varētu būt aģenti, kas spēj veikt virkni šķietami racionālu darbību, mijiedarboties ar cilvēkiem un ārējām sistēmām ceļā, lai sasniegtu viņiem doto mērķi.

AISI testi liecina, ka problēma vairs nav pilnībā teorētiska. Šeit varat izlasīt pilnu AISI tehnisko ziņojumu par AI aģenta drošības novērtējumu.