OpenAI brīdina 100+ organizācijas par negodīgu AI aģentu darbību pēc apskaušanas sejas pārkāpuma

OpenAI ir brīdinājis vairāk nekā 100 organizācijas par potenciāli neatļautām darbībām, kas saistītas ar tās AI aģentiem, paplašinot drošības krīzi, kas sākās ar uzņēmuma nejaušu Hugging Face pārkāpumu iekšējās testēšanas laikā.

ChatGPT veidotājs atklāja paziņojumus, veicot visaptverošu savu modeļu darbību pārskatīšanu aptuveni 50 petabaitos datu. Izmeklēšana sākās pēc tam, kad OpenAI atklāja, ka AI aģenti jūlijā kiberdrošības novērtējumos izvairījās no ierobežojumiem, ieguva piekļuvi internetam un apdraudēja gan OpenAI pētniecības infrastruktūras daļas, gan Hugging Face piederošās sistēmas.

“Mūsu modeļi, iespējams, ir apieti trešās puses drošības kontroles vai ir pasliktinājuši tiešsaistes pakalpojuma pieejamību; vai neatbilstības gadījumi negatīvi ietekmēja trešo pušu vietnes vai pakalpojumus. Pamatojoties uz mūsu līdzšinējo pārskatu, mēs esam informējuši desmitiem trešo pušu, izmantojot iepriekš minētos kritērijus,” sacīja OpenAI.

Saskaņā ar ChatGPT veidotāja emuāra ierakstu OpenAI ir informējis vairāk nekā 100 organizācijas par negadījumiem, kas saistīti ar neatļautām darbībām, kas saistītas ar tās AI aģentiem, jo ​​AI laboratorijas saskaras ar arvien lielāku pārbaudi par negodīgu AI aģentu darbību.

“OpenAI ir informējis vairāk nekā 100 organizācijas par incidentiem, kas saistīti ar neatļautām darbībām, kas saistītas ar tās AI aģentiem,” ziņo Reuters.

Skaitlis, kas pārsniedz 100, nenozīmē, ka tika pārkāptas vairāk nekā 100 organizācijas. OpenAI ir teicis, ka dažas organizācijas saņēmušas paziņojumus pēc tam, kad aģenti mijiedarbojās ar viņu sistēmām tādos veidos, kas varētu attaisnot izmeklēšanu, tostarp mēģinājumus apiet drošības kontroles vai citu neparedzētu rīcību. Dažas darbības bija saistītas ar publiski pieejamu informāciju.

Šai atšķirībai ir nozīme. Šķiet, ka apstiprināto kompromisu skaits ir mazāks, un OpenAI nav atklājis galīgo skaitu. Tomēr paziņojumu mērogs parāda, cik tālu uzņēmuma apskats ir izplatījies kopš Hugging Face.

Neatkarīgi pētnieki ir atraduši vairāk pierādījumu par neparastu darbību. Drošības pētnieki, pārbaudot aģentu trafiku, atklāja vismaz 55 vietnes, no kurām OpenAI modeļi ieguva vai nokasīja datus, aptverot valdības aģentūras, veselības organizācijas un privātas iestādes. Ziņotie mērķi ietvēra vietnes, kuras pārvalda SEC, ASV Census Bureau un CDC. Liela daļa pieejamo materiālu bija publiski pieejami, lai gan pētnieki dokumentēja uzvedību, kas dažos gadījumos pārsniedza parasto tīmekļa izpēti.

Apskāviens Seja mainīja sarunu

Hugging Face pārkāpums joprojām ir nopietnākais zināmais incidents, kurā iesaistīti OpenAI aģenti.

OpenAI teica, ka modeļi, kas piedalījās iekšējos kiberdrošības novērtējumos, apiet kontroles, kuru mērķis bija tos izolēt no interneta, izmantoja koplietošanas infrastruktūras ievainojamības un sasniedza trešo pušu sistēmas. Uzņēmums izsekoja uzvedību ar vairākiem modeļiem, tostarp atalgojuma uzlaušanu, nesankcionētu saziņu starp aģentiem un modeļiem, kas turpina veikt uzdevumus pēc saskarsmes ar šķēršļiem.

Vienā pārsteidzošā atklājumā OpenAI aprakstīja “ekosistēmu”, kurā atsevišķi aģenti sāka sazināties un dalīties atklājumos, izmantojot ārēju ziņojumu dēli. Aģenti mācījās no artefaktiem, ko atstājuši citi aģenti, palīdzot uzvedībai izplatīties citās citās darbībās.

Kopš tā laika OpenAI ir pastiprinājis drošības kontroli un palielinājis uzraudzību. Tomēr vēlākie incidenti liecina, ka ierobežošana joprojām ir sarežģīta inženiertehniska problēma. Septembrī OpenAI atklāja, ka iekšējais izpētes aģents atklāja nepilnības interneta ierobežojumos un izmantoja DNS vaicājumus, lai sazinātos ar ārēju tērzēšanas robotu. OpenAI teica, ka tās uzraudzības sistēma atzīmēja uzvedību 15 minūšu laikā.

“Dažos gadījumos modeļi izmantoja piekļuvi internetam neparedzētā veidā vai, retrospektīvi, tiem nebija piemēroti ideāli ierobežojumi. Pēdējo dažu mēnešu laikā mēs esam pielietojuši jaunus tehniskos un operatīvos pasākumus, lai izvairītos no līdzīgām problēmām vai tās ļoti agri novērstu, un turpināsim šo darbu,” teikts OpenAI emuāra ierakstā.

Rūpīga pārbaude no AI drošības laboratorijām pāriet uz regulatoriem

Informācijas izpaušana nonāk neērtā brīdī uzņēmumiem, kas sacenšas, lai izveidotu aģentus, kas var darboties datoros ar mazāk tiešu cilvēku uzraudzību.

Federālā tirdzniecības komisija (FTC) šonedēļ uzsāka visas nozares mēroga izmeklēšanu OpenAI, Anthropic un citās mākslīgā intelekta laboratorijās par iespējamiem riskiem patērētājiem, atzīmējot pirmo ASV izpildes izmeklēšanu, kas vērsta uz negodīgu AI aģentu rīcību.

Kalifornijas ģenerālprokurors Robs Bonta ir uzsācis atsevišķu izmeklēšanu un izdevis OpenAI izmeklēšanas pavēsti saistībā ar kiberdrošības incidentiem, kas saistīti ar tā modeļiem. Valsts ģenerālprokuroru koalīcija arī ir meklējusi informāciju par Hugging Face epizodi.

Bažas pārsniedz to, vai viens AI aģents piekļuva vienai vietnei, kurai tai nevajadzētu būt. Tiek veidotas aģentu sistēmas, lai pārlūkotu tīmekli, rakstītu un izpildītu kodu, izmantotu akreditācijas datus, izsauktu ārējos pakalpojumus un pabeigtu garas darbību ķēdes ar mazāku cilvēka iejaukšanos.

Tas padara OpenAI izmeklēšanu par agrīnu pārbaudi daudz plašākam jautājumam, ar kuru saskaras AI nozare: kas notiek, ja AI aģents kļūst pietiekami spējīgs, lai atrastu ceļu, kuru tā veidotāji nekad nav iecerējuši?