Mazāk nekā divus mēnešus pēc tam, kad Ķīnas Z.ai pārsteidza mākslīgā intelekta nozari ar GLM-5.2 — modeli, kas pārspēja OpenAI GPT-5.5 galvenajos etalonos un samazināja atšķirību starp vadošajām ASV mākslīgā intelekta laboratorijām, Ķīnas jaunuzņēmums ir atgriezies ar vēl vienu izaicinājumu robežai.
Šoreiz tā ir kiberdrošība.
Z.ai piektdien paziņoja, ka tā jaunais atvērtā pirmkoda GLM-5.3 modelis ieguvis 84,5% rezultātu vietnē CyberGym, etalonā, kas pārbauda AI modeļa spēju pārbaudīt kodu, atrast programmatūras ievainojamības un pārbaudīt, vai trūkumi ir patiesi. Tas nedaudz pārsniedza 83,8% rezultātu, ko Z.ai ziņoja par Anthropic ierobežotās piekļuves Mythos 5 modeli.
Ķīnas uzņēmums Z.ai saka, ka GLM-5.3 pārspēj Anthropic’s Mythos 5 AI ievainojamības noteikšanā

Rezultāts nenozīmē, ka GLM-5.3 kopumā ir apsteidzis Mythos 5. Anthropic modelim joprojām bija ievērojams pārsvars, pārvēršot atklātās ievainojamības par darba izmantošanu. Taču, ņemot vērā GLM-5.2 spēcīgo uzstāšanos salīdzinājumā ar vadošajiem ASV modeļiem, jaunākie rezultāti pastiprina tendenci, kuru kļūst arvien grūtāk noraidīt: Ķīnas populārākie atvērtā pirmkoda mākslīgā intelekta modeļi spēj novērst plaisu ātrāk, nekā daudzi gaidīja.
“Mēs novērtējam GLM-5.3, izmantojot trīs etalonus, kas aptver dažādus ievainojamības analīzes un izmantošanas posmus. Programmā CyberGym, kas sākas ar balto avota kodu un pārbauda, vai modelis var identificēt un apstiprināt ievainojamības, izraisot kļūdas, GLM-5.3 novērtē 84,5%, salīdzinot ar GLM-7.2 labāko rezultātu, kas ir%sbench.2. Mythos 5 (83,8%) un GPT-5.6 Sol (83,6%),” GLM-5.3 izlaiduma lapā sacīja Z.ai.


Z.ai apgalvojumi nav neatkarīgi pārbaudīti.
Plaisa kļūst skaidrāka, kad modeļi pāriet no ievainojamību atrašanas uz to izmantošanu. Vietnē ExploitBench GLM-5.3 ieguva 54,4%, salīdzinot ar 78,0% Mythos 5. Atsevišķā laika testā Z.ai teica, ka GLM-5.3 pabeidza 105 uzbrukuma izstrādes uzdevumus divās stundās un 130 – sešās stundās. Tajā pašā laika posmā Mythos 5 pabeidza 181 un 247 uzdevumus.
Vietnē ExploitBench, kas prasa dziļāku argumentāciju par reālām ievainojamībām un to izmantošanu, GLM-5.3 sasniedz 54,4%, vairāk nekā divkāršojot GLM-5.2 24,4%, savukārt Mythos 5 un GPT-5.6 Sol punktu skaits ir attiecīgi 78,0% un 76,5%. Programmā ExploitGym, kas mēra, cik ekspluatācijas uzdevumus modelis var izpildīt ar laiku normalizētu budžetu, GLM-5.3 pabeidz 105 uzdevumus divu stundu laikā un 130 uzdevumus sešu stundu laikā, salīdzinot ar 29 un 39 GLM-5.2; budžeti tiek normalizēti dažādos modeļos, izmantojot katra modeļa caurlaides skaitļus, kas detalizēti aprakstīti zemsvītras piezīmēs. Mythos 5 joprojām ir krietni priekšā ar 181 un 247 uzdevumiem.
Šai atšķirībai ir nozīme. Drošības nepilnību atrašana un funkcionālas izmantošanas izveide ir ļoti atšķirīgas iespējas, un pēdējai ir daudz lielāka iespēja ļaunprātīgi izmantot.
Anthropic ir saglabājis Mythos, sava Claude Fable 5 modeļa versiju, kurā ir noņemti noteikti kiberdrošības aizsardzības līdzekļi, aiz ierobežotas piekļuves pārbaudītajām organizācijām. Uzņēmums plāno publiskot GLM-5.3 aptuveni divu nedēļu laikā pēc drošības novērtējumu pabeigšanas un drošības pasākumu nostiprināšanas.
Tās visjutīgākās kiberdrošības iespējas joprojām būs ierobežotas ar pārbaudītiem lietotājiem, izmantojot to, ko Z.ai sauc par “uzticamas piekļuves” programmu. Sākotnējā piekļuve tiks piešķirta atlasītajiem palaišanas partneriem, pirms tā tiks atvērta plašākai grupai.
Ķīnas atvērtā koda AI push ieiet jutīgākā fāzē
Izlaišanas stratēģija var izrādīties tikpat nozīmīga kā etalona rādītāji.
“Cik man ir zināms, šī ir pirmā reize, kad Ķīnas laboratorija publiski attaisno aizkavētu atklātu modeļu svaru izlaišanu drošības apsvērumu dēļ,” aģentūrai Reuters teica Gabriels Vāgners, Pekinas konsultāciju uzņēmuma Concordia AI MI pārvaldības pētnieks.
“Tas liecina, ka atvērtā svara riska pārvaldības prakse Ķīnā kļūst arvien sarežģītāka.”
Z.ai teica, ka GLM-5.3 ietver sistēmas riskantu pieprasījumu pārbaudei, modeļa darbības uzraudzībai un ļaunprātīgu uzdevumu noraidīšanai. Mērķis ir nodalīt likumīgu drošības darbu, piemēram, kļūdu labošanu, kiberdrošības izglītību un autorizētu testēšanu, no mēģinājumiem ļaunprātīgi izmantot modeli.
Tas kļūst daudz grūtāk, kad modeļu svari ir publiski pieejami. Izstrādātāji var modificēt atvērtos modeļus, noņemt aizsargierīces vai savienot tos ar ārējiem rīkiem, atstājot modeļu veidotājiem daudz mazāk iespēju kontrolēt to, kā tiek izmantotas viņu sistēmas.
Z.ai sliecas uz šo spriedzi, nevis atkāpjas no atvērtā pirmkoda. Uzņēmums paziņoja par “Open Source Shield” iniciatīvu, lai pārbaudītu atlasītos atvērtā pirmkoda projektus, nodrošinātu modeļa piekļuvi aizsardzības drošības darbam un pievienotu koda audita funkcijas savam ZCode programmēšanas produktam.
“Šajā garā Z.ai, šķiet, piedāvā sava veida “Project Glasswing” ar ķīniešu iezīmēm, kas atklātību uzskata par priekšrocību, nevis trūkumu,” sacīja Vāgners.
Vēl viens iemesls, lai uzmanīgi vērotu Z.ai, ir šis.
Ņujorkā bāzētā Hugging Face pagājušajā mēnesī paziņoja, ka izmantoja Z.ai iepriekšējo GLM-5.2 modeli, lai palīdzētu aizsargāties pret negodīga OpenAI aģenta kiberuzbrukumu, kas pārkāpa tās sistēmas. Ķīnas kiberdrošības uzņēmums 360 ir atsevišķi apgalvojis, ka tā Tulongfeng ievainojamības atklāšanas sistēma ir sasniegusi Mythos salīdzināmas iespējas, lai gan šie apgalvojumi nav neatkarīgi pārbaudīti.
GLM-5.3 izmanto citu pieeju. Tas ir universāls kodēšanas modelis, nevis īpaša kiberdrošības sistēma. Z.ai teica, ka tam ir tāds pats bāzes modelis kā GLM-5.2, ar ilgāku un daudzveidīgāku pēcapmācības un pastiprināšanas mācību vidi, kas nodrošina spēcīgākas drošības iespējas.
Tas padara progresu no GLM-5.2 īpaši interesantu. Z.ai jau piesaistīja ārzemju izstrādātājus ar kodēšanas un aģentu iespējām, tuvojoties vadošajiem ASV modeļiem par zemākām cenām. Tagad uzņēmums iespiež šo pašu modeļu saimi vienā no AI visnozīmīgākajām lietojumprogrammām.
Etalona sacīkstes nebūt nav atrisinātas. Mythos joprojām ir ievērojami spēcīgāks ekspluatācijas izstrādē, un Z.ai GLM-5.3 rezultātiem joprojām ir nepieciešama neatkarīga pārbaude.
Taču virzienu kļūst arvien grūtāk ignorēt. Pirmā kodēšana un AI aģenti. Tagad kiberdrošība. Konkurence starp Ķīnas atvērtajiem modeļiem un Amerikas vadošajām slēgtajām mākslīgā intelekta sistēmām virzās uz iespējām, kur likmes ir daudz augstākas nekā etalonu lielīšanās tiesības.