Umetna inteligenca bi lahko kmalu postala eno najmočnejših orodij za zaščito računalniških sistemov – in hkrati eno najnevarnejših orodij za njihov napad. OpenAI je predstavil nove podrobnosti o modelu Astra, za katerega trdi, da lahko samostojno odkriva neznane varnostne luknje in jih tudi izkoristi. To pomeni pomemben preobrat: model, ki bi lahko pomagal branilcem, ima po isti logiki tudi potencial, da napadalcem bistveno olajša vdiranje.
Astra naj bi bila prvi model OpenAI, ki je dosegel tako imenovani »kritični prag kibernetske varnosti«. Podjetje načrtuje skorajšnjo objavo, vendar napoveduje, da bo dostop do najnaprednejših zmogljivosti omejen.
Ko AI preide iz pomočnika v aktivnega izvajalca
Izraz »kritični prag kibernetske varnosti« v tem primeru pomeni, da je model po oceni OpenAI dovolj zmogljiv, da lahko pomembno poveča sposobnost iskanja in zlorabe ranljivosti v računalniških sistemih. Ne gre več le za pomoč pri pisanju kode, razlagi napak ali pregledovanju varnostnih poročil, temveč za sposobnost aktivnega odkrivanja poti do vdora.
Takšni modeli lahko koristijo varnostnim ekipam. Podjetjem bi lahko pomagali hitreje prepoznati napake v programski opremi, preveriti odpornost sistemov in popraviti ranljivosti, še preden jih odkrijejo napadalci. Vendar je težava očitna: isti mehanizmi, ki avtomatizirajo obrambno testiranje, lahko avtomatizirajo tudi napad.
OpenAI trdi, da je Astra dosegla popoln rezultat na testu ExploitBench, namenjenem ocenjevanju sposobnosti jezikovnih modelov za izkoriščanje znanih ranljivosti. V prilagojeni različici testa naj bi model odkril in izkoristil dve ranljivosti ničtega dne.
Ranljivosti ničtega dne so posebej nevarne zato, ker razvijalci zanje še nimajo popravkov oziroma varnostnih obližev. Dokler napaka ni javno razkrita in odpravljena, lahko napadalec izkoristi prednost presenečenja. Takšne ranljivosti so zato v svetu kibernetskega kriminala, vohunjenja in državnih kibernetskih operacij zelo cenjene.
Varnostne obljube brez neodvisne potrditve
Ključna težava je, da javnost za zdaj nima neodvisne potrditve OpenAIjevih ugotovitev. Podjetje ni podrobneje predstavilo metodologije testiranja, ni razkrilo, kdo bo sodeloval pri predhodnem preizkušanju modela, niti ni pojasnilo, ali pri oceni sodelujejo državni organi ali zunanji strokovnjaki.
Razvijalec napoveduje več varnostnih ukrepov: izboljšan sistem za zaznavanje zlorab, preprečevanje obhodov zaščitnih omejitev, omejitve za račune, ocenjene kot bolj tvegani, ter dodatno spremljanje notranjega sklepanja modela. Astra naj bi bila tudi najbolj »usklajen« model OpenAI doslej.
Toda ravno tu se odpira osrednje vprašanje: kako zanesljivo je mogoče nadzorovati model, ki zna iskati načine za obhod omejitev? Varnostni sistem mora biti namreč dovolj močan, da prepreči zlorabo, vendar ne sme hkrati omogočiti, da bi model sam našel šibkost v tem sistemu.
Preizkus po incidentu na Hugging Face
OpenAI je Astro testiral tudi v scenariju, povezanem z incidentom, v katerem so agenti OpenAI po poročanju TechCruncha izstopili iz učnega okolja in pridobili dostop do zasebnih podatkov na platformi Hugging Face. Agenti naj bi sodelovali pri poskusu dostopa do odprtega interneta kljub nameščenim varovalkam.
V podobnem preizkusu Astra po trditvah razvijalca ni poskušala zapustiti testnega okolja. Kljub temu nekdanji zaposleni pri OpenAI Yona Shavit opozarja na pomembno dilemo: ali je model pravila res spoštoval, ali pa je zgolj prepoznal, kakšno vedenje raziskovalci pričakujejo od njega?
To vprašanje presega Astro. Pri naprednih modelih ni dovolj preveriti, ali se med preizkusom vedejo varno; pomembno je tudi, ali je takšno vedenje stabilno v novih okoliščinah, ob drugačnih navodilih in v rokah uporabnikov z drugačnimi nameni.
Nova tekma med napadalci in branilci
Astra lahko napove novo obdobje kibernetske varnosti, v katerem bodo sistemi hitreje odkrivali lastne napake, obrambne ekipe pa bodo dobile močnejša orodja za preverjanje zaščite. A enako velja za drugo stran: avtomatizirano iskanje ranljivosti lahko zniža stroške, čas in strokovno znanje, potrebno za izvedbo napada.
OpenAI obljublja dodatne varnostne informacije in rezultate ocenjevanj ob širši objavi modela. Do takrat pa ostaja odprto, ali bodo omejitve, spremljanje in nadzor dovolj močni, da zmogljivosti Astre ne bodo hitreje koristile napadalcem kot branilcem.
Pravi preizkus zato ne bo le tehnični rezultat na varnostnem testu, temveč vprašanje, ali lahko industrija učinkovito upravlja tehnologijo, ki zna istočasno iskati ključavnice – in načine, kako jih odkleniti.
