# Baseten, Hugging Face in Goodfire gradijo varnostni standard za odprte modele UI

Odprti modeli umetne inteligence imajo pomembno prednost: raziskovalci in razvijalci lahko preverjajo njihovo delovanje, jih prilagajajo in uporabljajo neodvisno od velikih tehnoloških podjetij. Toda ista odprtost prinaša tudi varnostno tveganje. Če je mogoče do modela dostopati in ga spreminjati, je mogoče odstraniti tudi omejitve, ki preprečujejo škodljivo uporabo.

Prav zato so Baseten, Hugging Face in Goodfire AI napovedali sodelovanje pri razvoju varnostne infrastrukture za modele z odprtimi utežmi. Pobudo vodi Base Labs, raziskovalna skupina, ki jo je Baseten ustanovil letos. Njen namen je razviti metode za testiranje, spremljanje in varnejše uvajanje odprtih modelov v prakso.

Vprašanje je vse pomembnejše, saj odprti modeli hitro postajajo del orodij razvijalcev, podjetij in raziskovalnih skupin. Varnostni ukrepi, ki jih ponudniki velikih zaprtih modelov običajno upravljajo centralno, pri odprtih modelih niso nujno trajni.

## Ko je varovalke mogoče odstraniti

TechCrunch ob napovedi opozarja na prakso, imenovano *abliteration*. Gre za postopke, s katerimi uporabnik iz modela odstrani ali oslabi varnostne omejitve. Posledica je lahko model, ki je bolj pripravljen ustvarjati vsebine, za katere je bil prvotno naučen, da jih zavrača — denimo zlonamerno kodo, dezinformacije, sovražni govor ali druga tvegana navodila.

Obseg pojava ni zanemarljiv. Hugging Face, ena ključnih platform za gostovanje odprtokodnih modelov, po navedbah TechCruncha navaja več kot 6.000 modelov, spremenjenih na tak način.

To ne pomeni, da je vsak odprti model sam po sebi nevaren. Pomeni pa, da varnosti ni mogoče obravnavati kot enkratne funkcije, dodane ob izdaji modela. Spremljati jo je treba skozi celoten življenjski cikel: od učenja in objave modela do njegove uporabe na produkcijskih sistemih.

## Varnost naj bo vgrajena, ne dodana naknadno

Base Labs želi razvijati in javno objavljati metode za učenje ter spremljanje odprtih modelov. Baseten pobudo predstavlja kot standard, po katerem bi bili varnostni postopki transparentno vključeni v razvoj in uporabo modelov, ne pa nameščeni šele po koncu razvoja.

V praksi bi tak okvir lahko vključeval varnostna testiranja modelov, spremljanje neobičajnega vedenja po uvedbi, postopke za prijavo ranljivosti in pregledne informacije o tem, katere omejitve model vsebuje. Partnerji tehničnih podrobnosti sodelovanja za zdaj niso razkrili, zato ostaja odprto, kako natančno bo standard deloval in katere dele infrastrukture bodo ponudili javnosti.

Baseten je ob napovedi na omrežju X zapisal, da je odprtost lahko prednost za varnost UI, saj omogoča večji vpogled v vedenje modelov ter lažje pretvarjanje raziskovalnih ugotovitev v pregledne nadzorne mehanizme.

## Goodfire stavi na razumevanje »črne skrinjice«

Pomembno vlogo bi lahko imel Goodfire AI, podjetje, ki razvija tehnologije za interpretabilnost modelov. To pomeni poskus razumevanja, zakaj model pride do določene odločitve ali odgovora.

Interpretabilnost je za varnost ključna, ker omogoča prepoznavanje notranjih vzorcev in ranljivosti, preden ti povzročijo škodo. Če razvijalci bolje razumejo, kateri deli modela vplivajo na nevarne ali nezaželene odgovore, lahko zaščite izboljšajo bolj ciljno kot zgolj z dodajanjem površinskih filtrov.

Goodfire je cilj sodelovanja povzel z besedami: »Varnost mora biti vgrajena v odprte modele in jo morajo zagotavljati tisti, ki jih strežejo.«

Partnerstvo podpirajo tudi precejšnja finančna sredstva. Baseten, ponudnik infrastrukture za izvajanje modelov UI, je junija v krogu serije F zbral 1,5 milijarde dolarjev in dosegel vrednotenje 13 milijard dolarjev. Goodfire je letos v krogu serije B, ki ga je vodil B Capital, zbral 150 milijonov dolarjev za razvoj svoje platforme za interpretabilnost.

## Standard brez širše skupnosti ne bo dovolj

Baseten poziva širšo skupnost razvijalcev, naj prispeva k nastajajočemu okviru. To bo verjetno tudi največji preizkus pobude. Odprti ekosistem je razdrobljen: modeli nastajajo v različnih organizacijah, uporabljajo se na različnih platformah in se lahko hitro spreminjajo.

Univerzalni standard bo zato težko uveljaviti. Hkrati bodo morali partnerji najti ravnotežje med varnostjo in odprtostjo, saj preveč togih pravil lahko omeji raziskovanje in razvoj, premalo zaščite pa poveča možnosti zlorabe.

Kljub temu je pobuda pomemben signal. Če naj odprti modeli ostanejo verodostojna alternativa zaprtim sistemom, bo moral ekosistem poleg zmogljivosti dokazati tudi, da zna varnost graditi pregledno, preverljivo in skupaj z razvijalci.

Ustanovitelj SEOS AI, predavatelj in svetovalec o uporabi umetne inteligence v podjetjih.

Leave A Reply

Exit mobile version