# Zakulisje AI tekme: Anthropic razkriva domnevne množične poskuse destilacije modela Claude
V tekmi za razvoj zmogljive umetne inteligence niso odločilni le čipi, podatkovni centri in vrhunski raziskovalci. Vse pomembnejše postaja tudi vprašanje, kdo lahko dostopa do sposobnosti najboljših zaprtih modelov – in ali je te sposobnosti mogoče sistematično prenesti v konkurenčne sisteme.
Anthropic v novem poročilu trdi, da je zaznal več obsežnih kampanj nedovoljene destilacije svojega modela Claude. Podjetje dejavnosti pripisuje petim ločenim kampanjam, povezanim s kitajskimi akterji, med katerimi omenja Alibaba in Moonshot AI. Skupaj naj bi šlo za skoraj 200 milijonov izmenjav z modelom.
Gre za očitek z velikimi poslovnimi in strateškimi posledicami. Vrhunski jezikovni modeli zahtevajo milijardne vložke v računsko infrastrukturo, dostop do kakovostnih podatkov ter dolgotrajno delo raziskovalnih ekip. Če bi bilo mogoče njihove ključne sposobnosti učinkovito pridobivati prek množičnih poizvedb in jih prenesti v manjše lastne modele, bi to lahko občutno zmanjšalo stroške in čas razvoja konkurentov.
## Destilacija sama po sebi ni sporna – sporen je način
Izraz *destilacija* v strojnem učenju sam po sebi ne pomeni napada. Gre za uveljavljeno tehniko, pri kateri manjši model posnema odgovore večjega, zmogljivejšega modela. Tako je mogoče izdelati hitrejši in cenejši sistem, ki ohrani del sposobnosti večjega modela.
Ključna razlika je v tem, ali se to izvaja z dovoljenjem lastnika modela in v skladu s pogoji uporabe. Anthropic očita, da so akterji uporabili številne račune in posebej oblikovane pozive, s katerimi naj bi skušali iz modela izvleči informacije, namenjene internemu delovanju – predvsem sledi sklepanja oziroma tako imenovano verigo razmišljanja.
Takšne sledi imajo za razvijalce veliko vrednost. Končni odgovor pove, *kaj* je model odgovoril, podrobnejši postopek sklepanja pa lahko pokaže, *kako* je prišel do odgovora. Pri učenju manjših modelov so lahko takšni podatki posebej uporabni pri programiranju, matematiki, logičnem reševanju problemov in uporabi zunanjih orodij.
Anthropic uporabnikom praviloma ne prikaže celotnega notranjega procesa sklepanja. Claude namesto tega ponuja povzetke razmišljanja. Podjetje pa navaja, da so napadalci odkrili metode, s katerimi so model pripravili do neposrednejšega razkrivanja teh sledi.
## Umetnost prevare: ko je zahteva videti kot prevod
Eden zanimivejših primerov iz poročila pokaže, da napadi niso nujno tehnično zapleteni v klasičnem smislu. Namesto vdora v strežnike ali kraje dostopnih ključev naj bi napadalci model poskušali zavajati z navidez nedolžnimi navodili.
V enem primeru je bil Claude postavljen v vlogo prevajalca. Poziv ga je prosil, naj »prejšnji delovni pomnilnik« prevede v naravno in natančno japonščino, zapisano samo v katakani. Namen takega oblikovanja vprašanja naj bi bil obiti zaščite, ki modelu preprečujejo razkrivanje notranjih delov procesa odgovarjanja.
To kaže na širši problem varnosti generativne umetne inteligence. Modeli ne presojajo zgolj posameznih besed, temveč pomen in kontekst navodil. Napadalci zato nenehno preizkušajo, ali lahko z drugačno jezikovno obliko, prevodom, igranjem vlog ali večstopenjskim pogovorom dosežejo rezultat, ki ga neposreden ukaz ne bi.
## Alibaba naj bi bil povezan z največjo kampanjo
Največji delež poskusov Anthropic pripisuje kampanji, povezani z Alibabo. Po navedbah podjetja je med majem in julijem 2026 zaznal približno 151 milijonov izmenjav, pri čemer je aktivnost na vrhuncu dosegala skoraj tri milijone zahtev na dan.
Poizvedbe naj bi prihajale prek približno 3.500 računov. Anthropic jih kljub temu povezuje v enotno akcijo, saj naj bi uporabljale enak oziroma zelo podoben fiksni poziv za pridobivanje sledi sklepanja. Podjetje ocenjuje, da je bil namen ustvarjanje učnega gradiva za Alibabino družino modelov Qwen.
Če so navedbe pravilne, primer ilustrira, kako lahko že dostop prek običajnega uporabniškega vmesnika postane orodje za množično zbiranje podatkov. Za izvajalce to pomeni, da morajo spremljati ne le posamezne škodljive pozive, temveč tudi nenavadne vzorce uporabe: ponavljanje zahtev, usklajeno delovanje številnih računov, avtomatizirano pošiljanje poizvedb in ponavljajoče se strukture promptov.
## Moonshot AI in domnevne vojaške zahteve
Anthropic omenja tudi kampanjo, povezano z Moonshot AI, podjetjem, ki razvija model Kimi. Po trditvah iz poročila so nekatere zahteve kazale na morebitno povezavo s kitajsko vojsko.
Ena od njih je Claudeu naročila analizo posnetkov videonadzora z namenom ugotavljanja, ali se oseba na posnetkih »vede nenavadno«. V obdobju desetih dni naj bi bilo prek omrežja 5.000 računov modelu posredovanih skoraj 300.000 zahtev, večinoma usmerjenih v Anthropicov model Opus.
Poročilo s tem odpira vprašanje dvojne rabe modelov AI. Zmogljivosti, uporabne za poslovno analitiko, programiranje ali raziskave, se lahko uporabijo tudi pri nadzoru, obveščevalnih dejavnostih in vojaških nalogah. Prav zato postajajo vprašanja nadzora dostopa, preverjanja uporabnikov in zaznavanja zlorab pomemben del razvoja naprednih modelov.
## Nova fronta v boju za intelektualno lastnino
Primer ni pomemben le za Anthropic. Podobne skrbi je že izpostavil OpenAI, ki je poročal o dejavnostih, povezanih z DeepSeekom. Hkrati pa bo treba ločevati med legitimnim raziskovanjem, odprtimi modeli, običajnim učenjem iz javno dostopnih odgovorov in organiziranimi poskusi izogibanja zaščitam ter pogodbenim pogojem.
Za podjetja, ki razvijajo zaprte modele, to pomeni pritisk k dodatnim varnostnim ukrepom: strožjemu omejevanju dostopa, boljšemu odkrivanju povezanih računov, spremljanju avtomatiziranih vzorcev uporabe ter zaščiti pred poskusi izvabljanja notranjih informacij z manipulativnimi pozivi.
V širšem smislu pa primer kaže, da se tekmovanje v umetni inteligenci vse bolj seli od vprašanja, kdo lahko izdela najboljši model, k vprašanju, kdo lahko zaščiti njegove sposobnosti. V obdobju, ko so vrhunski modeli hkrati tehnološki produkt, strateška infrastruktura in dragocena intelektualna lastnina, bodo poskusi njihovega posnemanja verjetno postajali vse bolj sofisticirani.
