Anthropic želi z modelom Opus 5.5 doseči redko kombinacijo: večjo zmogljivost, nižje stroške in strožji nadzor nad potencialno tveganimi uporabami. Podjetje trdi, da je njegova nova vodilna različica Claudea posebej napredovala pri programiranju in zahtevnem znanjskem delu, hkrati pa je cena izhodnih žetonov padla za petino.

Toda ključne trditve o vodilni zmogljivosti za zdaj izhajajo predvsem od Anthropica. V gradivu, na katerem temelji objava, ni navedenih primerljivih neodvisnih rezultatov proti modelom OpenAI, Googla ali Mete. Opus 5.5 je zato smiselno razumeti kot pomembno Anthropicovo izdajo, ne pa še kot dokončno potrjenega absolutnega vodilnega modela na celotnem trgu.

Opus 5.5: zmogljivejši model za kompleksnejše delo

Opus 5.5 je najnovejša različica najzmogljivejšega modela v Anthropicovi družini Claude. V ponudbi podjetja je Opus namenjen najzahtevnejšim nalogam, Sonnet predstavlja srednji razred, Haiku pa je hitrejša in cenovno dostopnejša možnost za manj kompleksne primere uporabe.

Anthropic navaja, da novi model postavlja nove mejnike pri programiranju in znanjskem delu. To so naloge, pri katerih model ne odgovarja zgolj na preprosta vprašanja, temveč mora razumeti obsežnejše dokumente, analizirati podatke, razlagati kodo, pripravljati tehnične predloge ali pomagati pri večstopenjskem reševanju problemov.

Za razvijalce bi to lahko pomenilo kakovostnejšo pomoč pri razlagi stare kode, iskanju napak, pripravi testov in dokumentacije ali pri načrtovanju sprememb v večjih programskih projektih. Za raziskovalce in poslovne uporabnike pa bi bila pomembna predvsem zmožnost hitrejšega povzemanja gradiv, priprave analiz in strukturiranja zahtevnih informacij.

Podjetje trdi, da Opus 5.5 v številnih meritvah prekaša večji model Fable ter da je uspešno zaključil več neformalnih nalog, pri katerih je Fable odpovedal. Ker članek ne navaja metodologije teh primerjav, celotnih rezultatov ali neodvisnih ponovitev testov, je treba navedbe obravnavati kot oceno proizvajalca.

20-odstotno znižanje cene izhodnih žetonov

Najbolj oprijemljiva sprememba je cena. Anthropic bo za milijon izhodnih žetonov pri Opusu 5.5 zaračunal 20 dolarjev, medtem ko je prejšnja različica stala 25 dolarjev. To pomeni 20-odstotno znižanje pri tej postavki.

Žetoni so osnovne enote besedila, ki jih modeli uporabljajo pri obdelavi in ustvarjanju odgovorov. Pri uporabi API-ja so stroški praviloma ločeni na vhodne žetone, torej besedilo, ki ga uporabnik pošlje modelu, in izhodne žetone, ki jih model ustvari v odgovoru.

V praksi bi podjetje, ki mesečno porabi deset milijonov izhodnih žetonov, ob nespremenjeni uporabi za izhodni del plačalo približno 200 dolarjev namesto 250 dolarjev. Prihranek bi tako znašal 50 dolarjev mesečno, vendar je končni strošek odvisen tudi od cene vhodnih žetonov, dolžine pozivov, vrste nalog in morebitnih količinskih popustov.

Za manjše razvijalce znižanje samo po sebi verjetno ne pomeni preobrata, je pa pomembno za ekipe, ki modele uporabljajo množično: v podpornih sistemih, avtomatiziranem ustvarjanju kode, analizi dokumentacije ali agentih, ki ustvarijo veliko količino besedila. Anthropic ob tem navaja, da je model tudi hitrejši za izvajanje in da za streženje potrebuje manj računske moči.

Kako se postavlja ob OpenAI, Google in Meto?

Na trgu velikih jezikovnih modelov Anthropic tekmuje predvsem z modeli GPT podjetja OpenAI, družino Gemini podjetja Google ter odprtokodnejšimi modeli Llama podjetja Meta. Razlike med njimi niso le v surovi zmogljivosti, temveč tudi v ceni, hitrosti, dostopu prek API-ja, zasebnosti podatkov, podpori za slike in druge večpredstavne vsebine ter v možnostih prilagajanja modelov.

Anthropicova strategija pri Opusu 5.5 je očitno usmerjena v podjetja in profesionalne uporabnike, za katere so pomembni zanesljivost pri zahtevnih nalogah, nižji stroški uporabe in varnostne omejitve. Vendar neposredna primerjava s konkurenco na podlagi objavljenega gradiva ni mogoča.

Vir ne ponuja primerjalnih rezultatov proti aktualnim modelom OpenAI, Google ali Meta, niti ne navaja enotnih testov, na katerih bi bilo mogoče oceniti razliko v kakovosti ali stroških. Tudi oznaka »vodilen« je zato predvsem trženjska oziroma podjetniška trditev, dokler je ne potrdijo javno dostopne in neodvisno ponovljive primerjave.

Za uporabnike bo pomembneje od samega naziva modela, kako se bo Opus 5.5 obnesel pri njihovih konkretnih nalogah: pri odpravljanju napak v kodi, delu z dolgimi dokumenti, natančnosti odgovorov, uporabi orodij in dejanskem strošku posameznega delovnega procesa.

Manj žargona in bolj neposredni odgovori

Anthropic izpostavlja tudi spremembe v slogu komunikacije. Opus 5.5 naj bi manj pogosto uporabljal žargon in pomembne informacije pogosteje postavil na začetek odgovora.

To se morda zdi manj pomembna novost od benchmarkov, vendar je za poslovno uporabo lahko zelo uporabna. Model, ki najprej poda jasen odgovor, nato pa šele razlago, uporabniku prihrani čas in olajša preverjanje rezultatov. Pri programiranju to pomeni, da bi lahko najprej izpostavil napako ali predlagano rešitev, nato pa dodal podrobno tehnično utemeljitev.

Anthropic je napovedal tudi prihod modelov Sonnet 5.5 in Haiku 5.5. Če bo podjetje podobne izboljšave preneslo še na cenejša modela, bi lahko naprednejše zmogljivosti postale dostopne širšemu krogu razvijalcev in podjetij.

Varnostne omejitve pri kibernetskih in bioloških tveganjih

Opus 5.5 bo podvržen podobnim zaščitnim ukrepom kot Anthropicov model Fable. Ta je v gradivu opisan kot večji model, medtem ko je Mythos naveden kot referenčna raven za biološke in kibernetskovarnostne sposobnosti. Objavljeno besedilo ne pojasni natančne tehnične narave obeh oznak, zato ni mogoče zanesljivo sklepati, ali gre za samostojna javno dostopna modela, interne varnostne klasifikacije ali primerjalne reference.

Bistvo ukrepov je omejevanje uporabe modela pri nalogah z večjim tveganjem. Med temi Anthropic posebej omenja odkrivanje ranljivosti v prevedenih programih ter razvoj prepoznavnih bioloških orožij.

Podjetje navaja, da je model prestal usklajevalno testiranje in ocene pred izidom, pri katerih so sodelovale tudi zunanje organizacije, kot sta METR in Frontier Design. METR je organizacija, ki izvaja raziskave in vrednotenja zmogljivosti ter tveganj naprednih sistemov umetne inteligence. Za Frontier Design vir ne poda dodatne razlage, zato njene natančne vloge pri ocenjevanju Opusa 5.5 ni mogoče podrobneje opredeliti.

Neodvisno varnostno testiranje je pomembno, vendar samo po sebi ne pomeni, da model ne more biti zlorabljen. Takšne ocene navadno preverjajo določene scenarije in časovno omejeno različico sistema, medtem ko se načini uporabe, priključena orodja in sposobnosti modelov hitro spreminjajo.

Napredek, ki naj bi bil počasnejši od tveganj

Izdaja prihaja po tem, ko je izvršni direktor Anthropica Dario Amodei pozval k premišljenemu tempu razvoja najzmogljivejših modelov. Njegovo stališče je, da samo vlaganje v varnostne mehanizme ni dovolj; razvoj sposobnosti bi se moral odvijati tako hitro, da lahko preverjanje tveganj, varnostne tehnike in javni nadzor temu sledijo.

Ta pristop odpira temeljno napetost v industriji umetne inteligence. Podjetja tekmujejo v hitrosti izdaj, zmogljivostih in pridobivanju uporabnikov, hkrati pa vse zmogljivejši modeli odpirajo vprašanja zlorabe, napačnih informacij, kibernetske varnosti, zasebnosti in odgovornosti za avtomatizirane odločitve.

Anthropic trdi, da že pripravlja naprednejše sisteme za usposabljanje, ocenjevanje, varnost in spremljanje prihodnjih modelov. Prav tako poziva k večji vlogi javne politike pri zagotavljanju varnosti sistemov, na katere se ljudje in podjetja zanašajo.

Opus 5.5 zato ni le običajna nadgradnja modela. Je tudi preizkus, ali je mogoče v tekmi za zmogljivejšo umetno inteligenco hkrati zniževati stroške, izboljševati uporabniško izkušnjo in ohranjati verodostojne varnostne omejitve. Ali Anthropic to dejansko dosega bolje od konkurence, pa bodo pokazale šele neodvisne primerjave in izkušnje uporabnikov v praksi.

Ustanovitelj SEOS AI, predavatelj in svetovalec o uporabi umetne inteligence v podjetjih.

Leave A Reply

Exit mobile version