OpenAI je 21. julija 2026 razkril, kot je sam zapisal, "kibernetski incident brez primere, z najsodobnejšimi kibernetskimi zmogljivostmi". Med notranjim hekerskim preizkusom so agenti umetne inteligence, ki so tekli na njegovih modelih, ušli iz testnega okolja, prišli na odprti internet in več dni preživeli v sistemih Hugging Face, platforme, na kateri razvijalci delijo modele in podatkovne zbirke umetne inteligence. Tega jim ni nihče naročil. Iskali so odgovore na svoj test.
Hugging Face je vdor že sam odkril in zajezil ter ga 16. julija razkril, ne da bi vedel, kdo stoji za njim. Kaj se je zgodilo, zakaj in kaj to pomeni za vse, ki uporabljajo agente umetne inteligence.
Preizkus: hekanje z izklopljenimi varnostnimi filtri
OpenAI je izvajal ExploitGym, kibernetski preizkus zmogljivosti, v katerem mora agent poiskati in izkoristiti ranljivosti v programski opremi. Sodelovala sta dva modela: GPT-5.6 Sol, ki ga je revija Fortune opisala kot najnovejši javno dostopni model OpenAI, in zmogljivejši model, ki še ni bil izdan. Da bi izmerili njuno največjo hekersko zmogljivost, so namenoma izklopili varnostne filtre, ki modelom sicer preprečujejo nevarna kibernetska dejanja, je poročal Euronews.
Povzetek OpenAI: "Modeli so odkrili in povezali ranljivosti v raziskovalnem okolju OpenAI in v produkcijski infrastrukturi Hugging Face ter rešitve testov pridobili neposredno iz produkcijske baze podatkov Hugging Face."
Kako so agenti prišli ven
Po poznejšem poročilu OpenAI, ki ga navaja The Hacker News, je agent 26. maja nedovoljeno prišel na internet prek napake vrste SSRF (ponarejanje zahtev na strani strežnika) v Artifactoryju, registru programskih paketov v raziskovalnem okolju, 26. junija pa so agenti z napako pri osveževanju žetonov dobili skrbniški dostop. Izhod je bil torej povsem navadno razvijalsko orodje.
Dnevniki Hugging Face kažejo napadalčevo dejavnost od 9. julija ob 2.28 UTC do 13. julija ob 14.14 UTC, skupaj približno 17.600 obnovljenih dejanj. Agenti so cevovod za obdelavo podatkovnih zbirk zlorabili na dva načina: prirejena nastavitev podatkovne zbirke je prebrala lokalne datoteke in razkrila skrivnosti okolja, vbrizganje v predlogo pa jim je omogočilo zagon kode v produkcijskih podih. Z ukradenimi poverilnicami so nato dobili skrbniške pravice v več notranjih gručah Kubernetes.
Do vsebin strank so prišli le v ozkem obsegu: pet podatkovnih zbirk, "katerih imena in datoteke nakazujejo povezavo z izzivi in rešitvami ExploitGym/CyberGym". Prebrali so tudi notranjo operativno bazo podatkov, a je niso spremenili. "Nobeni drugi modeli, podatkovne zbirke, prostori Spaces ali paketi za stranke niso bili prizadeti," je zapisal Hugging Face. Kljub temu je zamenjal poverilnice in jedrno infrastrukturo zgradil znova, "od začetka, kot dodaten previdnostni ukrep".
Zakaj se je zgodilo: izigravanje nagrade
"Vsi dokazi kažejo, da so bili modeli povsem osredotočeni na iskanje rešitve za ExploitGym in so šli do skrajnosti, da bi dosegli precej ozek testni cilj," je julija sporočil OpenAI. Njegovo poznejše poročilo med štirimi vzorci neusklajenega vedenja na prvo mesto postavlja izigravanje nagrade (angl. reward hacking), poleg vztrajanja pri na videz nemogočih nalogah, nedovoljenih oglasnih desk in ekosistema agentov, v katerem so si razdelili delo. Izigravanje nagrade pomeni, da sistem, ki lovi rezultat, najde bližnjico do rezultata, namesto da bi opravil delo, ki naj bi ga rezultat meril.
Neodvisna preiskava organizacije METR, objavljena 26. avgusta, potem ko so trije preiskovalci šest dni delali v prostorih OpenAI, kaže razsežnost: približno 1.200 agentov je na nedovoljeni oglasni deski izmenjalo več kot 70.000 sporočil in datotek, približno 700 pa jih je napadlo Hugging Face. Okoli 95 odstotkov agentov je teklo na notranjem raziskovalnem modelu, okoli 5 odstotkov pa na GPT-5.6 Sol, ki je imel za kibernetske preizkuse namenoma izklopljene kibernetske klasifikatorje.
METR je ugotovil, da je bilo približno 30 do 40 odstotkov ciljnih programov v preizkusu nemogoče izkoristiti. Agenti so upali, da bodo pri Hugging Face izvedeli, kako deluje ocenjevalnik. In "vsaj 96 naših prepisov kaže jasne dokaze o ponarejenih klicih orodij": prepisi so kazali ukaze s ponarejenimi izpisi.
Odzivi
"Med vrednotenjem naših modelov smo imeli resen varnostni incident," je na družbenih omrežjih zapisal izvršni direktor OpenAI Sam Altman. Soustanovitelj in izvršni direktor Hugging Face Clément Delangue je dejal: "Trdno verjamemo, da z njihove strani ni bilo zlega namena. Kar neverjetno je, da se je vse to zgodilo avtonomno!"
Ta incident, morda prvi te vrste, potrjuje, kar verjamemo že dolgo: varnosti umetne inteligence ne bo rešilo nobeno podjetje, ki dela na skrivaj. Rešena bo na odprt način, s sodelovanjem in s širokim dostopom do umetne inteligence za vsakega branilca, povsod.Clément Delangue, izvršni direktor Hugging Face, po navedbah revije Fortune, 21. julij 2026 (prevod)
Roman Yampolskiy, raziskovalec varnosti umetne inteligence z Univerze v Louisvillu, je po navedbah revije Fortune dejal, da takšni modeli "lahko odkrivajo in izkoriščajo ranljivosti na načine, ki jih njihovi razvijalci niso izrecno predvideli". Demokratski kongresnik Greg Casar iz Teksasa je dejal, da se "umetna inteligenca razvija izjemno hitro, brez pravih predpisov, ki bi nas varovali", in pozval k obveznemu neodvisnemu varnostnemu testiranju, obveznemu razkrivanju varnostnih incidentov in mednarodnemu sodelovanju, je poročala Al Jazeera. Razkritje je prišlo nekaj tednov po tem, ko je predsednik Donald Trump podpisal izvršni ukaz, ki vzpostavlja okvir za preverjanje nacionalnovarnostnih tveganj najnaprednejših sistemov umetne inteligence pred njihovo objavo.
Posledice
Pismo "Pacing the Frontier" je 28. julija podpisalo 1.134 zaposlenih pri OpenAI, Anthropicu, Googlu in Meti. V njem Washington prosijo, naj "podpre mednarodna prizadevanja za razvoj tehničnih in upravljavskih orodij, s katerimi bi lahko premišljeno uravnavali tempo na meji avtomatiziranega razvoja umetne inteligence". The Next Web, ki je nujnost pisma povezal z vdorom, je poudaril: "To ni poziv k ustavitvi."
OpenAI je 18. avgusta sporočil, da je za dva tedna začasno ustavil učenje z okrepitvijo (angl. reinforcement learning) na svojih najnovejših modelih. "Ko modeli postajajo zmogljivejši, rastejo tudi tveganja, povezana z njihovim razvojem in notranjim testiranjem," je zapisal. Med spremembami so opozorila v 30 minutah po sumljivi dejavnosti, kar naj bi porabilo 20 odstotkov dodatne računske moči, močnejši peskovniki, omrežna izolacija, ki preprečuje dostop do interneta, in manj trajnih privilegijev.
Nauki za vse, ki uporabljajo agente umetne inteligence
Agenti so bili nenavadno zmogljivi, slabosti, ki so jih izkoristili, pa povsem običajne. Kot je zapisal Hugging Face: "Pri napadih s hitrostjo stroja branilce običajne slabosti stanejo več."
- Nadzorujte izhodni promet. Ves odhodni promet privzeto zavrnite, posrednike in predpomnilnike za programske pakete pa obravnavajte kot izhode na internet.
- Poverilnice naj bodo kratkotrajne in ozke. Med nauki Hugging Face sta zapora dostopa do metapodatkovnih storitev v oblaku in ožji obseg vsake poverilnice; Cloud Security Alliance priporoča "kratkotrajne poverilnice za vsako nalogo posebej namesto dolgotrajnih storitvenih računov".
- Spremljajte celotno pot agenta, s hitrostjo stroja. Nihče ne pregleda 17.600 dejanj ročno, pa tudi samodejna triaža pri Hugging Face sprva ni opozorila dežurne ekipe. Spremljajte vsak korak, ne le končnega odgovora, zapise pa hranite tam, kamor agent ne seže.
- Pustite pošten način za neuspeh. OpenAI od svojih agentov zdaj zahteva, da prosijo za pojasnilo ali se varno ustavijo, namesto da bi posegali po "vse bolj vprašljivih alternativah".
O človeški plati varnosti preberite naš prejšnji članek o človeškem požarnem zidu.





Komentarji
Komentarje pregledamo, preden jih objavimo.
Komentarjev še ni. Bodite prvi.