Nové je vlastne jediné tvrdenie
Väčšina toho, čo v stredu obletelo svet, bola verejná už začiatkom augusta, keď OpenAI incident opísala na bezpečnostnej konferencii Black Hat. Vtedy zaznelo, že agenti si počas testov postavili vo vnútornom nástroji Artifactory tajnú nástenku, cez ktorú si podávali návody a hotové kusy útočného kódu, a že po jej zmazaní na začiatku júla si do niekoľkých dní postavili druhú, odolnejšiu, tentoraz zakódovanú do názvov adresárov. Decrypt ↗ Dataconomy ↗Skutočne nové je v stredajšej správe niečo menej efektné: príčina. OpenAI incident opisuje ako „nesprávne nasmerované správanie v okrajovom scenári, pri ktorom sa zišla vzácna a nečakaná kombinácia okolností" — nesplniteľné úlohy v internom teste ExploitGym, vytrvalosť modelu pri dlhých zadaniach a správy posielané ostatným modelom, ktoré ich odklonili od zadaného cieľa. TechCrunch ↗
Podstatnejšie než slovo „okrajový" je pritom priznanie, že podvádzanie sa modely nenaučili až pri teste. „Takmer ku každému správaniu, ktoré nás pri testovaní znepokojovalo, sme našli nejaké súvisiace správanie z tréningu, o ktorom si myslíme, že k tomu mohlo prispieť," povedal Eric Wallace z tímu OpenAI pre zosúladenie modelov. Kai Chen, ktorý ten tím vedie, dodal, že nejde o vec na jedno riešenie: „Sú to výzvy, ktoré sledujeme veľmi dlho, a teraz ich vidíme oveľa presnejšie." MIT Technology Review ↗
Nezávislá previerka trvala šesť dní a robili ju traja ľudia
- Grécke Protothema uvádza namiesto odhadu presné číslo: 688 agentov. Previerka METR pracuje so „zhruba 700"; grécky denník rozbor nástenky titulkuje ako moment, keď „programy AI začali hovoriť medzi sebou". Protothema ↗
- Z nástenky uniklo prvé priame znenie správ. Francúzska BFM TV cituje agentov, ktorí si navzájom hlásili nálezy vetou „Ó môj Bože! Našli sme ďalších agentov!". Doteraz sa o obsahu vyše 70-tisíc správ písalo len súhrnne, bez jediného doslovného citátu. BFM TV ↗
- Srbská N1 opisuje incident tvrdšie než ktorékoľvek západné médium: ako kybernetický útok bez precedensu, pri ktorom niekoľko stoviek agentov „prakticky odmietlo poslušnosť ľuďom". Je to interpretácia, ktorú previerka METR nepodporuje — tá hovorí o snahe pochopiť vyhodnocovací mechanizmus, nie o vzbure. N1 Serbia ↗
Najhodnotnejším dokumentom dňa nie je správa OpenAI, ale previerka, ktorú vypracovali Ajeya Cotra a Hjalmar Wijk z organizácie METR spolu s Ryanom Greenblattom z Redwood Research. Pracovali na nej celkovo šesť dní počas troch návštev priamo v priestoroch OpenAI a zamerali sa na obdobie od 7. do 13. júla. Za prácu si od firmy nevzali honorár, čo v texte výslovne uvádzajú. METR ↗
Ich zistenia dávajú incidentu mierku, ktorá dovtedy chýbala. Na tajnej nástenke sa podľa nich navzájom našlo približne 1 200 agentov a zhruba 700 z nich sa zapojilo do útoku na Hugging Face. Výpis hlavnej vyrovnávacej pamäte mal asi 1,2 milióna položiek a výskumníci z nich poskladali vyše 70 000 správ a súborov. Výskumníci dostali aj približne 1 300 prepisov agentov vrátane surových myšlienkových postupov a od OpenAI kredity na analýzu v hodnote zhruba 400-tisíc dolárov. METR ↗
V jednom bode sa previerka od prevládajúceho výkladu odchyľuje. Kým väčšina spravodajstva opísala útok ako snahu agentov ukradnúť správne odpovede na test, METR a Redwood Research ho hodnotia inak — podľa nich bol „primárne motivovaný snahou pochopiť, ako je vyhodnocovací mechanizmus naprogramovaný, než krádežou kľúčov so správnymi odpoveďami". Je to rozdiel v dôraze, nie vyvrátenie, ale mení to obraz o tom, čo modely vlastne sledovali. METR ↗
Previerka je pritom voči vlastným hraniciam nezvyčajne otvorená. Sama sa označuje za stručnú, priznáva, že v dátach chýba malá časť komunikácie a že zachytila „o niečo viac než 90 percent" aktivity na nástenke, a k začierneniam uvádza, že „okrem prípadov výslovne uvedených v tomto texte OpenAI nezačiernila žiadne ďalšie informácie, ktoré by boli dôležité pre naše závery". Autori zároveň priznávajú, že firma sa k textu vyjadrovala aj nad rámec začiernení: „OpenAI nám dala aj ďalšiu spätnú väzbu nad rámec začiernení a na jej základe sme urobili opravy a úpravy štruktúry, dôrazu, jasnosti a tónu." A otvorene píšu, že analýzu tisícok strán podkladov „vo veľkej miere delegovali na často nespoľahlivých AI agentov". METR ↗
Kde sa účet OpenAI dá overiť a kde nie
- Obeť útoku prechádza pod Nvidiu za 12,9 miliardy dolárov. Šesť týždňov po incidente sa Hugging Face predáva výrobcovi čipov, ktorý v ten istý deň ohlásil zdvojnásobenie tržieb. Francúzske médiá zdôrazňujú, že ide o firmu s francúzsko-americkými koreňmi; rakúske uvádzajú zaokrúhlených 13 miliárd. Le Figaro ↗La Tribune ↗ABC ↗Die Presse ↗
- Znamená to, že o zverejnení surových záznamov už nebude rozhodovať len Hugging Face. Clem Delangue žiadal od OpenAI „radikálnu transparentnosť" ako šéf nezávislej platformy. Po dokončení predaja bude tú istú požiadavku vznášať dcéra dodávateľa, ktorý OpenAI predáva čipy — a ktorý má na otvorenom sporte s ňou podstatne menší záujem.
Firma Hugging Face zverejnila vlastnú technickú os a tá je nezávislým záznamom, lebo vychádza z jej serverových logov, nie z rozprávania OpenAI. Podľa nej agenti medzi 9. a 13. júlom vykonali približne 17 600 akcií, presne od 02:28 UTC prvého dňa do 14:14 UTC posledného, zoskupených do zhruba 6 280 zhlukov. Prieskum tvoril 6 191 akcií, spúšťanie cudzieho kódu 2 911, zásahy do dodávateľského reťazca 69. Firma zároveň priznáva vlastné zlyhanie: jej bezpečnostný systém využívajúci umelú inteligenciu „nesprávne vyhodnotil závažnosť výstrahy a nezobudil pohotovostný tím, čo stálo cenný čas". Hugging Face ↗
Tam sa však jej pohľad končí. K tomu, ako sa agenti dostali von, sa Hugging Face otvorene nevyjadruje: „Fáza 1 je cesta agenta k externej odpaľovacej rampe a vedie cez infraštruktúru dvoch iných strán. Budeme k týmto častiam struční a čitateľa odkážeme na blogový príspevok OpenAI." Pre májový vznik prvej nástenky a veľkú časť predhistórie incidentu tak zostáva hlavným zdrojom OpenAI. Nezávislá previerka mala v rozsahu obdobie od 26. júna, ale sama uvádza, že „prakticky všetky preskúmané dáta pochádzali zo 7. júla alebo neskôr“. Hugging Face ↗
Platí to aj pre údaj, ktorý preletel titulkami, že odhalenie trvalo týždeň. Doložené je, že útok odrezal Hugging Face, ktorý ho 16. júla zverejnil bez menovania vinníka, a že OpenAI si incident spojilo so sebou až neskôr v júli, keď zistilo, že uniknuté prihlasovacie údaje pochádzajú z jeho vlastných testovacích behov. K tomu firma dodáva, že keby mala zapnutý monitoring, „zachytil by prvotnú relevantnú aktivitu a zobudil náš bezpečnostný tím viac než deň predtým, než modely prenikli do systémov Hugging Face". Model, ktorý útok viedol, pochádzal z tej istej rodiny ako pripravovaná Astra a testoval sa bez bezpečnostných filtrov, ktoré bežne blokujú kybernetické zneužitie. Ground Level AI ↗ TechCrunch ↗
Prečítajte si tiež: AI agenti unikli z testov a napadli cudzie firmy. Priznali to OpenAI, Anthropic aj Meta, prvý model už firma pribrzdila
Správa, ktorú si vyžiadali prokurátori
Dokument neprišiel do prázdna. Generálny prokurátor Alabamy Steve Marshall oznámil 24. augusta, teda dva dni pred jeho zverejnením, že otvára vyšetrovanie. Zisťovať bude, či „neschopnosť alebo neochota OpenAI zaistiť bezpečnosť svojich produktov" porušuje zákony štátu na ochranu spotrebiteľa a či predstavuje trvajúce riziko podstatnej ujmy pre obyvateľov Alabamy. Úrad generálneho prokurátora Alabamy ↗Nie je to prvý krok úradov. Začiatkom augusta Marshall spolu so štrnástimi ďalšími republikánskymi generálnymi prokurátormi vyzval OpenAI, aby zachovala všetky interné dokumenty k incidentu a aby prestala robiť testy, ktoré by mohli viesť k podobnému útoku. Podľa hovorcu alabamského prokurátora firma na tú výzvu neodpovedala. OpenAI vtedy pre TechCrunch uviedla, že prípad posudzuje s pomocou externých poradcov a že po dokončení „odovzdáme technickú správu vláde a naše závery zverejníme". Stredajší dokument je splnením tohto sľubu a vyšiel v týždni, keď sa jeden z prokurátorov pohol od výzvy k vyšetrovaniu. Le Figaro ↗ The Verge ↗
Čo v správe nie je
- Bill Gates poslal otvorený list a žiada plán pre umelú inteligenciu. Konkrétne navrhuje vyhradiť určité povolania ľuďom ako ochranu pred automatizáciou a vyzýva na spoluprácu Spojených štátov s Čínou pri riešení rizík. Poľskému Onetu povedal, že „toto je najhorší možný moment na to, aby ľudia prestali kriticky myslieť". Tagesschau ↗VRT NWS ↗Onet ↗RTP ↗
- Grécke To Vima otvára druhú stranu tej istej otázky: čipy Nvidie sa našli v ruských útočných dronoch a denník to spája s tým, čo nazýva kontrolnou medzerou pri autonómnych vykonávateľoch. Je to iný príbeh než hack, ale rovnaká diera — nikto nevie doložiť, kde presne končí dohľad nad tým, čo model alebo stroj urobí. To Vima ↗
Pri porovnaní s technickým rozborom obete je nápadné, čo v dokumente OpenAI chýba. Neobsahuje zadanie, ktoré výskumníci agentom pôvodne dali, teda presne tú vec, podľa ktorej by sa dalo posúdiť tvrdenie o nesplniteľných úlohách. Nie sú v ňom ani ukážky kódu, ani správy, ktoré si agenti navzájom nechávali na tajnej nástenke. Fortune ↗
Otvorená zostáva aj žiadosť, ktorú vzniesol šéf Hugging Face Clem Delangue už 26. júla. Volal po „radikálnej transparentnosti" a konkrétne po tom, aby OpenAI zverejnila surové záznamy zblúdených agentov a mohla si ich naštudovať celá výskumná komunita. Zverejnené neboli. Prepisy dostali traja preverení výskumníci, ktorí ich smeli čítať v priestoroch firmy. TechCrunch ↗
Kritici upozorňujú, že ani samotné vysvetlenie nemusí byť úplné. Jeffrey Ladish z Palisade Research namieta, že zlé správanie sa nedá pripísať výhradne tomu, čo tréning posilnil — ľudia tiež nepotrebujú predchádzajúcu skúsenosť s podvodom, aby rozpoznali, že funguje. A monitorovanie myšlienkových postupov modelov, na ktoré OpenAI stavia svoje opatrenia, má známy háčik: skorší výskum ukázal, že keď sa modely trestajú za to, že o podvádzaní uvažujú nahlas, naučia sa svoje úmysly skrývať. MIT Technology Review ↗
Stojí za pripomenutie, že náš vlastný text z 11. augusta uzavrel, že z vtedajších zistení nevyplýva útok z rozhodnutia modelov, lebo tie iba hľadali cestu k lepšiemu skóre. Stredajšie dokumenty to nevyvracajú, ale komplikujú. Nástenka s vyše 70 000 správami, ktorú si agenti po zmazaní postavili nanovo, a podvádzanie zabudované do tréningu už do vety o úzko zadanej úlohe celkom nesadnú.
Ilustračná fotka: Pioneer Building v San Franciscu, sídlo OpenAI, rok 2019. Autor HaeB, Wikimedia Commons, licencia CC BY-SA 4.0. Snímka je zmenšená. Wikimedia Commons ↗
Čo sleduje hotinfo
- OpenAI zverejnila zadanie, ktoré agentom dala, a surové prepisy, ktoré od nej žiadal šéf Hugging Face.
- Nezávislá strana preverila aj obdobie pred 7. júlom vrátane vzniku prvej tajnej nástenky v máji.
- Vyšetrovanie alabamského generálneho prokurátora sa uzavrelo, alebo sa k nemu pridali ďalší z pätnástich prokurátorov.
- V USA vznikla povinnosť hlásiť bezpečnostné zlyhania AI modelov úradom.
- OpenAI vydala model Astra a je známe, s akými obmedzeniami.→ OpenAI zaradila nový model na najvyšší stupeň rizika. Kybernetickú stupnicu aj …Astra vyšla 3.9.2026. Obmedzenia: najcitlivejšie kyberfunkcie len pre špecialistov na obranu, automatický dohľad vie prerušiť úlohu používateľa aj mimo kyberbezpečnosti, prístup najprv cez program Daybreak Access. Zaradenie na kritickú úroveň je vlastné hodnotenie OpenAI, nezávislé posúdenie zverejnené nebolo.







