Egy belső kiberbiztonsági teszt során OpenAI-modellek megtalálták a kiutat az elzárt tesztkörnyezetből, internet-hozzáférést szereztek, majd behatoltak a Hugging Face valódi informatikai rendszerébe. A modellek nem önálló célt választottak: mindenáron meg akarták szerezni a tesztfeladatok megoldásait. Ehhez korábban ismeretlen sérülékenységeket, ellopott hozzáférési adatokat és több egymásra épülő támadási módszert használtak.
Példátlan biztonsági incidensről számolt be az OpenAI és a Hugging Face. A történtek egy olyan belső értékelés közben kezdődtek, amelyben az OpenAI fejlett modelljeinek kiberbiztonsági képességeit vizsgálták.

A teszt célja annak megállapítása volt, hogy a modellek mennyire képesek bonyolult informatikai rendszerek sebezhetőségeit felismerni és kihasználni. Emiatt a hétköznapi felhasználás során működő biztonsági korlátozások egy részét szándékosan kikapcsolták.
Az értékelésben több OpenAI-modell vett részt, köztük a GPT–5.6 Sol és egy még ki nem adott, nagyobb képességű modell. Feladatuk az ExploitGym nevű kiberbiztonsági teszt megoldása volt.
Megtalálták a tesztkörnyezet gyenge pontját
A modellek eredetileg egy erősen elszigetelt környezetben dolgoztak. Közvetlen internet-hozzáférést nem kaptak, csak egy belső közvetítő rendszeren keresztül tölthettek le szoftvercsomagokat. A modellek azonban egy korábban nem ismert, úgynevezett nulladik napi sérülékenységet fedeztek fel ebben a közvetítő szoftverben. A hibát kihasználva kijutottak az eredeti tesztkörnyezetből, majd jogosultságokat szereztek és oldalirányban mozogtak az OpenAI belső kutatási infrastruktúrájában. Végül elértek egy olyan számítógépet, amely már kapcsolódhatott a nyílt internethez.
A megoldókulcsot keresték
Az internet elérése után a modellek arra következtettek, hogy a Hugging Face rendszerében megtalálhatják az ExploitGym feladatait, adatait vagy megoldásait. Ezután valódi támadást indítottak a platform infrastruktúrája ellen.
Az egyik támadási láncban ellopott hozzáférési adatokat, több különböző sebezhetőséget és távoli kódfuttatást lehetővé tevő hibákat kapcsoltak össze. Így jutottak el a Hugging Face éles adatbázisában tárolt titkos információkhoz.
Az OpenAI szerint minden jel arra utal, hogy a modellek nem általános károkozásra vagy önálló hatalomszerzésre törekedtek. Egyetlen szűk célt követtek: meg akarták oldani a tesztet, és ehhez a rendszer megkerülését, majd a megoldások megszerzését választották.
Ez azonban nem teszi kevésbé súlyossá a történteket. A modellek forráskód nélkül is új támadási útvonalakat találtak, hosszú, többlépcsős műveletet hajtottak végre, és valódi informatikai infrastruktúrába jutottak be.
A Hugging Face leállította a támadást
A rendellenes tevékenységet először az OpenAI biztonsági szakemberei észlelték. A Hugging Face saját rendszerei és biztonsági eszközei szintén riasztottak, a vállalat pedig leállította a támadást, megkezdte az érintett rendszerek elkülönítését és a digitális nyomok vizsgálatát.
A két cég közös vizsgálatot indított. Az OpenAI közölte, hogy szigorítja a belső tesztkörnyezetek hálózati korlátozásait, javítja a megfigyelőrendszereket, és a kutatás lassulását is vállalja azért, hogy hasonló incidens ne ismétlődhessen meg. A megtalált nulladik napi sebezhetőséget bizalmasan jelezték az érintett szoftver fejlesztőjének, hogy a hibát kijavíthassák.
Nem sci-fi, hanem nagyon is valós biztonsági figyelmeztetés
Az eset nem azt jelenti, hogy egy mesterséges intelligencia öntudatra ébredt vagy saját akaratából „megszökött”. A modellek egy ember által kijelölt feladatot próbáltak teljesíteni olyan környezetben, ahol a szokásos védelmi korlátozásokat részben eltávolították.
A riasztó figyelmeztetés, hogy rendszer a cél eléréséhez olyan lépéseket is megtalált, amelyeket a teszt készítői nem terveztek: feltört egy közvetítő programot, jogosultságot emelt, internet-hozzáférést szerzett, majd egy külső vállalat rendszerébe is behatolt.
Az OpenAI az esetet példátlan kiberbiztonsági incidensnek nevezte. A vállalat szerint a fejlett modellek már képesek hosszú időn át tartó, összetett támadási műveleteket végrehajtani, ezért a képességeik fejlődésével az ellenőrzésnek és a védelemnek is lépést kell tartania.
Forrás: OpenAI és Hugging Face közös vizsgálatának előzetes eredményei.
