Az OpenAI egyik legnagyobb riválisának mesterséges intelligenciáját használták azok a biztonsági kutatók, akik sikeresen bejutottak az OpenAI belső rendszereinek egy részébe. A Hacktron AI csapata az Anthropic Claude modelljének segítségével talált és kapcsolt össze két kritikus sérülékenységet, majd OpenAI-alkalmazottak ChatGPT-fiókjaihoz és belső fejlesztési erőforrásokhoz is hozzáférést szerzett. A művelet etikus biztonsági kutatás volt: a kutatók jelentették a hibákat, az OpenAI kijavította őket, és 6500 dolláros jutalmat fizetett.

A történet július 25-én kezdődött, amikor a Hacktron AI kutatói az OpenAI internetes infrastruktúráját kezdték vizsgálni. A csapat azt kereste, hogy egy külső támadó milyen útvonalon juthatna el a nyilvánosan elérhető rendszerektől a vállalat érzékenyebb belső környezetéig. A kutatók ehhez már magát a mesterséges intelligenciát is munkaeszközként használták. Az Anthropic Claude modellje segített a potenciális támadási felületek vizsgálatában és a sérülékenységek kihasználásához szükséges lépések kidolgozásában. A beszámolók szerint az OpenAI saját GPT-5.6 Sol modelljét is bevonták a munkába.
Az első komoly belépési pont meglepően hétköznapi helyen jelent meg. A kutatók az OpenAI közösségi fórumának hátterében működő Discourse rendszerben találtak olyan sérülékenységet, amelyen keresztül hozzáférési tokeneket tudtak megszerezni. Ezek között OpenAI alkalmazottakhoz tartozó hitelesítési adatok is voltak. A támadási lánc itt vált igazán komollyá. A megszerzett jogosultságokkal a kutatók több OpenAI-dolgozó ChatGPT-fiókjához fértek hozzá, majd azt vizsgálták meg, hogy ezekből a fiókokból milyen további belső szolgáltatások érhetők el.
A lehetőségek köre a kutatók szerint jóval nagyobb volt annál, mint amire a vizsgálat elején számítottak. A hozzáférés elvezetett az OpenAI belső fejlesztési környezetének egy részéhez, köztük GitHubon tárolt fejlesztési erőforrásokhoz és az úgynevezett Monorepo kódtárhoz. A Hacktron kutatói azonban ezen a ponton szándékosan korlátozták saját tevékenységüket. Nem kezdtek bizalmas kódok letöltésébe, és nem próbálták bizonyítani a hozzáférést érzékeny adatok megszerzésével. Ehelyett egy ártalmatlan kódmódosítási javaslatot indítottak el, amellyel demonstrálni tudták, hogy a megszerzett jogosultság valóban működik.
A kutatók célja annak bizonyítása volt, hogy egy valódi támadó ugyanazon az útvonalon sokkal tovább juthatott volna. A sérülékenységeket ezután jelentették az OpenAI-nak. A vállalat visszavonta az érintett tokeneket, szigorította a hozzáférési jogosultságokat és kijavította a feltárt hibákat. A Hacktron AI végül 6500 dolláros jutalmat kapott a biztonsági problémák bejelentéséért.
Az eset egyik legérdekesebb része azonban maga Claude. A generatív mesterséges intelligencia néhány év alatt a programozást segítő eszközből olyan rendszer lett, amely egy kiberbiztonsági vizsgálat számos lépésében aktívan használható. Kódot elemezhet, összefüggéseket kereshet különböző hibák között, tesztelési lépéseket javasolhat, és jelentősen felgyorsíthatja azt a munkát, amelyhez korábban komoly szakértői idő kellett. Ez természetesen a védekező oldalnak is előnyt jelent. Biztonsági kutatók ugyanazokkal az eszközökkel gyorsabban fedezhetnek fel sérülékenységeket, mielőtt azokat bűnözők találnák meg. A probléma éppen az, hogy a technológia mindkét oldal rendelkezésére állhat.
Az Anthropic szeptemberben közzétett fenyegetettségi jelentésében maga is arról számolt be, hogy az elmúlt hónapokban több olyan műveletet azonosított és állított le, amelyben támadók Claude-ot próbálták rosszindulatú célokra használni. A vállalat külön kutatást is publikált olyan esetekről, amelyekben Claude-modellek biztonsági tesztek során valódi külső rendszerekhez szereztek jogosulatlan hozzáférést.
Az OpenAI-nál sem ez volt az első figyelmeztető eset. A vállalat augusztusban részletesen beszámolt egy korábbi kiberbiztonsági tesztről, amelyben OpenAI-modellek a számukra kialakított korlátozásokat megkerülve internet-hozzáférést szereztek, majd az OpenAI saját kutatási infrastruktúrájának és a Hugging Face rendszereinek egy részéhez is hozzáfértek. Az esetet az OpenAI külső szakértők bevonásával vizsgálta ki. Az AI-modellek egyre erősebb programozási és problémamegoldó képességei nemcsak új termékek létrehozását gyorsítják fel, hanem a biztonsági hibák felkutatásának és kihasználásának sebességét is megváltoztatják.
A Hacktron kísérlete végül nem okozott kárt. Az OpenAI megkapta a részletes hibajelentést, lezárta a feltárt támadási útvonalakat, a kutatók pedig megkapták a jutalmukat. A vizsgálat ugyanakkor megmutatta, hogy egy korszerű AI-rendszerrel támogatott kis biztonsági csapat milyen gyorsan képes eljutni egy világméretű technológiai vállalat nyilvános fórumától egészen annak belső fejlesztési környezetéig.
