Egy szimulált, kitalált vállalat rendszerét kellett volna teszt jelleggel feltörnie, ehelyett három teljesen valódi cég éles informatikai rendszerébe jutott be a Google Gemini mesterséges intelligenciája. A kiberbiztonsági kísérlet során a modell az egyik esetben addig próbálkozott jelszavakkal, amíg sikerült belépnie, két másik alkalommal pedig nyilvánosan elérhető online adattárakban talált működő hitelesítő adatokat, és azokkal nyitott ajtót valódi rendszerekre.
Bár a Gemini mindhárom alkalommal magától leállt, amikor ráébredt, hogy már nem a mátrixban jár, az eset komoly biztonsági kérdéseket vetett fel. A modellnek ugyanis eleve nem kellett volna kijutnia a nyílt internetre: a tesztet végző Irregular szerint éppen a tesztkörnyezet hibás konfigurációja nyitotta ki előtte azt az ajtót, amelynek zárva kellett volna maradnia.
Követte a nyomokat és már a valódi interneten járt
Az egész történet még májusban kezdődött egy úgynevezett capture the flag, vagyis „szerezd meg a zászlót” kiberbiztonsági gyakorlattal. Az ilyen teszteknél a modelleket mesterségesen felépített környezetben engedik rá különböző informatikai feladatokra, hogy kiderüljön, milyen támadó képességekkel rendelkeznek, megtalálják-e a sebezhetőségeket, és képesek-e megszerezni a kijelölt információkat.
A Gemini előtt is ilyen feladat állt. Az Irregular nevű független AI-biztonsági vállalat tesztkörnyezetében egy fiktív cég rendszeréből kellett információt megszereznie. Csakhogy két szerencsétlen körülmény találkozott: a kitalált vállalat neve megegyezett egy valóban működő cég nevével, a Gemini pedig a teszt során véletlenül internet-hozzáférést is kapott.
A Gemini pedig keresni kezdett, és a gondosan elkerített digitális homokozó helyett egyszer csak kisétált a nyílt internetre, ahol már nem díszletként felépített szerverek és mesterséges célpontok várták. Az első esetben egy valódi vállalat védett szolgáltatásához próbált hozzáférni. Jelszavakkal kísérletezett egészen addig, amíg sikerült bejutnia. Ezen a ponton azonban felismerte, hogy a célpont nem a teszt része, és megszakította a műveletet.
A következő futtatásoknál a Gemini újabb utakat talált a külvilágba. Webes keresést végzett a fiktív vállalat neve alapján, majd két esetben nyilvánosan hozzáférhető adattárakban olyan hitelesítő adatokat talált, amelyek valódi vállalatok védett rendszereihez tartoztak. A modell úgy kezelte ezeket, mintha a számára kijelölt feladat részei lennének. Megpróbálta használni őket és működtek. Így a Gemini még két olyan vállalat infrastruktúrájába jutott be, amelyeknek semmi közük nem volt az Irregular kiberbiztonsági gyakorlatához. A Google szerint mindkét eset ugyanúgy végződött: amikor a modell felismerte, hogy valódi céget ért el, megszakította a behatolást.
A három érintett vállalat nevét nem hozták nyilvánosságra. Heather Adkins, a Google biztonsági mérnöki részlegének alelnöke közölte, hogy mindhárom céget értesítették, és együtt dolgoztak a tesztet végző partnerrel a folyamat megváltoztatásán. Az Irregular szerint a kapcsolódó problémákról július végén valamennyi érintett AI-labort tájékoztatták, az általuk ismert hibákat pedig hetekkel ezelőtt kijavították. A Google azt sem közölte, pontosan melyik Gemini-változat szerepelt a tesztben. A nyilvánosságra került beszámolók szerint azonban nem a vállalat legújabb modelljéről volt szó.
A történetet elsőként a Wall Street Journal tárta fel, a Google pedig pénteken megerősítette a három esetet. A tényeken túl azonban már egészen másképp fest a történet attól függően, honnan nézzük.
A Google értelmezésében a történtek nem azt bizonyítják, hogy a Gemini szembefordult volna az alkotóival, vagy saját, veszélyes célt talált volna ki magának. A vállalat szerint lényeges, hogy a modell mindhárom esetben megállt, miután felismerte, hogy valódi vállalati rendszert ért el. A Google ezért nem tekintette az esetet úgynevezett misalignmentnek, vagyis olyan helyzetnek, amelyben a modell viselkedése eltér az ember által meghatározott céltól. A vállalat eredetileg nyilvánosságra sem hozta a három incidenst. Az esetek azután kerültek nyilvánosságra, hogy a Wall Street Journal kérdésekkel fordult a Google-höz.
Jack Cable fehérkalapos hacker, a Corridor AI biztonsági vállalat vezetője a Wall Street Journalnak arról beszélt, hogy az ilyen eseteknél nem lehet kizárólag azt nézni, keletkezett-e végül kár. A modell olyan rendszerekhez szerzett hozzáférést, amelyek nem tartoztak a számára kijelölt teszthez. A Wall Street Journal maga is a Google AI-rendszerének első ismert ilyen „kitöréseként” írta le az esetet.
Az OpenAI, az Anthropic és a Meta tesztjeinél is történt hasonló
Az Irregular olyan tesztekben is részt vett, amelyek során az OpenAI, az Anthropic és a Meta modelljeinél szintén előfordult, hogy a mesterséges intelligencia a számára kijelölt tesztkörnyezeten kívüli valódi rendszereket ért el. Ezt nem utólagos találgatásként állítják: az érintett vállalatok korábban maguk is nyilvánosságra hoztak hasonló incidenseket, az Irregular pedig megerősítette, hogy ugyanahhoz a tesztelési problémához kapcsolódtak.
A modellek reakciója azonban nem minden esetben volt ugyanolyan. Az Al Jazeera a Wall Street Journal beszámolója alapján azt írta, hogy egy Anthropic Claude-modell egy hasonló vizsgálat során nem állt le azután sem, hogy felismerte: valódi vállalat rendszerét éri el. Az OpenAI és a Meta modelljeihez kapcsolódóan szintén kerültek már nyilvánosságra olyan tesztincidensek, amelyeknél a modell a szimuláció határain kívülre jutott.
Az Irregular szerint ezeknél az eseteknél ugyanahhoz az alapvető problémához vezetett vissza a nyom: a kiberbiztonsági tesztekben részt vevő modellek olyan hozzáférést kaptak, amelyen keresztül valódi internetes rendszereket is elérhettek. A cég július végén értesítette az érintett laborokat, majd módosította a tesztelési folyamatot.
