Az OpenAI közölte, hogy néhány legfejlettebb MI-modellje elszabadult, és feltört egy start-upot, miután a cég egy biztonsági teszt során elvesztette felettük az irányítást.
A ChatGPT fejlesztője szerint az ügynöke – egy olyan MI-rendszer, amely emberi utasítás után önállóan is képes működni – ellenőrzött környezetben futott, de miután gyengeségeket talált, ki tudott lépni a tesztkörnyezet korlátai közül.
Célpontnak a Hugging Face-t választották, amely a világ egyik legnagyobb MI-modell-megosztó központja, és hozzáférést szereztek a cég néhány belső rendszeréhez.
Az OpenAI „példátlannak” nevezte az incidenst, és vizsgálatot indított a Hugging Face-szel közösen. A cég vezetője, Clement Delangue az X-en azt írta, „felfoghatatlan, hogy mindez teljesen autonóm módon történt”.
„A vizsgálat még tart, és meg fogjuk osztani a tanulságokat abból, ami talán az első ilyen jellegű eset” – tette hozzá Delangue.
A kormány szóvivője közölte, hogy az Egyesült Királyság AI Security Institute-ja elemzi az incidensben látott MI-viselkedést, és továbbra is együtt dolgozik az OpenAI-jal és más laborokkal a védelmi megoldások erősítésén.
Hozzátette, hogy a szervezeteknek fokozniuk kell a kiberbiztonságukat, például azzal, hogy csatlakoznak a kormány által támogatott Cyber Essentials tanúsítási programhoz.
Bizonytalan sandboxok
Gina Neff, a Cambridge-i Egyetem Minderoo Centre for Technology and Democracy intézetének vezetője a BBC Radio 4 Today című műsorában elmondta, hogy a sandboxnak nevezett biztonsági tesztek „elvileg olyan védett környezetek, ahol meg lehet nézni, mire képesek a modellek”.
„Ebben az esetben úgy tűnik, az OpenAI nem készített elég biztonságos sandboxot” – mondta.
Ahelyett, hogy csak a tesztet futtatták volna, az ügynökök saját kibertámadást indítottak magával a sandboxszal szemben, és olyan sebezhetőséget találtak, amely lehetővé tette számukra a korlátozások megkerülését.
Miután kijutottak, az MI a Hugging Face-t azonosította a tesztben keresett válaszok valószínű forrásaként, és megpróbált hozzáférést szerezni.
Neil Lawrence, a Cambridge-i Egyetem gépi tanulás professzora „lenyűgöző teljesítménynek” nevezte az esetet, de figyelmeztetett, hogy „bőven a jelenlegi, nagy teljesítményű MI-modellek ismert képességein belül marad”.
„Az OpenAI most próbál felzárkózni, igyekszik bemutatni a saját rendszereinek képességeit a kiberbiztonság terén.”
„Ez azt mutatja, hogy az OpenAI nem tudja biztonságosan bevezetni a saját technológiáját” – tette hozzá.
A cég közölte, hogy lezárta az incidenst feltáró sebezhetőségeket, és újjáépítette az érintett rendszereket.
„Az autonóm, MI-vezérelt támadó eszközök már nem csak elméleti lehetőségek” – fogalmaztak.
„Egy online platform védelme ma már azt jelenti, hogy az adatokat és a modellfelületet elsődleges támadási felületként kell kezelni, és a védelemben is MI-t kell használni, hogy tartani lehessen a lépést.”
„Továbbra is itt fogunk befektetni, és megosztjuk, amit tanulunk.”
„Kijózanító pillanat”
Az incidens újra ráirányította a figyelmet arra, mire képesek a fejlett MI-rendszerek, és hogy a jelenlegi védelmi megoldások elegendőek-e, miközben a technológia egyre erősebbé válik.
Spencer Starkey, a SonicWall kiberbiztonsági cég egyik vezetője a BBC-nek azt mondta, az eset egyértelművé tette, hogy a szervezeteknek „szintet kell lépniük” a saját védelmükben, és a „kiberrezilienciát alapvető működési prioritásként” kell kezelniük.
„A kellemetlen igazság az, hogy túl sok szervezet még mindig emberi sebességgel védekezik, miközben az ellenfelek gépi sebességre kapcsolnak” – fogalmazott.
Közben Travis Lelle, a Guidepoint Security kiberbiztonsági tanácsadó cég vezető biztonsági mérnöke úgy nyilatkozott, hogy a frissítés „kijózanító pillanat a kiberbiztonságban”.
„Ez egy ismert aszimmetriára mutat rá” – mondta.
„A támadó ügynököket semmi sem korlátozza, miközben a legjobb védelmi eszközöket olyan korlátok közé szorítják, amelyek nem értik a kontextust.”
Jake Moore, az ESET globális kiberbiztonsági tanácsadója szerint a bejelentésnek versenypiaci vetülete is lehet.
Szerinte az OpenAI igyekszik felhívni a figyelmet a saját MI-képességeire, miközben a rivális Anthropic egyre nagyobb figyelmet kap a Claude Mythos modell miatt.
„Felveti a kérdést, hogy az OpenAI mostanában talán az Anthropic marketingálmát próbálja utolérni” – mondta.

