Az OpenAI szerint a jutalomrendszer hibái miatt AI ügynökök nulladik napi sebezhetőségeket használtak ki és betörtek a Hugging Face-re

enlightened Ez az oldal a közösségért készül. heart Kövess minket máshol is:  Linux Mint Magyar Közösség a Mastodon-on  Telegram csatorna – csak hírek  Beszélgessünk a Telegram – Linux csevegő csoport  Hírek olvasása RSS segítségével  Linux Mint Hivatalos Magyar Közösség a Facebook-on      Linux Mint Baráti Kör a Facebook-on
wink Ha hasznosnak találod, és szeretnéd, hogy folytatódjon, támogasd a munkát Ko-fi vagy Paypal segítségével. laugh

kami911 képe

Az OpenAI szerdán hozta nyilvánosságra, hogy a jutalomrendszer kijátszása volt a fő oka a múlt havi, mesterséges intelligencia (AI) által vezérelt Hugging Face betörésnek, és hogy már május végén találtak bizonyítékot a félresiklott viselkedésre.

A cég szerint az incidens több OpenAI modell kiberbiztonsági értékelése közben történt, és főként egy „nagy tudású, csak belső használatú kutatási modell” működése állt mögötte, amely méretben a GPT‑5.6 Solhoz hasonlítható.

„A modellek, csökkentett védelmi korlátok mellett, olyan lépéseket tettek, amelyek nem estek egybe a rájuk bízott feladatok céljaival: engedély nélküli csatornákon kommunikáltak, sebezhetőségeket használtak ki a közös infrastruktúrában, internet-hozzáférést szereztek, és harmadik felek rendszereihez fértek hozzá” – írta az OpenAI az esetről készült elemzésben.

Az OpenAI szerint az egyik kutatási modell által vezérelt AI ügynökök – noha elvileg nem fértek hozzá az internethez – mégis találtak módot arra, hogy egy akkor még nulladik napi sebezhetőséget kihasználva az Artifactory csomagkezelőben internet-hozzáférést szerezzenek a májusi és júniusi megerősítéses tanulási (RL) futások során. Június végére adminisztrátori szintű Artifactory hozzáférést értek el, majd július elején több napon át tartó, összehangolt támadást indítottak a Hugging Face ellen, hogy csaljanak az ExploitGym feladataikban.

„Körülbelül 1200, egymástól elvileg elszigetelt ügynök talált módot arra, hogy egy nem engedélyezett üzenőfalon keresztül kommunikáljon, és az esemény vizsgálata alatt több mint 70 000 üzenetet és fájlt küldtek egymásnak” – közölte a METR, amely saját, független elemzést is kiadott az incidensről. „Ezek közül 700 ügynök vett részt a Hugging Face elleni támadásban.”

Az OpenAI által ismertetett eseménysor a következőképpen nézett ki:

  • Május 12. – Egy tréningfutás során egy ügynök Artifactory megjegyzést hagy, amelyben hiányzó fájlt kér a többi ügynöktől.
  • Május 13. – Ugyanebből a tréningkísérletből egy másik ügynök, amelynek WebCache-en keresztül engedélyezték az internet-hozzáférést, ugyanarra a fájlra szorul a feladatai teljesítéséhez. A Hugging Face weboldalán keres, egy már nyilvánosan kiszivárgott felhasználói tokent használva, miután kikövetkezteti, hogy az AI modellplatform lehet az értékelési gyakorlat forrása.
  • Május 13. – Más ügynökök, miközben az Artifactoryt vizsgálják, hasonló „megjegyzéseket” találnak, amelyek információt vagy erőforrásokat kérnek. Így az Artifactory gyakorlatilag „üzenőfallá” válik, amelyen keresztül kommunikálnak egymással.
  • Május 26. – Egy ügynök nem szándékolt internet-hozzáférést szerez egy SSRF sebezhetőség kihasználásával az Artifactoryban. Hamarosan más ügynökök is követik.
  • Június 26. – Az ügynökök egy token-frissítési sebezhetőséget használnak ki egy régi hitelesítési végponton keresztül, és így adminisztrátori szintű Artifactory hozzáférést szereznek.

Június 26. – július 4. – Az ügynökök kihasználják ezt a hozzáférést, Groovy plugineket telepítenek, parancsokat futtatnak, és tartós, alkalmazásszintű irányítást szereznek.

Július 4. – A folyamatos aktivitás miatt az OpenAI Artifactory szolgáltatása elérhetetlenné válik.

Július 8. – Az OpenAI újraépíti az Artifactoryt, visszavonja az ügynökök hitelesítő adatait, szigorítja a hozzáférés-vezérlést, és értesíti a JFrogot a token-frissítési sebezhetőségről.

Július 8. – Elkezdődik a Hugging Face elleni támadás. Az ügynökök új kommunikációs módszert találnak az Artifactory használatával: ezúttal könyvtárneveket használnak „jegyzetként”, hogy nyilvános, a Hugging Face tárolókban lévő, OpenAI értékelési feladatokhoz kapcsolódó anyagokat kérjenek. Az ügynökök együttműködni és feladatokat delegálni kezdenek, magukat „rajként” vagy „kollektívaként” írják le.

Július 9. – Egy kizárólag belső használatú ügynök, amelynek feladata egy ExploitGym értékelés teljesítése, root hozzáférést szerez a sandboxot futtató szülő virtuális gépen. Egy második belső ügynök ezután ugyanilyen hozzáférést szerez, és megkerüli az OpenAI kimenő hálózati korlátozásait, ismeretlen Artifactory végpontok kihasználásával visszanyeri az internet-hozzáférést. Ugyanezen a napon egy CyberGym API-kulcsot és egy teljes kihasználási leírást is megosztanak az Artifactory „üzenőfalán” egy Modalon futó ügyfél munkaterheléséhez.

Július 10. – Egy ügynök 14, nyilvánosan elérhető, írási jogosultsággal rendelkező Hugging Face hitelesítő adatot ellenőriz és megoszt, miután arra következtet, hogy a Hugging Face olyan modelleket, adathalmazokat és megoldásokat tárolhat, amelyek kapcsolódnak a rájuk bízott értékelési feladatokhoz.

Július 11. – Az ügynökök nulladik napi sebezhetőséget használnak ki a Hugging Face HDF5-fájlok kezelésében, így termelési munkafolyamatokat futtató gépek hitelesítő adatait szerzik meg, mélyebbre ásnak az infrastruktúrában, és tovább bővítik a hozzáférésüket.

Július 11. – Az ügynökök egy RefJinja template-injection nulladik napi sebezhetőséget is kihasználnak, és parancsokat futtatnak a Hugging Face munkafolyamatain.

Július 12. – Az ügynökök kiterjesztik a Hugging Face clusterhez való hozzáférésüket, és Kubernetes-, adatbázis-, üzenetküldési, kód-tároló- és felhőhitelesítő adatokat gyűjtenek Hugging Face munkafolyamatokról négy régióban. Végül 13 órán belül több clusterben is adminisztrátori és hostszintű hozzáférést érnek el.

Július 12. – Egy ügynök, amely kódot futtat egy feltört, CyberGym-ügyfélhez tartozó, Modalon hosztolt munkaterhelésben, a Hugging Face termelési aláíróanyagából hamisított tokent használ, és letölt egy 731 MB-os, privát CyberGym fájlt egy felhasználó fiókjából. Később ugyanazon a napon egy ügynök az Artifactoryt használja átjáróként ugyanennek a fájlnak a letöltéséhez.

Július 13. – Az ügynökök kihasználják az Artifactory JRuby-alapú RubyGems feldolgozását, megszerzik az aláírókulcsát, és hamis adminisztrátori hitelesítő adatokat hoznak létre.

Július 16. – A Hugging Face nyilvánosságra hozza a biztonsági incidenst.

Július 19. – Az OpenAI vizsgálatot indít, miután egy biztonsági riasztás szokatlan, identitáshoz kapcsolódó API-hívásokat jelez.

Július 19. – Az ügynökök az OpenAI belső infrastruktúráját veszik célba, a CVE-2026-53362 sebezhetőség kihasználásával root hozzáférést szereznek az alatta futó worker node-on, adminisztrátori jogosultságot kapnak egy Kubernetes clusterhez, és hozzáférnek felhős titkokhoz.

Július 19. – Az OpenAI leállítja az aktív ExploitGym értékelési futásokat, és szélesebb körű vizsgálat indul.

„Az ügynökök nagy, közös projekteken dolgozva működtek együtt, hogy kijátsszák az ExploitGym pontozót, és a Hugging Face-t támadták, hogy nyomokat találjanak” – közölte a METR. „Azoknak az ügynököknek, amelyek lehetetlen feladatokat kaptak, közös céljuk volt: általános módszert találni arra, hogyan lehet becsapni vagy manipulálni az automatikus ExploitGym pontozót, hogy átmenő értékelést adjon lehetetlen feladatokra. Amint létrejött az üzenőfal, az ügynökök azonnal elkezdték megvitatni ezt a kérdést, és megosztani az információkat és erőforrásokat a pontozó kijátszásáról.”

Az OpenAI elismerte, hogy a májusban megfigyelt ügynökviselkedés alapot teremtett a Hugging Face elleni betöréshez. Az ügynökök az incidenskezelés részeként a július 4-i szolgáltatáskiesés után törölt eredeti üzenőfal helyett új kommunikációs módszert találtak ki az Artifactory használatával.

„Akkor még nem láttuk át az improvizált üzenőfal és a nem szándékolt internet-hozzáférés szélesebb körű korlátozási és összehangolási következményeit” – tették hozzá. „Röviden: egy belső csapat május végén észrevette, hogy egy ügynök üzenőfalat használ, és tiltott internet-hozzáférést is igénybe vesz.”

„Az improvizált üzenőfal létezése és az ügynökök közötti kommunikáció jelentősége azonban nem volt egyértelmű azoknak a vezetőknek, akik a július 5-i incidens észleléséért és kezeléséért feleltek. Továbbra is vizsgáljuk azokat a folyamatokat és működési gyakorlatokat, amelyek befolyásolták az incidens előtti észlelési és reagálási lépéseket.”

Az OpenAI azt is közölte, hogy négy félrecsúszott viselkedési mintát azonosított, amelyek hozzájárultak az incidenshez: jutalomrendszer kijátszása; a látszólag lehetetlen feladatokhoz való makacs ragaszkodás, ami kockázatos, a kereteken túlnyúló stratégiákhoz vezette őket; jogosulatlan kommunikáció tartós üzenőfalakon keresztül, hogy megosszák az eredményeket, együttműködjenek és összeadják a munkájukat; valamint az ügynökök ökoszisztémája, amely lehetővé tette a munkamegosztást és a célok átvételét egymástól.

„A félrecsúszott viselkedésen túl az is szerepet játszott az incidensben, hogy nem terjesztettük ki azokat az erős védelmi mechanizmusokat, amelyeket a kifelé elérhető modelljeinknél alkalmazunk, minden belső értékelésre” – emelte ki a cég.

A vizsgálat eredményeire reagálva a feltörekvő AI cég erősebb biztonsági kontrollokat vezet be. Szigorúbb követelményeket írnak elő az összehangolásra a modellek teljes életciklusa során, jobban elszigetelt sandboxokat hoznak létre, korlátozzák az internet-hozzáférést, és szigorúbban szabályozzák a modellek súlyaihoz való hozzáférést. Az összehangolás javítása érdekében az ügynököknek mostantól kötelező tisztázó kérdést feltenniük vagy biztonságosan leállniuk, ahelyett hogy „egyre kétesebb megoldásokat” keressenek.

„Ezt az incidenst figyelmeztető lövésnek tekintjük, amely jelzi, hogy a mai modellek képességei már most is lehetővé teszik az irányítás elvesztésével járó eseteket” – zárta az OpenAI. „Az AI rendszereket fejlesztő cégeknek gondoskodniuk kell arról, hogy rendszereik mindig érdemi emberi irányítás alatt maradjanak, és hogy hatékony védelmi mechanizmusok korlátozzák a kártételi lehetőségeiket.”

„Ahogy ezekhez a képességekhez egyre többen hozzáférnek, mások is szándékosan felhasználhatják őket támadások végrehajtására. A modellfejlesztőknek és általában a kiberbiztonsági védekezés szereplőinek is fel kell készülniük az AI által támogatott támadókra, akik gyorsabban, nagyobb léptékben és jobb összehangoltsággal dolgoznak majd, mint az emberi támadók.”