A Microsoft AI ügynöke a tesztek 30 százalékában nem védte meg az ügyféladatokat

enlightened Ez az oldal a közösségért készül. heart Kövess minket máshol is:  Linux Mint Magyar Közösség a Mastodon-on  Telegram csatorna – csak hírek  Beszélgessünk a Telegram – Linux csevegő csoport  Hírek olvasása RSS segítségével  Linux Mint Hivatalos Magyar Közösség a Facebook-on      Linux Mint Baráti Kör a Facebook-on
wink Ha hasznosnak találod, és szeretnéd, hogy folytatódjon, támogasd a munkát Ko-fi vagy Paypal segítségével. laugh

kami911 képe

Az AI ügynökök elvileg megkönnyítik az életünket azzal, hogy feladatokat végeznek helyettünk, de ha nagyobb önállóságot adunk a szoftvernek, az kényelmetlen biztonsági kérdéseket is felvet. A Microsoft most egy ilyen problémát mutatott be egy teszt AI ügynökkel, amely a vonatkozó értékelési beszélgetések 30 százalékában kiadott szimulált ügyféladatokat.

Fontos, hogy a Microsoft nem hozott nyilvánosságra valódi ügyféladatokat. Egy ellenőrzött tesztről volt szó, számlázási ügyfélszolgálati ügynökkel és szimulált fiókokkal. Az eredmények viszont jól megmutatják, mi történhet, ha hasonló viselkedés éles rendszerben jelenik meg.

A kísérlet a Microsoft új, run-assert-eval nevű nyílt forráskódú eszközén végzett munka része. A cél, hogy a fejlesztők fel tudják deríteni az AI ügynökök kockázatos viselkedését, mérni tudják, milyen gyakran fordul elő, létrehozzanak runtime védelmeket, majd újra leteszteljék az ügynököt, hogy kiderüljön, ezek a védelmek valóban működnek-e.

A Microsoft számlázási ügyfélszolgálati ügynökének az adott ügyfél saját fiókjából kellett volna információt adnia. Emellett meg kellett akadályoznia, hogy másik fiók adataihoz hozzáférjen, ami minden érzékeny adatot kezelő rendszer esetében alapkövetelmény.

A Microsoft alapértékelése során azonban az ügynök 40 releváns beszélgetésből 12-ben egy másik szimulált ügyfél adatait is kiadta. Ez 30 százalékos szabálysértési arány, és a Microsoft megjegyzi, hogy egy éles környezetben az ilyen viselkedés adatvédelmi incidensnek minősülhet.

A vállalat ezután a saját eszközeivel olyan runtime szabályt hozott létre, amelynek célja az ilyen viselkedés megakadályozása. Ahelyett, hogy egyszerűen további utasításokat adott volna az AI-nak, és bízott volna benne, hogy azokat betartja, a vezérlés a kritikus eszközök meghívása előtt ellenőrzi a fiókazonosítókat, majd az eredményeket is átnézi, hogy a helytelenül lekért információ ne kerülhessen be a modell kontextusába.

Miután ezeket a védelmeket bevezették, a Microsoft újra lefuttatta az értékelést. Az ügynök 34 releváns beszélgetésből 2-ben sértette meg a szabályt, így a megfigyelt szabálysértési arány 5,9 százalékra csökkent. Ez jóval kedvezőbb a 30 százaléknál, bár ügyféladatok esetében nyilvánvalóan a nullához közeli érték lenne az elfogadható.

A Microsoft megközelítésének egyik érdekes eleme, hogy maga az értékelés változatlan marad. A viselkedés definíciója, a tesztesetek és az értékelő ugyanazok az alap- és a védett futások során is, így a runtime szabály az egyetlen szándékos változó, nem pedig a teszt módosítása a kedvezőbb eredmény érdekében.

A workflow több Microsoft-projektet kapcsol össze. A Clarity a kockázatok feltárásáért felel, az ASSERT az ügynök viselkedését értékeli, az Agent Control Specification pedig a runtime érvényesítést kezeli. A run-assert-eval fogja össze ezeket az elemeket, így a fejlesztők a probléma azonosításától eljuthatnak egy lehetséges védelem teszteléséig anélkül, hogy az egész folyamatot nekik kellene összerakniuk.

Az emberi tényező sem tűnik el a képletből. A Microsoft szerint a generált szabályzatokat mindig átnézik, mielőtt lefuttatják a felügyelt értékelést. Ez fontos részlet, hiszen ezek a szabályok dönthetik el, hogy egy autonóm ügynök mely fiókokhoz, adatbázisokhoz és eszközökhöz férhet hozzá.

Az ASSERT és az Agent Control Specification MIT-licenc alatt érhető el, a run-assert-eval pedig az ASSERT tárolón keresztül. A Microsoft úgy képzeli, hogy ez a folyamat ismételhető release-küszöbbé válik az AI ügynökök számára, és a fejlesztők még a rendszerek élesítése előtt felmérhetik a kockázatos viselkedést.

Itt válik az egész kísérlet érdekesebbé önmagában a rémisztő 30 százalékos számnál. A cégek versenyt futnak azért, hogy az AI asszisztenseket olyan ügynökökké alakítsák, amelyek fiókokhoz férnek hozzá és valós műveleteket hajtanak végre. Ezek az extra képességek olyan következményeket hoznak magukkal, amelyek egy átlagos chatbot-hibánál nem feltétlenül jelentkeznek.

A Microsoft nem tárt fel valódi ügyféladat-szivárgást, és a szimulált tesztet sem szabad így beállítani. Azt mutatták meg, hogy egy AI ügynök milyen gyakran tud megsérteni egy látszólag egyértelmű hozzáférési szabályt – elég gyakran ahhoz, hogy a runtime védelmek már ne választható funkciónak tűnjenek.

Egy chatbot rossz válasza bosszantó. Egy autonóm ügynök, amely rossz ügyfélfiókból húz le adatokat, ennél jóval súlyosabb gondot okozhat. A Microsoft kísérlete emlékeztet rá, hogy attól, hogy elmondjuk egy AI-nak, mit ne tegyen, még nem biztos, hogy valóban meg is akadályozzuk benne.