A Kernel.org harcba száll az AI-crawlerekkel: napi milliós lekérések ellen küzd

enlightened Ez az oldal a közösségért készül. heart Kövess minket máshol is:  Linux Mint Magyar Közösség a Mastodon-on  Telegram csatorna – csak hírek  Beszélgessünk a Telegram – Linux csevegő csoport  Hírek olvasása RSS segítségével  Linux Mint Hivatalos Magyar Közösség a Facebook-on      Linux Mint Baráti Kör a Facebook-on
wink Ha hasznosnak találod, és szeretnéd, hogy folytatódjon, támogasd a munkát Ko-fi vagy Paypal segítségével. laugh

kami911 képe

Az AI-crawlerek egyre jobban terhelik a kernel.org infrastruktúráját: a projekt már a teljes CPU-kapacitásának nagyjából 20%-át csak az automatizált lekérdezések kiszolgálására használja.

Konstantin Ryabitsev, aki a kernel.org infrastruktúrájának üzemeltetésében segít, azt mondja, hogy a Git.kernel.org naponta körülbelül 6 millió kérést kap az egyes commit-oldalakra. Az Anubis proof-of-work rendszer ennek nagyjából kétharmadát blokkolja, de így is rengeteg kérés átcsúszik.

Ennek érthetően komoly hatása van. A kernel.org összesen 90 CPU-magot futtat öt helyszínen, és ebből 14–16 mag folyamatosan azzal foglalkozik, hogy a Git commitokat HTML-lé alakítsa a crawlerek számára.

„Több CPU-időt költünk arra, hogy commitokat rendereljünk a crawlereknek, mint amennyit az összes többi, jogos hozzáférésre együttvéve, beleértve a Git klónozását is.”

Külön bosszantó, hogy a letöltött adatok eleve szabadon elérhetők Git-en keresztül. Ahelyett, hogy a crawlerek klónoznák a tárolókat, és helyben dolgoznának velük, sokan egyesével kérik le a commit-oldalakat.

A helyzetet az is súlyosbítja, ahogyan a Git.kernel.org felépül. A fő Linux tárolóban nagyjából 1,48 millió commit van, és az oldal több száz forkot is kiszolgál. A commitok, javítócsomagok, difffájlok és sima szöveges nézetek sokféle megjelenítése miatt óriási számú URL áll a crawlerek rendelkezésére.

A kernel.org többféle módszerrel próbálta kordában tartani a forgalmat, például bizonyos IP-címek és hálózatok tiltásával. Idővel azonban ezek a lépések egyre kevésbé működtek, mivel a crawlerek lakossági és mobil proxyhálózatokra álltak át.

Később bevezették az Anubist, amely egy kis proof-of-work feladat megoldására kéri a látogatókat, mielőtt használhatnák az oldalt. Nem meglepő módon a crawlerek ehhez is gyorsan alkalmazkodtak, és már a nehezebb feladatokat is megoldják.

Mindezek után a kernel.org most közvetlenebb megoldásokon gondolkodik. Csökkenthetik a bejárható URL-ek számát, és korlátozhatják az erőforrás-igényes műveleteket az anonim felhasználók számára. A Linux kernel tárolók és a fejlesztési adatok természetesen továbbra is nyilvánosan elérhetők maradnak.

További részletekért olvasd el Ryabitsev bejegyzését.