A Mozilla 5 millió dollárt költ arra, hogy megváltoztassa, honnan szerzik az AI-cégek az adataikat

enlightened Ez az oldal a közösségért készül. heart Kövess minket máshol is:  Linux Mint Magyar Közösség a Mastodon-on  Telegram csatorna – csak hírek  Beszélgessünk a Telegram – Linux csevegő csoport  Hírek olvasása RSS segítségével  Linux Mint Hivatalos Magyar Közösség a Facebook-on      Linux Mint Baráti Kör a Facebook-on
wink Ha hasznosnak találod, és szeretnéd, hogy folytatódjon, támogasd a munkát Ko-fi vagy Paypal segítségével. laugh

kami911 képe

A mesterségesintelligencia-cégeknek óriási mennyiségű adatra van szükségük, de hogy honnan származnak ezek az adatok, és ki kap értük pénzt, továbbra is kényes kérdés. A Mozilla szerint van más megoldás is, és 5 millió dollárt tesz mögé.

A Mozilla Data Collective 5 millió dollárt kapott a Mozillától, hogy bővítse az AI-tanító adatok megosztására szolgáló platformját. A cég célja, hogy a fejlesztők sokkal változatosabb adatokhoz férjenek hozzá, miközben az adatokat szolgáltató emberek és szervezetek megőrzik az ellenőrzést afelett, hogyan használják fel ezeket.

Ez éles ellentétben áll azzal a tömeges adatgyűjtéssel, amelyre a mai generatív AI-ipar nagy része épül. Ahelyett, hogy minden online elérhető tartalmat potenciális tanítóanyagként kezelnének, a platform a pontosan visszakövethető eredetre, a licencekre és a hozzájárulásra helyezi a hangsúlyt.

Jelenleg több mint 1700 adatkészletet kínál, több mint 450 nyelven. A cég szerint 350 szervezet kapott engedélyt a hozzájárulásra, többnyelvű, multikulturális és multimodális alkalmazásokat lefedve.

A pénz is fontos része a képletnek. A Mozilla Data Collective bevezette a fizetős adatkészleteket, amelyek lehetővé teszik a tulajdonosok számára, hogy díjat számítsanak fel a hozzáférésért. A nyilvános üzleti modell szerint a letöltők 5 százalékos platformdíjat fizetnek, a feltöltők pedig megtartják az általuk meghatározott összeget. Emellett továbbra is elérhetők maradnak az ingyenes és nyílt licencek alatt közzétett anyagok.

Ez egyre fontosabbá válhat, ahogy az AI-cégek a weben már összegyűjtött óriási adatmennyiségen túl jobb minőségű tartalmakat keresnek. A több adat nem feltétlenül jelent jobb adatot, különösen akkor, amikor a fejlesztők olyan rendszereket akarnak építeni, amelyek jól működnek az online térben alulreprezentált nyelvek és kultúrák esetében is.

A cég szerint a kereskedelmi kereslet is gyorsan nő. A Mozilla Data Collective állítása szerint nagy AI-laborok, több ezer startup és növekedési fázisban lévő cég, valamint több tucat unikornis már most is használja a platformon elérhető anyagokat. Azt közölték, hogy az évesített bevételi futási rátájuk már kilencszerese annak a mérföldkőnek, amit a fejlesztés jelenlegi szakaszára kitűztek, de a konkrét bevételi adatot nem hozták nyilvánosságra.

Az új finanszírozás támogatja a bővítést multimodális kulturális videók és nagyobb szöveges gyűjtemények irányába, amelyek európai, afrikai és dél-ázsiai nyelveket fednek le. A Mozilla Data Collective további licencelési lehetőségeket, startupoknak és növekedési fázisban lévő cégeknek szánt előfizetéseket, valamint új biztonsági és adatkezelési funkciókat is tervez.

A Mozilla Data Collective a Mozilla Foundation kezdeményezéséből nőtt ki, és 2026-ban önálló, Egyesült Királyságban bejegyzett szervezetté vált. Gyökerei közé tartozik a Common Voice is, a Mozilla régóta futó projektje, amely nyíltan elérhető, többnyelvű beszéddatasetet épít.

Ebben nyilván komoly üzleti lehetőség rejlik. Az AI-fejlesztőknek minőségi tanítóanyagokra van szükségük, miközben azok a szervezetek, amelyek értékes archívumokkal rendelkeznek, sokkal szívesebben csatlakoznak, ha ők szabhatják meg a feltételeket, és pénzt is kapnak érte.

A legnagyobb kihívás a méretezés lesz. Az internet letakarítása olcsó és egyszerű. Egy olyan piactér felépítése viszont, amely a hozzájárulásra, az adatok eredetére és a tisztességes díjazásra épül, jóval nehezebb feladat.

A Mozillánál most újabb 5 millió dollár áll rendelkezésre, hogy kiderüljön, működhet-e ez a megközelítés.