A mesterségesintelligencia-cégeknek óriási mennyiségű adatra van szükségük, de hogy honnan származnak ezek az adatok, és ki kap értük pénzt, továbbra is kényes kérdés. A Mozilla szerint van más megoldás is, és 5 millió dollárt tesz mögé.
A Mozilla Data Collective 5 millió dollárt kapott a Mozillától, hogy bővítse az AI-tanító adatok megosztására szolgáló platformját. A cég célja, hogy a fejlesztők sokkal változatosabb adatokhoz férjenek hozzá, miközben az adatokat szolgáltató emberek és szervezetek megőrzik az ellenőrzést afelett, hogyan használják fel ezeket.
Ez éles ellentétben áll azzal a tömeges adatgyűjtéssel, amelyre a mai generatív AI-ipar nagy része épül. Ahelyett, hogy minden online elérhető tartalmat potenciális tanítóanyagként kezelnének, a platform a pontosan visszakövethető eredetre, a licencekre és a hozzájárulásra helyezi a hangsúlyt.
Jelenleg több mint 1700 adatkészletet kínál, több mint 450 nyelven. A cég szerint 350 szervezet kapott engedélyt a hozzájárulásra, többnyelvű, multikulturális és multimodális alkalmazásokat lefedve.
A pénz is fontos része a képletnek. A Mozilla Data Collective bevezette a fizetős adatkészleteket, amelyek lehetővé teszik a tulajdonosok számára, hogy díjat számítsanak fel a hozzáférésért. A nyilvános üzleti modell szerint a letöltők 5 százalékos platformdíjat fizetnek, a feltöltők pedig megtartják az általuk meghatározott összeget. Emellett továbbra is elérhetők maradnak az ingyenes és nyílt licencek alatt közzétett anyagok.
Ez egyre fontosabbá válhat, ahogy az AI-cégek a weben már összegyűjtött óriási adatmennyiségen túl jobb minőségű tartalmakat keresnek. A több adat nem feltétlenül jelent jobb adatot, különösen akkor, amikor a fejlesztők olyan rendszereket akarnak építeni, amelyek jól működnek az online térben alulreprezentált nyelvek és kultúrák esetében is.
A cég szerint a kereskedelmi kereslet is gyorsan nő. A Mozilla Data Collective állítása szerint nagy AI-laborok, több ezer startup és növekedési fázisban lévő cég, valamint több tucat unikornis már most is használja a platformon elérhető anyagokat. Azt közölték, hogy az évesített bevételi futási rátájuk már kilencszerese annak a mérföldkőnek, amit a fejlesztés jelenlegi szakaszára kitűztek, de a konkrét bevételi adatot nem hozták nyilvánosságra.
Az új finanszírozás támogatja a bővítést multimodális kulturális videók és nagyobb szöveges gyűjtemények irányába, amelyek európai, afrikai és dél-ázsiai nyelveket fednek le. A Mozilla Data Collective további licencelési lehetőségeket, startupoknak és növekedési fázisban lévő cégeknek szánt előfizetéseket, valamint új biztonsági és adatkezelési funkciókat is tervez.
A Mozilla Data Collective a Mozilla Foundation kezdeményezéséből nőtt ki, és 2026-ban önálló, Egyesült Királyságban bejegyzett szervezetté vált. Gyökerei közé tartozik a Common Voice is, a Mozilla régóta futó projektje, amely nyíltan elérhető, többnyelvű beszéddatasetet épít.
Ebben nyilván komoly üzleti lehetőség rejlik. Az AI-fejlesztőknek minőségi tanítóanyagokra van szükségük, miközben azok a szervezetek, amelyek értékes archívumokkal rendelkeznek, sokkal szívesebben csatlakoznak, ha ők szabhatják meg a feltételeket, és pénzt is kapnak érte.
A legnagyobb kihívás a méretezés lesz. Az internet letakarítása olcsó és egyszerű. Egy olyan piactér felépítése viszont, amely a hozzájárulásra, az adatok eredetére és a tisztességes díjazásra épül, jóval nehezebb feladat.
A Mozillánál most újabb 5 millió dollár áll rendelkezésre, hogy kiderüljön, működhet-e ez a megközelítés.

