Vocalinux: nyílt forráskódú hangalapú diktáló app Linuxra

enlightened Ez az oldal a közösségért készül. heart Kövess minket máshol is:  Linux Mint Magyar Közösség a Mastodon-on  Telegram csatorna – csak hírek  Beszélgessünk a Telegram – Linux csevegő csoport  Hírek olvasása RSS segítségével  Linux Mint Hivatalos Magyar Közösség a Facebook-on      Linux Mint Baráti Kör a Facebook-on
wink Ha hasznosnak találod, és szeretnéd, hogy folytatódjon, támogasd a munkát Ko-fi vagy Paypal segítségével. laugh

kami911 képe

Akik Linuxon rendszer-szintű hangalapú szövegbevitelt keresnek, mostantól egy nyílt forráskódú megoldás közül választhatnak: a Vocalinux egy új, adatvédelem-központú diktáló alkalmazás, amely a kimondott szöveget közvetlenül a fókuszban lévő asztali alkalmazásba illeszti be.

A Vocalinux nem különálló átiratozó eszközként működik, hanem a háttérben fut, és egy szabadon beállítható billentyűparanccsal lehet aktiválni. A felhasználók átválthatnak folyamatos rögzítésre vagy nyomva tartós beszédre, a mikrofonba diktálnak, a szöveg pedig a böngészőbe, szövegszerkesztőbe, irodai programba, terminálba, üzenetküldő kliensbe vagy bármely más aktív szövegmezőbe kerül.

A munkafolyamat hasonlít a Windows és a macOS beépített hangalapú gépelésére, de a Vocalinux kifejezetten Linuxra készült, és alapértelmezés szerint helyben dolgozza fel a beszédet. Nem kell hozzá fiók, előfizetés vagy felhőszolgáltatás, a mikrofonfelvételek a gépen maradnak.

Az alkalmazás támogatja a X11 és a Wayland munkameneteket is. A szöveg beillesztése Linuxon jelentősen eltérhet a két megjelenítési rendszer között, különösen azért, mert a Wayland tervezetten korlátozza az alkalmazások billentyűleütés-szimulációs lehetőségeit.

A Vocalinux három helyi beszédfelismerő backenddel működik: whisper.cpp, OpenAI Whisper és VOSK. Alapértelmezés szerint a whisper.cpp az aktív motor, amely a Whisper beszédfelismerő modell optimalizált natív megvalósítását nyújtja. A felhasználók azonban választhatnak más backendet is a hardverük, a kívánt nyelv vagy a teljesítményigények alapján.

A beszédfelismerő modellek közvetlenül a felhasználó rendszerén futnak, így a Vocalinux internetkapcsolat nélkül is működik, miután a szükséges összetevőket és modelleket letöltötték.

Az alkalmazás Vulkan-gyorsítást is tud használni, ha a rendszer GPU-ja ezt támogatja. Így a beszédfelismerés AMD, Intel és NVIDIA grafikus hardveren is futhat, nem csak a processzoron. Gyengébb gépeken kisebb modelleket is választhatunk, ilyenkor némi pontosságot áldozunk fel az alacsonyabb erőforrás-igényért és a gyorsabb átiratozásért.

A magát a diktálást kiegészítve a Vocalinux rendszertálca-ikont, állítható hangjelzéseket, automatikus indítást, grafikus beállítások felületet és testreszabható billentyűparancsokat kínál. A billentyűparancs-kezelés nem amerikai billentyűzetkiosztásokkal is működik, a két aktiválási mód pedig lehetővé teszi, hogy válasszunk a dupla billentyűkombináció és a beszéd közbeni nyomva tartás között.

Bár a Vocalinux alapvetően offline használatra készült, tartalmaz egy opcionális távoli módot is. Ilyenkor nem egy kereskedelmi szolgáltatóhoz küldi az audiót, hanem egy olyan átiratozó szerverhez, amelyet a felhasználó maga üzemeltet. Támogatottak az OpenAI-kompatibilis HTTP végpontok és a whisper.cpp-hez mellékelt szerver-implementáció, emellett további motorok – például a FunASR és a SenseVoice – is használhatók kompatibilis szerverkonfigurációval.

Telepítésre a projekt interaktív shell telepítője szolgál, amely több népszerű Linux disztribúciót támogat, köztük a Ubuntu, Debian, Fedora, Arch és openSUSE rendszereket. Emellett a Vocalinux elérhető Flatpak-csomagként és az Arch AUR-ban is.

A cikk írásakor a legfrissebb verzió a Vocalinux 0.14.2. További részletekért lásd a projekt weboldalát, illetve a GitHub tárolót.