Az OpenAI GPT 6.1 Sol majdnem Astra-szintű intelligenciát hoz, ötödáron

enlightened Ez az oldal a közösségért készül. heart Kövess minket máshol is:  Linux Mint Magyar Közösség a Mastodon-on  Telegram csatorna – csak hírek  Beszélgessünk a Telegram – Linux csevegő csoport  Hírek olvasása RSS segítségével  Linux Mint Hivatalos Magyar Közösség a Facebook-on      Linux Mint Baráti Kör a Facebook-on
wink Ha hasznosnak találod, és szeretnéd, hogy folytatódjon, támogasd a munkát Ko-fi vagy Paypal segítségével. laugh

kami911 képe

Az OpenAI mindössze egy hete mutatta be a GPT-6 Solt, de máris érkezik hozzá egy verziófrissítés. A GPT-6.1 Sol jobb kódolást, számítógép-használatot, tudományos munkát és pontosabb tényeket ígér, engem viszont leginkább a hatékonyság érdekel.

Az OpenAI szerint a GPT-6.1 Sol képességekben közel kerül a jóval drágább GPT-6 Astra modellhez az ügynökszerű kódolás, a számítógép-használat és a professzionális munka területén. Mindezt nagyjából Astra standard be- és kimeneti tokenárainak ötödéért kínálják.

Az API-t használó fejlesztőknek a GPT-6.1 Sol 2 dollárba kerül egymillió bemeneti tokenre és 10 dollárba egymillió kimeneti tokenre. A cache-elt bemenet ára mindössze 0,10 dollár egymillió tokenre, ami az OpenAI szerint 95 százalékkal olcsóbb a standard bemenetnél, és fele a GPT-6 Sol cache-elt bemeneti díjának.

A hatékonyság nem csak az API-nál számít. Az OpenAI a Work és a Codex esetében közös keretet használ, és a különböző modellek ezt eltérő ütemben fogyasztják, a modelltől, a feladattól, a következtetési szinttől és más tényezőktől függően. Ha valaki Solt használ Astra helyett, általában tovább kitart ugyanaz a keret, bár ez nem jelenti azt, hogy automatikusan ötszörös használatra lehet számítani.

Nehéz felhasználóként ennek kifejezetten örülök. Az Astra elképesztően erős, de amikor látod, milyen gyorsan fogy a kereted, kétszer is meggondolod, hogy mindenre azt használd-e. Ha a GPT-6.1 Sol elbír a munkám nagy részével, miközben jobban beosztja a keretet, szívesebben használnám a Solt nap mint nap, és az Astrát meghagynám azokra a feladatokra, ahol tényleg szükség van az extra intelligenciára.

Az OpenAI saját tesztjei alapján ez a kompromisszum nem is olyan fájdalmas. A DeepSWE v1.1 benchmarkon, amely valós kódbázisokon mér nehéz szoftvermérnöki feladatokat, a GPT-6.1 Sol hozta az Astra szintjét, miközben nagyjából az ötödébe került.

A számítógép-használatnál hasonló a kép. Az OSWorld 2.0 offline részén a GPT-6.1 Sol maximális következtetési szinten mindössze 2,1 százalékponttal maradt el az Astrától, miközben feladatonként körülbelül hetedannyiba került.

Sol nem mindenben múlja felül Astrát, és az OpenAI sem állítja ezt. Az Astra továbbra is a jobb választás bizonyos, különösen igényes munkákhoz, például tudományos feladatokhoz, ahol az OpenAI mérései szerint még mindig előnyben van.

A GPT-6.1 Sol ráadásul úgy tűnik, kevesebb ténybeli hibát vét, mint az elődje. Alacsony következtetési szinten az OpenAI azt találta, hogy a tényhibát tartalmazó válaszok aránya 11,4 százalékról 7,7 százalékra csökkent a GPT-6 Solhoz képest.

Ezeket a számokat érdemes kontextusba helyezni. Az OpenAI szándékosan nehéz beszélgetéseket használt, olyanokat, ahol a felhasználók korábban már jeleztek hibákat, ezért ezeket nem szabad úgy értelmezni, mint a ChatGPT normál használat közben várható átlagos hibaarányát.

Van azonban egy fontos csavar, ha valaki sima ChatGPT-beszélgetést szeretne indítani, és ott kiválasztani a GPT-6.1 Solt. Erre egyelőre még nincs lehetőség.

A GPT-6.1 Sol már elérhető a Plus, Pro, Business, Enterprise és Edu előfizetőknek a ChatGPT Workben és a Codexben. A fejlesztők az API-n keresztül érhetik el a gpt-6.1-sol modellt, a cég szerint pedig a sima Chat felületen valamivel később jelenik meg.

Az OpenAI a következő napokban az Ultrafast kínálatba is be akarja tenni a GPT-6.1 Solt. A vállalat szerint így a Codexben akár nyolcszorosára is felgyorsulhat a tokenek generálása a modell normál sebességéhez képest, ami még vonzóbbá teheti Solt az interaktív fejlesztéshez.

Fontos, hogy ezek az OpenAI saját mérései, a független tesztek majd pontosabban megmutatják, hogyan teljesít a GPT-6.1 Sol a mindennapi használatban. Lehet, hogy végül az lesz az igazán érdekes kérdés, egyáltalán észrevesznek-e a felhasználók érdemi különbséget a képességekben.

Ha Sol elvégzi ugyanazt a munka nagy részét, miközben kevesebbet fogyaszt az egyenlegemből, nem kérdés, melyik modellt fogom először elővenni. Astra maradhat arra az esetre, amikor tényleg szükségem van rá.