Tudásmegosztás • 10 perc olvasás •
DeepSeek – Hogyan kerül be egy LLM a hírekbe?
Sólyom Balázs
Chief Data Officer

2025. január 20-án a kínai DeepSeek vállalat kiadott egy új, nagy nyelvi modellt, amely magára vonta a figyelmet mind Data Science körökben, mind pedig a piacon. A DeepSeek R1 publikálását követően az NVIDIA vállalat részvényei összesen 589 milliárd dollárt estek, ahogy sok más amerikai AI-hoz köthető részvény ára is bezuhant a nap folyamán. Hogyan okozhatott egy ilyen meglehetősen hétköznapi esemény ilyen léptékű változásokat?
Először is, hadd szolgáljunk némi háttérinformációval. A DeepSeek vállalatot 2023-ban alapították Kínában és bár meglehetősen új szereplő ezen a piacon, nem ez az első nagyközönség számára is elérhető modelljük. 2023 novemberében adták ki a DeepSeek Coder névre hallgató első, saját nagy nyelvi modelljüket, ami lényegében a Meta által közreadott Llama modell másolata volt. Ezt követően sorozatosan adtak ki különböző feladatokra specializált LLM-eket, azonban egészen az R1-es megjelenéséig nem értek el nagyobb áttörés.
DeepSeek R1: A Bajnok
A DeepSeek R1 modell lényegében a DeepSeek V3 továbbtanított változata. Ez az új verzió kifejezetten logikai következtetésekre, kódolásra és matematikai problémák megoldására optimalizált, ami az úgynevezett Chain-of-Tought technikát használja. Ami azt jelenti, hogy az R1 modell lényegében önmagával vitatja meg a lépéseket és önmagának ad visszajelzést azokkal kapcsolatban, így biztosabb, hogy helyes következtetésekre jut az adott probléma kapcsán.
Ez azonban még nem magyarázat a DeepSeek R1 modell üstökösszerű felívelésére, lássuk az okokat:
- Kína jelenleg GPU embargó alatt van az USA részéről, ami jelentősen korlátozza a hardverbeszerzési- és használati lehetőségeiket. Ennek kiküszöbölésére a DeepSeek kutatói több optimalizációs technikát is bevetettek, melynek eredményeképpen a korábban nyílt elérésű modellek között bajnok Llama modellekhez képest 10-szer kevesebb tanítási erőforrás felhasználásával is jobb eredményt értek el.
- A DeepSeek R1 felveszi a versenyt az OpenAI legújabb hasonló modelljeivel, és bizonyos benchmarkokon le is győzi őket. (Habár a verseny szoros, és ez a teljesítmény-növekedés nem látványos.)
- Az R1 egy bárki által letölthető és használható, nyílt modell, amely elérhető több másik, a vállalat által készített, kisebb teljesítményű és hardverigényű, úgynevezett Distilled modellel együtt. Valamint a DeepSeek jelentősen olcsóbban kínál API alapú hozzáférést a saját modelljeihez, mint az OpenAI.
Technológiai újítások
A DeepSeek V3 és R1 szerkezetüket tekintve nem térnek el jelentősen az eddig is domináns modellektől, amelyek mind az úgynevezett Transformer architektúrán alapulnak. A szerkezeti újítások, amiket alkalmaztak, a szöveg-generálás sebességének növelését és az erőforrás-használat csökkentését szolgálják.
Az igazi áttörést a modellek tanítása során alkalmazott módszerek jelentik, amelyek töredékére csökkentették a szükséges számítási kapacitást. Itt vegyesen alkalmaztak alacsony szintű, közvetlenül a hardveren futó kódot érintő módosításokat és olyan technikákat, amelyek sokkal kevesebb példa-adatból is lehetővé tették a modellek számára a hatékony tanulást.
Ezen felül a kész R1-es modell egyfajta tanító LLM-ként való felhasználásával létrehoztak egy sor kisebb méretű modellt is, amelyek már korábban létező nyílt elérésű modelleken alapulnak, és ezeket tovább tanították következtetéses, matematikai és kódolási feladatokra.
Kifejezetten szakmai szemmel nézve a következő technikákat használták:
- Multi-Headed Latent Attention: az Attention mechanizmus alacsonyabb dimenzionalitású vektortérben működő verziója, ami csökkenti a modell méretét.
- DeepSeekMoE: Mixture-of-Experts módszer, ami lehetővé teszi, hogy a szöveg generáláskor csak a súlyok kis része aktiválódjon a modellben.
- Multi-Token Prediction: a modell egyszerre több tokent is generál, ez javítja a tanulási teljesítményt és spekulatív generálásra is lehetőséget ad.
- FP8 Mixed-Precision Training: a modell bizonyos részei alacsonyabb pontosságú paramétereket használnak, ez csökkenti a modellméretet és gyorsítja a tanítást.
- Near Full Computation-Communication Overlap: a tanításhoz használt GPU-kra egy CUDA-nál alacsonyabb szintű nyelven írtak optimalizált keretrendszert, ami jelentősen hatékonyabbá teszi a több GPU-n történő elosztott tanítást.
- Large Scale Reinforcement Learning és Supervised Fine-Tuning lépések: az R1 tanítása során vegyesen tanítottak előre megadott következtetési láncokon és csak a végkövetkeztetést megadva, a generált outputot kiértékeléses alapon jutalmazva, ez sokkal kevesebb adatot igényelt, mint a korábbi módszerek.
A DeepSeek R1 használata
A teljes R1 használatához olyan hardverre van szükségünk, ami a modellhez tartozó mind a 671 trillió paramétert képes a memóriában tartani, ez kb. 1543 GB-nyi RAM/VRAM-nyi adatot jelent (vagyis a használatához hozzávetőlegesen 16 db NVIDIA A100-as GPU-ra van szükség). Quantized, azaz csökkentett pontosságú modellek ennél kevesebb tárhellyel is működőképesek, de a teljesítményük is rosszabb. Ugyanez igaz a fent említett Distilled modellekre is, amik a maguk kategóriájában kiemelkedő teljesítményt nyújtanak, de nem veszik fel a versenyt a nagyobb modellekkel.
Ha nem áll rendelkezésünkre ekkora tárhely, választhatjuk a DeepSeek API-jának használatát, ám ez adatbiztonsági kockázatokkal jár, ugyanis a DeepSeek fenntartja a jogot a rendszerükbe feltöltött adatok felhasználására. Regisztrálni egyébként Google Accounttal vagy kínai email címmel/telefonszámmal lehetséges, ezt követően kézzel ingyenesen kipróbálhatóak mind a V3, mind az R1 modellek.
Az API-n keresztül való használat árazása az OpenAI-hoz képest igen kedvező:
| DeepSeek V3 | ChatGPT 4o | DeepSeek R1 | ChatGPT o1 | |
| 1M input token (cache) | $0.014 | $1.25 | $0.14 | $7.5 |
| 1M input token | $0.14 | $2.5 | $0.55 | $15 |
| 1M output token | $0.28 | $10 | $2.19 | $60 |
| Context window (token) | 64,000 | 128,000 | 64,000 | 200,000 |
Táncba hívás, avagy tapasztalatok első kézből
- Magyartudás: Mindkét vizsgált modellel kommunikálhatunk magyarul. A V3 és az R1 is gyakorlatilag helyesírási hibák nélküli, választékos nyelvezettel fog nekünk válaszolni, a ChatGPT 4o-hoz hasonlóan.
- Matematika: Matematikai feladatok esetén képes összetettebb bizonyításokra, ugyanakkor nem mond ellent a felhasználónak, így megpróbál bebizonyítani valótlan állításokat is, ahelyett, hogy megcáfolná azokat.
- Komplex kódolási feladatok: A komplexebb kódolási problémák, már megakaszthatják a működését, előfordult, hogy hibás kódokat generált, vagy bizonyos specifikus könyvtárak funkcióival nem volt tisztában.
- Cenzúra: Bizonyos szenzitív témákban cenzorált a kapott adat.

Következmények
A DeepSeek R1 valószínűleg csak rövid ideig birtokolhatja a „legjobb LLM” titulust, mert már most több vállalat állítja, hogy az ő megoldásaik jobb teljesítményt nyújtanak az R1 modellnél. A modell jelentősége azonban nem a hosszú távú vezető szerepében rejlik, és még csak nem is feltétlenül a nyílt elérésű, fizetős szolgáltatásokkal is versenyképes mivoltában – bár ez is egy fontos aspektus, mert visszairányítja a fókuszt az open-source közegre, és a jövőben más vállalatok is tehetnek lépéseket ebbe az irányba, ami hosszú távon elősegítené az AI demokratizálását. A R1 modell igazi érte a tanítási folyamat optimalizálásával kapcsolatban elért eredményekben keresendő.
Eddig szinte kizárólag óriásvállalatok (Google, OpenAI, Meta, Anthropic stb.) engedhették meg maguknak, hogy saját LLM-eket taníthassanak, ám a DeepSeek által bemutatott technológia megnyitja a kaput a sokkal kisebb számítási kapacitással rendelkező szereplők számára is (pl.: kisebb vállalatok, egyetemek). Az alacsonyabb erőforrásigény és költségek kombinációja, amellyel az optimalizált modellek működnek, azt jelzi, hogy hamarosan új kategória jöhet létre: olyan cégek és startupok, amelyek eddig nem tudtak nagy AI modellekkel dolgozni, most saját fejlesztéseket végezhetnek és beszállhatnak az iparági versenybe.
Habár még mindig millió dolláros nagyságrendről beszélünk, az ilyen típusú fejlesztések azt mutatják, hogy léteznek még kiaknázatlan optimalizációs lehetőségek, amelyek alapjaiban változtathatják meg az LLM-ek iparági helyzetét és a piaci normákat.
És bár az AI területe eddig is folyamatosan fejlődött, ha az az iparági trendek és a fejlesztési költségek ilyen ütemben csökkennek, elképzelhető, hogy a következő években még jelentősebb ugrások várhatók, és az AI alkalmazások még inkább részévé válhatnak a mindennapi vállalati működésnek.
Hatékonyság vs. kényelem
Az AI fejlődésében érdemes megemlíteni egy másik, egyre inkább felértékelődő aspektust is: a keleti és nyugati világ közötti különbséget a technológiai versenyt illetően. Míg a nyugati világ sok esetben a jólétet és a kényelmet helyezi előtérbe – például a munkahelyi wellbeing programokkal, mint a 4 napos munkahét –, addig Kínában és más keleti országokban a hatékonyság és a gyors fejlődés érdekében hajlandóak komoly áldozatokat hozni. A verseny tehát egyértelműen a hatékonyság és az eredményesség irányába dől, és ez az, ami hosszú távon meghatározhatja a globális AI piac alakulását.
Mit jelent mindez a magyar piacra nézve
Eddig a hazai szereplők számára saját, kifejezetten magyar nyelvű LLM-ek tanítása csak nagyon szűkös keretek között volt elképzelhető. Ez, a DeepSeek által bemutatott újításokkal megváltozhat és teret kaphatnak a hazai vállalatok is, az ilyen és ehhez hasonló fejlesztésekre. A DeepSeek által generált hírverés pedig felkeltheti olyan nagyobb szereplők figyelmét is, akik eddig nem voltak jelen az LLM-ek piacán, ám ennek hatására mégis úgy döntenek, érdemes ilyen technológiákba befektetni.



