Ugrás a tartalomhoz

Tudásmegosztás3 perc olvasás

ATLAS, megoldás a hosszú kontextusokra

A Google új megközelítése, az ATLAS áttöri a korlátokat: memóriamodulja futás közben is képes tanulni és alkalmazkodni, így akár tízmillió tokenes szövegek mellett is stabilan teljesít. Mit jelent ez a gyakorlatban? Teljes könyvek, hatalmas kódprojektek vagy többórás videók feldolgozása válhat reálissá.

Összefoglalás itt:
vagy

A mai nagy nyelvi modellek, mint a GPT vagy a Gemini modellek, lenyűgözően sok szöveget tudnak feldolgozni, de van egy nagy korlátjuk: a kontextusablak mérete. Ez határozza meg, hogy mennyi szöveget képesek egyszerre „észben tartani”. Bár a legújabb rendszerek már több százezer vagy akár pár millió tokent kezelnek, ahogy nő a hossz, a teljesítményük gyorsan romlik. Ennek oka, hogy a Transformer-architektúra minden egyes szót minden másikkal összehasonlít, és így a számítási igény négyzetesen nő a szöveg hosszával.

Sok kutató próbált ezen enyhíteni. Az „ablakos” és a „ritkított” attention például csak a közeli vagy bizonyos kiválasztott szavakat veszi figyelembe, míg a megújult RNN-ek és az úgynevezett State Space Modellek egészen más elven működnek, lépésről lépésre frissítve egy belső állapotot. Ezek mind javítanak a hatékonyságon, de igazán hosszú, több milliós kontextusokra még nem volt jó megoldás.

Ezen változtat az ATLAS, amelyet a Google kutatói mutattak be 2025-ben. Az ATLAS egy új család, a Deep Transformers első képviselője, és legnagyobb újdonsága egy memóriamodul, amely nemcsak tanítás közben, hanem futás közben is képes tanulni. Amikor egy új token érkezik, a modell megpróbálja előre jelezni, milyen információ tartozik hozzá, és ha téved, azonnal javítja a memóriáját. Így folyamatosan alkalmazkodik az adott szöveghez, miközben az alaphálózat változatlan marad.

Az eredmények látványosak: a BABILong tesztben az ATLAS tízmillió tokenes szövegek mellett is 80%-os pontosságot ért el, míg a korábbi modellek ennél jóval rosszabbul teljesítettek. Ez óriási előrelépés, hiszen eddig legfeljebb kétmillió token körül húzódott a határ. Bár az ATLAS még viszonylag kicsi modellméretben készült, és nyitott kérdés, hogyan működik majd több tízmilliárd paraméterrel, már most látszik, hogy új korszakot nyithat.

Az ATLAS lényege, hogy a nyelvi modellek ne csak egyszerre nézzenek vissza sok szóra, hanem valóban tanuljanak és emlékezzenek is az adott feladat közben. Ez pedig lehetőséget adhat olyan alkalmazásokra, mint teljes könyvek vagy hatalmas kódprojektek feldolgozása, sőt, akár többórás videók értelmezése is.

Forrás: