A Large Language Model (LLM), magyarul nagy nyelvi modell, olyan gépi tanulási modell, amelyet nagy mennyiségű szöveges és más reprezentálható adaton tanítanak meg nyelvi mintázatok felismerésére és új tartalom előállítására. Az LLM-ek alapvető működése a tokenek – szavak, szórészletek vagy más szövegegységek – közötti valószínűségi kapcsolatok modellezésére és a következő token előrejelzésére épül.
A modern LLM-ek többsége a Transformer neurális hálózati architektúrára épül, amelyet Google-kutatók mutattak be 2017-ben az Attention Is All You Need tanulmányban. A Transformer attention mechanizmusa lehetővé teszi, hogy a modell a szöveg különböző részei közötti kapcsolatokat figyelembe vegye a feldolgozás során.
Az LLM a tanítás során nem hagyományos adatbázist vagy enciklopédiát épít. A tanítási adatokból statisztikai mintázatokat tanul meg, amelyeket a modell paraméterei reprezentálnak. Amikor promptot kap, ezek és az aktuálisan rendelkezésére álló kontextus alapján tokenről tokenre állítja elő a választ.
Ez magyarázza az LLM-ek egyik fontos korlátját is: a nyelvileg meggyőző válasz nem garantálja annak tényszerű helyességét. A modell generálhat pontatlan vagy nem létező információt, ezért a nagy nyelvi modelleket gyakran külső adatforrásokkal, Retrieval-Augmented Generationnel (RAG), kereséssel vagy más toolokkal egészítik ki.
Konkrét példa
Egy webshop LLM-re épülő asszisztense képes lehet természetes nyelven értelmezni azt a kérést, hogy „olyan laptopot keresek, amely alkalmas videóvágásra, de nem szeretnék 400 ezer forintnál többet költeni”.
Az LLM értelmezheti a felhasználó szándékát és megfogalmazhatja a választ. Az aktuális árak és készlet meghatározásához azonban külső termékadatokra vagy megfelelő toolokra van szüksége, ha ezek az információk nincsenek az aktuális kontextusában.
Miért fontos?
Az LLM-ek adják számos generatív AI-alkalmazás, chatbot, keresési funkció és AI-agent nyelvi és következtetési alapját. Üzleti szempontból lehetővé teszik, hogy korábban nehezen automatizálható, természetes nyelvet igénylő feladatok – például információfeldolgozás, tartalomgenerálás, ügyfélszolgálat vagy dokumentumelemzés – részben automatizálhatók legyenek.
Az LLM ugyanakkor nem azonos egy AI-agenttel. A nyelvi modell önmagában elsősorban bemenetet dolgoz fel és kimenetet generál; egy agent ehhez további komponenseket, eszközöket és végrehajtási logikát használhat annak érdekében, hogy több lépésből álló feladatokat hajtson végre.
Kapcsolódó fogalmak
Generative AI
Transformer
Retrieval-Augmented Generation (RAG)
Prompt Engineering
AI Agent