A Transformer egy neurális hálózati architektúra, amely az úgynevezett attention, különösen a self-attention mechanizmus segítségével dolgozza fel az adatsorozatok elemei közötti kapcsolatokat. A Transformer architektúra a modern nagy nyelvi modellek (LLM-ek) technológiai alapja, de más AI-területeken is használható.
A Transformert Ashish Vaswani és szerzőtársai mutatták be 2017-ben az Attention Is All You Need című tanulmányban. Az eredeti architektúrát gépi fordításra fejlesztették, és fontos újítása az volt, hogy a korábbi szekvenciafeldolgozó megoldásokkal szemben nem rekurrens vagy konvolúciós hálózatokra, hanem attention mechanizmusokra épült. Ez hatékonyabb párhuzamos feldolgozást tett lehetővé a modell tanítása során.
A Transformer működésének központi eleme a self-attention. Ennek segítségével a modell egy szekvencia – például egy mondat – minden eleménél figyelembe tudja venni, hogy a többi elem mennyire releváns annak értelmezéséhez. Ha például egy mondatban szerepel egy névmás, a self-attention segítségével a modell súlyozhatja, hogy a mondat mely korábbi részei kapcsolódnak hozzá leginkább.
A self-attentiont jellemzően több párhuzamos attention head végzi. Ezek különböző kapcsolatokat tanulhatnak meg az elemek között, majd több ilyen réteg egymásra építésével a modell egyre összetettebb reprezentációkat alakíthat ki.
Az eredeti Transformer encoderből és decoderből állt. Az encoder feldolgozza a bemenetet és reprezentációt készít belőle, a decoder pedig ebből állítja elő a kimeneti szekvenciát. Később encoder-only és decoder-only Transformer architektúrák is elterjedtek. A generatív LLM-ek jelentős része decoder-only megközelítést használ, amely az addig rendelkezésre álló tokenek alapján generálja a következő tokent.
Konkrét példa
Ha egy nyelvi modell azt a mondatot dolgozza fel, hogy „A vásárló visszaküldte a laptopot, mert az meghibásodott”, a self-attention mechanizmus segítségével kapcsolatot tud kialakítani az „az” és a „laptop” között.
Egy modern LLM-ben ugyanez az alapelv sok rétegen és attention headen keresztül, jóval összetettebb nyelvi kapcsolatok feldolgozásában vesz részt.
Miért fontos?
A Transformer tette lehetővé a modern generatív AI és a nagy nyelvi modellek fejlődésének jelentős részét. A GPT és más LLM-ek Transformer-alapú modellek, ezért az architektúra közvetve számos ma használt AI-asszisztens, generatív alkalmazás és AI-agent működésének alapját adja.
Digitális vagy e-commerce döntéshozóként nem szükséges a Transformer matematikai működését ismerni, de a fogalom segít különválasztani az AI-technológia rétegeit: a Transformer egy neurális hálózati architektúra, az LLM pedig egy olyan nyelvi modell, amely jellemzően erre az architektúrára épül.
Kapcsolódó fogalmak
Large Language Model (LLM)
Self-Attention
Generative AI
Token
Embedding