Egy AI-modell tokenenként lehet olcsó, miközben egy használható eredmény előállítása végül többe kerül vele. Az AWS új benchmarkja szerint ezért a modellválasztásnál nemcsak az input- és outputtokenek árát érdemes nézni, hanem azt is, hány próbálkozásból, hány agent-turnből és milyen minőségben születik meg az elfogadható eredmény.
Az AWS szeptember 11-én publikált elemzésében három GPT-5.6 modellt – Lunát, Terrát és Solt – valamint két költségorientált modellt, a GPT-5.4 minit és nanót vizsgált több különböző workloadon. A kutatás egyik legfontosabb tanulsága nem az, hogy valamelyik modell minden esetben olcsóbb vagy jobb lenne, hanem az, hogy a tokenár önmagában könnyen rossz optimalizációs cél lehet.
Nem a token kerül pénzbe, hanem a használható eredmény
A hagyományos modell-összehasonlítás gyakran ott kezdődik és ér véget, hogy mennyibe kerül egymillió input- vagy outputtoken. Az AWS ehelyett több tesztben azt mérte, hogy mennyi a költség egy helyes vagy előre meghatározott minőségi küszöböt teljesítő eredményre vetítve. Ez azért változtatja meg a képet, mert az alacsonyabb tokenár előnye gyorsan eltűnhet, ha egy modell több tokenből dolgozik, gyakrabban hibázik, vagy többször kell újrafuttatni.
Az AIME matematikai benchmarkon például az AWS tesztjében a GPT-5.6 Luna egy helyes válaszra jutó költsége 0,0021 dollár volt, míg a GPT-5.4 minié 0,0139 dollár. Ez nem általános ár- vagy minőségi sorrend a két modell között: az eredmény az adott tesztkonfigurációra, árazásra és benchmarkra vonatkozik.
A fontosabb tanulság maga a mérési logika: a sikeres eredmény költsége üzletileg sokszor informatívabb mutató, mint az egységnyi token ára.
Agenteknél a turnszám külön költségtényező
Az eltérés még látványosabb lehet agentic workflow-knál.
Ha egy agent minden új lépésben újraküldi a rendszerpromptot, a korábbi válaszokat és az addigi tool outputokat, akkor a kontextus folyamatosan növekszik. Egy hosszabb agent trajectory ezért nem egyszerűen néhány plusz API-hívást jelent: egyre több korábbi kontextust is újra fel kell dolgozni.
Az AWS egy 50 kérdéses DeepSearchQA mintában valódi webes keresést végző agenteket futtatott. A GPT-5.4 mini átlagosan 7,6 turnt használt kérdésenként, és a tesztben 114 ezer inputtoken jutott egy kérdésre, szemben a Terra 50 ezer tokenjével. Ebben a konkrét mintában a Terra magasabb tokenára ellenére 0,31 dollárba került egy sikeres válasz, míg a mini esetében ez 0,40 dollár volt. A Luna esetében az AWS 0,05 dolláros költséget mért sikeres válaszonként.
Egy agentnél ezért a „mennyibe kerül egy API-hívás?” mellett egy másik kérdés is fontossá válik:
hány lépésből jut el a modell az elfogadható eredményig?
Kutatási, retrieval-, több eszközt használó vagy más multi-step workflow-knál ez közvetlenül befolyásolhatja a teljes futási költséget.
A minőség költségét is érdemes beleszámolni
Az AWS 48 professzionális feladatból álló GDPval mintát is vizsgált. Ezek nem egyszerű kérdés-válasz feladatok voltak, hanem például pénzügyi, jogi vagy más szakmai dokumentumok, amelyeket előre meghatározott értékelési szempontok alapján pontoztak.
Ebben a mintában a Luna 27 feladatnál érte el a meghatározott megfelelési küszöböt, a mini 20-nál, a nano pedig 17-nél. Az AWS számítása szerint a Luna egy sikeres dokumentumra jutó költsége 0,010 dollár volt, szemben a mini 0,030 és a nano 0,012 dollárjával.
Ez sem bizonyítja, hogy a Luna minden dokumentum-előállítási feladatra jobb vagy olcsóbb választás. A kutatás inkább arra mutat rá, hogy ahol az outputot embernek kell újraírnia, javítania vagy újragenerálnia, ott a hibák és az utómunka is a modell teljes költségének része.
Van egy fontos módszertani korlát
Az eredményeket nem szabad általános OpenAI-modellranglistaként értelmezni.
Az AWS maga hangsúlyozza, hogy a Bedrockon futtatott GPT-5.6 modelleknél a reasoning ki volt kapcsolva, míg az OpenAI API-n futó GPT-5.4 mini és nano az alapértelmezett beállításaival futott. A szerzők ezért a tesztet sem kontrollált „intrinsic modellképesség” összehasonlításként írják le, hanem gyakorlati deployment-konfigurációk vizsgálataként.
A minta mérete is workloadonként eltérő volt, 48 és 198 feladat között, a DeepSearchQA agentteszt pedig mindössze 50 kérdésből állt. Az AWS maga is azt javasolja, hogy a kisebb különbségeket irányjelzőként kezeljük. Ráadásul a kutatás AWS-forrásból származik, és a szerzők között AWS- és OpenAI-munkatárs is van. A benchmark reprodukálható, a hozzá tartozó kód és eredményfájlok nyilvánosan elérhetők, ez azonban nem teszi független kutatássá. A GDPval tesztnél további korlát volt, hogy az outputokat 8192 tokenben maximalizálták; ez több GPT-5.6-os válasz csonkolását is okozta, ezért az AWS szerint más outputlimittel a minőség és a költség is változhatna.
Mit jelent ez számunkra?
A legtöbb magyar webshopnak ettől a kutatástól még nincs azonnali modellváltási feladata.
A fontos következtetés inkább azoknak szól, akik már AI-alapú workflow-kat, agenteket, dokumentumfeldolgozást, kutatási folyamatokat vagy nagy volumenű automatizációt építenek. Ilyenkor a modelltesztet érdemes közelebb vinni a valódi üzleti egységhez. Nemcsak azt mérni, hogy mennyibe kerül egymillió token, hanem például azt, hogy:
- mennyibe kerül egy elfogadható minőségű eredmény;
- hány próbálkozás szükséges hozzá;
- hány agent-turnből készül el;
- mennyi emberi javításra van szükség utána.
Az AWS ezért azt javasolja, hogy a vállalatok saját, ismert jó eredménnyel rendelkező 50–100 feladatukon is futtassanak összehasonlító teszteket. Ez a benchmark legfontosabb üzleti tanulsága is. Az AI-modell ára nem ugyanaz, mint az AI-val elvégzett munka ára. Agentic workflow-knál pedig minél hosszabb és összetettebb a folyamat, annál nagyobb eséllyel válik ez a különbség valódi költségtényezővé.
Forrás:
AWS Machine Learning Blog – Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload, 2026. szeptember 11. - https://aws.amazon.com/blogs/machine-learning/beyond-the-price-per-token-choosing-the-right-openai-model-on-amazon-bedrock-for-your-workload