AI & Marketing CIKK

Egy olcsóbb AI-modell végül többe is kerülhet – ezt mutatja az AWS benchmarkja

Egy olcsóbb AI-modell végül többe is kerülhet – ezt mutatja az AWS benchmarkja

Egy AI-modell tokenenként lehet olcsó, miközben egy használható eredmény előállítása végül többe kerül vele. Az AWS új benchmarkja szerint ezért a modellválasztásnál nemcsak az input- és outputtokenek árát érdemes nézni, hanem azt is, hány próbálkozásból, hány agent-turnből és milyen minőségben születik meg az elfogadható eredmény.

Az AWS szeptember 11-én publikált elemzésében három GPT-5.6 modellt – Lunát, Terrát és Solt – valamint két költségorientált modellt, a GPT-5.4 minit és nanót vizsgált több különböző workloadon. A kutatás egyik legfontosabb tanulsága nem az, hogy valamelyik modell minden esetben olcsóbb vagy jobb lenne, hanem az, hogy a tokenár önmagában könnyen rossz optimalizációs cél lehet.

Nem a token kerül pénzbe, hanem a használható eredmény

A hagyományos modell-összehasonlítás gyakran ott kezdődik és ér véget, hogy mennyibe kerül egymillió input- vagy outputtoken. Az AWS ehelyett több tesztben azt mérte, hogy mennyi a költség egy helyes vagy előre meghatározott minőségi küszöböt teljesítő eredményre vetítve. Ez azért változtatja meg a képet, mert az alacsonyabb tokenár előnye gyorsan eltűnhet, ha egy modell több tokenből dolgozik, gyakrabban hibázik, vagy többször kell újrafuttatni.

Az AIME matematikai benchmarkon például az AWS tesztjében a GPT-5.6 Luna egy helyes válaszra jutó költsége 0,0021 dollár volt, míg a GPT-5.4 minié 0,0139 dollár. Ez nem általános ár- vagy minőségi sorrend a két modell között: az eredmény az adott tesztkonfigurációra, árazásra és benchmarkra vonatkozik.

A fontosabb tanulság maga a mérési logika: a sikeres eredmény költsége üzletileg sokszor informatívabb mutató, mint az egységnyi token ára.

Agenteknél a turnszám külön költségtényező

Az eltérés még látványosabb lehet agentic workflow-knál.

Ha egy agent minden új lépésben újraküldi a rendszerpromptot, a korábbi válaszokat és az addigi tool outputokat, akkor a kontextus folyamatosan növekszik. Egy hosszabb agent trajectory ezért nem egyszerűen néhány plusz API-hívást jelent: egyre több korábbi kontextust is újra fel kell dolgozni.

Az AWS egy 50 kérdéses DeepSearchQA mintában valódi webes keresést végző agenteket futtatott. A GPT-5.4 mini átlagosan 7,6 turnt használt kérdésenként, és a tesztben 114 ezer inputtoken jutott egy kérdésre, szemben a Terra 50 ezer tokenjével. Ebben a konkrét mintában a Terra magasabb tokenára ellenére 0,31 dollárba került egy sikeres válasz, míg a mini esetében ez 0,40 dollár volt. A Luna esetében az AWS 0,05 dolláros költséget mért sikeres válaszonként.

Egy agentnél ezért a „mennyibe kerül egy API-hívás?” mellett egy másik kérdés is fontossá válik:

hány lépésből jut el a modell az elfogadható eredményig?

Kutatási, retrieval-, több eszközt használó vagy más multi-step workflow-knál ez közvetlenül befolyásolhatja a teljes futási költséget.

A minőség költségét is érdemes beleszámolni

Az AWS 48 professzionális feladatból álló GDPval mintát is vizsgált. Ezek nem egyszerű kérdés-válasz feladatok voltak, hanem például pénzügyi, jogi vagy más szakmai dokumentumok, amelyeket előre meghatározott értékelési szempontok alapján pontoztak.

Ebben a mintában a Luna 27 feladatnál érte el a meghatározott megfelelési küszöböt, a mini 20-nál, a nano pedig 17-nél. Az AWS számítása szerint a Luna egy sikeres dokumentumra jutó költsége 0,010 dollár volt, szemben a mini 0,030 és a nano 0,012 dollárjával.

Ez sem bizonyítja, hogy a Luna minden dokumentum-előállítási feladatra jobb vagy olcsóbb választás. A kutatás inkább arra mutat rá, hogy ahol az outputot embernek kell újraírnia, javítania vagy újragenerálnia, ott a hibák és az utómunka is a modell teljes költségének része.

Van egy fontos módszertani korlát

Az eredményeket nem szabad általános OpenAI-modellranglistaként értelmezni. 

Az AWS maga hangsúlyozza, hogy a Bedrockon futtatott GPT-5.6 modelleknél a reasoning ki volt kapcsolva, míg az OpenAI API-n futó GPT-5.4 mini és nano az alapértelmezett beállításaival futott. A szerzők ezért a tesztet sem kontrollált „intrinsic modellképesség” összehasonlításként írják le, hanem gyakorlati deployment-konfigurációk vizsgálataként.

A minta mérete is workloadonként eltérő volt, 48 és 198 feladat között, a DeepSearchQA agentteszt pedig mindössze 50 kérdésből állt. Az AWS maga is azt javasolja, hogy a kisebb különbségeket irányjelzőként kezeljük. Ráadásul a kutatás AWS-forrásból származik, és a szerzők között AWS- és OpenAI-munkatárs is van. A benchmark reprodukálható, a hozzá tartozó kód és eredményfájlok nyilvánosan elérhetők, ez azonban nem teszi független kutatássá. A GDPval tesztnél további korlát volt, hogy az outputokat 8192 tokenben maximalizálták; ez több GPT-5.6-os válasz csonkolását is okozta, ezért az AWS szerint más outputlimittel a minőség és a költség is változhatna.

Mit jelent ez számunkra?

A legtöbb magyar webshopnak ettől a kutatástól még nincs azonnali modellváltási feladata.

A fontos következtetés inkább azoknak szól, akik már AI-alapú workflow-kat, agenteket, dokumentumfeldolgozást, kutatási folyamatokat vagy nagy volumenű automatizációt építenek. Ilyenkor a modelltesztet érdemes közelebb vinni a valódi üzleti egységhez. Nemcsak azt mérni, hogy mennyibe kerül egymillió token, hanem például azt, hogy:

  • mennyibe kerül egy elfogadható minőségű eredmény;
  • hány próbálkozás szükséges hozzá;
  • hány agent-turnből készül el;
  • mennyi emberi javításra van szükség utána.

Az AWS ezért azt javasolja, hogy a vállalatok saját, ismert jó eredménnyel rendelkező 50–100 feladatukon is futtassanak összehasonlító teszteket. Ez a benchmark legfontosabb üzleti tanulsága is. Az AI-modell ára nem ugyanaz, mint az AI-val elvégzett munka ára. Agentic workflow-knál pedig minél hosszabb és összetettebb a folyamat, annál nagyobb eséllyel válik ez a különbség valódi költségtényezővé.

Forrás: 

AWS Machine Learning Blog – Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload, 2026. szeptember 11. - https://aws.amazon.com/blogs/machine-learning/beyond-the-price-per-token-choosing-the-right-openai-model-on-amazon-bedrock-for-your-workload