Mi történik, ha nem emberek keresik egymást egy piacon, hanem elküldik maguk helyett az AI-agentjeiket? Az Anthropic erre épített egy kísérleti piacteret: 201 dolgozójuk könyveit Claude-agentek próbálták egymás között elcserélni.
A Project Swap elsőre akár játékos kísérletnek is tűnhet. Valójában azonban az agentic commerce egyik legfontosabb problémáját modellezi. Ahhoz, hogy egy AI-agent valóban vásároljon, tárgyaljon vagy üzletet kössön helyettünk, nem elég jól keresnie és jól alkudoznia. Először azt kell tudnia, hogy mit akarunk valójában.
Az Anthropic kísérletében éppen ez bizonyult a nehezebb résznek.
201 ember, 201 agent és egy könyvpiac
Az Anthropic 2026. szeptember 24-én publikált Project Swap kutatásában 201 alkalmazott vett részt hat irodából. Mindenki hozott egy könyvet, amelytől szívesen megvált volna, majd röviden elbeszélgetett Claude-dal arról, milyen könyveket szeret és mit olvasna szívesen a nyáron.
Claude ezekből a rövid beszélgetésekből megpróbálta felépíteni az adott ember preferenciáit. Ezután minden résztvevő kapott egy saját AI-agentet. Az agentek egy digitális kereskedési térre kerültek, ahol egymással kommunikálhattak, csereajánlatokat tehettek, ajánlatokat fogadhattak vagy utasíthattak vissza, sőt több szereplős cseréket is megszervezhettek.
A cél egyszerű volt: az agent szerezzen a saját emberének olyan könyvet, amelyet várhatóan szívesen elolvasna. A kísérlet azért különösen érdekes, mert az Anthropic külön tudta vizsgálni az agent két, könnyen összemosható képességét: mennyire érti meg az embert, akit képvisel és képes-e jól tárgyalni a nevében. A kettőről pedig meglehetősen eltérő kép rajzolódott ki.
Claude meglepően sokat megértett néhány perc alatt – de messze nem mindent
A kutatók nem elégedtek meg azzal, amit Claude gondolt a résztvevők ízléséről. A résztvevőket külön arra is megkérték, hogy saját maguk rangsoroljanak tíz könyvet. Így össze lehetett hasonlítani Claude becsült preferenciáit azzal, amit az emberek ténylegesen megadtak.
A rövid beszélgetésből létrehozott Claude-rangsor a könyvpárok 61 százalékánál ugyanazt a sorrendet adta, mint a résztvevő saját rangsora. A véletlenszerű találgatás 50 százalék körül teljesítene. Ez figyelemre méltó eredmény ahhoz képest, hogy a medián résztvevő mindössze 216 szót írt nyolc üzenetben. Azonban a 61 százalék egyben azt is jelenti, hogy az agent emberről alkotott modellje jelentős mértékben pontatlan maradt. Amikor az agent később önállóan kezd döntéseket hozni, ez a pontatlanság már nem elméleti probléma. Megjelenik a döntéseiben.
Nem az alkudozás volt a fő probléma
A Project Swap talán legérdekesebb eredménye akkor jelent meg, amikor az Anthropic megvizsgálta, miért maradt el a piac teljesítménye az elméletileg elérhető eredménytől. Ha mindenki a számára lehető legjobb, még megvalósítható könyvet kapta volna, a kutatók által használt hatékonysági mutató 0,89 lett volna. A tényleges decentralizált kereskedés eredménye átlagosan 0,55 volt. Logikus lenne azt gondolni, hogy az AI-agentek egyszerűen nem tárgyaltak elég jól. Csakhogy nem ez magyarázta a különbség nagy részét.
Amikor a kutatók Claude becsült preferenciái alapján kiszámították a legjobb lehetséges elosztást, majd ezt az emberek saját rangsorán értékelték, már csak 0,60-as eredményt kaptak. Az Anthropic számítása szerint az optimális eredménytől való elmaradás 85 százalékát az okozta, hogy Claude nem ismerte elég pontosan az emberek preferenciáit. Maga a decentralizált agent–agent kereskedés a különbség fennmaradó 15 százalékáért felelt, vagyis az agentek viszonylag jól játszották a játékot, csak nem mindig a megfelelő célt próbálták elérni.
Az agentic commerce egyik alapvető problémája
Egy hagyományos webshopban a vásárló végig jelen van a döntési folyamatban. Megnézi a találatokat. Összehasonlítja a termékeket. Kiszűri azokat, amelyek valamilyen számára fontos, de a rendszer számára láthatatlan okból nem megfelelőek. Meggondolja magát. Végül rákattint a vásárlás gombra.
Egy autonómabb shopping agent esetében ennek egy része eltűnhet.
Az agent kereshet, értékelhet, tárgyalhat és bizonyos környezetekben akár tranzakciót is kezdeményezhet. Minél több döntési jogot kap, annál fontosabbá válik azonban, hogy pontosan reprezentálja a felhasználó valódi preferenciáit. Ez nem ugyanaz, mint ismerni néhány explicit feltételt.
Egy laptopvásárlásnál például könnyű megadni, hogy legfeljebb 500 ezer forintot szeretnénk költeni, 14 hüvelykes gépet keresünk és fontos a hosszú akkumulátor-üzemidő.
Sokkal nehezebb formalizálni azt, hogy milyen kompromisszumot fogadunk el a súly és a teljesítmény között, mennyit ér nekünk egy jobb kijelző, melyik márkával kapcsolatban vannak korábbi tapasztalataink, vagy melyik olyan tulajdonság lesz döntő, amelyre a keresés elején még mi magunk sem gondoltunk.
A Project Swap résztvevői ugyanezzel a problémával találkoztak könyveknél. Többen jelezték például, hogy olyan könyvet kaptak, amelyet korábban már olvastak. Mások arra utaltak, hogy saját maguk sem feltétlenül tudják pontosan megfogalmazni, éppen milyen könyvre vágynak. Ez fontos különbség.
Az agent nemcsak egy utasítást hajt végre. Valamilyen módon modellt kell alkotnia arról az emberről is, akinek a nevében dönt.
Minél önállóbb az agent, annál fontosabb lehet a „próbadöntés”
Az Anthropic kutatói egy érdekes lehetséges megoldást is felvetnek. Mielőtt egy agent valódi piacon kezdene önállóan dönteni, meg lehet vizsgálni, hogy néhány mintadöntésben mennyire egyezik az ember választásával.
A Project Swapban ennek egyszerű változata már létezett: az emberek tíz könyvet rangsoroltak, ezt pedig össze lehetett vetni Claude becslésével. Egy jövőbeli rendszerben ugyanez akár egyfajta kalibrációs lépésként működhetne. Az agent mutathatna néhány példát:
-
ezt választanám;
-
ezt kizárnám;
-
ezért fizetnék többet;
-
ebben a helyzetben ezt a kompromisszumot kötném.
A felhasználó pedig még azelőtt korrigálhatná az agentet, hogy valódi döntési jogot ad neki. Ez különösen fontos lehet olyan helyzetekben, ahol az agent nemcsak ajánlásokat készít, hanem valóban cselekszik is.
Az sem mindegy, milyen modell tárgyal
A Project Swap másik érdekes eredménye az agent mögött futó modellek közötti különbség volt.
Az Anthropic több alkalommal újrafuttatta a kereskedési szimulációkat, különböző modellekkel és instrukciókkal. Amikor az agentek semleges instrukciókat kaptak, a Claude által becsült preferenciákon mérve az erősebb modellek által működtetett piacok általában hatékonyabbak voltak. A Haiku-agentekkel működő kereskedési terek átlagosan 0,75-ös, az Opus-agentekkel működők 0,88-as hatékonyságot értek el; az adott preferenciák melletti elméleti optimum 0,95 volt.
A különböző promptok hatása ennél kisebbnek bizonyult. Ez nem jelenti azt, hogy a promptok általában lényegtelenek, vagy hogy minden agentic kereskedelmi környezetben automatikusan a legerősebb modell lesz a legjobb választás. A vizsgálat egy mesterséges, kontrollált könyvcserepiacra vonatkozott, de a kísérlet egy fontos rendszertervezési kérdést már láthatóvá tesz:
egy agentic marketplace-en nemcsak különböző vásárlók, hanem különböző képességű agentek is találkozhatnak majd egymással.
Ez egészen új piaci dinamikákat hozhat létre.
Az agentek már most is meglepően „piaci” módon viselkedtek
Az Anthropic összesen 205 kereskedési futás üzeneteit vizsgálta, és 16 visszatérő tárgyalási taktikát azonosított.
Az agentek időnyomásra hivatkoztak, versengő ajánlatokat hasonlítottak össze, könyvdíjakat emlegettek, várólistákat vezettek, több szereplős cseréket próbáltak megszervezni, sőt néhányan közvetítőként kezdtek működni olyan szereplők között is, akiket eredetileg nem képviseltek. Közben stratégiailag kezelték az információt is.
A legerősebben preferált könyvet az agentek nagy része valamikor megnevezte, de a teljes preferencialistájukat általában nem fedték fel. Ez már nagyon messze van attól a modelltől, amelyben egy chatbot egyszerűen válaszol egy vásárló kérdésére. Itt önálló szereplők kommunikálnak más önálló szereplőkkel, ajánlatokat értékelnek és megpróbálnak egy meghatározott cél érdekében tranzakciókat létrehozni.
Egy agentic piacnak nemcsak agentekre, hanem szabályokra is szüksége lesz
A kísérlet közben az is kiderült, hogy még jól viselkedő agentek mellett sem elég egyszerűen létrehozni egy kommunikációs felületet, majd hagyni őket kereskedni.
A Project Swap erősen kontrollált környezet volt. Az összes agentet ugyanaz a vállalat készítette, Claude-modelleken futottak, azonos alapvető szabályokat követtek, és az egész kereskedési történet látható volt.
Még így is szükség volt korlátozásokra.
Egyszerre csak bizonyos számú agent kommunikálhatott, és minden aktiváláskor csak egy üzenetet küldhettek. Az Anthropic szerint az ilyen rate limitek fontos eszközei lehetnek a jövő agentic marketplace-einek, hiszen egy AI-agent nem fárad el: technikailag képes lenne folyamatosan üzenetekkel bombázni a többi szereplőt.
A valódi piacok ennél jóval nehezebbek lesznek.
Ott különböző vállalatok agentjei találkozhatnak, eltérő modellekkel, célokkal és ösztönzőkkel. Meg kell határozni, ki léphet be a piacra, hogyan azonosíthatók a szereplők, milyen információkat láthatnak egymásról, mi történik egy meghiúsult tranzakció esetén, és hogyan lehet utólag rekonstruálni egy agent döntéseit.
Az agentic commerce infrastruktúrája nem ér véget az AI-modelleknél. Szükség lesz piaci protokollokra, identitásra, jogosultságokra, tranzakciós szabályokra és megfigyelhetőségre is.
A Project Swap nem bizonyítja, hogy készen állunk az autonóm vásárlásra
A kutatás korlátai fontosak. A résztvevők mind Anthropic-alkalmazottak voltak, ezért nem tekinthetők reprezentatív fogyasztói mintának. Valószínűleg az átlagosnál jobban ismerik Claude-ot, és nyitottabbak lehetnek arra, hogy döntéseket bízzanak rá. A végső kérdőívet ráadásul a résztvevők 59 százaléka töltötte ki.
A piac mesterségesen egyszerű volt, a résztvevők könyveket cseréltek, nem pénzügyi kockázattal járó valódi vásárlásokat végeztek, és minden agent Claude production modellen futott. A kutatás kifejezetten nem vizsgálta, mi történik, ha rosszindulatú vagy más agenteket kihasználni próbáló szereplők jelennek meg.
Ezért a Project Swap eredményeiből nem következik, hogy a mai AI-agentek készen állnak arra, hogy általánosan önálló vásárlókká vagy kereskedőkké váljanak.
A kísérlet ennél érdekesebb dolgot mutat meg. Megmutatja, hol kezdődhetnek a problémák, amikor tényleg átadjuk nekik a döntést.
Lehet, hogy nem az lesz a legfontosabb kérdés, mennyire okos az agent
Az agentic commerce-ről könnyű úgy gondolkodni, mint egy technológiai automatizálási problémáról.
-
Megtalálja-e az agent a terméket?
-
Össze tudja-e hasonlítani az ajánlatokat?
-
Tud-e tárgyalni?
-
Képes-e végrehajtani a tranzakciót?
A Project Swap ehhez hozzáad egy ennél alapvetőbb kérdést: biztosan azt optimalizálja, amit mi szeretnénk?
Az Anthropic könyvpiacán az agentek tárgyalási képessége már kevésbé korlátozta az eredményt, mint az, hogy mennyire pontosan ismerték az általuk képviselt ember preferenciáit. Egy könyv esetében ennek legrosszabb következménye egy kevésbé érdekes nyári olvasmány. Egy több százezer forintos vásárlásnál már más a tét.
Az agentic commerce következő nagy problémája ezért lehet, hogy nem egyszerűen jobb vásárló agenteket kell építeni. Hanem olyan agenteket, amelyekről még azelőtt kiderül, mennyire jól ismernek bennünket, mielőtt elkezdenek helyettünk vásárolni.
Források
Anthropic — Project Swap: What happens when agents trade for us?
https://www.anthropic.com/research/project-swap