AgentMemBench porovnal päť prístupov k dlhodobej pamäti AI agentov
Benchmark na 491 anotovaných otázkach pripísal najlepšiu kvalitu externému vektorovému úložisku. Pri veľmi vzdialených spomienkach zlyhali kontextové okná, sumarizácia aj grafová pamäť, výsledky však pochádzajú z jednej konfigurácie modelu.
Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.
- Typ zdroja
- Výskumná práca
- Zdroj / autorita
- arXiv
Redakčný kontext
Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov. Zodpovednú kontrolu pravidiel robí Marek Považský.
Článok je zaradený v sekcii AI modely a opiera sa o 1 zdroj.
Nový výskumný benchmark AgentMemBench porovnáva päť spôsobov, ako môžu konverzační agenti pracovať s informáciami, ktoré sa už nezmestia do aktuálneho kontextového okna. Autor testoval jednoduché posúvanie kontextu, externé key-value úložisko s hustým vyhľadávaním, grafovú epizodickú pamäť, kompresiu pomocou sumarizácie a pamäť rozšírenú o web. Všetky stratégie prešli rovnakým experimentálnym rámcom, aby sa obmedzili rozdiely spôsobené odlišnými modelmi a implementáciami.
Hodnotenie využilo tri verejné datasety. LoCoMo obsahuje dlhé dialógy rozdelené do viacerých relácií, MultiDoc2Dial sa zameriava na plnenie úloh s oporou v dokumentoch a MSC na personu zachovávanú naprieč viacerými rozhovormi. Celkovo benchmark zahŕňa 491 anotovaných otázkových ťahov. Takýto výber pokrýva viac typov pamäte: presné udalosti zo vzdialenej minulosti, fakty z dokumentov aj stabilné osobné informácie.
Stratégie sa porovnávali pomocou Recall@k, MRR a nDCG@k pre vyhľadávanie, Answer F1 pre výslednú odpoveď a skóre vernosti posudzované jazykovým modelom. Autor meral aj pamäťovú stopu a latenciu, takže víťazstvo neurčuje iba počet správnych nálezov. Generovanie aj automatické hodnotenie zabezpečoval Qwen2.5-7B-Instruct v štvorbitovej podobe s deterministickým greedy dekódovaním.
Najlepšie výsledky dosiahlo externé key-value úložisko, označené EKV. V makropriemere získalo Recall@5 na úrovni 0,792, MRR 0,677, Answer F1 0,156 a skóre vernosti 0,354. Podľa práce viedlo na každej osi kvality. Kompresná sumarizácia bola druhá vo vyhľadávaní so skóre 0,556, no náskok EKV sa prejavil aj v odpovediach, nielen v schopnosti nájsť kandidátsku spomienku.
Najvýraznejší rozdiel sa ukázal na LoCoMo, kde správny ťah často ležal o mnoho relácií dozadu. Posúvané kontextové okno, webovo rozšírená pamäť, grafová pamäť aj sumarizácia tam podľa autora dosiahli Recall@5 najviac 0,005. EKV ako jediné získalo 0,573. Výsledok naznačuje, že pri veľmi dlhom horizonte nestačí uchovávať iba nedávne správy alebo postupne komprimovaný príbeh; systém potrebuje mechanizmus, ktorý dokáže prehľadať celý archív.
Výhoda však nie je zadarmo. EKV malo pamäťovú stopu približne 5 100 tokenov, kým jednoduché kontextové okno a webovo rozšírená stratégia sa pohybovali okolo 300 tokenov. Benchmark tak pomenúva explicitný kompromis medzi presnosťou a efektivitou. Produkčný agent nemusí potrebovať maximálnu mieru vybavenia pri každej otázke a pri miliónoch používateľov môžu náklady na indexovanie, embeddingy a vyhľadávanie prevážiť nad ziskom z niekoľkých správnych odpovedí navyše.
Zaujímavé je aj hodnotenie webovej pamäte. VAM sa v internom vybavovaní faktov vyrovnala obyčajnému kontextovému oknu už z definície, pretože externé výsledky nemali pôvod v sledovanom dialógu. Web môže doplniť aktuálne fakty, ale nenahradí archív osobnej konverzácie. To je dôležité rozlíšenie pre návrh agentov: znalosť sveta, dokumentová pamäť a autobiografická pamäť sú odlišné problémy a nemali by sa skrývať za jediné všeobecné skóre.
Autor do rovnakého harnessu zaradil aj publikované systémy MemGPT/Letta a HippoRAG a zverejnil kód, prostredie aj výsledné artefakty. Reprodukovateľnosť je silnou stránkou práce, no závery majú limity. Použitý bol jediný 7B model na generovanie aj hodnotenie, iba 491 otázok a konkrétne implementácie jednotlivých stratégií. Lepší sumarizátor, iný embeddingový model, hybridné vyhľadávanie alebo dôkladnejšie grafové schémy by mohli poradie zmeniť.
AgentMemBench preto netvrdí, že vektorové úložisko je univerzálnym riešením pamäte. Presvedčivo však ukazuje, že testy zamerané iba na krátke dialógy môžu zakryť kolaps pri skutočne vzdialených udalostiach. Pre vývojárov je praktickým odkazom potreba oddelene merať vybavenie, kvalitu odpovede, vernosť, náklady a latenciu. Dlhodobá pamäť nie je jedna funkcia, ale architektúra s kompromismi, ktorých vhodnosť závisí od konkrétneho pracovného postupu a citlivosti uložených údajov.
Zdroje