Apple navrhuje LEAD, aby sa dlhé uvažovanie modelov vedelo zotaviť z chýb
Metóda LEAD kombinuje rozklad úlohy s krátkym výhľadom a prekrývajúcimi sa pokusmi. Má obmedziť situácie, keď jediný chybný krok nenávratne pokazí celé dlhé riešenie.
Tag
Všetky publikované články, v ktorých sa téma agentické systémy objavuje ako dôležitý kontext. Aktuálne 14 textov v archíve.
Metóda LEAD kombinuje rozklad úlohy s krátkym výhľadom a prekrývajúcimi sa pokusmi. Má obmedziť situácie, keď jediný chybný krok nenávratne pokazí celé dlhé riešenie.
OpenAI zverejnilo skúsenosti z interného nasadenia modelu, ktorý dokázal autonómne pracovať veľmi dlho. Firma tvrdí, že klasické hodnotenia nestačili, preto pridala testy odvodené z incidentov, sledovanie celej trajektórie a väčšiu kontrolu pre používateľov.
Preprint o hybridných sekvenčných modeloch spochybňuje jednoduchú predstavu, že väčšie modely automaticky získajú rovnaké schopnosti. Autori tvrdia, že kľúčová je kombinácia kompresnej pamäte a presného prístupu k uloženým faktom.
Nový preprint opisuje metódu AGOPS, ktorá z hotových príkladov úloh odvodzuje špecifické pokyny pre používateľské prompty. Cieľom nie je nahradiť model, ale znížiť straty spôsobené nejasnými zadaniami.
NVIDIA predstavila rodinu Nemotron 3 Embed na Hugging Face. Modely sú určené pre vyhľadávanie v RAG systémoch, pamäť agentov a kódové úlohy; najväčší variant podľa oznámenia vedie leaderboard RTEB.
OpenAI opisuje GPT-Red ako automatizovaný red-teamovací model, ktorý hľadá slabiny v prompt injection útokoch a vytvára tréningové dáta pre robustnejšie modely. Téma je dôležitá najmä pre agentov pracujúcich s webom, e-mailom, súbormi a nástrojmi.
AWS rozšíril Amazon Bedrock o modely OpenAI GPT-5.6 Sol, Terra a Luna. Pre firmy je dôležité najmä to, že nové modely prichádzajú cez spravované rozhranie Bedrocku, s dôrazom na agentické úlohy, bezpečnosť a prevádzkovú kontrolu.
Nový preprint ASK in the Dark skúma, kedy má posilňovací agent požiadať malý jazykový model o radu. Výsledok naznačuje, že pri čiastočne pozorovateľných úlohách rozhoduje najmä kontext v prompte, nie veľkosť modelu.
Nová práca opisuje koncept siete modelov, v ktorej by sa ľahšie vyhľadávali, prepájali a používali menšie doménové AI systémy. Ide skôr o architektonickú víziu než hotový štandard, no dobre vystihuje problém fragmentácie modelov.
Preprint z University Medicine Essen opisuje on-premise systém ACIE pre klinickú extrakciu informácií. Lekári v retrospektívnej štúdii akceptovali 96,5 % extrahovaných hodnôt, no práca zároveň ukazuje, prečo bežné RAG nestačí na celé pacientske kontexty.
Cloudflare rozšíril AI Gateway o limity výdavkov v reálnom čase a pripravuje rozpočty viazané na identitu používateľa. Novinka cieli na firmy, ktoré používajú viac modelových providerov a potrebujú zastaviť nečakané účty skôr, než sa stanú incidentom.
Nový výskumný návrh z arXivu ukazuje, ako využiť smerovacie váhy v agentických a zložených AI systémoch na lacnú hierarchickú atribúciu. BOHM nenahrádza SHAP vo všetkom, ale rieši praktický problém, keď jednotlivé komponenty nie sú dostupné na opakované testovanie.