Apple navrhuje LEAD, aby sa dlhé uvažovanie modelov vedelo zotaviť z chýb
Metóda LEAD kombinuje rozklad úlohy s krátkym výhľadom a prekrývajúcimi sa pokusmi. Má obmedziť situácie, keď jediný chybný krok nenávratne pokazí celé dlhé riešenie.
Kategória
Výskumné práce, metódy, reprodukovateľné výsledky a posuny v bezpečnosti modelov.
Metóda LEAD kombinuje rozklad úlohy s krátkym výhľadom a prekrývajúcimi sa pokusmi. Má obmedziť situácie, keď jediný chybný krok nenávratne pokazí celé dlhé riešenie.
Nový preprint kombinuje jednorazové generatívne doplnenie referenčného pohľadu s 3D verziou PatchMatch. Cieľom je obmedziť halucinácie medzi pohľadmi a zrýchliť úpravu scén v 3D Gaussian Splattingu.
Práca z arXivu navrhuje, aby sa niektoré pravdepodobnostné modely identifikovali podľa miznúcich binomických vzťahov namiesto priameho odhadu parametrov.
Prehľad na Hugging Face opisuje, prečo sa robotika a fyzická AI čoraz viac opierajú o simulované dáta, GPU fyziku a nástroje ako MuJoCo, Isaac Sim, Isaac Lab či Newton.
Nový preprint navrhuje dynamický klasifikačný servis SIFT. Lacný sparse encoder a LightGBM triedia väčšinu dokumentov, neisté prípady posielajú LLM sudcovi a jeho verdikty sa vracajú do tréningového korpusu až po kontrole regresií.
Nový výskum Apple opisuje generovanie syntetických trajektórií pre API-calling agentov iba zo špecifikácií rozhraní. Cieľom je obísť drahú prípravu plných sandboxov a databáz.
Výskumný tím Apple ukazuje CalibAtt, tréningovo voľný spôsob, ako pri difúznych text-to-video modeloch preskakovať stabilne nedôležité spojenia v pozornosti bez výraznej straty kvality.
Preprint RA-FR navrhuje, aby systémy na vyhľadávanie tvárí nevracali pevný Top-k zoznam, ale adaptívnu množinu s explicitnou hranicou rizika. Téma je technicky zaujímavá aj citlivá z pohľadu nasadenia v dohľade.
Nový preprint opisuje obranu pre fotorealistické 3D tvárové avatary. Namiesto úprav jednej fotografie pridáva do 3D reprezentácie jemnú vrstvu, ktorá má meniť interpretáciu modelov pri zachovaní identity.
LVSum skúša, či multimodálne modely vedia sumarizovať dlhé videá nielen vecne, ale aj s presným časovým ukotvením. Benchmark obsahuje ľudské anotácie s odkazmi na konkrétne momenty vo videu.
Výskumný tím Apple opisuje Length Value Model, ktorý odhaduje zvyšnú dĺžku generovania na úrovni tokenov. Cieľom je lepšie vyvažovať cenu inferencie, čas odpovede a výkon pri úlohách, kde dlhšie uvažovanie pomáha iba niekedy.
Výskum Apple a Carnegie Mellon rieši, ako má transformer rozlišovať obrazové záplaty z viacerých kalibrovaných kamier bez toho, aby stratil geometriu scény.