Apple navrhuje LEAD, aby sa dlhé uvažovanie modelov vedelo zotaviť z chýb
Metóda LEAD kombinuje rozklad úlohy s krátkym výhľadom a prekrývajúcimi sa pokusmi. Má obmedziť situácie, keď jediný chybný krok nenávratne pokazí celé dlhé riešenie.
Tag
Všetky publikované články, v ktorých sa téma jazykové modely objavuje ako dôležitý kontext. Aktuálne 7 textov v archíve.
Metóda LEAD kombinuje rozklad úlohy s krátkym výhľadom a prekrývajúcimi sa pokusmi. Má obmedziť situácie, keď jediný chybný krok nenávratne pokazí celé dlhé riešenie.
Výskumný tím Apple opisuje Length Value Model, ktorý odhaduje zvyšnú dĺžku generovania na úrovni tokenov. Cieľom je lepšie vyvažovať cenu inferencie, čas odpovede a výkon pri úlohách, kde dlhšie uvažovanie pomáha iba niekedy.

IBM Research predstavil CoFrGeNets, architektúru pre generovanie jazyka, ktorá nahrádza pozornosť a feed-forward bloky v transformeroch kompaktnejšími komponentmi. Výsledky sú zatiaľ výskumné, ale ukazujú smer k menším modelom s nižšími nárokmi na tréning.
Nová práca upozorňuje, že detektory lží pre veľké jazykové modely sa nedajú hodnotiť iba na modeloch, ktoré sa naoko správajú nepravdivo. Autori preto navrhujú testbedy, kde je najprv overené, čomu model skutočne verí.
Survey o transliterácii v NLP pripomína, že rozdielne písma zostávajú praktickou brzdou cross-lingual prenosu. Aj v ére veľkých modelov môže prepis medzi skriptami zlepšiť pokrytie, efektivitu aj prácu s code-mixom.
Práca na arXive tvrdí, že aj silné jazykové modely vrátane GPT-4o majú väčší problém s abstraktným významom, než sa často predpokladá. Výsledok je dôležitý najmä preto, že odhaľuje slabinu, ktorú nezakryjú bežné benchmarky ani všeobecný dojem z plynulého textu.
Nový paper pripomína, že veľké jazykové modely nemusia mať pevné chápanie abstraktných významov. Na úlohe ReCAM zaostávajú aj za staršími fine-tuned modelmi.