Apple zmapoval, kedy difúzne jazykové modely strácajú výhodu paralelného generovania
Analýza Apple a univerzitných partnerov ukazuje, že paralelné generovanie tokenov samo osebe nezaručuje rýchlejšiu ani lacnejšiu inferenciu. Difúzne jazykové modely narážajú pri dlhom kontexte na opakované výpočty a pri dávkovom spracovaní zatiaľ lepšie škálujú autoregresívne modely; rozhodujúce bude zníženie počtu vzorkovacích krokov.