Apple zrýchlil syntézu hlasu na zariadení, detokenizér pracuje s pamäťou približne 21 MB
Architektúra pre Siri Expressive Voices oddeľuje časové a hĺbkové spracovanie zvuku. Na koprocesore AMX dosahuje približne 10 ms na krok a konštantnú pamäť pri dlhšom výstupe.
Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.
- Typ zdroja
- Kurátorovaný súhrn
- Zdroj / autorita
- Apple Machine Learning Research
Redakčný kontext
Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov a zodpovednú kontrolu pravidiel robí Marek Považský.
Článok je zaradený v sekcii AI výskum a opiera sa o 3 zdroje.
Apple opísal architektúru, ktorá premieňa sémantické zvukové tokeny modelu AFM 3 Core Advanced na výsledný hlas priamo v zariadení. Systém je nasadený v Siri Expressive Voices a musí sa zmestiť do prísneho rozpočtu výpočtu aj pamäte na koprocesore Apple Matrix Coprocessor (AMX). Výskumníci uvádzajú približne 10 milisekúnd na generačný krok, teda asi šestnásťnásobne rýchlejšie spracovanie než prehrávanie v reálnom čase.
Kritickou časťou je detokenizér. Zatiaľ čo veľký model vytvorí sémantickú reprezentáciu reči, detokenizér ju musí rozbaliť do detailného zvukového signálu. Pri takzvanej reziduálnej vektorovej kvantizácii sa zvuk opisuje viacerými úrovňami, ktoré postupne dopĺňajú jemnejšie informácie. Tradičné návrhy môžu mať osobitný dekodér pre každú úroveň, čo zvyšuje počet parametrov, pamäť a zložitosť nasadenia.
Apple používa tri časti: prúdový enkodér, časový dekodér a hĺbkový dekodér. Časový dekodér sleduje vývoj reči po časovej osi, zatiaľ čo hĺbkový dekodér generuje jednotlivé úrovne kvantizácie. Ich oddelenie umožňuje použiť jeden opakovane využívaný hĺbkový dekodér namiesto viacerých špecializovaných modulov. Podmieňovanie inšpirované difúznym transformátorom mu oznamuje, ktorú úroveň práve rekonštruuje.
Druhým dôležitým prvkom je kauzálna pozornosť s posuvným oknom a vyrovnávacou pamäťou kľúčov a hodnôt pevnej veľkosti. Model si preto nemusí ponechať všetky predchádzajúce zvukové kroky. Špičková prevádzková pamäť má byť približne 21 MB a aktíva uložené v zariadení 329 MB. Pamäť zostáva približne konštantná aj pri generovaní dvadsaťsekundového či niekoľkominútového hlasového výstupu.
Tento detail je významný pre používateľský zážitok. Hlasový asistent musí reagovať bez citeľného čakania a zároveň bežať popri ďalších procesoch telefónu alebo počítača. Ak syntéza spotrebuje rastúce množstvo pamäte, dlhšia odpoveď môže viesť k spomaleniu alebo ukončeniu procesu. Prúdový návrh umožňuje zvuk prehrávať priebežne a nevyžaduje čakať na vytvorenie celej nahrávky.
Podľa Apple architektúra pracuje s aktivačnou veľkosťou približne jednej miliardy parametrov v rámci AFM 3 Core Advanced. V porovnaní s predchádzajúcim systémom syntézy reči v zariadení sa priemerné používateľské hodnotenie kvality zvýšilo z 3,87 na 4,15 bodu. Pri konverzačnej reči firma uvádza zlepšenie z 3,82 na 4,24. Ide o výsledky výrobcu, preto ich treba čítať spolu s metodikou a konkrétnymi testovacími podmienkami.
Výskumníci hodnotili aj fonetickú rozlíšiteľnosť, percepčnú kvalitu a odhady založené na neurónových metrikách. Ablácie mali overiť prínos časového výhľadu, spôsobu podmieňovania a spoločného hĺbkového dekodéra. Takéto rozdelenie testov je dôležité: vysoká rýchlosť sama osebe nestačí, ak systém zhorší zrozumiteľnosť, zamení fonémy alebo pri expresívnom prejave vytvorí nestabilnú intonáciu.
Nasadenie v zariadení prináša aj súkromie a odolnosť. Zvuk nemusí pri každej odpovedi odchádzať do cloudu a základná syntéza môže fungovať pri slabom pripojení. Neznamená to však, že celý hlasový asistent je automaticky lokálny; zdroj textu alebo rozhodovanie môžu stále využívať iné modely a služby. Výskum sa týka konkrétne efektívnej premeny zvukových tokenov na hlas.
Pre vývojárov modelov je zaujímavý všeobecnejší princíp: os sekvencie a os kvantizačných úrovní nemusia spracúvať rovnaké bloky. Ak sa architektúra rozdelí podľa ich odlišných vlastností, možno znížiť pamäť bez toho, aby sa každá optimalizácia platila stratou kvality. Podobný prístup môže byť užitočný aj pri hudbe, zvukových efektoch alebo iných prúdových generatívnych systémoch.
Apple týmto výskumom ukazuje, že súťaž v hlasovej AI sa neodohráva iba vo veľkosti základného modelu. O reálnom produkte rozhoduje aj posledná vrstva medzi tokenmi a reproduktorom: latencia, pamäť, energetická náročnosť a konzistentná kvalita pri dlhom výstupe. Práve optimalizácia detokenizéra umožňuje preniesť expresívnejší hlas z laboratória do každodenného zariadenia.
Zdroje