NVIDIA rozšírila Magpie TTS na 12 jazykov, slovenčina zatiaľ chýba
MagpieTTS Multilingual v2607 prináša arabčinu, kórejčinu a portugalčinu, päť hlasov a otvorené váhy pre nasadenie vo vlastnej infraštruktúre. Model s 364 miliónmi parametrov cieli na hlasových agentov, no slovenčinu nepodporuje a zverejnené výsledky zatiaľ pochádzajú najmä od NVIDIA.
Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.
- Typ zdroja
- Oficiálny zdroj
- Zdroj / autorita
- NVIDIA, Hugging Face, arXiv a Európska komisia
Ako vznikol tento text
Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.
Text je zaradený v sekcii AI modely a opiera sa o 6 zdrojov. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.
Jediný model pre dvanásť jazykov
NVIDIA rozšírila model MagpieTTS Multilingual o modernú spisovnú arabčinu, kórejčinu a portugalčinu, čím sa počet podporovaných jazykov zvýšil na dvanásť. Verzia v2607 bola podľa modelovej karty vydaná 21. júla 2026; podrobnejšie produktové predstavenie nasledovalo 10. augusta. Model má 364 miliónov parametrov a premieňa text na mono zvuk vo formáte PCM so vzorkovacou frekvenciou 22,05 kHz. Okrem nových jazykov podporuje angličtinu, čínštinu, francúzštinu, nemčinu, hindčinu, taliančinu, japončinu, španielčinu a vietnamčinu. Slovenčina ani čeština medzi nimi zatiaľ nie sú, čo podstatne obmedzuje jeho okamžitú využiteľnosť v domácich službách.
Spresnenie si zaslúži aj ponuka hlasov. Nejde o samostatnú mužskú a ženskú dvojicu natrénovanú osobitne pre každý jazyk. Modelová karta uvádza päť hlasov pôvodne pomenovaných pre angličtinu, ktoré možno používať naprieč všetkými podporovanými jazykmi prostredníctvom spoločnej reprezentácie hovoriaceho. Štyri hlasy sú proprietárne a jeden verejný. Takéto riešenie pomáha zachovať rozpoznateľnú identitu hlasu pri prepínaní jazykov, no nemusí zachytiť regionálny prízvuk či prirodzenú prozódiu rovnako presvedčivo ako lokálne nahraté hlasy. NVIDIA navyše z bezpečnostných dôvodov z tejto verzie odstránila napodobnenie ľubovoľného hlasu bez dodatočného tréningu.
Čo prináša rýchlosť a čo hovoria merania
Magpie používa transformátorový kodér a dekóder, ktorý predikuje diskrétne tokeny zvukového kodeku. Pri takzvanom skladaní rámcov spracuje dekóder dva zvukové rámce v jednom kroku, takže potrebuje menej autoregresívnych iterácií. Lokálny transformátor následne modeluje vzťahy medzi viacerými kodekovými knihami a koriguje stratu kvality, ktorú by priniesla úplne paralelná predikcia. Tento prístup opisuje práca prijatá na konferenciu ICASSP 2026. Jej výsledky podporujú všeobecný kompromis medzi priepustnosťou a vernosťou syntézy, nie však automaticky všetky produktové tvrdenia o aktuálnom viacjazyčnom checkpointe.
Pri nasadení cez optimalizovaný kontajner NVIDIA NIM výrobca uvádza čas do prvého zvuku 32 milisekúnd na GPU B200, 47 milisekúnd na H100, 53 milisekúnd na DGX Spark a 79 milisekúnd na A100 pri jedinom prúde. Pri 64 súbežných prúdoch dosiahol B200 podľa rovnakých meraní 239 milisekúnd a priepustnosť približne 320-násobku reálneho času. Ide o priemer troch lokálnych skúšok v dokumentácii NIM 26.07, nie o nezávislý benchmark. Čísla nezahŕňajú zachytenie zvuku, automatický prepis, prácu jazykového modelu, sieťový prenos ani prehrávanie na zariadení používateľa.
Modelová karta uvádza aj výsledky kvality na interných testovacích množinách. Vo francúzštine klesla chybovosť znakov medzi verziami v2602 a v2607 z 2,70 na 1,54 percenta a v španielčine z 1,14 na 0,60 percenta. Pri nemčine sa naopak mierne zvýšila z 0,66 na 0,80 percenta, hoci podobnosť hovoriaceho vzrástla. Nové jazyky dosiahli chybovosť 1,62 percenta pre arabčinu, 2,69 percenta pre kórejčinu a 2,91 percenta pre portugalčinu. Tieto metriky merajú najmä zrozumiteľnosť a identitu hlasu; nenahrádzajú nezávislé posluchové testy prirodzenosti, emócií či vhodnosti prízvuku.
Praktické nasadenie nie je iba stiahnutie váh
Otvorené váhy umožňujú prevádzkovať model vo vlastnom prostredí, skúmať ho a dolaďovať cez rámec NeMo. Označenie „open weights“ však netreba zamieňať s úplne bezpodmienečným open-source softvérom: používanie upravuje NVIDIA Open Model License. Produkčné latencie boli namerané s kontajnerom NIM, ktorý zahŕňa optimalizovaný inferenčný zásobník pre GPU NVIDIA. Organizácia preto musí oddeliť vlastnosti samotného checkpointu od výkonu komerčne podporovanej obslužnej vrstvy. Náklady zahŕňajú GPU, rezervnú kapacitu, monitoring, škálovanie a prevádzkový tím, nielen nulový poplatok za jednotlivé API volanie.
Magpie je určený najmä pre kaskádové systémy, v ktorých rozpoznávanie reči, jazykový model a syntéza zostávajú samostatnými komponentmi. Takáto architektúra umožňuje vymeniť chybnú časť, samostatne merať latenciu a upraviť výslovnosť produktových názvov či odbornej terminológie. Model podporuje vlastné fonetické slovníky založené na medzinárodnej fonetickej abecede a prepínanie jazykov, vrátane rozšírení pre hindčinu a japončinu. V kontaktnom centre však stále treba vyriešiť prerušenie hovoriaceho, potláčanie šumu, správu dialógu, bezpečné volanie nástrojov aj odovzdanie rozhovoru človeku.
Technické limity sú dôležité pri plánovaní služby. V štandardnom režime model generuje najviac približne 20 sekúnd reči naraz. Dlhší text spracúva posuvným oknom a najlepšie funguje, keď vstup používa správnu interpunkciu a veľké písmená. Text musí prejsť normalizáciou, aby model vhodne vyslovil čísla, skratky a špeciálne znaky. Výstup mimo dvanástich uvedených jazykov nie je podporovaný. Slovenský tím by preto nemal očakávať, že podobnosť slovenčiny s inými európskymi jazykmi zabezpečí použiteľný hlas bez samostatných dát, hodnotenia a pravdepodobne aj ďalšieho tréningu.
Slovenský a európsky kontext
Pre slovenské podniky je najzaujímavejšia možnosť ponechať hlasové dáta vo vlastnej alebo zmluvne kontrolovanej infraštruktúre. Samotné lokálne nasadenie však automaticky nezaručuje súlad s GDPR. Nahrávka zákazníka, prepis aj údaje získané počas rozhovoru môžu byť osobnými údajmi; prevádzkovateľ musí určiť právny základ, účel, dobu uchovávania, prístupové oprávnenia a primerané zabezpečenie. Pri zdravotných či iných citlivých informáciách platia prísnejšie podmienky. Pred nasadením je preto potrebné zmapovať celú dátovú cestu vrátane logov ASR, promptov, analytiky a záloh, nielen server so syntézou hlasu.
Od augusta 2026 sú v Európskej únii účinné aj pravidlá transparentnosti podľa AI Actu. Európska komisia pripomína povinnosť informovať človeka, keď komunikuje so systémom AI, a požiadavky na identifikovateľnosť generovaného obsahu; osobitné označovanie sa týka okrem iného deepfake zvuku. Presný rozsah povinností závisí od použitia, preto bežný hlas navigácie nemožno automaticky stotožniť s imitáciou konkrétnej osoby. Prevádzkovatelia by napriek tomu mali zreteľne oznámiť automatizovanú povahu hovoru, viesť pôvod zvukového výstupu a zabrániť tomu, aby bol syntetický hlas prezentovaný ako skutočný pracovník.
Najväčšou otvorenou otázkou ostáva kvalita mimo jazykov a podmienok, ktoré testovala NVIDIA. Chýbajú rozsiahle nezávislé porovnania s konkurenčnými TTS systémami, posluchové testy rodených hovoriacich pre tri nové jazyky aj merania na lacnejšom hardvéri. Nie je tiež jasné, koľko dát a práce by si vyžiadalo kvalitné doplnenie slovenčiny. Magpie preto predstavuje zaujímavý stavebný blok pre viacjazyčných agentov, nie hotové riešenie pre slovenský trh. Rozumný pilot by mal merať celkovú latenciu rozhovoru, správnosť výslovnosti, zlyhania pri dlhom texte, náklady na súbežné hovory a hodnotenie skutočných používateľov.
Zdroje