OpenAI prestavalo hlasovú AI: GPT-Live počúva aj hovorí súčasne
GPT-Live odstraňuje samostatnú detekciu konca repliky, používa plne duplexný hlasový model a náročnejšie úlohy deleguje na výkonnejšie modely mimo kritickej zvukovej cesty.
Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.
- Typ zdroja
- Oficiálny zdroj
- Zdroj / autorita
- OpenAI
Redakčný kontext
Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov. Zodpovednú kontrolu pravidiel robí Marek Považský.
Článok je zaradený v sekcii AI produkty a opiera sa o 1 zdroj.
OpenAI opísalo architektúru GPT-Live, svojej tretej generácie hlasového systému, ktorý má viesť rozhovor bez rigidného striedania replík. Namiesto čakania, kým samostatný detektor rozhodne, že používateľ dohovoril, model priebežne prijíma aj vytvára zvuk. Je plne duplexný: môže počúvať v čase, keď sám hovorí, a podľa priebehu konverzácie reagovať na prerušenie, krátke potvrdenie či zmenu smeru rozhovoru. Firma tvrdí, že tým odstránila jednu z hlavných príčin neprirodzených prestávok a predčasného skákania do reči.
Predchádzajúce hlasové systémy boli zväčša postavené ako sled oddelených krokov. Zvuk sa najprv prepísal na text, jazykový model pripravil odpoveď a syntéza reči ju napokon premenila späť na zvuk. Priame speech-to-speech modely síce dokázali zachovať intonáciu a ďalšie signály strácané pri prepise, no stále potrebovali určiť hranicu používateľovej repliky. Malý turn detector tak musel voliť medzi dvoma zlými výsledkami: pri skorom rozhodnutí človeka prerušil, pri neskorom vniesol do dialógu citeľné čakanie.
GPT-Live presúva riadenie rytmu rozhovoru priamo do hlasového modelu. Zvuk tečie oboma smermi po samostatnej rýchlej trase, zatiaľ čo vyhľadávanie, používanie nástrojov a náročnejšie uvažovanie prebiehajú asynchrónne. Hlasová vrstva teda môže udržať prirodzenú výmenu aj vtedy, keď sa na pozadí pripravuje zložitejší výsledok. OpenAI uvádza ako príklad delegovanie na model GPT-5.5: hlasový model vedie bezprostrednú komunikáciu a výkonnejší model spracuje úlohu, ktorá potrebuje viac času alebo externý nástroj.
Oddelenie zvukovej a aplikačnej vrstvy je dôležité aj pre vývojárov. Pomalé volanie nástroja môže oneskoriť vlastný výsledok, nemá však zastaviť doručovanie zvukových rámcov. Nástroje, pravidlá či backend aplikácie sa zároveň dajú meniť bez zásahu do kritickej mediálnej cesty. OpenAI túto časť systému prepísalo z Pythonu s asyncio do jazyka Go. Podľa firmy sa tým distribúcia časovania rámcov zlepšila natoľko, že 95. percentil nového riešenia zodpovedá mediánu predchádzajúcej implementácie.
Prenos stojí na WebRTC, ktoré dokáže pracovať so stratou paketov, posunom hodín aj zmenami pripojenia. Systém môže pri oneskorených paketoch zvuk jemne natiahnuť a neskôr zrýchliť prehrávanie, aby sa vrátil do reálneho času. Samotný model používa stavovú inferenciu, pretože jedna hlasová relácia môže trvať dlho a priebežne si buduje kontext. To je odlišný prevádzkový problém od krátkych, navzájom nezávislých textových požiadaviek.
Pri presune relácie medzi servermi OpenAI najprv pripraví náhradnú inštanciu modelu, naplní ju aktuálnym kontextom a dočasne spustí obe inštancie paralelne. Prepnutie nastane až po pripravení novej. Rovnaký mechanizmus slúži na kompakciu kontextu pri dlhom hovore. Pôvodná inštancia pokračuje v konverzácii, kým systém skráti históriu a obnoví KV cache na náhradnej inštancii. Cieľom je, aby používateľ nepočul technickú prestávku ani pri údržbe stavu relácie.
Hoci samotná konverzácia nemá pevné ťahy, ostatné časti produktu ich stále potrebujú. Rozhranie ChatGPT, analytika aj niektoré bezpečnostné mechanizmy pracujú s oddelenými správami používateľa a asistenta. Aplikačný server preto z čiastočných prepisov a časových signálov skladá priebežný, ešte meniteľný pohľad na rozhovor. Až keď je priradenie hovoriaceho dostatočne spoľahlivé, správu uzavrie do autoritatívneho záznamu. Krátke „mhm“ počas cudzej reči pritom nemusí dostať rovnaké postavenie ako plnohodnotné prerušenie.
OpenAI upravovalo aj samotné nadviazanie spojenia. Firma predstavila súbor spätne kompatibilných zmien s názvom WebRTC Abridged Roundtrip Protocol, skrátene WARP, ktorý má znížiť štart mediálneho a dátového spojenia zo šiestich sieťových kôl na jedno. Návrh kombinuje rýchlejšie vyjednávanie DTLS, predbežnú dohodu SCTP a dátových kanálov a odstránenie opakovanej práce medzi vrstvami protokolu. Špecifikácie sú otvorené, návrhy smerujú do pracovnej skupiny IETF a podpora už podľa OpenAI pribudla do libwebrtc a Pionu.
Nasadenie zároveň ukázalo, že kapacitu hlasovej AI nemožno merať iba priepustnosťou GPU. Otvorené relácie nepretržite posielajú rámce, takže spolu s inferenciou musia škálovať procesorové obslužné vrstvy, fronty, sieťové trasy aj regionálne smerovanie. Dlhé hovory navyše odhaľujú tlak na pamäť a perzistenciu, opätovné pripojenia preverujú obnovu stavu a bežné odpojenie klienta môže odkryť súbehové chyby pri ukončovaní relácie. OpenAI preto pri testovaní sledovalo počet súčasných relácií so zachovaným časovaním každého rámca, nie iba počet požiadaviek obslúžených akcelerátorom.
Architektúra už poháňa hlasové funkcie ChatGPT vrátane koordinácie agentov a ovládania počítača v desktopovej aplikácii. OpenAI ju zároveň označuje za základ pripravovaného GPT-Live API. Praktický význam preto presahuje pohodlnejšie rozprávanie s chatbotom: ide o technický základ pre hlasových agentov, ktorí majú počas rozhovoru vyhľadávať, používať nástroje a reagovať bez dlhých hluchých miest. Otvorenou otázkou ostáva, ako sa deklarovaná plynulosť, stabilita a bezpečné segmentovanie prepisov prejavia pri rôznych jazykoch, prízvukoch, hlučnom prostredí a reálnom zaťažení mimo infraštruktúry OpenAI.
Zdroje