Preprint testuje, kedy môžu audio modely hodnotiť plne duplexných hlasových agentov namiesto ľudí
Nová arXiv práca skúma spoľahlivosť Gemini modelov ako audio hodnotiteľov rozhovorov, kde človek a agent hovoria aj prerušujú sa v reálnom čase.
Tag
Všetky publikované články, v ktorých sa téma audio AI objavuje ako dôležitý kontext. Aktuálne 5 textov v archíve.
Nová arXiv práca skúma spoľahlivosť Gemini modelov ako audio hodnotiteľov rozhovorov, kde človek a agent hovoria aj prerušujú sa v reálnom čase.
Amazon zverejnil architektúru, ktorá spája open-source model Parakeet-TDT, AWS Batch a spotové GPU inštancie pri veľkoobjemovom prepise audia. Signálom nie je len technický návod, ale aj rastúci tlak na lacnejšie multimodálne pipeline mimo uzavretých API služieb.
Mistral prináša Voxtral TTS, 4B open-weight model pre text-to-speech. Sľubuje nízku latenciu, silnú viacjazyčnosť a lepšiu prirodzenosť pre nasadenie voice agentov vo firme.
Google sprístupnil Gemini 3.1 Flash TTS ako nový hlasový model s jemnejším riadením štýlu, tempa a prejavu vo viac než 70 jazykoch. Praktický význam nie je len v kvalite hlasu, ale v tom, že sa syntéza reči posúva bližšie k produkčným workflowom pre videá, asistenty a firemné voice rozhrania.
Voxtral Realtime a Voxtral Transcribe 2 posúvajú Mistral hlbšie do speech infra vrstvy a naznačujú, že open-weight audio modely už môžu byť reálnou alternatívou pre voice agentov, titulkovanie aj privátne deploymenty.