OpenAI prestavalo hlasovú AI: GPT-Live počúva aj hovorí súčasne
GPT-Live odstraňuje samostatnú detekciu konca repliky, používa plne duplexný hlasový model a náročnejšie úlohy deleguje na výkonnejšie modely mimo kritickej zvukovej cesty.
Tag
Všetky publikované články, v ktorých sa téma speech-to-speech objavuje ako dôležitý kontext. Aktuálne 3 textov v archíve.
GPT-Live odstraňuje samostatnú detekciu konca repliky, používa plne duplexný hlasový model a náročnejšie úlohy deleguje na výkonnejšie modely mimo kritickej zvukovej cesty.
Hugging Face a Hume AI predstavili Real World VoiceEQ, rozsiahly benchmark pre hlasové modely. Namiesto samotnej chybovosti prepisu sleduje, či systémy zachytia emóciu, neistotu, identitu hlasu, šum a prirodzenosť reakcie v reálnom rozhovore.
Preprint navrhuje praktické hodnotenie long-form simultánneho speech-to-speech prekladu. Namiesto krátkych segmentov sleduje kvalitu a latenciu v dlhom prúde reči, čo lepšie zodpovedá reálnym stretnutiam a prednáškam.