aifeed.skAI Feed
AI produkty3 min čítania

Fish Audio získava 52 miliónov dolárov a rozširuje hlasovú AI za hranice syntézy reči

Fish Audio spája veľké seed financovanie s plánom na model porozumenia zvuku a prevod reči na reč; jeho technické a obchodné údaje však pochádzajú najmä od firmy.

Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.

Typ zdroja
Kurátorovaný súhrn
Zdroj / autorita
Fish Audio

Redakčný kontext

Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov a zodpovednú kontrolu pravidiel robí Marek Považský.

Článok je zaradený v sekcii AI produkty a opiera sa o 3 zdroje.

Hlasová platforma Fish Audio oznámila seed investíciu 52 miliónov dolárov, ktorú viedli Coreline Ventures a Capital Today. Firma zároveň zverejnila plán rozšíriť sa od syntézy reči k modelu na porozumenie zvuku a k prevodu reči priamo na reč. Správa je zaujímavá nielen nezvyčajne veľkým prvým kolom financovania, ale aj tým, že projekt vyrástol z otvoreného modelu trénovaného na jedinej grafickej karte na komerčnú platformu pre tvorcov, vývojárov a podnikové nasadenia.

Podľa oficiálneho príspevku Fish Audio vznikol technický základ projektu ako voľnočasový experiment Shijiu Liaa, vtedy výskumníka v NVIDIA. Prvé modely vyvíjal na jednej karte RTX 4090 a zameral sa na problém, ktorý tradičná syntéza reči často skrýva: systém môže správne vysloviť jednotlivé slová, no pri dlhšom prejave stráca prirodzený rytmus, emóciu a konzistentnú interpretáciu. Táto práca neskôr vytvorila základ rodiny Fish Speech a modelu S2.

Firma uvádza, že počas prvého roka vydala päť zvukových modelov, z toho štyri na prevod textu na reč a jeden na rozpoznávanie reči. Tím sa podľa jej údajov rozšíril z troch na 22 ľudí, platformu používa viac ako osem miliónov tvorcov, vývojárov a podnikov a komunitná knižnica obsahuje viac než dva milióny hlasových profilov. Fish Audio zároveň deklaruje 21 miliónov dolárov opakovaných ročných výnosov. Tieto čísla sú firemné tvrdenia a neboli nezávisle auditované.

Aktuálnym komerčným modelom je S2.1 Pro. Fish Audio pri ňom uvádza podporu viac než 83 jazykov, vyše 15-tisíc prirodzených ovládacích pokynov a riadenie emócie až na úrovni slov. Firma tvrdí, že model na jednej karte NVIDIA H200 spracuje viac než osemtisíc tokenov za sekundu vďaka vlastným jadrám pre formát FP8 a prebudovanému inferenčnému zásobníku. Práve pokles nákladov má umožniť bezplatné používanie rozhrania API pre S2.1 Pro do konca augusta.

Technicky podstatná je snaha oddeliť obsah výpovede od spôsobu jej podania. Pri hlasových agentoch nestačí, aby model vytvoril správnu vetu. Musí udržať vhodné tempo, dôraz, náladu a odozvu pri dlhšom rozhovore, a pritom zostať rýchly. Pre zákaznícku podporu je dôležitá nízka latencia a stabilita, pre audioknihy dlhodobá konzistentnosť postavy a pre hry schopnosť meniť emóciu bez nového nahrávania. Fish Audio chce tieto potreby obslúžiť rovnakým programovateľným hlasovým základom.

Nasledujúcou etapou má byť model porozumenia zvuku, ktorý firma označuje ako Audio LM, a systém reč-na-reč. Takýto posun by z Fish Audio urobil širšiu zvukovú platformu: systém by nielen generoval hlas z textu, ale analyzoval by tón, udalosti a význam vstupného zvuku a odpovedal bez nutnosti úplného textového medzikroku. To môže znížiť oneskorenie a zachovať viac paralingvistických informácií, napríklad váhanie, rozrušenie alebo dôraz. Konkrétne parametre a termíny týchto pripravovaných modelov však zatiaľ firma nezverejnila.

Pre vývojárov je dôležitý aj vzťah medzi otvorenou a uzavretou časťou projektu. Úložisko Fish Speech má silnú komunitu a viaceré staršie generatívne modely sú otvorené, zatiaľ čo najnovší S2.1 Pro je dostupný cez platené rozhranie API. Takýto hybridný model môže urýchľovať experimentovanie a súčasne financovať prevádzku náročnej infraštruktúry. Zároveň však znamená, že produkčné vlastnosti najnovšej verzie nemožno nezávisle reprodukovať iba zo zverejneného kódu.

Rozšírenie hlasového klonovania prináša aj otázky súhlasu a vlastníctva hlasu. TechCrunch pripomína sťažnosti tvorcov, podľa ktorých sa ich hlasy dostali na platformu bez povolenia. Fish Audio uvádza, že proces odstránenia automatizovalo a po dodaní vzorky hlasu alebo zmluvného dokladu vie profil stiahnuť v priebehu niekoľkých minút. Reaktívne odstránenie však samo osebe nezabráni prvotnému nahratiu cudzieho hlasu. Pre podnikové použitie preto budú rozhodujúce overenie vlastníctva, evidencia licencie, audit pôvodu dát a jasné pravidlá ďalšieho použitia.

Firma tvrdí, že podniky a vývojári už tvoria približne dve tretiny jej príjmov. Ako požiadavky veľkých zákazníkov uvádza lokálne nasadenie, režim bez uchovávania dát a konfigurácie zodpovedajúce zdravotníckym pravidlám HIPAA. To ukazuje, že súťaž v hlasovej AI sa neodohráva iba v kvalite ukážkového hlasu. Rovnako dôležité sú dostupnosť služby, oneskorenie, náklady, bezpečnostná dokumentácia a možnosť preukázať, čo sa deje s nahrávkami používateľov.

Nový kapitál má podporiť výskum pokročilejších zvukových modelov, vývojárske nástroje, rozhranie API a podnikový predaj. Fish Audio vstupuje do hustého trhu, kde pôsobia ElevenLabs, Cartesia, Speechify, WellSaid a ďalší poskytovatelia. O jeho dlhodobej pozícii preto nerozhodne samotná veľkosť investície, ale schopnosť potvrdiť deklarovanú kvalitu nezávislými testami, udržať nízke náklady a vybudovať dôveryhodné pravidlá pre hlasy skutočných ľudí.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie