AI Radar
Fish Audio привлекла $52 млн в seed-раунде на развитие моделей синтеза речи для авторов и компаний. Стартап заявляет более 8 млн пользователей и $21 млн ARR, одновременно автоматизируя удаление голосов, загруженных без согласия владельцев.
Fish Audio развивает голосовые модели для разных сценариев: выразительной озвучки игр и видео, реалистичных голосов для аватаров и низколатентных голосовых агентов в звонках. Компания говорит о библиотеке из более чем 15 тысяч естественноязыковых контролей — параметров, которые позволяют задавать желаемые свойства речи обычным описанием. Seed-раунд на $52 млн возглавили Coreline Ventures и Capital Today; также участвовали 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners и HF0.
Проект начал бывший исследователь Nvidia Шицзя Ляо, который обучил раннюю модель генерации речи на одной GPU и открыл исходный код. Репозиторий Fish Speech на GitHub набрал свыше 31 тысячи звёзд. За последний год компания выпустила пять моделей: четыре speech-generation и одну speech-to-text. Три генеративные модели остаются открытыми, но актуальная S2.1 Pro доступна только через платный API. Помимо тарифов для авторов и команд с клонированием голоса, Fish Audio предлагает корпоративную платформу; по словам компании, её уже используют HeyGen и Sanas.
Рост голосовой библиотеки частично строился на пользовательских загрузках: владельцам обещали компенсацию, если их голос применялся в моделях. Эта схема уже вызвала претензии: несколько создателей заявляли, что их голоса появились на платформе без согласия. Раньше сервис принимал DMCA-запросы, но обработка занимала много времени. Теперь Fish Audio автоматизировала удаление: создатель может прислать короткий образец голоса либо договор, подтверждающий права, и компания обещает убрать голос с платформы менее чем за три минуты.
Быстрый takedown снимает последствия после обнаружения нарушения, но не решает проблему в её начале. Любой человек по-прежнему может загрузить чужой голос без ведома владельца, и до жалобы он может использоваться на сервисе. Представитель Coreline Ventures прямо связывает жизнеспособность модели сообщества с доверием создателей: для этого нужны подтверждённое владение голосом, понятные лицензии, прозрачность, простой механизм жалобы и в перспективе распределение дохода от коммерческого использования. Для Fish Audio эти меры становятся частью продукта, а не второстепенной юридической процедурой.
Голосовые модели становятся базовой технологией для контента, аватаров и корпоративных звонков, поэтому спрос растёт одновременно на выразительность, управляемость и низкую задержку. Но голос — биометрически и репутационно чувствительный актив: быстрый механизм удаления полезен, однако не заменяет проверку согласия до публикации. Клиентам таких платформ важно оценивать происхождение голосовых данных и условия их коммерческой лицензии.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.