Стартап Fish Audio из Пало-Альто привлёк $50 млн в посевом раунде. Раунд возглавили Coreline Ventures и Capital Today, также в нём участвовали 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners и HF0.
Компания развивает генерацию речи для разных сценариев: от творческих задач, где важна выразительность голоса, до корпоративных сервисов поддержки и продаж, где нужен более точный контроль над результатом. Для этого Fish Audio использует библиотеку из более 15 000 элементов управления естественным языком.
По данным компании, с момента запуска в прошлом году её открытые и облачные модели используют более 8 млн человек. Годовая регулярная выручка достигла $21 млн.
Fish Audio начиналась как небольшой проект бывшего исследователя NVIDIA Шицзя Ляо. Он был недоволен тем, как звучали доступные на рынке синтетические голоса, и обучил модель генерации речи на одном GPU, а затем открыл исходный код. Репозиторий Fish Speech на GitHub сейчас имеет более 31 000 звёзд, и им пользуются независимые разработчики, создатели игр и контента.
За последний год компания выпустила пять моделей: четыре для генерации речи и одну для распознавания речи. Три модели генерации речи доступны с открытым кодом, а последняя S2.1 Pro распространяется только через платный API.
Fish Audio продаёт ежемесячные тарифы для авторов и команд с лимитом минут генерации и функцией клонирования голоса. Также компания предлагает корпоративную версию API и своей платформы. По её словам, решения Fish Audio уже используют HeyGen, Sanas и Plaud.
Гендиректор и сооснователь компании Рисса Цао пояснила различия в запросах клиентов: «У каждой компании свои сценарии и предпочтения. Например, HeyGen, которая использует наши голоса для ИИ-аватаров, нужна реалистичность; игровой студии нужна выразительная речь для персонажей; а компаниям, которые делают голосовых агентов, таким как LiveKit, нужны более естественные голоса с низкой задержкой и достаточной выразительностью для звонков».
Часть библиотеки голосов Fish Audio собирала через пользователей: компания предлагала отправлять свои записи для обучения моделей и обещала компенсацию, если голос будет использоваться. Несколько месяцев назад это вызвало претензии: некоторые авторы заявили, что их голоса загрузили в сервис без согласия.
Ранее у компании уже был процесс удаления контента по DMCA, но он занимал много времени. Сейчас, по словам Цао, Fish Audio автоматизировала этот механизм. Автор может отправить короткий образец голоса или контракт, чтобы подтвердить права, и тогда запись удалят с платформы менее чем за 3 минуты.
При этом автоматизация удаления не решает проблему полностью. Если кто-то загрузит голос артиста без его ведома, он останется доступен на платформе до тех пор, пока правообладатель сам не обнаружит это и не подаст запрос на удаление.
Партнёр Coreline Ventures Оскуэ Хонда отметил: «Подход, завязанный на сообществе, может стать долгосрочным преимуществом только в том случае, если авторы доверяют платформе. Это значит, что согласие, прозрачность и указание авторства должны быть встроены в продукт, а не добавлены потом. Я считаю, что рынку нужны подтверждённые права на голос, понятные условия лицензирования, простой механизм жалоб и удаления, а со временем и модели распределения дохода, при которых авторы получают деньги, если их голоса лицензируются или используются в коммерческих целях».
Цао сказала, что пока продукт существовал как проект с открытым кодом и тарифами для авторов, компания работала эффективно и не нуждалась в финансировании. Но затем Fish Audio решила развивать более продвинутые модели и активнее выходить на корпоративный сегмент, на фоне чего и начала привлекать капитал.
В этом году компания планирует выпустить модель для понимания аудио. Также Fish Audio разрабатывает speech-to-speech-модель, которая будет преобразовывать одну речь в другую.
Сегмент генерации речи остаётся конкурентным. За бюджеты авторов и компаний борются ElevenLabs, WellSaid, Cartesia, Speechify, Async, ранее известная как Podcastle, и Krisp.
Партнёр 359 Capital Рико Маллоззи считает, что более детальные настройки для разработчиков и экономичное обучение моделей помогут Fish Audio лучше конкурировать с крупными ИИ-лабораториями. По его словам, «то, что они смогли создать модели передового уровня с такой командой, особенно на фоне других хорошо профинансированных ИИ-компаний, впечатляет. Это показывает их сильную техническую подготовку в сокращении разрыва между искусственным звучанием и голосами, похожими на человеческие».
Источник: TechCrunch.






















