宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

Fish Audio完成5200萬美元種子輪融資,布局AI語音模型市場

2026年07月29日 首頁 » 熱門科技

AI語音模型市場正迎來爆發式增長。創作者需要更具表現力的AI語音,而希望實現客服與銷售自動化的企業則需要更易調控的語音模型。

總部位於帕洛阿爾托的Fish Audio致力於滿足上述各類需求,其平台擁有超過15000種自然語言控制選項。自去年上線以來,已有超過800萬用戶在使用其開源版本或託管版本的模型,目前年度經常性收入已達2100萬美元。

為進一步鞏固這一發展勢頭,Fish Audio於本周二宣布完成5200萬美元種子輪融資,由Coreline Ventures和今日資本領投。本輪融資還吸引了359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners以及HF0等機構參與。

Fish Audio最初源於前英偉達FishAudio完成5200萬美元種子輪融資布局AI語音模型市場研究員廖世嘉(Shijia Liao)的一個小型項目。由於市面上現有的合成語音表現力不足,他在單張GPU上訓練了一個語音生成模型,並將其開源。該項目Fish Speech在GitHub上現已累計超過31000個星標,被獨立開發者、遊戲設計師和內容創作者廣泛使用。

過去一年間,Fish Audio共推出了五款模型,包括四款語音生成模型和一款語音轉文字模型。其中三款語音生成模型已開源,但最新的S2.1 Pro模型目前僅通過付費API提供服務。

Fish Audio為創作者和團隊提供付費月度套餐,解鎖一定時長的語音生成功能及語音克隆特性,同時也面向企業提供API和平台的企業版服務。目前,HeyGen和Sanas等機構已在使用其服務。

"每家企業的使用場景和偏好各不相同。比如,像HeyGen這樣用我們的聲音來驅動AI虛擬形象的公司,追求的是聲音的真實感;遊戲工作室希望角色擁有富有表現力的聲音;而像LiveKit這樣的語音智能體公司,則更需要自然流暢、低延遲且具備足夠表現力的通話聲音。"Fish Audio聯合創始人兼CEO曹睿莎(Rissa Cao)表示。

該公司構建聲音庫的方式之一,是邀請用戶提交自己的聲音用於模型訓練,並在其聲音被使用時給予報酬。然而,這一做法在幾個月前引發了爭議——部分創作者反映,他們的聲音在未獲授權的情況下被上傳至Fish Audio平台。雖然該公司已建立了DMCA內容下架流程,但處理周期較長。

曹睿莎向TechCrunch透露,公司目前已將下架流程自動化。創作者只需提交一段簡短的聲音樣本或相關合同來證明上傳聲音歸其所有,聲音即可在3分鐘內從平台下架。

不過,這仍無法完全阻止他人在未經當事人知情的情況下擅自上傳其聲音。在藝術家發現並提出申請之前,其聲音仍會持續在平台上被使用。

Coreline Ventures合伙人本田大輔(Osuke Honda)表示,社區驅動模式只有在創作者信任平台的前提下才能持續運作。

"以社區為核心的方式,只有當創作者真正信任平台時,才能形成持久的競爭優勢。這意味著同意機制、透明度和署名權必須內嵌於產品本身,而非事後補救。我認為行業需要朝著聲音所有權驗證、清晰的許可條款、便捷的舉報與下架流程,以及最終讓創作者在其聲音被授權或商業化使用時獲得收益分成的方向發展。"他說道。

曹睿莎表示,早期公司僅以開源項目形式運營時,憑藉創作者套餐便能高效運轉,無需外部融資。但為了開發更先進的模型、拓展企業市場,加之投資方的關注持續升溫,公司才決定尋求外部資本。

展望未來,Fish Audio計劃今年發布一款音頻理解模型,同時也在研發語音到語音的轉換模型。

語音生成市場競爭激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async(前身為Podcastle)和Krisp等公司均在爭奪創作者和企業客戶。

359 Capital合伙人里科·馬洛茲(Rico Mallozzi)認為,面向開發者的精細化控制能力和高效的模型訓練成本,將幫助Fish Audio在與大型AI實驗室的競爭中取得優勢。

"以他們現有的團隊規模,能夠構建出行業領先的模型,與那些資金更為充裕的AI實驗室相比,這實屬不易。這充分體現了他們在縮小人工合成聲音與真人聲音差距方面的深厚技術實力。"馬洛茲在接受TechCrunch採訪時表示。

Q&A

Q1:Fish Audio是一家什麼樣的公司,主要做什麼?

A:Fish Audio是一家總部位於帕洛阿爾托的AI語音模型初創公司,提供超過15000種自然語言控制選項,支持語音生成與語音克隆功能。目前平台用戶超過800萬,年度經常性收入達2100萬美元,服務對象涵蓋內容創作者、遊戲開發者以及HeyGen、Sanas等企業客戶。

Q2:Fish Audio在聲音版權保護方面存在哪些問題,目前如何解決?

A:此前有創作者反映其聲音在未經授權的情況下被上傳至Fish Audio平台,且原有下架流程耗時較長。目前公司已將下架流程自動化,創作者提交聲音樣本或合同證明歸屬權後,可在3分鐘內完成下架處理。不過,在創作者主動發現並申請下架之前,其聲音仍可能被平台使用。

Q3:Fish Audio與ElevenLabs等競爭對手相比有哪些優勢?

A:Fish Audio的核心競爭力在於面向開發者的精細化控制能力和高效的模型訓練成本。其開源模型Fish Speech在GitHub上已積累超過31000個星標,擁有活躍的開發者社區。此外,投資方認為Fish Audio以較小的團隊規模實現了行業領先的模型表現,在縮小合成聲音與真人聲音差距方面展現出較強的技術實力。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新