儘管AI智能體在處理客服問題方面的能力日益增強,但大多數人在與其通話時,仍能立刻判斷出對方是機器而非真人。
成立於2024年底的初創公司Smallest.ai認為,語音智能體的下一次飛躍,不會來自於讓大語言模型跑得更快,而是要構建專為人類對話設計的小型專用模型。簡而言之,該公司的目標是讓人們與AI智能體對話時,感受不出任何差異。
為此,Smallest.ai正在研發一種小型語音模型,旨在模擬人類處理資訊的方式——邊聽、邊思考、邊說話,三者同步進行。
"我和你說話的時候,你已經在思考了,如果我說太久,你可能會打斷我。"Smallest.ai創始人兼CEO蘇達爾山·卡馬思在接受TechCrunch採訪時表示,這正是該公司模型的設計邏輯。
為推進這一願景,Smallest.ai完成了1300萬美元的A輪融資,由Seligman Ventures領投,Sierra Ventures和3one4 Capital參與跟投。此次融資完成後,該公司累計融資總額已超過2100萬美元。
"大語言模型的工作方式是:你給它一整段提示詞,然後它才開始思考。"卡馬思說。在文字聊天中,這點延遲尚可接受,但在語音對話里,哪怕是短暫的停頓,也會讓人感覺不自然。"想想我們平時說話的方式,我不會先給你發一大段錄音,你再開始思考。"
Smallest.ai的模型充當實時智能處理層,能夠針對特定話題與客戶進行自然對話,且響應延遲幾乎為零。但當模型遇到超出其知識範圍的問題時,Smallest.ai會將該查詢轉交給大型基礎模型處理,同時讓客戶短暫等待,以便"查詢"相關資訊——這與真實人工客服的處理方式如出一轍。
卡馬思預計,未來所有AI智能體都將依賴兩類模型協同工作:一類是用於實時交互的小型語音模型,另一類是按需調用以解決複雜問題的"離線"大語言模型。
與大型基礎模型不同,Smallest.ai專注於語音領域的細粒度能力,涵蓋多種口音識別、數十種語言支持以及嘈雜環境下的穩定運行。
目前,該公司的客戶已包括RingCentral、Truecaller等語音領域的企業。卡馬思表示,所有客服類公司,包括Sierra、Decagon等新興企業,都是其潛在目標客戶。
當被問及資金充裕的AI客服公司為何不自行研發語音模型時,卡馬思回應稱,對客服初創公司而言,深耕語音技術會分散其對核心業務的專注度。
在競爭格局上,Smallest.ai的主要對手包括語音AI領域的頭部企業ElevenLabs、Cartesia,以及專注本地語言的區域性玩家Sarvam。部分競爭對手將語音AI應用於音頻配音、播客製作等場景,而Smallest.ai則完全專注於面向企業客戶的實時對話語音智能體。
"我們希望自己的模型能夠突破圖靈測試,"卡馬思說,"當你與我們的模型對話時,你應該分辨不出它是AI還是人類。這是公司唯一的核心目標。"
Q&A
Q1:Smallest.ai的語音模型和普通大語言模型有什麼區別?
A:普通大語言模型需要接收完整提示詞後才開始處理,存在明顯延遲,用在語音對話中會讓人感覺不自然。Smallest.ai開發的小型語音模型則模擬人類"邊聽邊思考邊說"的方式,實現近乎零延遲的實時對話。遇到超出能力範圍的問題時,再轉交大型基礎模型處理,兼顧響應速度與處理深度。
Q2:Smallest.ai目前有哪些客戶?
A:Smallest.ai的現有客戶包括語音通信領域的RingCentral和來電顯示服務商Truecaller。此外,公司創始人卡馬思表示,Sierra、Decagon等新興AI客服公司,以及所有客戶支持類企業,都是其潛在目標客戶群體。
Q3:Smallest.ai在語音AI市場上面臨哪些競爭對手?
A:Smallest.ai的主要競爭對手包括語音AI頭部企業ElevenLabs、技術公司Cartesia,以及專注印度等地區本地語言的Sarvam。與部分競品側重音頻配音、播客等場景不同,Smallest.ai專注於企業級實時對話語音智能體這一垂直方向。






