聯合創始人Grace Li表示,她的公司在2025年畢業前幾周由幾位大學好友共同創立,最初的目標是讓AI遊戲引擎真正好用。這些模型確實能生成可運行的遊戲,但遊戲體驗普遍不佳,這引出了一個值得深思的問題:如何判斷一款遊戲是否真的好玩?
他們認為,這個問題離不開人類的主觀判斷,於是開始探索如何大規模收集真實的用戶反饋。
這一探索最終催生了DesignArena——一款目前全球已有530萬用戶使用的AI工具。事實證明,許多AI公司都在尋找可規模化的用戶反饋渠道,並願意為此付費。
"對於很多模型而言,設計層面的改進一直缺少這樣一個關鍵環節,"Li說,"大約一周後,我們就與一家前沿實驗室簽下了第一筆重要合同,此後的故事大家也都知道了。"
本周一,DesignArena背後的公司Intelligence宣布完成790萬美元種子輪融資,本輪由Index Ventures領投,Conviction(Sarah Guo與Mike Vernal參與)、A*、Valkyrie等機構跟投。
對於普通用戶而言,使用DesignArena的體驗類似於使用一個智能模型路由器。平台提供類似ChatGPT的提示輸入界面,並針對網頁、圖片及十餘種其他視覺格式設有獨立的下拉菜單。用戶輸入需求、選擇格式與風格後,系統會呈現一系列"A對B"的比較選項,引導用戶對輸出結果從優到劣進行排序。
這項服務本身頗具實用價值,但平台真正的核心在於企業端——參與的模型可以將其視為媒體生成模型持續獲取即時反饋的來源。Li指出,用戶通常並不在意自己在對哪個模型進行評分,他們只想要最好的輸出結果,因此這些排名能夠為模型提供關於用戶真實需求的重要參考。
Li表示,這對前沿實驗室而言是一項值得付費的服務,她還透露該平台目前年度經常性收入已達6000萬美元,鞏固了其作為AI行業人工評估數據核心來源的地位。
尤為重要的是,用戶須登錄賬號才能獲取輸出結果,這使Intelligence能夠追蹤不同地區及不同時期用戶偏好的變化趨勢。(Li注意到,亞洲地區的網頁儀錶盤設計風格往往更為繁複多元。)這些數據對於自動化基準測試而言是重要的補充——後者雖然可以實現更大規模的評測,但往往容易被操控或造假,上周Hugging Face的數據泄露事件便以極端的方式揭示了這一問題。
當然,這並不意味著眾包人工反饋一定是一門穩賺不賠的生意。就在不到一年前,同樣以人工評估為核心的Yupp於今年初宣布關閉,此前該公司曾從a16z crypto的Chris Dixon處融資3300萬美元,也吸引了部分前沿模型作為客戶,並聲稱擁有超過130萬用戶,但最終仍未能建立可持續的長期商業模式。
儘管如此,其他基於人工評估的初創公司似乎正在蓬勃發展。專注於文本回複評估的LM Arena採用了類似的思路,在正式推出付費產品僅四個月後,便於今年1月完成了1.5億美元的A輪融資。
Q&A
Q1:DesignArena是什麼,主要用來做什麼?
A:DesignArena是由Intelligence公司開發的AI工具,目前全球已有530萬用戶使用。它的核心功能是通過"A對B"對比排名的方式,收集用戶對AI生成內容(如網頁、圖片等視覺格式)的真實偏好反饋。這些反饋數據可供AI前沿實驗室用於改進其媒體生成模型,幫助模型更好地理解用戶真正想要什麼樣的輸出結果。
Q2:Intelligence公司的商業模式是怎樣的,目前收入情況如何?
A:Intelligence的商業模式主要面向企業端,AI前沿實驗室可以付費獲取平台上由真實用戶產生的評估數據,用於優化自身的媒體生成模型。對於普通用戶,平台提供免費的AI輸出對比排名服務,但用戶須登錄賬號使用。目前該平台年度經常性收入已達6000萬美元,並在本次種子輪融資中獲得Index Ventures等機構的790萬美元投資。
Q3:眾包人工反饋賽道有哪些成功和失敗的案例?
A:這一賽道已有較明顯的分化。失敗案例方面,Yupp在獲得a16z crypto的Chris Dixon投資3300萬美元、擁有超130萬用戶的情況下,仍因無法建立可持續商業模式而於今年關閉。成功案例方面,專注文本評估的LM Arena在推出付費產品僅四個月後便完成了1.5億美元A輪融資,Intelligence旗下的DesignArena也已實現6000萬美元年度經常性收入。






