頂尖大學為何將圖書館與實驗室建在同一校園?原因很簡單:數據、智能、學習與應用集中在一處,形成飛輪效應
。牛津、斯坦福和麻省理工學院之所以舉足輕重,靠的不是某項單一能力,而是所有能力高度集中、協同設計的結果。這些校園培育出諾貝爾獎得主和公司創始人,正是因為它們從一開始就圍繞核心要素構建,而非事後拼湊。
AI與數據平台同樣遵循這一邏輯:鄰近性與主權決定勝負。大多數企業都希望運行自己的AI與數據平台,但真正成功的寥寥無幾。成功者有一個共同特徵:擁有一個主權控制平面
,統一數據、運行時、治理與訪問控制各層緊密協作。他們彌合了"立志成為數據與AI平台"和"真正成為自己的AI作業系統"之間的差距。
請記住這個核心理念:鄰近性加上居中控制。智能體時代即將對這一理念發起前所未有的考驗。
Databricks近期收購了Electric團隊,該團隊開發了一款可在智能體沙箱內運行的WASM版Postgres
,體量極為輕量。此次收購將其併入Lakebase
,並配套實時同步引擎,實現邊緣端輕量Postgres與中央平台之間的數據同步,以保障持久性與可控性。這是一筆聰明的收購,但也透露了一個信號:當最大的平台競相在"面向智能體的Postgres"領域插旗,問題已不是Postgres是否勝出,而是這筆收購解決了哪一半問題,以及真正重要的那一半最終歸誰所有。
Postgres的勝出並非某家廠商的一面之詞,業內架構師的評估可以作證。ORBIS Austria數據與AI首席企業架構師Florian Zeba
直言:在概念驗證和最小可行產品
階段,Postgres是默認選擇,尤其是在AI相關項目中。但他同時指出了瓶頸所在:標準pgvector
在向量數量約500萬至1000萬以內可維持p99延遲低於20毫秒;一旦超過這一閾值,HNSW索引
將超出內存容量,延遲急劇劣化。這恰恰是一個基礎原語力不從心、需要平台接棒的臨界點。
智能體打破了傳統基礎設施的固有假設。它們在運行時動態決定所需數據,在沙箱中運行且只有一條網路路徑通向外部,同時以集群方式部署,每個智能體都需要實時獲知其他智能體的最新操作狀態。這實際上是兩個問題,但業界常常將其混為一談。
第一個問題是快速本地上下文,即在智能體運行所在位置部署一個輕量級資料庫。這正是Electric所解決的問題,確實有其價值,但這只是較易解決的那一半。
第二個問題是數據記錄:一個持久、受治理的狀態版本,供數百個非確定性智能體並發讀寫,且不產生衝突或數據損壞。這才是真正的難題——誰擁有這份記錄、寫入如何協調、向量數量超過閾值後檢索性能如何保持。邊緣原語加同步引擎能搬運數據,但無法治理數據,也無法解決中心端的性能問題。這正是校園原則的技術表達:智能與權威記錄必須從設計之初就共處一地,而不是把沙箱裡的數據通過網路路徑同步回一個由他人掌控的記錄系統。
性能數據值得關注。今年7月,McKnight諮詢集團
的獨立基準測試顯示:在標準化企業硬體上處理5000萬向量時,EDB Postgres(R) AI的查詢中位延遲為50毫秒,而Databricks的延遲超過4000毫秒,且召回率更低、每次查詢成本更高。檢索性能與治理能力雖是不同維度,但對於一個將自身定位為"面向智能體的Postgres"中心平台的產品而言,中心恰恰是這些數據最為關鍵的地方。
"將數據同步回中央平台以實現管控"——細則就藏在這句話里。管控是在誰的條件下實現的?治理數據記錄意味著資料庫本身必須強制執行每個智能體的權限,按角色劃定範圍,僅授予當前任務所需的最小權限,並在執行層面而非應用代碼層或提示詞層落實。寫入操作在觸及記錄之前須經過審批,每條語句均須被捕獲以供審計。做到這一點,一個智能體集群才真正可信。若跳過這一步,構建的不過是一套快速、分布式地破壞數據源真實性的機制。收購模式的隱患在於:你同步回去的那個中心,是一個專有控制平面
,其持久性與管控權是在平台條款下提供的,運行在你並不完全擁有的基礎設施之上。
以下是當前值得重點權衡的幾點建議:
在選擇工具之前,先將兩個問題分開。快速本地上下文與受治理的數據記錄是兩項不同的工作,詢問任何供應商他們所解決的究竟是哪一半。
了解自身的規模臨界點。pgvector在特定規模內表現優異,超出後性能下降。明確自身工作負載所處位置,以及平台在超過該臨界點後如何應對。
找到真正執行權限的邊界層。應用代碼和提示詞終究會失效,持久的解決方案是資料庫在執行層面、針對每個智能體強制執行權限,並對每次寫入設置門控。
要求完整的可審計性。如果無法逐條語句地還原每個智能體的行為,就無法信任它,也無法向監管機構證明其合規性。
確認誰掌控中心。如果數據記錄儲存在某個供應商的專有控制平面內,你實際上是在租用AI戰略的地基。務必確認能否在開放的Postgres上、在自己掌控的基礎設施上獨立運行。
Postgres贏得智能體資料庫之爭,在於它本身就具備事務保障和運營成熟度,能夠為不可預測的工作負載提供受治理的記錄支撐,且以開放方式實現。這才是值得守護的核心價值。
頂尖大學幾個世紀前就悟透了這個道理:將所有重要的事物集中在一處,統一設計,置於同一屋檐下。Databricks剛剛花錢買下了邊緣端。而中心——那個每個智能體都要寫回的、可信、受治理、可移植且高性能的數據記錄——仍然由你自己掌握。問題在於:你是真正掌控它,還是在租用它?
Q&A
Q1:為什麼說Postgres贏得了智能體資料庫之爭?
A:Postgres贏得智能體資料庫市場的核心原因在於,它本身具備成熟的事務保障能力和豐富的運營經驗,能夠為不可預測的智能體工作負載提供受治理的持久記錄支撐,並以開放方式實現。業內架構師普遍將Postgres作為AI相關項目概念驗證和最小可行產品階段的默認選擇。但需注意,標準pgvector在向量數量超過500萬至1000萬後性能會顯著下降,超出這一閾值後需要更完整的平台能力來接棒。
Q2:Databricks收購Electric團隊解決了哪些問題,又遺留了哪些問題?
A:此次收購解決了"快速本地上下文"問題,即在智能體沙箱內提供輕量級Postgres運行環境,並通過實時同步引擎將數據傳回中央平台。但遺留的關鍵問題是"數據記錄治理":誰擁有權威數據記錄、寫入衝突如何協調、超過向量規模閾值後檢索性能如何保障,以及數據被同步回的中央控制平面是否真正由企業自己掌控。這是該收購模式難以迴避的隱患。
Q3:企業在構建面向智能體的數據平台時應如何評估供應商?
A:企業應重點從以下維度評估:一是區分快速本地上下文與受治理數據記錄這兩個不同問題,確認供應商解決的是哪一半;二是明確自身工作負載的規模臨界點,了解平台超出閾值後的表現;三是確認權限是否在資料庫執行層面強制落實,而非依賴應用代碼或提示詞;四是要求完整的逐語句可審計性;五是確認數據記錄是否運行在開放Postgres和企業自控基礎設施上,避免將AI戰略的地基"租"給單一供應商。






