宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

Meta發布Muse Code編程智能體,支持複雜代碼庫任務

2026年08月12日 首頁 » 熱門科技

Meta推出了一款測試版編程智能體,專為處理大型代碼庫中的複雜軟體開發任務而設計。

Muse CodeMeta發布MuseCode編程智能體支持複雜代碼庫任務目前支持macOS和Linux系統,採用該公司最新推出的Muse Spark 1.2Meta發布MuseCode編程智能體支持複雜代碼庫任務模型。與以往需要為每項任務單獨創建智能體的方式不同,Muse Code內置了多個可在整個會話期間持續運行的專屬後台智能體Meta發布MuseCode編程智能體支持複雜代碼庫任務

這些智能體以異步方式執行任務,並可自主判斷何時向主智能體匯報工作進展。Meta表示,保持智能體持續活躍的設計,能夠減少重複收集資訊的開銷,並降低開發者在處理複雜多步驟任務時的介入需求。

"Muse Code採用本地事件日誌機制,每一次模型調用、工具運行、操作審批和代碼編輯都會被記錄其中,"Meta在官方博文中表示,這套記錄機制"使運行時具備精確回放能力和安全重啟能力",智能體在崩潰後可從中斷位置精準恢復。

Muse Spark 1.2模型可通過Muse Code及Meta模型API使用,Meta同時宣布擴大該API的全球訪問權限。

Meta表示,Muse Spark 1.2與Muse Code經過協同訓練,以提升模型在智能體環境下的表現和易用性。訓練過程融合了Muse Code的工具集和智能體工作流程,同時Meta增加了用於代碼生成的算力投入,並擴展了所覆蓋的開發環境範圍。此外,該模型還針對更長周期的任務進行了專項訓練,包括整倉代碼生成和大型端到端軟體項目。

Omdia首席分析師蘇連傑表示,Meta的協同訓練方式未必能形成明顯的競爭優勢,因為競爭對手同樣在同步推進各自編程模型與智能體框架的深度協同開發。"OpenAI和Anthropic等廠商已將智能體框架工程納入訓練流程的一部分,"他說。

Pareekh Consulting首席執行官Pareekh Jain指出,模型與智能體的協同優化確實有助於提升任務規劃和上下文處理能力,但要形成真正的競爭優勢,還需在企業級項目上拿出更好的實際成績,並切實減少人工干預。

在基準測試方面,Muse Spark 1.2在Terminal-Bench 2.1上取得了82.9%的pass@1得分,低於Claude Opus 5,但略高於GPT-5.6 Terra;在DeepSWE 1.1上得分為59.3%,落後於上述兩款競品。值得注意的是,Meta在進行Terminal-Bench 2.1和DeepSWE 1.1評測時,對每款模型均搭配其對應的編程智能體,而非使用統一的智能體框架。Meta也坦承,競品專有模型若使用專為其設計的工具和提示詞,表現可能有所不同。

Counterpoint Research研究副總裁Neil Shah表示,只有採用第三方工具或統一智能體框架進行評測,跨廠商的橫向比較才更具參考價值。"對於CIO而言,真正關鍵的指標是模型在企業自有開發流水線上的通過率,這才是衡量模型與智能體框架組合是否成功的核心標準——對Meta的Muse Spark 1.2和Muse Code來說也不例外,"他說。"這才是真正意義上的基準測試。"

在企業採用層面,蘇連傑指出,安全合規與治理要求可能會拖慢落地進程,尤其是在編程智能體需要與企業現有身份認證系統對接的場景下。"很多企業對於將AI工具接入CI/CD環境仍持謹慎態度,"他說。

Shah則表示,企業需要建立完善的訪問管控機制,規範智能體對代碼倉庫的訪問行為,並保留模型和智能體工作流處理企業數據的完整記錄。他還特別提到了Token用量難以預測這一問題及其對成本的潛在影響。

Meta的定價結構也帶來了數據治理方面的選擇。Meta表示,低價的Contributor版本所產生的數據可能被用於改進其產品,而標準版則不作此用途。Contributor版定價為每百萬輸入Token 0.10美元、每百萬輸出Token 0.20美元;標準版則分別為1.25美元和4.25美元。

"此外,企業對廠商綁定和依賴性也存在顧慮,擔心這會影響長期的系統靈活性和互操作性,"蘇連傑補充道。

Jain認為,企業的實際採用路徑可能會從定義清晰、風險較低的工作場景起步,在允許持續運行的智能體修改關鍵生產代碼之前,會經歷較為審慎的漸進過程。

Q&A

Q1:Muse Code和普通編程工具有什麼區別?

A:Muse Code最大的不同在於引入了持續運行的後台智能體。普通工具通常為每個任務臨時創建智能體,而Muse Code的智能體在整個會話中保持活躍,能夠異步執行任務、自主決定何時匯報進展,並在崩潰後精準恢復中斷前的狀態,特別適合處理大型代碼庫中複雜的多步驟開發任務。

Q2:Muse Spark 1.2在基準測試中表現如何?

A:Muse Spark 1.2在Terminal-Bench 2.1上的pass@1得分為82.9%,低於Claude Opus 5,但略高於GPT-5.6 Terra;在DeepSWE 1.1上得分59.3%,落後於兩款競品。需要注意的是,Meta的評測方式是為每款模型配套其專屬智能體,而非使用統一框架,因此跨模型比較的客觀性存在一定局限。

Q3:企業在採用Muse Code時主要面臨哪些顧慮?

A:企業的顧慮主要集中在三個方面:一是安全與合規要求,許多企業不願將AI工具接入CI/CD環境;二是數據治理風險,需要明確智能體訪問代碼倉庫的權限邊界及數據使用記錄;三是Token用量難以預測帶來的成本不確定性,以及對廠商綁定影響長期系統靈活性的擔憂。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新