宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

用NVIDIA NeMo Switchyard跨模型路由AI智能體工作負載

2026年08月12日 首頁 » 熱門科技

構建AI智能體並不意味著只選擇一個模型。每個模型都有各自的優勢、局限性和成本結構,這些因素會隨工作負載的不同而變化,甚至在同一工作負載的不同階段也會有所差異。例如,一個智能體任務可能在某個步驟需要分類能力,下一步需要推理能力,而常規後續任務則適合使用更小的模型。將所有請求都發送給最大的模型會增加成本和延遲,而將所有請求都發送給較小的模型則會降低複雜任務的處理質量。

模型路由通過協調專用模型與前沿模型來應對這一挑戰,使每項任務都能使用最適合的模型。NVIDIA NeMo Switchyard將這一複雜的工程問題轉化為智能體工作負載的實用解決方案,讓開發者無需針對每個服務商或模型選擇重構應用,即可實現跨模型的工作分發。

在運行時,路由器會評估每個請求及其可用上下文,然後將任務發送給最符合需求、約束條件和策略要求的模型。根據工作負載的不同,這種多模型協作系統與始終使用最強模型相比,有望提升準確率並降低成本。

NeMo Switchyard提供了一個支持多種路由策略的庫。本文將探討NeMo Switchyard如何幫助開發者實踐多模型協作方法,構建更高效、更可控、更適合真實AI工作流的智能體。

以Terminal-Bench Hard基準測試衡量的電腦操作任務為例(圖1)。儘管DeepSeek V4在該示例中整體準確率最高,但它並非在所有任務組上都是最優選擇。例如,Kimi K2.6更適合機器學習和強化學習任務組,而Qwen3.5 397B A17B在數學和科學任務上表現更佳,其餘六個任務組則應使用DeepSeek用NVIDIANeMoSwitchyard跨模型路由AI智能體工作負載 V4。這種方法同樣可以應用於單個任務層面,或在解決單一任務的不同階段靈活切換。

成本和完成時間進一步增加了決策的複雜性(圖2)。每個模型都有其運行或訪問成本,以及各自的輸出冗餘度特徵,這不僅體現在Token數量上,還涉及工具調用次數。

構建路由器需要綜合考量來自多個維度的信號,不同的路由算法決定了這些信號的來源。

有效的路由決策通常依賴三個維度的信號:

模型能力:哪些模型能夠正確完成任務。

模型成本結構:每個模型的延遲和成本。

基礎設施:支持可靠、無縫切換的系統級信號。

理解能力與成本信號的方式包括:

分析請求本身。路由器可以根據主題或預估難度對請求進行分類匹配。例如,分類器可以識別查詢的主題,將其與模型池中的對應模型匹配,並完成路由。嵌入模型或特徵提取器可用於從查詢中提取特徵。

分析模型狀態。路由器可以檢查模型的對數概率、級聯輸出、智能體執行軌跡、模型殘差流、注意力矩陣等資訊。

分析系統狀態。定價、延遲、負載以及包括錯誤在內的智能體專屬信號均可作為參考,用於評估模型路由器或作為實時路由信號。

值得注意的是,路由器不僅需要考慮使用哪些信號,還需要考慮何時、在哪裡對這些信號進行評估。例如,對於多輪智能體任務,路由器可以將每個完整請求路由到特定模型,也可以在每個步驟單獨路由。整個系統可以共享一個模型池,子智能體也可以針對特定任務使用專屬模型池。

這些問題的答案取決於多種因素,包括使用場景、部署複雜度、容錯要求、延遲或吞吐量限制。系統還需要基礎設施支持,以實現對智能體和用戶透明的無縫切換。

NeMo Switchyard通過支持多種路由器的智能編排層來解決上述挑戰。開發者還可以將自定義路由算法或數據引入NeMo Switchyard。

路由算法生成信號,指導跨不同優勢模型的路由決策。系統還需要基礎設施來接收路由器的決策結果,將請求發送至目標模型,並將響應返回給應用程式。

這一切的基礎是NeMo switchyard-libsy——NeMo Switchyard背後與服務商無關的SDK。它負責表示請求、定義系統可用模型,並管理對所選模型的調用。每個模型目標都有一個語義名稱,其背後的客戶端負責將該名稱映射到服務商端點和模型ID。這種分離設計使路由邏輯獨立於特定服務商。

當策略需要時,NeMo Switchyard可以在智能體會話中保持路由狀態。它還能保留早期輪次的資訊(如工具調用結果或親和性決策),並在後續路由決策中使用這些上下文。當不需要歷史資訊時,路由也可以保持無狀態。

這種分離設計至關重要,因為模型部署會不斷變化。團隊可能會更新模型、遷移到其他端點或更換服務商,而無需修改路由集成。NeMo Switchyard可以通過目標客戶端發起模型調用,也可以將調用返回給宿主應用程式。這使智能體運行時、推理平台或網關能夠控制請求的處理方式,同時保持相同的路由契約。

NeMo Switchyard伺服器是通過通用API提供路由能力的參考實現,可模擬大語言模型網關。它接受OpenAI、Anthropic和Responses API格式的請求,將其轉換為NeMo Switchyard內部請求格式,並返回預期的響應格式。同時,它還會記錄所選模型、決策依據、Token用量、延遲和調用結果,便於團隊檢查路由運行情況。

基礎設施就緒後,下一步是了解利用它進行決策的路由方法。NeMo Switchyard同時提供免調優路由器和可調優路由器。

NeMo Switchyard包含多種免調優路由器,無需基於工作負載專屬數據進行訓練即可做出決策,包括大語言模型分類器、階段路由器和升級路由器。

大語言模型分類器

大語言模型分類器使用大語言模型作為評判者來選擇候選模型,並在後續輪次中保持與該模型的會話親和性。這避免了在智能體解決任務的過程中對未發生實質變化的工作進行重複分類。

這種方法適用於無頭系統和領域專屬系統。團隊可以將編程、數學或醫療任務路由到指定模型目標,而NeMo Switchyard負責提供路由和狀態管理功能。

階段路由器

編程智能體會經歷不同的工作階段:早期階段需要探索代碼庫並從錯誤中恢復,後期則進入更為機械化的實現階段。這些階段對模型能力的需求各不相同,階段路由器正是利用這一特點來做出路由決策。

對於每個輪次,階段路由器會檢查近期的工具活動,判斷智能體所需的模型能力級別。嚴重錯誤、反覆無效的工作或長時間的探索會將該輪次推向能力更強的模型;而穩定的代碼編寫和編輯(尤其是測試通過後)則傾向於使用高效模型。如果信號不明確,路由器可以諮詢大語言模型評判者,再回退到配置的默認選項。

升級路由器

升級路由從低成本模型開始處理每個對話。大語言模型評判者逐輪監控任務進展,當檢測到持續性困難時,將會話切換到能力更強的模型。

這種方法專為多輪智能體工作負載設計——較小的模型可以處理常規工作,但在遭遇反覆錯誤、循環或偏離後可能需要支援,是對大語言模型分類器路由方法從靜態到自適應的延伸。

可調優路由器在此路由基礎上,用從真實工作負載數據中學習到的信號替代固定啟發式規則。可調優路由器不再根據請求文本判斷哪個模型最合適,而是學習預測每個候選模型正確回答請求的可能性。

預填充路由器

在訓練階段,預填充路由器提取大語言模型的殘差流來估計查詢的複雜度。共享主幹多層感知機利用殘差流中的信號,將其映射到路由池中每個大語言模型的準確率標籤。

在推理階段,預填充狀態作為路由器的輸入,共享主幹預測每個大語言模型成功完成任務或回答查詢的可能性。

路由器隨後可以應用一種策略,將預測準確率與成本、延遲或其他部署約束綜合權衡。每個候選模型獲得一個評分,請求被路由到在該工作負載下綜合表現最優的模型。圖5表明,路由並非只是選擇最強的模型,而是選擇最有可能以合理成本達到所需質量水平的模型。

NVIDIA正與智能體、模型和企業應用生態系統中的合作夥伴攜手,將NeMo Switchyard模型路由能力融入現有開發者工作流,無需額外配置。這些合作包括:

智能體工作流:與Cognition合作的編程智能體工作流、與Nous Research合作的易配置Hermes Agent模型路由、與Ramp合作的金融軟體工程工作流,以及與LangChain合作的模型路由評估。

應用與基礎設施集成:與LiteLLM合作的大語言模型應用棧插件;與Kong合作的AI網關、治理和API流量管理;與Classmethod合作的Claude模型路由;與Boomi Agent Garden合作的企業自動化與連接。

行業專屬AI智能體:與Cadence合作的ChipStack AI超級智能體形式驗證工作流,以及與Siemens合作的EDA智能體工作流。

LangChain使用其內部深度智能體評估套件對NeMo Switchyard進行了基準測試,該套件包含145個多輪智能體任務,涵蓋客戶支持對話、值班事件調查和跨消息、問題跟蹤及郵件的多步驟工作流自動化等生產場景,評估工具使用、多步驟檢索、文件系統操作和長上下文摘要能力。在五次運行中,使用升級路由器在NVIDIA Nemotron 3.5 Lightning和Claude Opus 4.8之間路由請求,與純前沿模型基線相比實現了74%的成本降低,僅7%的調用被發送至前沿模型,準確率差距約為6個百分點。

Cognition在Devin Desktop中實現了NeMo Switchyard階段路由方法,並部署給NVIDIA內部用戶進行真實場景測試。在Cognition針對生產級編程任務的FrontierCode Main基準測試中,該實現在Opus 5和Kimi K2.7之間進行路由,以3.11美元的平均成本實現了50.6%的準確率,接近前沿水平——與Opus 5準確率相差2.8個百分點,平均成本降低約28%。基準測試與內部部署共同提供了一個模型中立、自適應智能體的實踐案例,展示了不同模型的互補優勢如何隨任務演進動態發揮作用。

開發者可以從合作夥伴集成入手,將NeMo Switchyard引入熟悉的智能體工具、框架和網關,也可以使用NeMo Switchyard GitHub上的說明,將自定義路由能力構建到自己的智能體和大語言模型網關中。

模型路由使專用模型與前沿模型能夠協同工作,實現整體大於部分之和的效果。然而,構建實用且生產就緒的路由系統仍是一項極具挑戰性的工程任務。

NeMo Switchyard完全開源,並與現有技術棧無縫集成。

隨著AI系統越來越多地組合使用多個模型,路由已成為在效率、質量和成本之間取得平衡、為每項任務選擇合適模型的關鍵所在。

Q&A

Q1:NeMo Switchyard是什麼?它解決了什麼問題?

A:NeMo Switchyard是NVIDIA推出的模型路由庫,專為AI智能體工作負載設計。它解決的核心問題是:不同任務適合不同模型,但手動管理多模型調用非常複雜。NeMo Switchyard通過智能編排層,在運行時自動將請求路由到最合適的模型,在保證質量的同時降低成本和延遲,且無需開發者針對每個服務商重構應用。

Q2:NeMo Switchyard支持哪幾種路由方式?

A:NeMo Switchyard提供兩大類路由器。免調優路由器包括:大語言模型分類器(用大語言模型選擇候選模型並保持會話親和性)、階段路由器(根據智能體當前工作階段動態切換模型)、升級路由器(從低成本模型起步,遇到困難時自動升級到更強模型)。可調優路由器包括預填充路由器,它通過學習真實工作負載數據,預測每個候選模型的成功概率,並綜合準確率與成本做出路由決策。

Q3:使用NeMo Switchyard能帶來多大的成本節省?

A:根據LangChain的基準測試,使用升級路由器在NVIDIA Nemotron 3.5 Lightning和Claude Opus 4.8之間路由,與純前沿模型方案相比可實現74%的成本降低,僅7%的請求需要調用前沿模型,準確率差距約為6個百分點。Cognition的實測也顯示,在編程任務中路由方案比單獨使用頂級模型平均成本降低約28%,準確率僅相差2.8個百分點。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新