企業在處理大量影片內容時,往往面臨影片系統、企業知識庫與操作工具相互割裂的問題。開發者需要捕獲用戶意圖、檢索正確的組織上下文、生成結構化報告,並將分析結果路由至下游系統。本文將介紹如何通過 NVIDIA NemoClaw 將影片分析能力升級為可編程的行動觸發器,實現從"影片顯示了什麼"到"針對影片內容我們應採取哪些行動"的跨越。
NVIDIA NemoClaw 是一套用於構建自主智能體的開放藍圖集合,可幫助生態系統構建領域專屬、始終在線的智能體,使其在數字與物理工作流中更安全、更快速、更高效地運行。
本文主要涉及以下幾個核心藍圖:
NVIDIA Metropolis 影片搜索與摘要藍圖(VSS)負責攝取流式或歸檔影片,生成字幕和視覺元數據,並支持語義搜索、交互式問答及事件摘要。
NVIDIA 檢索增強生成藍圖(RAG)將企業專有文檔(手冊、政策、法規、標準操作程序及參考數據)索引至 GPU 加速的向量資料庫,以實現快速語義搜索。
系統架構與工具組成
VSS 通過一組內置於智能體的工具,提供有導引的、上下文感知的影片分析能力,並結合人機協同(HITL)提示在處理開始前捕獲用戶意圖。與 NVIDIA NemoClaw 的自主智能體藍圖結合後,系統可進一步實現生成工單、跨多來源比較模式、起草修訂流程、上報異常以及將結果輸送至下游工作流等功能。
三個智能體工具協同工作以實現上述目標:
長影片摘要(LVS)影片理解工具:執行帶有強制性 HITL 參數收集的長影片摘要,用戶可交互式指定場景、關注事件、跟蹤對象及可選的知識檢索查詢。
知識檢索(frag)工具:調用 RAG 藍圖,從文檔、政策、參考數據和知識庫中檢索特定組織的上下文,RAG 藍圖在內部負責嵌入、重排序和向量搜索。
報告生成工具:將影片分析與檢索到的上下文相結合,生成包含時間戳、敘述性分析和引用來源的結構化報告,並可通過 HITL 讓用戶在生成前確認或編輯提示詞。
健康飲食教練演示案例
為直觀展示上述流程,本文以構建一個"健康飲食教練"為例,該系統能夠分析食物影片,評估用戶的飲食習慣,並返回可跟蹤執行的具體後續步驟。
用戶通過 VSS 界面上傳餐食準備影片後,NemoClaw 啟動工作流,讀取技能定義文件(SKILL.md)以了解分析所需的參數,並將請求交給 VSS 智能體,後者通過一系列 HITL 提示引導用戶完成配置,涵蓋分析內容、場景設定、關注事件、跟蹤對象,以及用於檢索營養或法規指南等參考知識的可選 RAG 藍圖查詢。
參數確認後,NemoClaw 開始協調整個流水線:LVS 影片理解工具首先向 RAG 藍圖查詢相關營養指南,隨後將參數、影片及檢索到的上下文一併傳遞給 LVS 服務;該服務以分層方式對影片進行摘要,並將參考知識融入分析結果;報告生成工具最終將結果整合為結構化的帶時間戳報告,包含檢測到的事件、基於參考資料的敘述性分析、相關來源引用以及具體的行動建議。
下遊行動編排
NemoClaw 讀取完成的報告後,將其轉化為協調一致的行動:呈現完整分析結果(包含 Markdown 和 PDF 報告鏈接及影片回放),並自動創建 Jira 工單,匯總發現內容與建議的飲食調整方案,設定適當的優先級與負責人。
這一下游步驟具有很強的通用性。根據報告內容,NemoClaw 還可以:創建附有優先級和負責人資訊的調查結果工單;跨多次運行對湧現的模式進行匯總或上報;整合支撐性證據供審查或合規使用;將差距路由至適當的後續工作流。
系統整體架構分為四層:
編排層:NemoClaw 智能體、vss-generate-video-report-rag 技能及 HITL 提示
VSS 智能體層:包含影片輸入/輸出、搜索、理解、LVS、知識檢索和報告生成等工具
RAG 藍圖層:包含 NVIDIA RAG API、Milvus 向量資料庫、NVIDIA Nemotron 重排序 NIM 及已索引的參考與組織文檔
大語言模型融合層:將 VSS 提供的摘要與通過 RAG 藍圖檢索到的上下文進行融合增強
部署實施步驟
環境要求
至少配備 24 GB 顯存的 NVIDIA GPU
Docker Engine 及 Docker Compose v2
NGC API 密鑰(ngc.nvidia.com)
NVIDIA Build API 密鑰(build.nvidia.com)
已部署並可從智能體訪問的 RAG 藍圖(含伺服器 URL 及集合名稱)
已安裝 NemoClaw(用於編程訪問)
第一步:克隆 VSS 代碼庫
git clone https://github.com/NVIDIA-AI-Blueprints/video-search-and-summarization.git ~/vss-public cd ~/vss-public echo "$NGC_CLI_API_KEY" | docker login nvcr.io --username '$oauthtoken' --password-stdin
第二步:配置 LVS 環境變量
編輯 LVS 配置文件 deploy/docker/developer-profiles/dev-profile-lvs/.env,將 VSS_AGENT_CONFIG_FILE 設置為 config_rag.yml 以啟用 frag 知識檢索工具。RAG_ 相關的三個變量(RAG_SERVER_URL、RAG_API_KEY、KNOWLEDGE_COLLECTION)是智能體連接 RAG 藍圖所需的全部配置。
第三步:啟動服務棧
創建綁定掛載所需的數據目錄後,啟動整個服務棧。compose 配置文件會根據 .env 文件中的 COMPOSE_PROFILES 自動選擇。服務棧將啟動所有基礎設施組件(VST、Redis、Elasticsearch、LVS、NIM)及使用啟用 RAG 配置的智能體。
注意:NIM 加載可能需要 5 至 15 分鐘,請耐心等待。
第四步:初始化 NemoClaw
在代碼庫根目錄執行以下命令:
NEMOCLAW_PROVIDER=build NVIDIA_API_KEY="$NVIDIA_API_KEY" bash deploy/docker/scripts/nemoclaw/init_nemoclaw.sh demo
此命令將完成全部初始化工作:註冊 NemoClaw、配置模型提供商、應用 VSS 沙盒策略、安裝包含 vss-generate-video-report-rag 在內的代碼庫技能,並列印 OpenClaw UI 的訪問地址。
第五步:連接並開始使用
執行 nemoclaw SANDBOX_NAME connect openclaw tui 後,在 OpenClaw UI 中輸入 /new 開始新會話,然後發送請求消息即可啟動完整工作流。
性能表現
引入 NemoClaw 編排和 HITL 參數收集僅帶來極小的延遲開銷。HITL 階段是異步的,NemoClaw 與用戶交互時系統處於等待狀態,參數確認後影片處理即刻啟動。
合作夥伴落地案例
Computacenter 在 Run:AI 集群上部署了完整的"檢測→推理→行動"流水線,用於預測性維護。該方案使用 VSS 3 分析無人機、內窺鏡和熱成像檢查影片,結合 RAG 藍圖提供的原廠文檔上下文,並通過 NemoClaw 自動起草 Maximo 工單,將影片到工單的處理時間從 30 至 45 分鐘縮短至約 19 秒,覆蓋四類資產。
VAST Data 使用 NemoClaw 在 VAST DataEngine 上編排實時 VSS 流水線,通過 VAST RAG 與 VastDB 和向量結合處理直播遊戲流;該方案基於 NVIDIA 藍圖,使用 cosmos-reason2 和 Nemotron 模型,在 NVIDIA DSX AIR 上實現端到端運行。
總結與展望
VSS 3、RAG 藍圖與 NemoClaw 的集成代表著企業影片分析方式的根本性轉變。影片分析不再止步於靜態報告,而是成為協調行動的起點,具體體現在以下幾個維度:
速度:響應時間從數小時或數天縮短至數分鐘
規模:可跨多來源分析數千個影片並呈現企業級全局模式
一致性:政策、流程、法規和指南等參考知識得到一致應用
可追溯性:每項決策均可追溯至影片證據和來源文檔
自動化:告警生成、工單創建、文檔歸檔等常規工作流無需人工干預
這就是企業級影片 AI 的形態:專項分析引擎(VSS 與 RAG 藍圖)通過整潔、定義清晰的 API 組合成通用智能體工作流(NemoClaw),將組織智慧嵌入每一項決策之中。相關藍圖現已開放,可直接替換為您自己的影片來源和參考知識,例如將巡檢影片與原廠手冊配對、將零售賣場攝影機與陳列政策配對,或將直播內容與規則手冊配對,然後從一個完整的"影片到決策到行動"閉環開始試點並逐步擴展。
Q&A
Q1:NVIDIA NemoClaw 是什麼?它在影片分析中起什麼作用?
A:NVIDIA NemoClaw 是一套用於構建自主智能體的開放藍圖集合,能夠幫助構建領域專屬、始終在線的智能體。在影片分析場景中,它充當編排層,將 VSS 影片分析結果與 RAG 藍圖檢索到的知識相結合,自動觸發下遊行動,如創建 Jira 工單、上報異常、匯總跨影片模式等,從而將靜態的影片分析報告轉變為可執行的業務流程。
Q2:部署 VSS 與 NemoClaw 集成方案需要哪些硬體和軟體條件?
A:硬體方面,需要至少配備 24 GB 顯存的 NVIDIA GPU。軟體方面,需要安裝 Docker Engine 和 Docker Compose v2,並準備好 NGC API 密鑰和 NVIDIA Build API 密鑰。此外,還需要已部署並可從智能體網路訪問的 RAG 藍圖實例,以及已安裝的 NemoClaw。整個部署流程通過克隆 VSS 代碼庫、配置環境變量、執行初始化腳本完成,NIM 加載通常需要 5 至 15 分鐘。
Q3:Computacenter 使用該方案後,影片處理效率提升了多少?
A:Computacenter 在 Run:AI 集群上部署了基於 VSS 3、RAG 藍圖和 NemoClaw 的完整預測性維護流水線,用於分析無人機、內窺鏡和熱成像檢查影片,並自動起草 Maximo 工單。部署後,影片分析到生成工單的處理時間從原來的 30 至 45 分鐘大幅縮短至約 19 秒,覆蓋四類資產,效率提升顯著。






