全新輕量級開放式模型與路由函式庫,讓使用者得以在邊緣裝置、PC、工作站、資料中心與雲端環境中,對 AI、資料及工作流程擁有更加全面的掌控
隨著人工智慧(AI)從聊天機器人轉向自主代理,開放模型正回應市場需求,讓使用者能完整掌控 AI 在何處運行,以及如何部署與持續演進。

NVIDIA 今日推出 Nemotron 3.5 Lightning,進一步擴展 Nemotron 3 系列模型。這款模型針對長時間運行的代理型 AI 工作負載,提供同級最高的運行效率。此次發布延續 Nemotron 3 Nano,體現 NVIDIA 持續改善開放式模型,以提升準確度與速度的承諾。
Nemotron 3.5 Lightning 是一款擁有 300 億參數的混合專家(mixture-of-experts)模型,專為大型多代理系統中的特定任務打造,有助於建立更智慧、更高效的代理型應用。
此外,NVIDIA 亦推出 NeMo Switchyard,這是一套開源函式庫,能夠在常用的代理工具中實現智慧路由。企業可運用此函式庫,依據自身特定需求建立路由器。部署後,NeMo Switchyard 能智慧地將每項請求導向最適合且最具能力執行該任務的模型,無需開發人員重新編寫應用程式。
Nemotron 3.5 Lightning 與 NeMo Switchyard 結合後,可讓使用者更精準掌控 AI 的部署方式、執行位置及運作效率,涵蓋 PC、工作站、資料中心與雲端環境。
持續運作的 AI 代理需要模型系統
現代代理型系統,也就是持續運作的 AI 代理,正日益採用模型系統(systems of models),亦即由多個模型組成的模型組合,讓不同模型分別專精於不同任務。
NVIDIA Nemotron 開放模型正是為這類架構而設計。Nemotron 3 Ultra 或 GPT-5.6 等尖端推理模型可負責規劃並協調工作流程,而 Nemotron 3.5 Lightning 等較小型的專用模型,則能執行程式碼審查、工具使用、安全警示監控及回答帳務問題等特定任務。
Nemotron 3.5 Lightning 驅動大量專用任務
NVIDIA Nemotron 3.5 Lightning 是一款可全面客製化的開放模型,專為驅動持續運作 AI 代理的大量任務而打造。其開發亦獲得 Nemotron 聯盟成員的貢獻,包括提供評估方法、推論軟體及資料集,以協助推動模型發展。
相較於同級其他模型,Nemotron 3.5 Lightning 的輸出速度最高可提升 4 倍,使代理型任務的完成速度提升 30%。此外,由於其開放且可客製化的特性,Nemotron 3.5 Lightning 可透過 NVIDIA NeMo,輕鬆針對組織自身的領域資料、工具及工作流程進行後訓練,進一步提升專用任務的準確度。
各產業的 AI 領導者正針對自身工作負載客製化 Nemotron 3.5 Lightning,包括 CrowdStrike 將其應用於網路安全、Harvey 與 Trajectory 應用於法律服務,以及 CodeRabbit 與 Baseten 應用於程式碼審查,這些應用有助於提升特定領域代理型任務的準確度。此外,Lila Sciences 正致力於提升物理科學與生命科學領域中代理型任務的推理能力,而 Fastino Labs 則透過客製化該模型,在軟體開發、金融與醫療工作負載方面展現了業界領先的準確率。
Nemotron 3.5 Lightning 同時讓企業得以掌控隱私與部署。模型可在本地 AI 系統上運行,包括 NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station 及 NVIDIA Jetson,協助使用者充分發揮既有基礎架構投資的效益。Nemotron 3.5 Lightning 亦可擴展至邊緣 AI 裝置、NVIDIA RTX PRO 工作站、資料中心及雲端環境,以滿足企業應用情境。針對需要快速回應的大量專用任務,Nemotron 3.5 Lightning 也可在本地端或內部部署環境運行。
此外,如同每次推出 Nemotron 模型,NVIDIA 都會在授權條款允許的範圍內,盡可能公開訓練資料與技術,讓模型具備可追溯性、可供稽核,並能用於訓練其他模型。除了 Lightning 之外,NVIDIA 此次也同步發布 Nemotron-RL-Agentic-Terminal-Pivot,這是一套代理型強化學習資料集,可用於對 Lightning 進行後訓練,以培養其程式設計代理能力。
透過模型路由打造更高效的 AI 應用
有些模型更擅長程式設計,有些適合推理,有些適用於輕量型任務,有些則經過最佳化可在本地端執行,以提供更高的隱私性與效率。若客戶只依賴單一預設模型,可能增加不必要的支出或犧牲品質;若以人工方式管理模型路由,又會增加整合工作,進而拖慢部署速度。
NVIDIA NeMo Switchyard 是一套專為 AI 代理打造的開源模型路由函式庫。這項技術會根據特定需求,自動將提示詞導向代理工作流程各步驟中最合適且效率最佳的模型。代理應用程式開發人員可使用不同的路由演算法調校或修改路由器,使其符合品質、延遲及成本等優先考量。在模型系統中,企業可藉此打造功能強大的 AI 代理,同時提升詞元效益。
NVIDIA 內部基準測試顯示,NeMo Switchyard 能維持前沿模型等級的準確率,同時將完成任務的成本降至單獨使用 Opus 4.8 的近三分之一。
NVIDIA 正與 AI 生態系的合作夥伴共同將智慧模型路由導入開發人員現有的工具與平台。
Boomi:針對五項路由功能評估 Switchyard,領域路由準確率達 100%,並將 59% 的流量導向速度快 5 倍的微調模型,同時將後續輪次的延遲降低 21%。
Cadence:在形式驗證應用情境中使用 ChipStack AI Super Agent,將效率提升 9.9%。
Classmethod:目前在內部透過 NeMo Switchyard 運行 opencode 與 Fireworks 工作負載,初步測試顯示在維持品質的同時,成本降低 27%。
Cognition:將 NVIDIA NeMo Switchyard 的分階段路由器整合至 Devin Desktop,供 NVIDIA 內部使用。在 FrontierCode Main 上達到接近前沿模型的效能,同時相較於將所有請求都導向單一底層前沿模型,平均成本降低 28%。
Kong:透過 Kong AI Gateway 原生提供 NeMo Switchyard 路由功能。
LangChain:使用 NeMo Switchyard 執行 145 項多輪 Deep Agents 任務時,僅將 7% 的呼叫導向前沿模型,便將成本降低 74%,準確率則只下降 6%。
LiteLLM:正將 NeMo Switchyard 作為外掛程式形式整合至其 proxy 層,讓開發人員無需更動既有技術堆疊即可享有這些優勢。
Nous Research:將 NeMo Switchyard 整合至 Hermes,為開發人員提供易於設定的路由系統,以提升代理效率。
Ramp:在 Ramp SWE-Bench 測試中,使用 NeMo Switchyard 達到與前沿模型相當的效能,同時將成本降低 58%、執行時間縮短 33%。
西門子:正進行基準測試,以提升其 Fuse EDA AI Agent 的效率。
Nemotron 3.5 Lightning 現已於 Hugging Face、ModelScope、OpenRouter 及 build.nvidia.com 上提供,並可作為 NVIDIA NIM 微服務使用。此外,Nemotron 3.5 Lightning 也可透過 NVIDIA 雲端合作夥伴、後訓練平台、推論平台及雲端服務供應商所組成的廣泛生態系取得。NeMo Switchyard 現已於 GitHub 上提供,並即將登上合作夥伴平台。









