2026年8月11日
.png)
NVIDIA Nemotron 3.5 Lightning 現已在 GMI Cloud 上線,並提供 Day-0 支援。從 NVIDIA 按下開關的那一刻起,你就能透過 GMI Cloud 相容 OpenAI 的 serverless API 呼叫 Nemotron 3.5 Lightning。
兩個月前,我們 在 Day 0 就把 Nemotron 3 Ultra 帶給開發者,那是 NVIDIA 的 550B 前沿推理模型,專門應付最困難的協調與規劃決策。而 Nemotron 3.5 Lightning——一個由 Ultra 本身蒸餾而來、僅啟用 3B 參數的 30B MoE 模型——則負責高流量、隨時待命的任務,也就是 agent 實際工作中占比最高的那一塊,與 Ultra 形成互補。
Nemotron 3.5 Lightning 的不同之處
關於 agentic AI,有個不太好聽的事實:你的 agent 燒掉的 token,大多不是花在什麼精妙的推理上,而是花在重複的中間環節——摘要一個 PR、分類一則告警、補充上下文、檢查一條政策規則、呼叫一個工具、格式化一份結果。把每一個這種步驟,都導向前沿模型,就像派一艘貨櫃輪,去送一個包裹。
Nemotron 3.5 Lightning,就是為這個「量」的層級而生。它蒸餾自 NVIDIA 的前沿模型 Nemotron 3 Ultra,並與 Nemotron Coalition 共同開發,專為主流 agent harness 訓練,在程式撰寫、tool calling、指令遵循,與多輪工作流程上,都具備領先的開箱即用準確度。而且它完全開放,你可以針對自己的領域做後訓練,成果,完全歸你所有。
速度,是最大亮點。相較同級的其他模型,它的吞吐量最高可達 4 倍,完成任務的速度,最多快 30%。對隨時待命的 sub-agent 來說,這樣的速度優勢會不斷累積:同樣的時間預算,能完成更多步驟;同樣的花費,也能完成更多任務。
我們透過 GMI Cloud API,實測了 Nemotron 3.5 Lightning,現場看它做出好幾個小應用:彈跳的 DVD 螢幕保護程式、煙火小玩具、Matrix 特效、番茄鐘計時器,以及一個 2048 風格的遊戲。每一個都在幾秒內完成,推理只用掉幾百個 token——這正好具體展示了,上面那些吞吐量數字,在重複、高流量的 agent 任務中,實際代表什麼。
這款 Lightning 模型相較前一代 Nemotron 3 Nano 是一次大幅躍進,也是 Artificial Analysis Intelligence Index benchmark 上的前沿模型之一。
Benchmark | Nemotron 3.5 Lightning | Nemotron 3 Nano (前一代) |
SWE-Bench Verified(程式撰寫) | 54.3% | 21% |
GDPval-AA v2(知識工作) | 924 ELO | 479 ELO |
這是前一代兩倍以上的程式撰寫分數、將近兩倍的知識工作評級,同時在比較組中,擁有最強的抗幻覺表現。NVIDIA 指出,這些都是模型仍在訓練階段的初步結果,正式 GA 的數字,預期還會再進步。
項目 | 細節 |
架構 | 混合式 Mixture of Experts(MoE) |
總參數量 | 30B |
每個 token 啟用參數 | 3B |
蒸餾來源 | NVIDIA Nemotron 3 Ultra |
生成技術 | Multi-Token Prediction(MTP)、DFlash |
上下文長度 | 最高 1M tokens |
模型輸入/輸出 | 文字輸入、文字輸出 |
精度 | BF16、NVFP4 |
可執行硬體 | H100、H200、B200、GB200、GB300 |
授權 | OpenMWD |
Dflash 是一種 speculative decoding 方法,會用一個輕量模型,平行草擬多個未來 token。Lightning 模型再一次性驗證整個 token 區塊並採用有效的部分,在維持準確度的同時加速生成。
Multi-Token Prediction 讓每次前向傳遞能生成多個未來 token,降低 agent 不斷產出的長篇結構化輸出(摘要、發現、工具參數、報告)的延遲。
1M token 的上下文讓小模型也能做大模型的事,把完整的程式庫、告警歷史或多輪對話狀態一次裝下,不必截斷。
Nemotron 3.5 Lightning 也能融入更完整的多模型 agent 策略。搭配開源模型路由函式庫 NVIDIA NeMo Switchyard,agent 工具可以依品質、延遲、成本等需求,聰明地把每個請求送到最適合該任務的模型,而開發者完全不必改寫應用程式。
這正是我們一直在押注的架構。GMI Cloud 已經提供 Nemotron 3 Ultra 來處理前沿層級的呼叫;現在 Lightning,補上了高流量的專用呼叫。而因為兩者都位在同一個與 OpenAI 相容的端點之後,像 Switchyard 這樣的 router,就能在兩者之間調度流量,你完全不必改動任何一行應用程式碼。這讓團隊可以在整個工作流程中,針對準確度、延遲與成本持續最佳化模型選擇。
Nemotron 3.5 Lightning 在發布當天就已在 GMI Cloud 的 serverless 推論 API 上線。以 token 計費、零閒置成本,或在你的 agent 機隊需要保證吞吐量時,預留專屬端點。
把現有 SDK 指向 GMI 就能開始。如果你已經在 GMI Cloud 上跑 Ultra、Qwen、GLM 或 Kimi,把 Lightning 加進路由池只是改一個 model 字串的事。
Lightning 設計的目標,就是到哪都能跑:工作站上的 RTX、桌上的 DGX Spark,或資料中心裡的 H100/Blackwell。先用 GMI Cloud 的託管端點做原型,等到要進入正式規模時,再把後訓練好的客製 checkpoint 部署到專屬的 GMI 基礎設施上。
管理郵件、行事曆、專案與訂位的長時間執行助理,需要的是一個快速、便宜、不知疲倦的模型。Lightning 的 token 效率,讓常駐的背景 agent 在經濟上真正變得可行。
PR 摘要、程式碼分類、測試分流——這些都是環繞在前沿 coding agent 周邊的針對性任務。像 CodeRabbit 這樣的團隊,已經在使用 Nemotron 系列模型,做上下文補充,再交棒給更大的模型,進行審查與驗證。
告警內容補充、事件分類、日誌查詢、指標關聯,以及提供給分析師的結構化發現——高流量、緊繃的延遲預算,正好就是 Lightning 的守備範圍。
文件擷取、政策檢查、風險訊號監控、網路警報分流、帳務問題——針對你的領域,對 Lightning 做後訓練,它就會變成一個完全屬於你的專家模型。
curl https://api.gmi-serving.com/v1/chat/completions \
-H 'Content-Type: application/json' \
-H "Authorization: Bearer $GMI_API_KEY" \
--data '{
"model": "nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Hello! What can you do?"}
],
"max_tokens": 2048,
"stream": true
}'完整文件請見 docs.gmicloud.ai
前沿模型,搶下了頭條,但在正式環境中真正勝出的是「模型系統」。Nemotron 3.5 Lightning,就是那匹快速、開放、可客製的主力馬,讓隨時待命的 agent,在成本上真正說得通;而 GMI Cloud,則讓你在 Day-0 就能在專為此打造的基礎設施上使用它。
在 GMI Cloud 上部署 Nemotron 3.5 Lightning | 閱讀文件 | 加入 Discord 社群
Roan Weigert
DevRel @ GMI Cloud
GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies
