• 運算
  • 客戶
  • 價格
登入
More Blog Posts
XDiscordLinkedInYouTube

產品

  • GPU
  • MaaS
  • Studio

開發者

  • 模型總覽
  • 技術文件
  • 詞彙表

公司

  • 關於我們
  • 部落格
  • 活動
  • 合作夥伴
  • 新創計劃
  • 職涯
  • 大使計畫
  • 使命與願景

熱門模型

    掌握 AI 最新動態

    提交即表示您瞭解我們會收集並使用您提交的資訊,其中可能包含個人資訊。

    XDiscordLinkedInYouTube

    Copyright ©2026 All rights reserved.

    隱私政策使用條款法律文件
    More Blog Posts
    Announcements

    NVIDIA Nemotron 3.5 Lightning 在 GMI Cloud 上線:補上你的 Agentic 系統缺的那一塊

    2026年8月11日

    NVIDIA Nemotron 3.5 Lightning 現已在 GMI Cloud 上線,並提供 Day-0 支援。從 NVIDIA 按下開關的那一刻起,你就能透過 GMI Cloud 相容 OpenAI 的 serverless API 呼叫 Nemotron 3.5 Lightning。

    兩個月前,我們 在 Day 0 就把 Nemotron 3 Ultra 帶給開發者,那是 NVIDIA 的 550B 前沿推理模型,專門應付最困難的協調與規劃決策。而 Nemotron 3.5 Lightning——一個由 Ultra 本身蒸餾而來、僅啟用 3B 參數的 30B MoE 模型——則負責高流量、隨時待命的任務,也就是 agent 實際工作中占比最高的那一塊,與 Ultra 形成互補。

    Nemotron 3.5 Lightning 的不同之處

    關於 agentic AI,有個不太好聽的事實:你的 agent 燒掉的 token,大多不是花在什麼精妙的推理上,而是花在重複的中間環節——摘要一個 PR、分類一則告警、補充上下文、檢查一條政策規則、呼叫一個工具、格式化一份結果。把每一個這種步驟,都導向前沿模型,就像派一艘貨櫃輪,去送一個包裹。

    Nemotron 3.5 Lightning,就是為這個「量」的層級而生。它蒸餾自 NVIDIA 的前沿模型 Nemotron 3 Ultra,並與 Nemotron Coalition 共同開發,專為主流 agent harness 訓練,在程式撰寫、tool calling、指令遵循,與多輪工作流程上,都具備領先的開箱即用準確度。而且它完全開放,你可以針對自己的領域做後訓練,成果,完全歸你所有。

    吞吐量最高提升 4 倍

    速度,是最大亮點。相較同級的其他模型,它的吞吐量最高可達 4 倍,完成任務的速度,最多快 30%。對隨時待命的 sub-agent 來說,這樣的速度優勢會不斷累積:同樣的時間預算,能完成更多步驟;同樣的花費,也能完成更多任務。

    即時看它動手打造

    我們透過 GMI Cloud API,實測了 Nemotron 3.5 Lightning,現場看它做出好幾個小應用:彈跳的 DVD 螢幕保護程式、煙火小玩具、Matrix 特效、番茄鐘計時器,以及一個 2048 風格的遊戲。每一個都在幾秒內完成,推理只用掉幾百個 token——這正好具體展示了,上面那些吞吐量數字,在重複、高流量的 agent 任務中,實際代表什麼。

    準確度的世代躍進

    這款 Lightning 模型相較前一代 Nemotron 3 Nano 是一次大幅躍進,也是 Artificial Analysis Intelligence Index benchmark 上的前沿模型之一。

    Benchmark

    Nemotron 3.5 Lightning

    Nemotron 3 Nano 

    (前一代)

    SWE-Bench Verified(程式撰寫)

    54.3%

    21%

    GDPval-AA v2(知識工作)

    924 ELO

    479 ELO

    這是前一代兩倍以上的程式撰寫分數、將近兩倍的知識工作評級,同時在比較組中,擁有最強的抗幻覺表現。NVIDIA 指出,這些都是模型仍在訓練階段的初步結果,正式 GA 的數字,預期還會再進步。

    架構重點

    項目

    細節

    架構

    混合式 Mixture of Experts(MoE)

    總參數量

    30B

    每個 token 啟用參數

    3B

    蒸餾來源

    NVIDIA Nemotron 3 Ultra

    生成技術

    Multi-Token Prediction(MTP)、DFlash

    上下文長度

    最高 1M tokens

    模型輸入/輸出

    文字輸入、文字輸出

    精度

    BF16、NVFP4

    可執行硬體

    H100、H200、B200、GB200、GB300

    授權

    OpenMWD

    Dflash 是一種 speculative decoding 方法,會用一個輕量模型,平行草擬多個未來 token。Lightning 模型再一次性驗證整個 token 區塊並採用有效的部分,在維持準確度的同時加速生成。

    Multi-Token Prediction 讓每次前向傳遞能生成多個未來 token,降低 agent 不斷產出的長篇結構化輸出(摘要、發現、工具參數、報告)的延遲。

    1M token 的上下文讓小模型也能做大模型的事,把完整的程式庫、告警歷史或多輪對話狀態一次裝下,不必截斷。

    一套模型系統,一個 API

    Nemotron 3.5 Lightning 也能融入更完整的多模型 agent 策略。搭配開源模型路由函式庫 NVIDIA NeMo Switchyard,agent 工具可以依品質、延遲、成本等需求,聰明地把每個請求送到最適合該任務的模型,而開發者完全不必改寫應用程式。

    這正是我們一直在押注的架構。GMI Cloud 已經提供 Nemotron 3 Ultra 來處理前沿層級的呼叫;現在 Lightning,補上了高流量的專用呼叫。而因為兩者都位在同一個與 OpenAI 相容的端點之後,像 Switchyard 這樣的 router,就能在兩者之間調度流量,你完全不必改動任何一行應用程式碼。這讓團隊可以在整個工作流程中,針對準確度、延遲與成本持續最佳化模型選擇。

    為什麼在 GMI Cloud 上跑

    Day-0、Serverless、零閒置

    Nemotron 3.5 Lightning 在發布當天就已在 GMI Cloud 的 serverless 推論 API 上線。以 token 計費、零閒置成本,或在你的 agent 機隊需要保證吞吐量時,預留專屬端點。

    相容 OpenAI,一行整合

    把現有 SDK 指向 GMI 就能開始。如果你已經在 GMI Cloud 上跑 Ultra、Qwen、GLM 或 Kimi,把 Lightning 加進路由池只是改一個 model 字串的事。

    為混合部署而生

    Lightning 設計的目標,就是到哪都能跑:工作站上的 RTX、桌上的 DGX Spark,或資料中心裡的 H100/Blackwell。先用 GMI Cloud 的託管端點做原型,等到要進入正式規模時,再把後訓練好的客製 checkpoint 部署到專屬的 GMI 基礎設施上。

    你可以打造什麼

    隨時待命的個人 agent

    管理郵件、行事曆、專案與訂位的長時間執行助理,需要的是一個快速、便宜、不知疲倦的模型。Lightning 的 token 效率,讓常駐的背景 agent 在經濟上真正變得可行。

    軟體開發 sub-agent

    PR 摘要、程式碼分類、測試分流——這些都是環繞在前沿 coding agent 周邊的針對性任務。像 CodeRabbit 這樣的團隊,已經在使用 Nemotron 系列模型,做上下文補充,再交棒給更大的模型,進行審查與驗證。

    資安維運

    告警內容補充、事件分類、日誌查詢、指標關聯,以及提供給分析師的結構化發現——高流量、緊繃的延遲預算,正好就是 Lightning 的守備範圍。

    金融服務與電信工作流程

    文件擷取、政策檢查、風險訊號監控、網路警報分流、帳務問題——針對你的領域,對 Lightning 做後訓練,它就會變成一個完全屬於你的專家模型。

    開始使用


    curl https://api.gmi-serving.com/v1/chat/completions \
      -H 'Content-Type: application/json' \
      -H "Authorization: Bearer $GMI_API_KEY" \
      --data '{
        "model": "nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
        "messages": [
          {"role": "system", "content": "You are a helpful assistant."},
          {"role": "user", "content": "Hello! What can you do?"}
        ],
        "max_tokens": 2048,
        "stream": true
      }'

    完整文件請見 docs.gmicloud.ai

    前沿模型,搶下了頭條,但在正式環境中真正勝出的是「模型系統」。Nemotron 3.5 Lightning,就是那匹快速、開放、可客製的主力馬,讓隨時待命的 agent,在成本上真正說得通;而 GMI Cloud,則讓你在 Day-0 就能在專為此打造的基礎設施上使用它。

    在 GMI Cloud 上部署 Nemotron 3.5 Lightning | 閱讀文件 | 加入 Discord 社群

    Roan Weigert

    Roan Weigert

    DevRel @ GMI Cloud

    Build AI Without Limits

    GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies

    FAQ

    NVIDIA Nemotron 3.5 Lightning is a customizable open 30B MoE model with 3B active parameters, distilled from NVIDIA frontier Nemotron 3 Ultra. It's built to power always-on agents with leading out-of-the-box accuracy for coding, tool calling, instruction following, and multi-turn workflows.

    Ready to build?

    Explore powerful AI models and launch your project in just a few clicks.

    Get Started