August 11, 2026
.png)
NVIDIA Nemotron 3.5 LightningがGMI Cloudに登場しました。NVIDIAによる提供開始と同時にGMI CloudのOpenAI互換サーバーレスAPIを通じてNemotron 3.5 Lightningを利用できます。
2カ月前、GMI CloudはNVIDIAの550Bパラメータを備えたフロンティア推論モデル「Nemotron 3 Ultra」をDay 0で開発者向けに提供開始しました。Nemotron 3 Ultraは、特に高度なオーケストレーションやプランニングを必要とする処理に適したモデルです。今回登場したNemotron 3.5 Lightningは、Ultra自体から蒸留された30BのMoE(Mixture of Experts)モデルで、トークンあたりのアクティブパラメータはわずか3Bです。Ultraを補完しながら、エージェントが実際に行う処理の大半を占める、大量かつ常時稼働型のタスクを効率的に処理します。
エージェントAIの実態として、エージェントが消費するトークンの多くは、高度な推論に使われているわけではありません。PRの要約、アラートの分類、コンテキストの補強、ポリシールールの確認、ツールの呼び出し、結果のフォーマットなど、反復的な中間処理に費やされています。こうしたすべての処理をフロンティアモデルに任せるのは、荷物1個を届けるためにコンテナ船を手配するようなものです。
Nemotron 3.5 Lightningは、まさにこの大量処理レイヤーのために設計されています。NVIDIAのフロンティアモデルNemotron 3 Ultraから蒸留され、Nemotron Coalitionと共同で開発されたこのモデルは、主要なエージェントハーネス向けに特化してトレーニングされています。コーディング、ツール呼び出し、指示追従、マルチターンワークフローにおいて、優れた初期精度を実現します。さらに完全にオープンなモデルであるため、自社ドメインに合わせてポストトレーニングを行い、独自のモデルとして活用できます。
最大の特長はスピードです。同クラスの他モデルと比較して最大4倍のスループットを実現し、タスクを最大30%高速に完了します。常時稼働するサブエージェントでは、この速度向上が積み重なることで大きな効果を生みます。限られた時間内でより多くのステップを実行でき、同じコストでより多くのタスクを完了できます。
GMI Cloud APIを通じてNemotron 3.5 Lightningを実行し、複数の小規模アプリをリアルタイムで構築させました。作成したのは、バウンドするDVDスクリーンセーバー、花火アプリ、Matrix風エフェクト、ポモドーロタイマー、2048風ゲームなどです。いずれも数秒で構築が完了し、推論に使用したトークンはわずか数百程度でした。これは、前述したスループット性能が、反復的かつ大量のエージェントタスクでどのような効果をもたらすかを具体的に示しています。
Nemotron 3.5 Lightningは、前世代のNemotron 3 Nanoから大幅な進化を遂げておりArtificial Analysis Intelligence Indexベンチマークにおいても、フロンティアモデルの1つに位置付けられています。
ベンチマーク | Nemotron 3.5 Lightning | Nemotron 3 Nano (前世代) |
SWE-Bench Verified(コーディング) | 54.3% | 21% |
GDPval-AA v2(ナレッジワーク) | 924 ELO | 479 ELO |
コーディングスコアは前世代の2倍以上、ナレッジワークの評価も約2倍に向上しています。さらに、比較対象の中でも優れたハルシネーション耐性を示しています。NVIDIAによると、これらは現在もトレーニング中のモデルによる暫定結果であり、正式な一般提供(GA)時にはさらなる性能向上が見込まれています。
機能 | 詳細 |
アーキテクチャ | ハイブリッドMixture of Experts(MoE) |
総パラメータ数 | 30B |
トークンあたりのアクティブパラメータ | 3B |
蒸留元 | NVIDIA Nemotron 3 Ultra |
生成技術 | Multi-Token Prediction(MTP)、DFlash |
コンテキスト長 | 最大100万トークン |
モデルI/O | テキスト入力、テキスト出力 |
精度 | BF16、NVFP4 |
対応GPU | H100, H200, B200, GB200, GB300 |
ライセンス | OpenMWD |
DFlashは、軽量モデルを使用して複数の将来トークンを並列にドラフトする投機的デコーディング手法です。Lightningモデルがトークンブロック全体を一度に検証し、有効なトークンを採用することで、精度を維持しながら生成を高速化します。
Multi-Token Prediction(MTP)は、1回のフォワードパスで複数の将来トークンを生成します。これにより、要約、分析結果、ツール引数、レポートなど、エージェントが頻繁に生成する長い構造化出力のレイテンシを削減できます。
最大100万トークンのコンテキストにより、小規模なモデルでもリポジトリ全体、アラート履歴、マルチターンのセッション状態などを、途中で切り捨てることなく保持できます。
Nemotron 3.5 Lightningは、より広範なマルチモデル・エージェント戦略にも適しています。NVIDIA NeMo Switchyardは、オープンソースのモデルルーティングライブラリです。品質、レイテンシ、コストなどの要件に応じて、エージェントツールが各リクエストを最適なモデルへインテリジェントに振り分けることができ、開発者がアプリケーションを書き直す必要はありません。
これは、GMI Cloudが以前から注力してきたアーキテクチャでもあります。GMI Cloudではすでに、高度な処理向けにNemotron 3 Ultraを提供しています。今回、Lightningが大量かつ特化型の処理をカバーするようになりました。両モデルは同じOpenAI互換エンドポイントから利用できるため、Switchyardのようなルーターを使えば、アプリケーションコードを変更することなくモデル間でトラフィックを振り分けられます。これにより、ワークフロー全体で精度、レイテンシ、コストのバランスを考慮したモデル選択が可能になります。
Nemotron 3.5 Lightningは、モデルのリリース初日からGMI Cloudのサーバーレス推論APIで利用できます。トークン単位の従量課金で、アイドル時の料金は発生しません。また、エージェント群で一定のスループットを確保する必要がある場合は、専用エンドポイントを予約することもできます。
既存のSDKの接続先をGMI Cloudに変更するだけで利用を開始できます。すでにGMI Cloud上でUltra、Qwen、GLM、Kimiなどを利用している場合、Lightningをルーティング対象に追加するには、モデル文字列を変更するだけです。
Lightningは、ワークステーション上のRTX、デスク上のDGX Spark、データセンターのH100やBlackwellなど、さまざまな環境で実行できるよう設計されています。まずGMI Cloudのホスト型エンドポイントでプロトタイプを開発し、その後、自社向けにポストトレーニングしたチェックポイントを、本番環境向けの専用GMIインフラストラクチャにデプロイできます。
メール、カレンダー、プロジェクト、予約などを管理する長時間稼働型アシスタントには、高速かつ低コストで、継続的に処理できるモデルが必要です。Lightningの高いトークン効率により、常時バックグラウンドで動作するエージェントを、現実的なコストで運用できます。
PRの要約、コード分類、テストのトリアージなど、フロンティアコーディングエージェントを支える特化型タスクに適しています。CodeRabbitのようなチームでは、より大規模なモデルによるレビューや検証に引き渡す前のコンテキスト補強に、すでにNemotronモデルを活用しています。
アラートの情報補強、インシデント分類、ログクエリ、インジケーターの相関分析、アナリスト向けの構造化された分析結果の生成などに利用できます。大量処理と厳しいレイテンシ要件が求められるこれらのワークロードは、まさにLightningが得意とする領域です。
ドキュメント抽出、ポリシーチェック、リスクシグナルのモニタリング、ネットワークアラームのトリアージ、請求に関する問い合わせなどにも活用できます。Lightningを自社ドメイン向けにポストトレーニングすることで、自社で所有・管理できる専門モデルとして運用できます。
curl https://api.gmi-serving.com/v1/chat/completions \
-H 'Content-Type: application/json' \
-H "Authorization: Bearer $GMI_API_KEY" \
--data '{
"model": "nvidia/NVIDIA-Nemotron-3.5-Nano-30B-A3B-BF16",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Hello! What can you do?"}
],
"max_tokens": 2048,
"stream": true
}'詳細については、docs.gmicloud.aiのドキュメントをご覧ください。
フロンティアモデルは注目を集めます。しかし、本番環境で成果を生み出すのは、複数のモデルを適材適所で活用する「モデルシステム」です。Nemotron 3.5 Lightningは、高速でオープン、かつカスタマイズ可能な実用モデルとして、常時稼働型エージェントを経済的に成立させます。GMI Cloudなら、そのNemotron 3.5 Lightningをリリース初日から、AI推論に最適化されたインフラストラクチャ上で利用できます。
GMI CloudでNemotron 3.5 Lightningをデプロイ | ドキュメントを読む | Discordコミュニティに参加
Roan Weigert
DevRel @ GMI Cloud
GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies
