• コンピュート
  • 導入事例
  • 料金
ログイン
More Blog Posts
XDiscordLinkedInYouTube

製品

  • GPU
  • MaaS
  • Studio

開発者

  • モデルライブラリ
  • ドキュメント
  • 用語集

企業情報

  • 会社概要
  • ブログ
  • イベント
  • パートナーシップ
  • Scale
  • 採用情報
  • アンバサダープログラム
  • Mission & Vision

人気モデル

    最新情報をお届け

    送信することにより、お客様が提供された情報(個人情報を含む場合があります)を当社が収集および使用することについてご理解いただいたものとみなされます。

    XDiscordLinkedInYouTube

    Copyright ©2026 All rights reserved.

    プライバシーポリシー利用規約法的文書
    More Blog Posts
    Announcements

    NVIDIA Nemotron 3.5 LightningをGMI Cloudで提供開始:エージェントAIシステムに欠けていたもの

    August 11, 2026

    NVIDIA Nemotron 3.5 LightningがGMI Cloudに登場しました。NVIDIAによる提供開始と同時にGMI CloudのOpenAI互換サーバーレスAPIを通じてNemotron 3.5 Lightningを利用できます。

    2カ月前、GMI CloudはNVIDIAの550Bパラメータを備えたフロンティア推論モデル「Nemotron 3 Ultra」をDay 0で開発者向けに提供開始しました。Nemotron 3 Ultraは、特に高度なオーケストレーションやプランニングを必要とする処理に適したモデルです。今回登場したNemotron 3.5 Lightningは、Ultra自体から蒸留された30BのMoE(Mixture of Experts)モデルで、トークンあたりのアクティブパラメータはわずか3Bです。Ultraを補完しながら、エージェントが実際に行う処理の大半を占める、大量かつ常時稼働型のタスクを効率的に処理します。

    Nemotron 3.5 Lightningが異なる理由

    エージェントAIの実態として、エージェントが消費するトークンの多くは、高度な推論に使われているわけではありません。PRの要約、アラートの分類、コンテキストの補強、ポリシールールの確認、ツールの呼び出し、結果のフォーマットなど、反復的な中間処理に費やされています。こうしたすべての処理をフロンティアモデルに任せるのは、荷物1個を届けるためにコンテナ船を手配するようなものです。

    Nemotron 3.5 Lightningは、まさにこの大量処理レイヤーのために設計されています。NVIDIAのフロンティアモデルNemotron 3 Ultraから蒸留され、Nemotron Coalitionと共同で開発されたこのモデルは、主要なエージェントハーネス向けに特化してトレーニングされています。コーディング、ツール呼び出し、指示追従、マルチターンワークフローにおいて、優れた初期精度を実現します。さらに完全にオープンなモデルであるため、自社ドメインに合わせてポストトレーニングを行い、独自のモデルとして活用できます。

    最大4倍の高スループット

    最大の特長はスピードです。同クラスの他モデルと比較して最大4倍のスループットを実現し、タスクを最大30%高速に完了します。常時稼働するサブエージェントでは、この速度向上が積み重なることで大きな効果を生みます。限られた時間内でより多くのステップを実行でき、同じコストでより多くのタスクを完了できます。

    リアルタイムでアプリを構築

    GMI Cloud APIを通じてNemotron 3.5 Lightningを実行し、複数の小規模アプリをリアルタイムで構築させました。作成したのは、バウンドするDVDスクリーンセーバー、花火アプリ、Matrix風エフェクト、ポモドーロタイマー、2048風ゲームなどです。いずれも数秒で構築が完了し、推論に使用したトークンはわずか数百程度でした。これは、前述したスループット性能が、反復的かつ大量のエージェントタスクでどのような効果をもたらすかを具体的に示しています。

    精度も世代を超えて大幅に向上

    Nemotron 3.5 Lightningは、前世代のNemotron 3 Nanoから大幅な進化を遂げておりArtificial Analysis Intelligence Indexベンチマークにおいても、フロンティアモデルの1つに位置付けられています。

    ベンチマーク

    Nemotron 3.5 Lightning

    Nemotron 3 Nano

    (前世代)

    SWE-Bench Verified(コーディング)

    54.3%

    21%

    GDPval-AA v2(ナレッジワーク)

    924 ELO

    479 ELO

    コーディングスコアは前世代の2倍以上、ナレッジワークの評価も約2倍に向上しています。さらに、比較対象の中でも優れたハルシネーション耐性を示しています。NVIDIAによると、これらは現在もトレーニング中のモデルによる暫定結果であり、正式な一般提供(GA)時にはさらなる性能向上が見込まれています。

    アーキテクチャの主な特長

    機能

    詳細

    アーキテクチャ

    ハイブリッドMixture of Experts(MoE)

    総パラメータ数

    30B

    トークンあたりのアクティブパラメータ

    3B

    蒸留元

    NVIDIA Nemotron 3 Ultra

    生成技術

    Multi-Token Prediction(MTP)、DFlash

    コンテキスト長

    最大100万トークン

    モデルI/O

    テキスト入力、テキスト出力

    精度

    BF16、NVFP4

    対応GPU

    H100, H200, B200, GB200, GB300

    ライセンス

    OpenMWD

    DFlashは、軽量モデルを使用して複数の将来トークンを並列にドラフトする投機的デコーディング手法です。Lightningモデルがトークンブロック全体を一度に検証し、有効なトークンを採用することで、精度を維持しながら生成を高速化します。

    Multi-Token Prediction(MTP)は、1回のフォワードパスで複数の将来トークンを生成します。これにより、要約、分析結果、ツール引数、レポートなど、エージェントが頻繁に生成する長い構造化出力のレイテンシを削減できます。

    最大100万トークンのコンテキストにより、小規模なモデルでもリポジトリ全体、アラート履歴、マルチターンのセッション状態などを、途中で切り捨てることなく保持できます。

    1つのモデルシステムを1つのAPIで

    Nemotron 3.5 Lightningは、より広範なマルチモデル・エージェント戦略にも適しています。NVIDIA NeMo Switchyardは、オープンソースのモデルルーティングライブラリです。品質、レイテンシ、コストなどの要件に応じて、エージェントツールが各リクエストを最適なモデルへインテリジェントに振り分けることができ、開発者がアプリケーションを書き直す必要はありません。

    これは、GMI Cloudが以前から注力してきたアーキテクチャでもあります。GMI Cloudではすでに、高度な処理向けにNemotron 3 Ultraを提供しています。今回、Lightningが大量かつ特化型の処理をカバーするようになりました。両モデルは同じOpenAI互換エンドポイントから利用できるため、Switchyardのようなルーターを使えば、アプリケーションコードを変更することなくモデル間でトラフィックを振り分けられます。これにより、ワークフロー全体で精度、レイテンシ、コストのバランスを考慮したモデル選択が可能になります。

    GMI Cloudで実行するメリット

    Day-0、サーバーレス、アイドルコストゼロ

    Nemotron 3.5 Lightningは、モデルのリリース初日からGMI Cloudのサーバーレス推論APIで利用できます。トークン単位の従量課金で、アイドル時の料金は発生しません。また、エージェント群で一定のスループットを確保する必要がある場合は、専用エンドポイントを予約することもできます。

    OpenAI互換、わずかな変更で統合

    既存のSDKの接続先をGMI Cloudに変更するだけで利用を開始できます。すでにGMI Cloud上でUltra、Qwen、GLM、Kimiなどを利用している場合、Lightningをルーティング対象に追加するには、モデル文字列を変更するだけです。

    ハイブリッドデプロイメント向けに設計

    Lightningは、ワークステーション上のRTX、デスク上のDGX Spark、データセンターのH100やBlackwellなど、さまざまな環境で実行できるよう設計されています。まずGMI Cloudのホスト型エンドポイントでプロトタイプを開発し、その後、自社向けにポストトレーニングしたチェックポイントを、本番環境向けの専用GMIインフラストラクチャにデプロイできます。

    Nemotron 3.5 Lightningで構築できるもの

    常時稼働型パーソナルエージェント

    メール、カレンダー、プロジェクト、予約などを管理する長時間稼働型アシスタントには、高速かつ低コストで、継続的に処理できるモデルが必要です。Lightningの高いトークン効率により、常時バックグラウンドで動作するエージェントを、現実的なコストで運用できます。

    ソフトウェア開発向けサブエージェント

    PRの要約、コード分類、テストのトリアージなど、フロンティアコーディングエージェントを支える特化型タスクに適しています。CodeRabbitのようなチームでは、より大規模なモデルによるレビューや検証に引き渡す前のコンテキスト補強に、すでにNemotronモデルを活用しています。

    サイバーセキュリティ運用

    アラートの情報補強、インシデント分類、ログクエリ、インジケーターの相関分析、アナリスト向けの構造化された分析結果の生成などに利用できます。大量処理と厳しいレイテンシ要件が求められるこれらのワークロードは、まさにLightningが得意とする領域です。

    金融サービスおよび通信業界のワークフロー

    ドキュメント抽出、ポリシーチェック、リスクシグナルのモニタリング、ネットワークアラームのトリアージ、請求に関する問い合わせなどにも活用できます。Lightningを自社ドメイン向けにポストトレーニングすることで、自社で所有・管理できる専門モデルとして運用できます。

    利用を開始する


    curl https://api.gmi-serving.com/v1/chat/completions \
      -H 'Content-Type: application/json' \
      -H "Authorization: Bearer $GMI_API_KEY" \
      --data '{
        "model": "nvidia/NVIDIA-Nemotron-3.5-Nano-30B-A3B-BF16",
        "messages": [
          {"role": "system", "content": "You are a helpful assistant."},
          {"role": "user", "content": "Hello! What can you do?"}
        ],
        "max_tokens": 2048,
        "stream": true
      }'

    詳細については、docs.gmicloud.aiのドキュメントをご覧ください。

    フロンティアモデルは注目を集めます。しかし、本番環境で成果を生み出すのは、複数のモデルを適材適所で活用する「モデルシステム」です。Nemotron 3.5 Lightningは、高速でオープン、かつカスタマイズ可能な実用モデルとして、常時稼働型エージェントを経済的に成立させます。GMI Cloudなら、そのNemotron 3.5 Lightningをリリース初日から、AI推論に最適化されたインフラストラクチャ上で利用できます。

    GMI CloudでNemotron 3.5 Lightningをデプロイ | ドキュメントを読む | Discordコミュニティに参加

    Roan Weigert

    Roan Weigert

    DevRel @ GMI Cloud

    Build AI Without Limits

    GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies

    FAQ

    NVIDIA Nemotron 3.5 Lightning is a customizable open 30B MoE model with 3B active parameters, distilled from NVIDIA frontier Nemotron 3 Ultra. It's built to power always-on agents with leading out-of-the-box accuracy for coding, tool calling, instruction following, and multi-turn workflows.

    Ready to build?

    Explore powerful AI models and launch your project in just a few clicks.

    Get Started