• コンピュート
  • 導入事例
  • 料金
ログイン
More Blog Posts
XDiscordLinkedInYouTube

製品

  • GPU
  • MaaS
  • Studio

開発者

  • モデルライブラリ
  • ドキュメント
  • 用語集

企業情報

  • 会社概要
  • ブログ
  • イベント
  • パートナーシップ
  • Scale
  • 採用情報
  • アンバサダープログラム
  • Mission & Vision

人気モデル

    最新情報をお届け

    送信することにより、お客様が提供された情報(個人情報を含む場合があります)を当社が収集および使用することについてご理解いただいたものとみなされます。

    XDiscordLinkedInYouTube

    Copyright ©2026 All rights reserved.

    プライバシーポリシー利用規約法的文書
    More Blog Posts
    Announcements

    GLM-5.3-Flash:Ox Alphaとして話題をさらったステルスモデルの正体

    GLM-5.3-Flashが登場しました。320B(3,200億)パラメータを備え、「Ox Alpha」の名で正体を明かさないままリーダーボード上位を席巻したモデルです。その正体がZ.aiによって明かされ、フロンティア級のコーディング性能を、スケールしやすい価格で提供します。

    2026年8月26日

    約1週間にわたり、「Ox Alpha」と呼ばれる謎のモデルがOpenRouterとOpenCodeの利用ランキングでひっそりと上位を席巻していました。ほぼ無制限で無料利用できる一方、各種ベンチマークでは高い性能を記録。r/LocalLLaMAやr/singularityでは開発者の間でその正体をめぐるさまざまな憶測が飛び交い、Stripe CEOのPatrick Collison氏も「非常に印象的」と評価しました。そして2026年8月26日、BloombergとBusiness Insiderが、Z.aiがこのモデルの開発元であることを報じました。

    この発表手法そのものも、コミュニティ主導型のローンチ戦略として注目に値します。Z.aiはまずモデルを実環境で公開し、その性能によって評価を獲得させた後、十分な実績ができた段階で正体を明らかにしました。TestingCatalogは、マルチモーダル推論、低コストなコーディング性能、ローカル環境にも展開できるオープンウェイトを組み合わせたモデルとして紹介しています。技術製品をどのように話題化していくかという観点でも、注目すべきアプローチです。

    GLM-5.3-Flashの技術仕様

    GLM-5.3-Flashは、GLM-5ファミリー初のネイティブマルチモーダルモデルです。Z.aiの開発者向けドキュメントによると、テキスト、画像、動画を統合的に処理できます。最大の特徴は、スパースアテンションとリニアアテンションを組み合わせたハイブリッドアーキテクチャです。オープンソースのフロンティアモデルとして初めてこの構成を採用し、長いコンテキストではベースとなるGLM-5.3と比較して、アテンションの計算量を約3分の1、KVキャッシュを4分の1以下に削減しています。この点はWccftechによる発表内容の解説でも紹介されています。

    仕様

    GLM-5.3-Flash

    総パラメータ数

    320B

    アクティブパラメータ数

    18B

    アーキテクチャ

    ハイブリッド型スパース+リニアアテンション、Mixture-of-Experts(MoE)

    コンテキストウィンドウ

    1,048,576トークン(1M)

    モダリティ

    テキスト、画像、動画入力

    ライセンス

    MIT(オープンウェイト)

    この高い効率性により、フロンティアモデル級の性能をFlashクラスの価格帯で提供しながら、巨大なコンテキストウィンドウを活用する推論処理でもコストを抑えることができます。

    ベンチマークで示された実力

    独立系AIモデル評価プラットフォームArtificial AnalysisとZ.aiの評価では、GLM-5.3-Flashは、特にコーディングやエージェントタスクにおいて、最上位クラスのクローズドモデルに迫る性能を示しています。r/LocalLLMのリリーススレッドでも、Z.aiのモデルカードに掲載された同様の数値が紹介されています。

    ベンチマーク

    GLM-5.3-Flash

    比較

    Artificial Analysis Intelligence Index

    57

    同等モデルの中央値:18

    TerminalBench 2.1

    84.3

    Claude Opus 4.8:85.0

    DeepSWE v1.1

    63.4

    GLM-5.2:46.2

    Humanity's Last Exam(ツール使用あり)

    55.3

    ツールを活用した高い推論性能

    AutomationBench

    48.8

    高いツール利用性能

    特にターミナルベースのコーディングタスクではClaude Opus 4.8に迫るスコアを記録しています。コスト効率を重視して設計されたモデルでありながら、この水準に到達している点は注目に値します。

    GLM-5.3-Flashが注目される理由

    RedditやNVIDIA Developer Forums、業界メディアなどでの反応を見ると、GLM-5.3-Flashが注目されている理由は主に以下の4点に集約されます。

    • 優れたコストパフォーマンス。 GMI Cloudでは、GLM-5.3-Flashを入力100万トークンあたり$0.15、出力100万トークンあたり$0.50で提供しています。Gemini 3.7 Flashの入力$0.75、出力$3.75を大幅に下回る価格でありながら、高い性能を実現しています。

    • オープンウェイトによる高い柔軟性。 MITライセンスのため、ローカル環境や任意のGPUインフラストラクチャに展開できます。SGLang、vLLM、Unslothもリリース初日から対応しています。

    • マルチモーダルなコーディングループ。 Z.aiの開発者向けドキュメントによると、レンダリングされたUIを認識し、その結果をもとに自らコードを修正できます。これにより、エージェントが開発した画面を視覚的に確認しながらデバッグするようなワークフローが可能になります。

    • 1Mトークンのコンテキストウィンドウ。 大規模なコードベース、長時間にわたるエージェントセッション、動画理解など、長いコンテキストを必要とするユースケースを大規模に実行できます。

    より大きな戦略的トレンド

    GLM-5.3-Flashは、AlibabaのQwen3.8-Flash-Nextとほぼ同じタイミングで登場しました。Qwen3.8-Flash-Nextも、フロンティアモデルに迫る性能を狙ったオープンウェイトモデルです。FourWeekMBAも、両モデルの登場を象徴的な動きとして取り上げています。これらのモデルは、中国のAIラボによる「迅速にリリースし、ウェイトを公開し、開発者自身に公開環境で評価してもらう」という流れが加速していることを示しています。Z.aiが採用した「ステルステストから正式発表へ」というアプローチも、ブランドを先に押し出す従来型のマーケティングとは異なり、まず性能によって信頼を獲得する戦略といえます。

    コーディングエージェント、ロングコンテキストアプリケーション、マルチモーダルツールを開発するチームにとって、GLM-5.3-Flashは今すぐ評価対象に加える価値のあるモデルです。

    GLM-5.3からGLM-5.3-Flashへ

    以前の記事では、GLM-5.3をフライトシミュレーターのストレステストにかけ、60,000行規模のコードを一度に生成するデモを紹介しました。その際、テクスチャの不具合によって、モデル自身が視覚的に確認できない部分が弱点として明らかになりました。GLM-5.3-Flashは、まさにこの課題を解消します。ネイティブマルチモーダル理解により、自ら生成した出力を単に説明するだけでなく、実際に「見て」確認できるようになりました。しかも、前回検証したGLM-5.3よりも大幅に低いコストで利用できます。

    GLM-5.3-FlashをGMI Cloudで提供開始

    GLM-5.3-Flashは、GMI Cloudの統合APIから直接利用できます。

    GMI Cloud Playgroundですぐに試すことができます。また、開発を始める場合はAPIドキュメントをご覧ください。

    GMI CloudでGLM-5.3-Flashを利用するメリット

    GLM-5.3-Flashは、GLM-5.2の約10分の1のコストで、フロンティアモデル級のコーディング、エージェント、ビジュアルインテリジェンス性能を提供します。GMI Cloudでは、本番環境での大規模推論に対応するNVIDIA GPUインフラストラクチャ上でGLM-5.3-Flashを提供しています。総パラメータ数320B、アクティブパラメータ数18BのGLM-5.3-Flashは、ソフトウェアエンジニアリング、ツール利用、長期的な自動化タスクのベンチマークにおいてClaude Opus 4.8に迫る性能を発揮します。また、Manifold-Constrained Hyper-Connectionsと組み合わせたスパースアテンションとリニアアテンションのハイブリッドアーキテクチャにより、最大1Mトークンのロングコンテキストでも推論コストを抑えられます。

    さらに、30Tトークンのコーパスで学習されたネイティブマルチモーダルモデルであり、画像を直接理解できます。ビジュアルコーディング、フロントエンド開発、ドキュメントやグラフの分析、GUIの検証、レンダリング結果を確認して自己修正するエージェントワークフローなど、幅広い用途に活用できます。

    1回のAPIコールで利用開始

    GMI CloudのChat Completionsエンドポイントにシンプルなcurlリクエストを送信するだけで、GLM-5.3-Flashをすぐに利用できます。

    curl --request POST \
      --url https://api.gmi-serving.com/v1/chat/completions \
      -H 'Content-Type: application/json' \
      -H 'Authorization: Bearer *************' \
      --data '{
        "model": "zai-org/GLM-5.3-Flash",
        "messages": [
          {"role": "system", "content": "You are a helpful AI assistant"},
          {"role": "user", "content": "List 3 countries and their capitals."}
        ],
        "temperature": 0,
        "max_tokens": 500
      }'

    使い慣れたOpenAI互換フォーマットのまま、Flashクラスの価格で提供される最先端のオープンウェイトモデルを利用できます。

    GLM-5.3-Flashを今すぐ試す · ドキュメントを見る · Discordに参加する

    Roan Weigert

    Roan Weigert

    DevRel @ GMI Cloud

    Build AI Without Limits

    GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies

    Ready to build?

    Explore powerful AI models and launch your project in just a few clicks.

    Get Started