GLM-5.3-Flashが登場しました。320B(3,200億)パラメータを備え、「Ox Alpha」の名で正体を明かさないままリーダーボード上位を席巻したモデルです。その正体がZ.aiによって明かされ、フロンティア級のコーディング性能を、スケールしやすい価格で提供します。
2026年8月26日
.png)
約1週間にわたり、「Ox Alpha」と呼ばれる謎のモデルがOpenRouterとOpenCodeの利用ランキングでひっそりと上位を席巻していました。ほぼ無制限で無料利用できる一方、各種ベンチマークでは高い性能を記録。r/LocalLLaMAやr/singularityでは開発者の間でその正体をめぐるさまざまな憶測が飛び交い、Stripe CEOのPatrick Collison氏も「非常に印象的」と評価しました。そして2026年8月26日、BloombergとBusiness Insiderが、Z.aiがこのモデルの開発元であることを報じました。
この発表手法そのものも、コミュニティ主導型のローンチ戦略として注目に値します。Z.aiはまずモデルを実環境で公開し、その性能によって評価を獲得させた後、十分な実績ができた段階で正体を明らかにしました。TestingCatalogは、マルチモーダル推論、低コストなコーディング性能、ローカル環境にも展開できるオープンウェイトを組み合わせたモデルとして紹介しています。技術製品をどのように話題化していくかという観点でも、注目すべきアプローチです。
GLM-5.3-Flashは、GLM-5ファミリー初のネイティブマルチモーダルモデルです。Z.aiの開発者向けドキュメントによると、テキスト、画像、動画を統合的に処理できます。最大の特徴は、スパースアテンションとリニアアテンションを組み合わせたハイブリッドアーキテクチャです。オープンソースのフロンティアモデルとして初めてこの構成を採用し、長いコンテキストではベースとなるGLM-5.3と比較して、アテンションの計算量を約3分の1、KVキャッシュを4分の1以下に削減しています。この点はWccftechによる発表内容の解説でも紹介されています。
仕様 | GLM-5.3-Flash |
|---|---|
総パラメータ数 | 320B |
アクティブパラメータ数 | 18B |
アーキテクチャ | ハイブリッド型スパース+リニアアテンション、Mixture-of-Experts(MoE) |
コンテキストウィンドウ | 1,048,576トークン(1M) |
モダリティ | テキスト、画像、動画入力 |
ライセンス | MIT(オープンウェイト) |
この高い効率性により、フロンティアモデル級の性能をFlashクラスの価格帯で提供しながら、巨大なコンテキストウィンドウを活用する推論処理でもコストを抑えることができます。
独立系AIモデル評価プラットフォームArtificial AnalysisとZ.aiの評価では、GLM-5.3-Flashは、特にコーディングやエージェントタスクにおいて、最上位クラスのクローズドモデルに迫る性能を示しています。r/LocalLLMのリリーススレッドでも、Z.aiのモデルカードに掲載された同様の数値が紹介されています。
ベンチマーク | GLM-5.3-Flash | 比較 |
|---|---|---|
Artificial Analysis Intelligence Index | 57 | 同等モデルの中央値:18 |
TerminalBench 2.1 | 84.3 | Claude Opus 4.8:85.0 |
DeepSWE v1.1 | 63.4 | GLM-5.2:46.2 |
Humanity's Last Exam(ツール使用あり) | 55.3 | ツールを活用した高い推論性能 |
AutomationBench | 48.8 | 高いツール利用性能 |
特にターミナルベースのコーディングタスクではClaude Opus 4.8に迫るスコアを記録しています。コスト効率を重視して設計されたモデルでありながら、この水準に到達している点は注目に値します。
RedditやNVIDIA Developer Forums、業界メディアなどでの反応を見ると、GLM-5.3-Flashが注目されている理由は主に以下の4点に集約されます。
優れたコストパフォーマンス。 GMI Cloudでは、GLM-5.3-Flashを入力100万トークンあたり$0.15、出力100万トークンあたり$0.50で提供しています。Gemini 3.7 Flashの入力$0.75、出力$3.75を大幅に下回る価格でありながら、高い性能を実現しています。
オープンウェイトによる高い柔軟性。 MITライセンスのため、ローカル環境や任意のGPUインフラストラクチャに展開できます。SGLang、vLLM、Unslothもリリース初日から対応しています。
マルチモーダルなコーディングループ。 Z.aiの開発者向けドキュメントによると、レンダリングされたUIを認識し、その結果をもとに自らコードを修正できます。これにより、エージェントが開発した画面を視覚的に確認しながらデバッグするようなワークフローが可能になります。
1Mトークンのコンテキストウィンドウ。 大規模なコードベース、長時間にわたるエージェントセッション、動画理解など、長いコンテキストを必要とするユースケースを大規模に実行できます。
GLM-5.3-Flashは、AlibabaのQwen3.8-Flash-Nextとほぼ同じタイミングで登場しました。Qwen3.8-Flash-Nextも、フロンティアモデルに迫る性能を狙ったオープンウェイトモデルです。FourWeekMBAも、両モデルの登場を象徴的な動きとして取り上げています。これらのモデルは、中国のAIラボによる「迅速にリリースし、ウェイトを公開し、開発者自身に公開環境で評価してもらう」という流れが加速していることを示しています。Z.aiが採用した「ステルステストから正式発表へ」というアプローチも、ブランドを先に押し出す従来型のマーケティングとは異なり、まず性能によって信頼を獲得する戦略といえます。
コーディングエージェント、ロングコンテキストアプリケーション、マルチモーダルツールを開発するチームにとって、GLM-5.3-Flashは今すぐ評価対象に加える価値のあるモデルです。
以前の記事では、GLM-5.3をフライトシミュレーターのストレステストにかけ、60,000行規模のコードを一度に生成するデモを紹介しました。その際、テクスチャの不具合によって、モデル自身が視覚的に確認できない部分が弱点として明らかになりました。GLM-5.3-Flashは、まさにこの課題を解消します。ネイティブマルチモーダル理解により、自ら生成した出力を単に説明するだけでなく、実際に「見て」確認できるようになりました。しかも、前回検証したGLM-5.3よりも大幅に低いコストで利用できます。
GLM-5.3-Flashは、GMI Cloudの統合APIから直接利用できます。
GMI Cloud Playgroundですぐに試すことができます。また、開発を始める場合はAPIドキュメントをご覧ください。
GLM-5.3-Flashは、GLM-5.2の約10分の1のコストで、フロンティアモデル級のコーディング、エージェント、ビジュアルインテリジェンス性能を提供します。GMI Cloudでは、本番環境での大規模推論に対応するNVIDIA GPUインフラストラクチャ上でGLM-5.3-Flashを提供しています。総パラメータ数320B、アクティブパラメータ数18BのGLM-5.3-Flashは、ソフトウェアエンジニアリング、ツール利用、長期的な自動化タスクのベンチマークにおいてClaude Opus 4.8に迫る性能を発揮します。また、Manifold-Constrained Hyper-Connectionsと組み合わせたスパースアテンションとリニアアテンションのハイブリッドアーキテクチャにより、最大1Mトークンのロングコンテキストでも推論コストを抑えられます。
さらに、30Tトークンのコーパスで学習されたネイティブマルチモーダルモデルであり、画像を直接理解できます。ビジュアルコーディング、フロントエンド開発、ドキュメントやグラフの分析、GUIの検証、レンダリング結果を確認して自己修正するエージェントワークフローなど、幅広い用途に活用できます。
GMI CloudのChat Completionsエンドポイントにシンプルなcurlリクエストを送信するだけで、GLM-5.3-Flashをすぐに利用できます。
curl --request POST \
--url https://api.gmi-serving.com/v1/chat/completions \
-H 'Content-Type: application/json' \
-H 'Authorization: Bearer *************' \
--data '{
"model": "zai-org/GLM-5.3-Flash",
"messages": [
{"role": "system", "content": "You are a helpful AI assistant"},
{"role": "user", "content": "List 3 countries and their capitals."}
],
"temperature": 0,
"max_tokens": 500
}'使い慣れたOpenAI互換フォーマットのまま、Flashクラスの価格で提供される最先端のオープンウェイトモデルを利用できます。
Roan Weigert
DevRel @ GMI Cloud
GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies
