MiniMax M3、Grok 4.5 與 NVIDIA Nemotron 3 Nano Omni 領銜 2026 年 8 月的 BenchLM 排名,open-weight 模型與前沿 AI 的差距正在縮小;一起看看正在形塑正式環境部署的分數、速度與成本取捨。
2026年8月05日
.png)
BenchLM 排行榜,已於 8 月 5 日更新 2026 年 8 月的排名。在總共追蹤的 379 個模型中,涵蓋 104 個 supported 模型與 111 個 estimated 模型,資料呈現出一個自 2026 年初就持續累積的態勢:open-weight 模型如今在品質上已能與旗艦閉源系統正面競爭,同時提供的速度與部署彈性,是專有 API 得付出更高成本才能相比的。
排行榜背後的排名方法 —— BenchAlign v5.2,總共追蹤 381 項 benchmark,橫跨推理、程式撰寫、知識、數學、多模態、指令遵循、多語言與 agentic 任務完成度,其中有 27 項排名用 benchmark 會直接加權進綜合分數,其餘資料僅作為展示用的參考脈絡。每個模型的名次也都附有出處標籤:「Supported」代表經過多個來源家族的獨立第三方驗證;「Estimated」則代表分數來自 model card 資料或單一來源的 benchmark。這個區分很重要,因為 estimated 名次可能在獨立測試跟上後改變。8 月榜單的前三名全都是 Supported,並有多個來源家族相互佐證。
對正在評估正式環境模型的團隊來說,這份排行榜提供的不只是名次,它點出了值得針對特定工作負載去實測的模型。一個在程式撰寫上表現優異、但在指令遵循上偏弱的模型,可能在 IDE agent 中很出色,卻在面向客戶的聊天機器人上失守。綜合分數只是起點,真正做出部署決策的地方是分類細項。
這對任何要把 AI 部署到正式環境的人,都很重要。當一個 30B 參數的模型,每秒能輸出 323 個 token、benchmark 分數又接近前四分位,服務端的成本結構就會跟著改變。當一個 open-weight 模型,總分 68.8 且授權寬鬆,團隊就能自架與微調,不必再付按 token 計價的 API 費用。這些 benchmark,是部署決策的訊號,而且份量不輕。
Claude Mythos 5 以 83.04 的總分穩坐 BenchAlign 排行榜第一。Claude Fable 5 以 82.79 緊追在後,Claude Opus 5 則是 82.59。截至 2026 年 8 月,這三個 Anthropic 模型代表了目前可量測 AI 表現的最前沿。
第一名與第三名之間的差距不到半分。這種頂端的高度壓縮反映了一件真實的事:前沿相當擁擠,純 benchmark 分數正在收斂,即使真實世界的 agentic 能力仍在持續拉開差距。
排名 | 模型 | 供應商 | 分數 | 佐證 |
|---|---|---|---|---|
1 | Claude Mythos 5 | Anthropic | 83.04 | Supported |
2 | Claude Fable 5 | Anthropic | 82.79 | Supported |
3 | Claude Opus 5 | Anthropic | 82.59 | Supported |
4 | GPT-5.6 Sol | OpenAI | 81.48 | Supported |
5 | Kimi K3 | Moonshot AI | 79.89 | Supported |
6 | Claude Opus 4.8 | Anthropic | 77.34 | Supported |
7 | Muse Spark 1.1 | Meta | 76.15 | Supported |
8 | Grok 4.5 | xAI | 75.38 | Supported |
9 | Gemini 3.6 Flash | 75.30 | Supported | |
10 | GPT-5.4 | OpenAI | 73.20 | Supported |
BenchAlign 的方法,會將推理、程式撰寫、知識、數學、指令遵循、多模態、多語言,與 agentic benchmark,加權成單一綜合分數。程式撰寫與推理同時強勢的模型,通常爬升得最快。Claude Mythos 5 的名次,來自各類別一致的表現,其中推理與 agentic benchmark 尤其突出。
截至 2026 年 8 月 5 日,Claude Mythos 5 在 BenchAlign v5.2 上取得 83.04 分,於 379 個受追蹤模型中居首。
這是基準參考點,其下的一切都是在衡量與前沿的距離。2026 年 8 月榜單有趣之處,在於有好幾個模型與這個參考點靠得很近,而它們是用截然不同的架構與部署樣態走到那裡的。
BenchLM 排行榜,將 MiniMax M3 列為最佳 open-weight 模型。它以 68.8 的總分,跨過了取得「decision-ready」標記所需的佐證與時效門檻;其 benchmark,已由兩個獨立來源家族驗證。
MiniMax M3 代表了一類在 18 個月前還不切實際、無法自架的 open-weight 模型。這個模型已收錄在 GMI Cloud 的模型目錄 中,與另外 200 多個模型並列,提供相容 OpenAI 的 API 存取,也可選擇部署在專屬 GPU 基礎設施上。
當一個綜合分數 68.8 的模型,以 open weights 形式釋出,會改變什麼?部署管線整個被壓縮:團隊可以拿到模型、做量化、用 vLLM 或 SGLang 提供服務,並在自有資料上微調。外部 API 的按 token 成本結構,被託管基礎設施的每 GPU 小時成本取代。對每天超過數百萬 token 的工作負載來說,帳算下來,自架比較划算。
這正是 GPU 基礎設施的重要之處。要在正式規模下以低延遲執行像 MiniMax M3 這樣的模型,需要搭配高記憶體頻寬與高效推論引擎的 H100 或 H200 GPU。GMI Cloud 的 GPU 基礎設施提供的 H100 SXM5 與 H200 執行個體,讓這件事變得可行。
Grok 4.5 拿下 BenchLM 的「best near-frontier value」標記。它達到領先分數的 91%,而排行榜描述其輸出成本低了 88%。其 benchmark 已由三個獨立來源家族確認。
這正是會重塑部署決策的比值。團隊在評估正式環境的模型選項時,通常先看品質、再看速度、最後看成本。當一個模型能以極小的營運支出達到頂尖品質的 91%,整個算式就會跟著改變了:你用綜合 benchmark 上的幾分,換到一個能規模化的部署樣態。
Grok 4.5 跑在專屬的推論基礎設施上。它的上下文視窗、吞吐量與延遲特性,讓它適合那些「每 token 成本直接決定功能能不能上線」的大量請求應用。這個模型也成了 2026 年年中「高效推論長什麼樣」的一個參考標準。
類別 | 模型 | 供應商 | 關鍵指標 | 佐證層級 |
|---|---|---|---|---|
最佳 open weight | MiniMax M3 | MiniMax | 總分 68.8 | Supported · 2 個來源家族 |
最佳近前沿性價比 | Grok 4.5 | xAI | 頂尖分數的 91%,輸出價格低 88% | Supported · 3 個來源家族 |
實測最快 | Nemotron 3 Nano Omni 30B A3B | NVIDIA | 每秒 323 tokens(Artificial Analysis,2026 年 8 月 5 日更新) | 跨過排名 + 佐證門檻 |
最大可用上下文 | Grok 4.20 | xAI | 2M 上下文視窗 | Estimated · 1 個來源家族 |
請注意,最後一列屬於排行榜中最低的佐證層級:它是真實且已公開揭露的能力,但僅依據單一來源家族,而非像前三名總排名那樣經過獨立交叉驗證。
NVIDIA Nemotron 3 Nano Omni 在 Artificial Analysis 的外部量測中,錄得每秒 323 個 token(2026 年 8 月 5 日更新)。這讓它成為 BenchLM 排行榜上同時跨過排名與佐證門檻、實測速度最快的模型。
答案藏在架構裡:總參數 300 億,推論時僅啟用 30 億。這是一種稀疏的 mixture-of-experts 設計,會把每個 token 只導向整個模型的一小部分,大幅降低每個輸出 token 所需的運算量。結果是這個模型的產文速度,比許多啟用參數多出五倍、十倍的模型還要快上不少。
Nemotron 3 Nano Omni 每秒輸出 323 個 token,是 BenchLM 2026 年 8 月排行榜上外部實測最快的模型。
速度,除了方便之外,為什麼重要?在 agentic 工作流程中,回應更快的模型會把使用者體驗從「等 AI」變成「跟 AI 一起工作」。在批次處理中,每個節點更高的吞吐量意味著大型工作能完成,而不必長時間佔住 GPU 叢集。
Nemotron 3 Nano Omni 已可透過 GMI Cloud 使用。對正在打造延遲敏感 agent 或高吞吐管線的團隊來說,這個模型的架構很適合運行在 H100 與 H200 執行個體上。GMI Cloud 部落格上有上手的部署指南。
Grok 4.20 拿下 BenchLM「最大可用上下文」的標記:200 萬 tokens,同時仍保有至少領先綜合分數的一半。這個名次目前屬於 Estimated,僅由單一來源家族支撐,而非獨立多來源驗證;若團隊只憑這一點做決策,值得特別留意。
2M token 的上下文大約可容納 3,000 頁文字。一個 agent 可以吞下整個程式庫、完整的文件集,或長達數小時的對話紀錄,而不需要那些會流失細節的分塊或摘要策略。
長上下文視窗對 GPU 基礎設施有獨特的要求。2M token 上下文的 key-value cache 需要大量 VRAM。配備 141GB HBM3e 記憶體的 H200 GPU 能有效率地處理這類工作負載,而 GMI Cloud 的 GPU 基礎設施也支援這些模型所需的記憶體用量。
BenchLM Radar 在 2026 年 8 月頭幾天追蹤到三個確認發布的模型:Hark Handoff(Hark,8 月 5 日)、Ling 3.0 Flash FP8(InclusionAI,8 月 4 日)與 LFM2.5-2.6B(LiquidAI,8 月 4 日)。Radar 會在來源端監控發布、價格變動、淘汰與事故,在這些變化反映到彙整後的排行榜之前就先揭露出來。
InclusionAI 的 Ling 3.0 Flash FP8 於 8 月 4 日登場。FP8 量化格式代表它的重心放在推論效率上;FP8 模型通常比 FP16 版本跑得更快、記憶體用量更少。排行榜來源並未公布此版本的具體吞吐量或記憶體用量數字,因此在做容量規劃前,應直接向 InclusionAI 查證實際的效率提升幅度。
LiquidAI 的 LFM2.5-2.6B 於 8 月 4 日釋出。以 26 億參數而言,這是一個瞄準邊緣裝置與輕量 agent 部署的精簡模型。除了名稱、供應商與發布日期之外,BenchLM 來源目前尚未提供此模型的獨立 benchmark 結果或架構細節;在 Supported 層級的分數出現之前,與更大型 transformer 模型的比較都應視為未經驗證。
另外,阿里巴巴的 Qwen3.8 Max 在 BenchLM 上被列為 2026 年 8 月發布中排名最佳的模型,分數為 60.9。來源並未提供此模型的參數量或 open weights 釋出日期,因此關於總參數/啟用參數規模或授權時程的說法,應直接向阿里巴巴確認,而非當成排行榜已驗證的資訊。
2026 年 8 月初這波確認發布的節奏,延續了 open-weight 與效率導向發布日益頻繁的趨勢,儘管並非所有版本都已具備獨立驗證的 benchmark 分數。
BenchLM 2026 年 8 月排行榜,其實是一份用數字編碼而成的部署指南。每一個名次背後,都對應著真實的硬體需求、真實的延遲預算,以及真實的服務成本。
品質差距正在收斂。MiniMax M3 的 68.8 對上 Claude Mythos 5 的 83.04,綜合分數大約差 17%。團隊應該觀察這個差距在後續的 Supported 層級更新中是否持續縮小,而不是假設它會沿固定軌跡發展。
速度的效益會不斷累積。Nemotron 3 Nano Omni 只用 3B 啟用參數就達到 323 tok/s,證明稀疏架構在正式規模下確實可行。當一個模型能以這種速度產文,每張 GPU 的有效吞吐量、進而是每百萬 token 的成本,都會大幅下降。
上下文視窗正在擴張,儘管目前最強的宣稱(Grok 4.20 的 2M tokens)仍停留在 Estimated、單一來源的基礎上。它指向的部署意涵是真實的:單次通吃的程式庫分析、整份文件的推理、長達數小時的自主 agent 執行;但佐證層級提醒我們,在把架構決策押上去之前,最好先獨立驗證。要有效率地服務這些模型,硬體得是具備高頻寬記憶體的 H200 與 B200 等級 GPU。
BenchLM 的資料指向一個務實的結論:2026 年 8 月值得放進正式環境的模型,有很多都提供 open weights,或可透過高效率的 API 取得。自架與使用託管端點之間的抉擇,最終取決於吞吐量需求、延遲敏感度與資料落地限制。
GMI Cloud 提供的基礎設施層讓兩條路都行得通。模型目錄收錄了 MiniMax M3、Nemotron 3 Nano Omni、Grok 4.5、Qwen3.8 Max 以及其他 200 多個模型,並提供與 OpenAI 相容的端點給希望使用託管服務的團隊。對需要專屬 GPU 執行個體的團隊,也有預先配置好推論引擎的 H100 SXM5 與 H200 組態可選。
GMI Cloud 部落格涵蓋正式環境 AI 工作負載的部署模式、benchmark 深入剖析與架構指南。近期關於模型部署、推論最佳化與 agent 基礎設施的文章,都提供了具體且經過實測的組態。
這就是 2026 年 8 月的正式環境 AI 版圖:open-weight 模型正在逼近前沿,稀疏架構帶來的速度正在改變 agent 能做的事,而能大規模執行這些模型的 GPU 基礎設施,今天就已經存在。
加入 GMI Cloud 開發者社群,在 Discord 上交流,或到 X 上追蹤我們: @gmi_cloud。
Roan Weigert
DevRel @ GMI Cloud
GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies
