• 運算
  • 客戶
  • 價格
登入
More Blog Posts
XDiscordLinkedInYouTube

產品

  • GPU
  • MaaS
  • Studio

開發者

  • 模型總覽
  • 技術文件
  • 詞彙表

公司

  • 關於我們
  • 部落格
  • 活動
  • 合作夥伴
  • 新創計劃
  • 職涯
  • 大使計畫
  • 使命與願景

熱門模型

    掌握 AI 最新動態

    提交即表示您瞭解我們會收集並使用您提交的資訊,其中可能包含個人資訊。

    XDiscordLinkedInYouTube

    Copyright ©2026 All rights reserved.

    隱私政策使用條款法律文件
    More Blog Posts
    Announcements

    MiniMax M3、Grok 4.5 與 NVIDIA Nemotron 3 Nano Omni 領銜 2026 年 8 月的 BenchLM 排名,open-weight 模型與前沿 AI 的差距正在縮小;一起看看正在形塑正式環境部署的分數、速度與成本取捨。

    MiniMax M3、Grok 4.5 與 NVIDIA Nemotron 3 Nano Omni 領銜 2026 年 8 月的 BenchLM 排名,open-weight 模型與前沿 AI 的差距正在縮小;一起看看正在形塑正式環境部署的分數、速度與成本取捨。

    2026年8月05日

    BenchLM 排行榜,已於 8 月 5 日更新 2026 年 8 月的排名。在總共追蹤的 379 個模型中,涵蓋 104 個 supported 模型與 111 個 estimated 模型,資料呈現出一個自 2026 年初就持續累積的態勢:open-weight 模型如今在品質上已能與旗艦閉源系統正面競爭,同時提供的速度與部署彈性,是專有 API 得付出更高成本才能相比的。

    排行榜背後的排名方法 —— BenchAlign v5.2,總共追蹤 381 項 benchmark,橫跨推理、程式撰寫、知識、數學、多模態、指令遵循、多語言與 agentic 任務完成度,其中有 27 項排名用 benchmark 會直接加權進綜合分數,其餘資料僅作為展示用的參考脈絡。每個模型的名次也都附有出處標籤:「Supported」代表經過多個來源家族的獨立第三方驗證;「Estimated」則代表分數來自 model card 資料或單一來源的 benchmark。這個區分很重要,因為 estimated 名次可能在獨立測試跟上後改變。8 月榜單的前三名全都是 Supported,並有多個來源家族相互佐證。

    對正在評估正式環境模型的團隊來說,這份排行榜提供的不只是名次,它點出了值得針對特定工作負載去實測的模型。一個在程式撰寫上表現優異、但在指令遵循上偏弱的模型,可能在 IDE agent 中很出色,卻在面向客戶的聊天機器人上失守。綜合分數只是起點,真正做出部署決策的地方是分類細項。

    這對任何要把 AI 部署到正式環境的人,都很重要。當一個 30B 參數的模型,每秒能輸出 323 個 token、benchmark 分數又接近前四分位,服務端的成本結構就會跟著改變。當一個 open-weight 模型,總分 68.8 且授權寬鬆,團隊就能自架與微調,不必再付按 token 計價的 API 費用。這些 benchmark,是部署決策的訊號,而且份量不輕。

    榜單頂端:Claude Mythos 5 領先

    Claude Mythos 5 以 83.04 的總分穩坐 BenchAlign 排行榜第一。Claude Fable 5 以 82.79 緊追在後,Claude Opus 5 則是 82.59。截至 2026 年 8 月,這三個 Anthropic 模型代表了目前可量測 AI 表現的最前沿。

    第一名與第三名之間的差距不到半分。這種頂端的高度壓縮反映了一件真實的事:前沿相當擁擠,純 benchmark 分數正在收斂,即使真實世界的 agentic 能力仍在持續拉開差距。

    BenchAlign 排行榜前 10 名(2026 年 8 月 5 日)

    排名

    模型

    供應商

    分數

    佐證

    1

    Claude Mythos 5

    Anthropic

    83.04

    Supported

    2

    Claude Fable 5

    Anthropic

    82.79

    Supported

    3

    Claude Opus 5

    Anthropic

    82.59

    Supported

    4

    GPT-5.6 Sol

    OpenAI

    81.48

    Supported

    5

    Kimi K3

    Moonshot AI

    79.89

    Supported

    6

    Claude Opus 4.8

    Anthropic

    77.34

    Supported

    7

    Muse Spark 1.1

    Meta

    76.15

    Supported

    8

    Grok 4.5

    xAI

    75.38

    Supported

    9

    Gemini 3.6 Flash

    Google

    75.30

    Supported

    10

    GPT-5.4

    OpenAI

    73.20

    Supported

    BenchAlign 的方法,會將推理、程式撰寫、知識、數學、指令遵循、多模態、多語言,與 agentic benchmark,加權成單一綜合分數。程式撰寫與推理同時強勢的模型,通常爬升得最快。Claude Mythos 5 的名次,來自各類別一致的表現,其中推理與 agentic benchmark 尤其突出。

    截至 2026 年 8 月 5 日,Claude Mythos 5 在 BenchAlign v5.2 上取得 83.04 分,於 379 個受追蹤模型中居首。

    這是基準參考點,其下的一切都是在衡量與前沿的距離。2026 年 8 月榜單有趣之處,在於有好幾個模型與這個參考點靠得很近,而它們是用截然不同的架構與部署樣態走到那裡的。

    MiniMax M3:Open-Weight 的領先者

    BenchLM 排行榜,將 MiniMax M3 列為最佳 open-weight 模型。它以 68.8 的總分,跨過了取得「decision-ready」標記所需的佐證與時效門檻;其 benchmark,已由兩個獨立來源家族驗證。

    MiniMax M3 代表了一類在 18 個月前還不切實際、無法自架的 open-weight 模型。這個模型已收錄在 GMI Cloud 的模型目錄 中,與另外 200 多個模型並列,提供相容 OpenAI 的 API 存取,也可選擇部署在專屬 GPU 基礎設施上。

    當一個綜合分數 68.8 的模型,以 open weights 形式釋出,會改變什麼?部署管線整個被壓縮:團隊可以拿到模型、做量化、用 vLLM 或 SGLang 提供服務,並在自有資料上微調。外部 API 的按 token 成本結構,被託管基礎設施的每 GPU 小時成本取代。對每天超過數百萬 token 的工作負載來說,帳算下來,自架比較划算。

    這正是 GPU 基礎設施的重要之處。要在正式規模下以低延遲執行像 MiniMax M3 這樣的模型,需要搭配高記憶體頻寬與高效推論引擎的 H100 或 H200 GPU。GMI Cloud 的 GPU 基礎設施提供的 H100 SXM5 與 H200 執行個體,讓這件事變得可行。

    Grok 4.5:性價比的訊號

    Grok 4.5 拿下 BenchLM 的「best near-frontier value」標記。它達到領先分數的 91%,而排行榜描述其輸出成本低了 88%。其 benchmark 已由三個獨立來源家族確認。

    這正是會重塑部署決策的比值。團隊在評估正式環境的模型選項時,通常先看品質、再看速度、最後看成本。當一個模型能以極小的營運支出達到頂尖品質的 91%,整個算式就會跟著改變了:你用綜合 benchmark 上的幾分,換到一個能規模化的部署樣態。

    Grok 4.5 跑在專屬的推論基礎設施上。它的上下文視窗、吞吐量與延遲特性,讓它適合那些「每 token 成本直接決定功能能不能上線」的大量請求應用。這個模型也成了 2026 年年中「高效推論長什麼樣」的一個參考標準。

    Decision-Ready 精選(2026 年 8 月)

    類別

    模型

    供應商

    關鍵指標

    佐證層級

    最佳 open weight

    MiniMax M3

    MiniMax

    總分 68.8

    Supported · 2 個來源家族

    最佳近前沿性價比

    Grok 4.5

    xAI

    頂尖分數的 91%,輸出價格低 88%

    Supported · 3 個來源家族

    實測最快

    Nemotron 3 Nano Omni 30B A3B

    NVIDIA

    每秒 323 tokens(Artificial Analysis,2026 年 8 月 5 日更新)

    跨過排名 + 佐證門檻

    最大可用上下文

    Grok 4.20

    xAI

    2M 上下文視窗

    Estimated · 1 個來源家族

    請注意,最後一列屬於排行榜中最低的佐證層級:它是真實且已公開揭露的能力,但僅依據單一來源家族,而非像前三名總排名那樣經過獨立交叉驗證。

    Nemotron 3 Nano Omni:速度本身就是一項功能

    NVIDIA Nemotron 3 Nano Omni 在 Artificial Analysis 的外部量測中,錄得每秒 323 個 token(2026 年 8 月 5 日更新)。這讓它成為 BenchLM 排行榜上同時跨過排名與佐證門檻、實測速度最快的模型。

    答案藏在架構裡:總參數 300 億,推論時僅啟用 30 億。這是一種稀疏的 mixture-of-experts 設計,會把每個 token 只導向整個模型的一小部分,大幅降低每個輸出 token 所需的運算量。結果是這個模型的產文速度,比許多啟用參數多出五倍、十倍的模型還要快上不少。

    Nemotron 3 Nano Omni 每秒輸出 323 個 token,是 BenchLM 2026 年 8 月排行榜上外部實測最快的模型。

    速度,除了方便之外,為什麼重要?在 agentic 工作流程中,回應更快的模型會把使用者體驗從「等 AI」變成「跟 AI 一起工作」。在批次處理中,每個節點更高的吞吐量意味著大型工作能完成,而不必長時間佔住 GPU 叢集。

    Nemotron 3 Nano Omni 已可透過 GMI Cloud 使用。對正在打造延遲敏感 agent 或高吞吐管線的團隊來說,這個模型的架構很適合運行在 H100 與 H200 執行個體上。GMI Cloud 部落格上有上手的部署指南。

    Grok 4.20 與 2M 脈絡的前沿

    Grok 4.20 拿下 BenchLM「最大可用上下文」的標記:200 萬 tokens,同時仍保有至少領先綜合分數的一半。這個名次目前屬於 Estimated,僅由單一來源家族支撐,而非獨立多來源驗證;若團隊只憑這一點做決策,值得特別留意。

    2M token 的上下文大約可容納 3,000 頁文字。一個 agent 可以吞下整個程式庫、完整的文件集,或長達數小時的對話紀錄,而不需要那些會流失細節的分塊或摘要策略。

    長上下文視窗對 GPU 基礎設施有獨特的要求。2M token 上下文的 key-value cache 需要大量 VRAM。配備 141GB HBM3e 記憶體的 H200 GPU 能有效率地處理這類工作負載,而 GMI Cloud 的 GPU 基礎設施也支援這些模型所需的記憶體用量。

    新發布:八月第一週

    BenchLM Radar 在 2026 年 8 月頭幾天追蹤到三個確認發布的模型:Hark Handoff(Hark,8 月 5 日)、Ling 3.0 Flash FP8(InclusionAI,8 月 4 日)與 LFM2.5-2.6B(LiquidAI,8 月 4 日)。Radar 會在來源端監控發布、價格變動、淘汰與事故,在這些變化反映到彙整後的排行榜之前就先揭露出來。

    InclusionAI 的 Ling 3.0 Flash FP8 於 8 月 4 日登場。FP8 量化格式代表它的重心放在推論效率上;FP8 模型通常比 FP16 版本跑得更快、記憶體用量更少。排行榜來源並未公布此版本的具體吞吐量或記憶體用量數字,因此在做容量規劃前,應直接向 InclusionAI 查證實際的效率提升幅度。

    LiquidAI 的 LFM2.5-2.6B 於 8 月 4 日釋出。以 26 億參數而言,這是一個瞄準邊緣裝置與輕量 agent 部署的精簡模型。除了名稱、供應商與發布日期之外,BenchLM 來源目前尚未提供此模型的獨立 benchmark 結果或架構細節;在 Supported 層級的分數出現之前,與更大型 transformer 模型的比較都應視為未經驗證。

    另外,阿里巴巴的 Qwen3.8 Max 在 BenchLM 上被列為 2026 年 8 月發布中排名最佳的模型,分數為 60.9。來源並未提供此模型的參數量或 open weights 釋出日期,因此關於總參數/啟用參數規模或授權時程的說法,應直接向阿里巴巴確認,而非當成排行榜已驗證的資訊。

    2026 年 8 月初這波確認發布的節奏,延續了 open-weight 與效率導向發布日益頻繁的趨勢,儘管並非所有版本都已具備獨立驗證的 benchmark 分數。

    這些 Benchmark 對正式環境 AI 的意義

    BenchLM 2026 年 8 月排行榜,其實是一份用數字編碼而成的部署指南。每一個名次背後,都對應著真實的硬體需求、真實的延遲預算,以及真實的服務成本。

    品質差距正在收斂。MiniMax M3 的 68.8 對上 Claude Mythos 5 的 83.04,綜合分數大約差 17%。團隊應該觀察這個差距在後續的 Supported 層級更新中是否持續縮小,而不是假設它會沿固定軌跡發展。

    速度的效益會不斷累積。Nemotron 3 Nano Omni 只用 3B 啟用參數就達到 323 tok/s,證明稀疏架構在正式規模下確實可行。當一個模型能以這種速度產文,每張 GPU 的有效吞吐量、進而是每百萬 token 的成本,都會大幅下降。

    上下文視窗正在擴張,儘管目前最強的宣稱(Grok 4.20 的 2M tokens)仍停留在 Estimated、單一來源的基礎上。它指向的部署意涵是真實的:單次通吃的程式庫分析、整份文件的推理、長達數小時的自主 agent 執行;但佐證層級提醒我們,在把架構決策押上去之前,最好先獨立驗證。要有效率地服務這些模型,硬體得是具備高頻寬記憶體的 H200 與 B200 等級 GPU。

    在 GPU 基礎設施上執行 Open-Weight 模型

    BenchLM 的資料指向一個務實的結論:2026 年 8 月值得放進正式環境的模型,有很多都提供 open weights,或可透過高效率的 API 取得。自架與使用託管端點之間的抉擇,最終取決於吞吐量需求、延遲敏感度與資料落地限制。

    GMI Cloud 提供的基礎設施層讓兩條路都行得通。模型目錄收錄了 MiniMax M3、Nemotron 3 Nano Omni、Grok 4.5、Qwen3.8 Max 以及其他 200 多個模型,並提供與 OpenAI 相容的端點給希望使用託管服務的團隊。對需要專屬 GPU 執行個體的團隊,也有預先配置好推論引擎的 H100 SXM5 與 H200 組態可選。

    GMI Cloud 部落格涵蓋正式環境 AI 工作負載的部署模式、benchmark 深入剖析與架構指南。近期關於模型部署、推論最佳化與 agent 基礎設施的文章,都提供了具體且經過實測的組態。

    這就是 2026 年 8 月的正式環境 AI 版圖:open-weight 模型正在逼近前沿,稀疏架構帶來的速度正在改變 agent 能做的事,而能大規模執行這些模型的 GPU 基礎設施,今天就已經存在。

    立即開始打造

    加入 GMI Cloud 開發者社群,在 Discord 上交流,或到 X 上追蹤我們: @gmi_cloud。

    Roan Weigert

    Roan Weigert

    DevRel @ GMI Cloud

    Build AI Without Limits

    GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies

    Ready to build?

    Explore powerful AI models and launch your project in just a few clicks.

    Get Started