Qwen3.8-Max 今天上線。總參數 2.4 兆、啟用 950 億,open weights 下週釋出。它能自主寫程式 16 天、從零設計晶片,並在即時競賽中勝過 87% 的人類隊伍。
2026年8月03日

一個能連續 16 天不停寫程式的模型。一個從空資料夾開始設計加密晶片、在 500 個回合的自主最佳化中把 8,298 個閘數壓到 678 個的模型。一個投入即時競賽、與 526 支人類隊伍同場競技並贏過其中 458 支的模型。
這個模型,今天上線了——Qwen3.8-Max,是阿里巴巴 Qwen 團隊的新旗艦,open weights,將在下週釋出。
這個時間點的意義不只在 benchmark。open-weight 模型的天花板剛剛被抬高,而對於在專屬 GPU 基礎設施上跑推論的團隊來說,問題已經從「哪個模型分數最高」轉為「要以正式環境的吞吐量服務一個 2.4T 參數的 MoE,需要什麼條件」。
Qwen3.8-Max 採用 mixture-of-experts 架構:總參數 2.4 兆,每個 token 啟用 950 億。在 Artificial Analysis Intelligence Index 上,Qwen3.8-Max 得 53 分,落後於 Claude Opus 5(61)、Claude Fable 5(60)、GPT-5.6 Sol(59)、Kimi K3(57)與 Grok 4.5(54),但 open-weight 的釋出徹底改變了部署這道算式。

這個層級的前沿模型大多只提供 API。Qwen3.8-Max 今天先透過 QwenCloud 開放 API 存取,下週再釋出 open weights。對自架或在專屬 GPU 基礎設施上運行的團隊而言,這個差別就是一切:你拿到模型權重、拿到架構,也拿到依工作負載自由決定如何提供服務的自由。
這個模型,建立在 Qwen 3.5 的架構基礎上,並在任務、工作空間,與 harness 所構成的組合空間中,擴大 RL 訓練規模。Qwen 團隊描述了讓這種規模化成為可能的三項基礎建設創新:沿著彼此獨立的軸線持續擴充真實環境、以可自動擴展的評分準則統一異質驗證的通用獎勵系統,以及能抑制批次間梯度變異、維持 RL 規模化穩定的線上資料平衡器。
成果是一個在程式撰寫、工作處理、研究與多模態任務上都達到前沿水準的模型,同時在包括 Claude Code、Codex、OpenClaw 與 Hermes 在內的不同 agent harness 中維持一致的行為表現。
程式撰寫的數字是最大看點,但真正有意思的是方法論。
在 Terminal Bench 2.1 上,Qwen3.8-Max 得 86.6 分,領先 Claude Opus 4.8(84.6),落後 GPT-5.6 Sol(88.8)。在 SWE-bench Pro 上得 67.7,在 FrontierSWE 上得 73.5。這些成績足以與目前最好的純 API 模型競爭。
但 Qwen 團隊還走得更遠,做了三項長時程自主程式撰寫實驗,真正壓力測試「程式能力」在正式規模下究竟意味著什麼。
實驗一:自我演進的 harness。Qwen3.8-Max 被要求從零打造 oh-my-cli。在 16 天完全自主的運作中,它累積了 265 次 commit、127 個 PR 與 151 個 issue。它建立起一個完整的工程循環:需求進入 GitHub Issues,agent 透過狀態機認領、實作程式碼、觸發 CI 與 E2E 測試,通過後再合併。測試失敗時,它會把失敗導回相關 issue 重做,並把社群回饋與開發者回報轉換成可執行的工作項目。完整紀錄公開在 github.com/qwen-code-dev-bot/oh-my-cli。
實驗二:重現一篇研究論文,然後超越它。Qwen3.8-Max 拿到的,是一篇關於 LLM 推理資料選擇的近期論文、一批 GPU,以及一句「開始吧」的指示。在沒有任何起始程式碼、也沒有預建管線的情況下,它寫了 7,600 行程式、跑了 33 輪 GPU 訓練,在 125 小時的連續作業中重現了論文的全部六項主要發現,證實該論文的方法在 AIME24 上比隨機選擇高出 +7.7%。然後它繼續往前走:在四輪自主研究中,它發想並測試了 18 個改進點子。其中最好的一個計算訓練樣本中的「困難決策點」,還比論文自身的方法高出 +2.71 分。
實驗三:在即時競賽中擊敗人類。Qwen3.8-Max 參加了天池平台上的 WWW2025 多模態對話意圖辨識挑戰賽,與 526 支人類隊伍同場競技。在 24 小時的時限內,它讀完規則,建構出一套結合微調後的 BERT、RoBERTa 與 MacBERT 模型、並以 Qwen2.5-VL-7B 處理視覺的解法,組出加權投票的 ensemble,並在 45 次提交中反覆迭代。最終準確率 0.853,領先 458 支隊伍。
這些實驗檢驗的,正是單看 benchmark 分數會漏掉的東西:在數百個回合中維持連貫決策,不會偏離也不會停滯。
在 Qwen3.8-Max 這次發布中,晶片設計實驗是最能揭露長時程推理能力的一項測試。
任務是:以 RTL 設計一個 GCD/RSA 加密硬體加速器。模型從空的模組樣板與一個 testbench 開始,可使用 Iverilog 模擬、Yosys 合成、OpenROAD 做實體布局,並且必須在 4、6、8、16 位元等組態下維持位元級精確的功能正確性,同時把閘數壓到最低。
歷經 500 個回合、跨 13 個關鍵里程碑的 71 次評估,Qwen3.8-Max 把設計從 8,298 個閘一路壓到 678 個。這條最佳化路徑展現的是真正的架構思考,而非零碎的微調:
- 第 22 回合:演算法改寫。它把昂貴的 16 位元硬體 modulo 除法器換成迭代式 shift-subtract 架構,一步就砍掉 6,288 個閘,占總面積縮減的 80% 以上。- 第 35–48 回合:消除冗餘。它發現呼叫端的前置條件讓某個 reduction 階段變得多餘,於是把兩個獨立模組併成一個共用區塊,並縮小內部暫存器的位元寬度。- 第 60–113 回合:修剪控制邏輯。它移除冗餘暫存器,為偶數處理引入 early-exit 機制,並把減法器的 MSB 改作比較器使用。- 第 252 回合起:跨模組最佳化。它把乘法器直接內聯進模冪運算的 FSM,合併三個子模組,並在全域共用單一減法器。- 第 443–500 回合:閘級細修。共用 NOR gate 樹、拆分絕對差減法,以及 byte 到 bit 的選擇邏輯,擠出最後的冗餘。
實體布局說的是同一個故事。起始設計占用 106x106 µm² 的晶片面積,走線長度 33,369 µm,還有嚴重的時序違例。最終布局縮小到 46x46 µm²,走線長度 4,187 µm,並在 500 MHz 下達成 timing closure。實體晶片面積縮減 81%,完全由模型自己的架構決策所驅動,並透過自動化工具鏈端到端驗證。
這正是前沿模型與其他模型的分野:能在一次執行進行到數百回合之後,仍做出重大的結構性突破,而不是在早期摘完低垂果實後就停滯不前。
Qwen3.8-Max,把視覺帶進了 agent 迴圈,作為一種原生的回饋機制。模型會在執行過程中觀察自己的中間結果、檢視頁面版面與空間關係,並在偵測到意圖與結果不一致時修正輸出。視覺因此成為橫跨規劃、執行、驗證與迭代的回饋迴路,而不只是又一種輸入模態。
在多模態推理 benchmark 上,Qwen3.8-Max 在 MMMU-Pro 得 82.3、LogicVista 得 91.9、HiPhO 得 90.0。在視覺 agent benchmark 上,OSWorld-Verified 得 86.1、AndroidWorld 得 85.3。這些成績足以與 Claude Fable 5 競爭,且在數項指標上領先 GPT-5.6 Sol。完整的 benchmark 表格公布在 Qwen3.8-Max 發布文章中,涵蓋文字、視覺、影片與 agent 任務共 50 多項評測。
在文件密集的工作流程上,它能處理超過 200 頁的財報與 PDF,跨文字、圖表與版面擷取洞察。在影片方面,它能從長度超過 100 小時的內容建立記憶圖譜,重建事件進程與人物關係。
Qwen 團隊同時推出 Qwen-MM-Plugins,這是一套 harness 擴充函式庫,為既有 agent 框架加上圖片與影片處理、多模態記憶與視覺工具使用能力。透過這套外掛系統,任何 agent harness 都能變成多模態原生。此函式庫支援動態解析度處理、細緻的影片記憶,以及針對影片剪輯、Blender 與 CAD 工作流程的專門能力。
另外還有一個新的 benchmark:RecreationBench,用來測試混合式 agent 能力——模型純粹透過互動與回饋觀察一個運行中的應用,完全看不到原始碼,接著透過反覆撰寫程式與互動驗證,從零重建它。Qwen3.8-Max 在 Ubuntu、macOS、Windows、Android 與 web 五個平台上都取得前沿等級的成績。
下週的 open-weight 釋出,才是對基礎設施團隊真正重要的訊號。
一個 2.4T 參數、95B 啟用參數的 MoE 模型,是相當可觀的推論工作負載。完整模型,需要大量 GPU 記憶體來裝下所有 expert 權重;但每個 token 的啟用參數量,意味著搭配 expert parallelism 與高效批次處理,單一請求的運算量,在當代硬體上是可以掌握的。在專屬裸機 GPU 叢集上執行這種規模的模型,讓團隊能完全掌控服務架構。
Qwen 團隊建議把 reasoning_effort 當成主要的成本控制槓桿,共三個等級:複雜任務用 xhigh、需要兼顧準確度與速度時用 medium、追求效率則用 low。部署在專屬 GPU 基礎設施上的團隊,可以針對自身的工作負載組合逐一評測各等級,再據此配置硬體。以 xhigh 執行的 coding agent 可能需要 8 張 H200 GPU 搭配完整的模型平行化,而以 low 執行的文件處理管線,只需其中一小部分資源再加上 expert offloading 即可。
一個 2.4T 參數且開放權重的模型,意味著服務架構的主導權回到團隊手上。針對你的工作負載評測每個 reasoning 等級,依複雜度分流,把 GPU 資源配置在真正重要的地方。
模型路由成為自然的搭配。低複雜度的查詢在一般 GPU 上以 reasoning_effort=low 處理;高複雜度的程式與研究任務則在高記憶體執行個體上以 xhigh 執行。Open weights 讓這套路由架構得以成立,不必在每一層都付出按 token 計價的 API 加成。對已經在 GMI Cloud 上運行 open-weight 模型的團隊來說,把 Qwen3.8-Max 加進路由矩陣,等於在既有部署旁邊多了一份前沿能力。
這個模型也支援與 OpenAI、Anthropic API 相容的業界標準協定,可直接整合 Claude Code、Codex、Qoder CLI、Qwen Code 與 OpenClaw。已經標準化在特定 agent harness 上的基礎設施團隊,不必更動工具鏈就能導入 Qwen3.8-Max。Qwen 團隊為各個 harness 都提供了現成的設定片段,把整合時間縮短到幾分鐘。
對那些一直在跑 open-weight 模型、等待這個規模的前沿選項出現的團隊來說,下週就是鳴槍起跑。Qwen3.8-Max 今天已可透過 QwenCloud 的 API 使用,權重則會在下週登陸 Hugging Face 與 ModelScope。GMI Cloud 部落格會持續追蹤 open-weight 的釋出與後續公布的推論 benchmark。
Qwen3.8-Max 今天已在 GMI Cloud 的 serverless 推論 API 上線,不用排候補名單,也不需要另外架設專屬叢集。把你現有的 OpenAI 相容客戶端指向 https://api.gmi-serving.com/v1/chat/completions,換上 model ID,幾分鐘內就能跑起前沿推論:
curl --request POST \
--url https://api.gmi-serving.com/v1/chat/completions \
-H 'Content-Type: application/json' \
-H 'Authorization: Bearer YOUR_GMI_API_KEY' \
--data '{
"model": "Qwen/Qwen3.8-Max",
"messages": [
{"role": "system", "content": "You are a helpful AI assistant"},
{"role": "user", "content": "List 3 countries and their capitals."}
],
"temperature": 0,
"max_completion_tokens": 500
}'加入 GMI Cloud 開發者社群,在 Discord 上交流,或到 X 上追蹤我們 @gmi_cloud。
Roan Weigert
DevRel @ GMI Cloud
GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies
