• 運算
  • 客戶
  • 價格
登入
More Blog Posts
XDiscordLinkedInYouTube

產品

  • GPU
  • MaaS
  • Studio

開發者

  • 模型總覽
  • 技術文件
  • 詞彙表

公司

  • 關於我們
  • 部落格
  • 活動
  • 合作夥伴
  • 新創計劃
  • 職涯
  • 大使計畫
  • 使命與願景

熱門模型

    掌握 AI 最新動態

    提交即表示您瞭解我們會收集並使用您提交的資訊,其中可能包含個人資訊。

    XDiscordLinkedInYouTube

    Copyright ©2026 All rights reserved.

    隱私政策使用條款法律文件
    More Blog Posts
    Announcements

    Qwen3.8-Max:2.4T 參數即刻可用,Open Weights 下週釋出

    Qwen3.8-Max 今天上線。總參數 2.4 兆、啟用 950 億,open weights 下週釋出。它能自主寫程式 16 天、從零設計晶片,並在即時競賽中勝過 87% 的人類隊伍。

    2026年8月03日

    一個能連續 16 天不停寫程式的模型。一個從空資料夾開始設計加密晶片、在 500 個回合的自主最佳化中把 8,298 個閘數壓到 678 個的模型。一個投入即時競賽、與 526 支人類隊伍同場競技並贏過其中 458 支的模型。

    這個模型,今天上線了——Qwen3.8-Max,是阿里巴巴 Qwen 團隊的新旗艦,open weights,將在下週釋出。

    這個時間點的意義不只在 benchmark。open-weight 模型的天花板剛剛被抬高,而對於在專屬 GPU 基礎設施上跑推論的團隊來說,問題已經從「哪個模型分數最高」轉為「要以正式環境的吞吐量服務一個 2.4T 參數的 MoE,需要什麼條件」。

    一個具備 Open Weights 的 2.4T MoE

    Qwen3.8-Max 採用 mixture-of-experts 架構:總參數 2.4 兆,每個 token 啟用 950 億。在 Artificial Analysis Intelligence Index 上,Qwen3.8-Max 得 53 分,落後於 Claude Opus 5(61)、Claude Fable 5(60)、GPT-5.6 Sol(59)、Kimi K3(57)與 Grok 4.5(54),但 open-weight 的釋出徹底改變了部署這道算式。

    這個層級的前沿模型大多只提供 API。Qwen3.8-Max 今天先透過 QwenCloud 開放 API 存取,下週再釋出 open weights。對自架或在專屬 GPU 基礎設施上運行的團隊而言,這個差別就是一切:你拿到模型權重、拿到架構,也拿到依工作負載自由決定如何提供服務的自由。

    這個模型,建立在 Qwen 3.5 的架構基礎上,並在任務、工作空間,與 harness 所構成的組合空間中,擴大 RL 訓練規模。Qwen 團隊描述了讓這種規模化成為可能的三項基礎建設創新:沿著彼此獨立的軸線持續擴充真實環境、以可自動擴展的評分準則統一異質驗證的通用獎勵系統,以及能抑制批次間梯度變異、維持 RL 規模化穩定的線上資料平衡器。

    成果是一個在程式撰寫、工作處理、研究與多模態任務上都達到前沿水準的模型,同時在包括 Claude Code、Codex、OpenClaw 與 Hermes 在內的不同 agent harness 中維持一致的行為表現。

    程式撰寫:16 天、265 次 commit、零人為介入

    程式撰寫的數字是最大看點,但真正有意思的是方法論。

    在 Terminal Bench 2.1 上,Qwen3.8-Max 得 86.6 分,領先 Claude Opus 4.8(84.6),落後 GPT-5.6 Sol(88.8)。在 SWE-bench Pro 上得 67.7,在 FrontierSWE 上得 73.5。這些成績足以與目前最好的純 API 模型競爭。

    但 Qwen 團隊還走得更遠,做了三項長時程自主程式撰寫實驗,真正壓力測試「程式能力」在正式規模下究竟意味著什麼。

    實驗一:自我演進的 harness。Qwen3.8-Max 被要求從零打造 oh-my-cli。在 16 天完全自主的運作中,它累積了 265 次 commit、127 個 PR 與 151 個 issue。它建立起一個完整的工程循環:需求進入 GitHub Issues,agent 透過狀態機認領、實作程式碼、觸發 CI 與 E2E 測試,通過後再合併。測試失敗時,它會把失敗導回相關 issue 重做,並把社群回饋與開發者回報轉換成可執行的工作項目。完整紀錄公開在 github.com/qwen-code-dev-bot/oh-my-cli。

    實驗二:重現一篇研究論文,然後超越它。Qwen3.8-Max 拿到的,是一篇關於 LLM 推理資料選擇的近期論文、一批 GPU,以及一句「開始吧」的指示。在沒有任何起始程式碼、也沒有預建管線的情況下,它寫了 7,600 行程式、跑了 33 輪 GPU 訓練,在 125 小時的連續作業中重現了論文的全部六項主要發現,證實該論文的方法在 AIME24 上比隨機選擇高出 +7.7%。然後它繼續往前走:在四輪自主研究中,它發想並測試了 18 個改進點子。其中最好的一個計算訓練樣本中的「困難決策點」,還比論文自身的方法高出 +2.71 分。

    實驗三:在即時競賽中擊敗人類。Qwen3.8-Max 參加了天池平台上的 WWW2025 多模態對話意圖辨識挑戰賽,與 526 支人類隊伍同場競技。在 24 小時的時限內,它讀完規則,建構出一套結合微調後的 BERT、RoBERTa 與 MacBERT 模型、並以 Qwen2.5-VL-7B 處理視覺的解法,組出加權投票的 ensemble,並在 45 次提交中反覆迭代。最終準確率 0.853,領先 458 支隊伍。

    這些實驗檢驗的,正是單看 benchmark 分數會漏掉的東西:在數百個回合中維持連貫決策,不會偏離也不會停滯。

    一個閘一個閘地設計晶片

    在 Qwen3.8-Max 這次發布中,晶片設計實驗是最能揭露長時程推理能力的一項測試。

    任務是:以 RTL 設計一個 GCD/RSA 加密硬體加速器。模型從空的模組樣板與一個 testbench 開始,可使用 Iverilog 模擬、Yosys 合成、OpenROAD 做實體布局,並且必須在 4、6、8、16 位元等組態下維持位元級精確的功能正確性,同時把閘數壓到最低。

    歷經 500 個回合、跨 13 個關鍵里程碑的 71 次評估,Qwen3.8-Max 把設計從 8,298 個閘一路壓到 678 個。這條最佳化路徑展現的是真正的架構思考,而非零碎的微調:

    - 第 22 回合:演算法改寫。它把昂貴的 16 位元硬體 modulo 除法器換成迭代式 shift-subtract 架構,一步就砍掉 6,288 個閘,占總面積縮減的 80% 以上。- 第 35–48 回合:消除冗餘。它發現呼叫端的前置條件讓某個 reduction 階段變得多餘,於是把兩個獨立模組併成一個共用區塊,並縮小內部暫存器的位元寬度。- 第 60–113 回合:修剪控制邏輯。它移除冗餘暫存器,為偶數處理引入 early-exit 機制,並把減法器的 MSB 改作比較器使用。- 第 252 回合起:跨模組最佳化。它把乘法器直接內聯進模冪運算的 FSM,合併三個子模組,並在全域共用單一減法器。- 第 443–500 回合:閘級細修。共用 NOR gate 樹、拆分絕對差減法,以及 byte 到 bit 的選擇邏輯,擠出最後的冗餘。

    實體布局說的是同一個故事。起始設計占用 106x106 µm² 的晶片面積,走線長度 33,369 µm,還有嚴重的時序違例。最終布局縮小到 46x46 µm²,走線長度 4,187 µm,並在 500 MHz 下達成 timing closure。實體晶片面積縮減 81%,完全由模型自己的架構決策所驅動,並透過自動化工具鏈端到端驗證。

    這正是前沿模型與其他模型的分野:能在一次執行進行到數百回合之後,仍做出重大的結構性突破,而不是在早期摘完低垂果實後就停滯不前。

    會驗證自己成果的多模態 Agent

    Qwen3.8-Max,把視覺帶進了 agent 迴圈,作為一種原生的回饋機制。模型會在執行過程中觀察自己的中間結果、檢視頁面版面與空間關係,並在偵測到意圖與結果不一致時修正輸出。視覺因此成為橫跨規劃、執行、驗證與迭代的回饋迴路,而不只是又一種輸入模態。

    在多模態推理 benchmark 上,Qwen3.8-Max 在 MMMU-Pro 得 82.3、LogicVista 得 91.9、HiPhO 得 90.0。在視覺 agent benchmark 上,OSWorld-Verified 得 86.1、AndroidWorld 得 85.3。這些成績足以與 Claude Fable 5 競爭,且在數項指標上領先 GPT-5.6 Sol。完整的 benchmark 表格公布在 Qwen3.8-Max 發布文章中,涵蓋文字、視覺、影片與 agent 任務共 50 多項評測。

    在文件密集的工作流程上,它能處理超過 200 頁的財報與 PDF,跨文字、圖表與版面擷取洞察。在影片方面,它能從長度超過 100 小時的內容建立記憶圖譜,重建事件進程與人物關係。

    Qwen 團隊同時推出 Qwen-MM-Plugins,這是一套 harness 擴充函式庫,為既有 agent 框架加上圖片與影片處理、多模態記憶與視覺工具使用能力。透過這套外掛系統,任何 agent harness 都能變成多模態原生。此函式庫支援動態解析度處理、細緻的影片記憶,以及針對影片剪輯、Blender 與 CAD 工作流程的專門能力。

    另外還有一個新的 benchmark:RecreationBench,用來測試混合式 agent 能力——模型純粹透過互動與回饋觀察一個運行中的應用,完全看不到原始碼,接著透過反覆撰寫程式與互動驗證,從零重建它。Qwen3.8-Max 在 Ubuntu、macOS、Windows、Android 與 web 五個平台上都取得前沿等級的成績。

    Open Weights 對 GPU 基礎設施的意義

    下週的 open-weight 釋出,才是對基礎設施團隊真正重要的訊號。

    一個 2.4T 參數、95B 啟用參數的 MoE 模型,是相當可觀的推論工作負載。完整模型,需要大量 GPU 記憶體來裝下所有 expert 權重;但每個 token 的啟用參數量,意味著搭配 expert parallelism 與高效批次處理,單一請求的運算量,在當代硬體上是可以掌握的。在專屬裸機 GPU 叢集上執行這種規模的模型,讓團隊能完全掌控服務架構。

    Qwen 團隊建議把 reasoning_effort 當成主要的成本控制槓桿,共三個等級:複雜任務用 xhigh、需要兼顧準確度與速度時用 medium、追求效率則用 low。部署在專屬 GPU 基礎設施上的團隊,可以針對自身的工作負載組合逐一評測各等級,再據此配置硬體。以 xhigh 執行的 coding agent 可能需要 8 張 H200 GPU 搭配完整的模型平行化,而以 low 執行的文件處理管線,只需其中一小部分資源再加上 expert offloading 即可。

    一個 2.4T 參數且開放權重的模型,意味著服務架構的主導權回到團隊手上。針對你的工作負載評測每個 reasoning 等級,依複雜度分流,把 GPU 資源配置在真正重要的地方。

    模型路由成為自然的搭配。低複雜度的查詢在一般 GPU 上以 reasoning_effort=low 處理;高複雜度的程式與研究任務則在高記憶體執行個體上以 xhigh 執行。Open weights 讓這套路由架構得以成立,不必在每一層都付出按 token 計價的 API 加成。對已經在 GMI Cloud 上運行 open-weight 模型的團隊來說,把 Qwen3.8-Max 加進路由矩陣,等於在既有部署旁邊多了一份前沿能力。

    這個模型也支援與 OpenAI、Anthropic API 相容的業界標準協定,可直接整合 Claude Code、Codex、Qoder CLI、Qwen Code 與 OpenClaw。已經標準化在特定 agent harness 上的基礎設施團隊,不必更動工具鏈就能導入 Qwen3.8-Max。Qwen 團隊為各個 harness 都提供了現成的設定片段,把整合時間縮短到幾分鐘。

    對那些一直在跑 open-weight 模型、等待這個規模的前沿選項出現的團隊來說,下週就是鳴槍起跑。Qwen3.8-Max 今天已可透過 QwenCloud 的 API 使用,權重則會在下週登陸 Hugging Face 與 ModelScope。GMI Cloud 部落格會持續追蹤 open-weight 的釋出與後續公布的推論 benchmark。

    今天就在 GMI Cloud 上執行 Qwen3.8-Max

    Qwen3.8-Max 今天已在 GMI Cloud 的 serverless 推論 API 上線,不用排候補名單,也不需要另外架設專屬叢集。把你現有的 OpenAI 相容客戶端指向 https://api.gmi-serving.com/v1/chat/completions,換上 model ID,幾分鐘內就能跑起前沿推論:

    curl --request POST \
      --url https://api.gmi-serving.com/v1/chat/completions \
      -H 'Content-Type: application/json' \
      -H 'Authorization: Bearer YOUR_GMI_API_KEY' \
      --data '{
        "model": "Qwen/Qwen3.8-Max",
        "messages": [
          {"role": "system", "content": "You are a helpful AI assistant"},
          {"role": "user", "content": "List 3 countries and their capitals."}
        ],
        "temperature": 0,
        "max_completion_tokens": 500
      }'

    立即開始打造

    加入 GMI Cloud 開發者社群,在 Discord 上交流,或到 X 上追蹤我們 @gmi_cloud。

    Roan Weigert

    Roan Weigert

    DevRel @ GMI Cloud

    Build AI Without Limits

    GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies

    Ready to build?

    Explore powerful AI models and launch your project in just a few clicks.

    Get Started