• 運算
  • 客戶
  • 價格
登入
More Blog Posts
XDiscordLinkedInYouTube

產品

  • GPU
  • MaaS
  • Studio

開發者

  • 模型總覽
  • 技術文件
  • 詞彙表

公司

  • 關於我們
  • 部落格
  • 活動
  • 合作夥伴
  • 新創計劃
  • 職涯
  • 大使計畫
  • 使命與願景

熱門模型

    掌握 AI 最新動態

    提交即表示您瞭解我們會收集並使用您提交的資訊,其中可能包含個人資訊。

    XDiscordLinkedInYouTube

    Copyright ©2026 All rights reserved.

    隱私政策使用條款法律文件
    More Blog Posts
    Announcements

    為什麼 GLM-5.2 可能是目前最實用的程式開發模型

    GLM-5.2 帶著 1M token 上下文視窗與 MIT 授權登場,成為目前最容易部署的開放權重程式模型之一,現在就能在 GMI Cloud 上執行。

    2026年6月16日

    每隔幾個月,「實用」程式模型的門檻,就會被往上推一次。GLM-5.2 這次又推了一把。這次的轉變,關鍵不在原始 benchmark 分數,而在於這個模型真正讓你能打造什麼、部署什麼、擁有什麼。

    這次發布了什麼

    GLM-5.2 現已在 MIT 授權下完全開源,任何人都能自架、微調,並用於商業部署。上週,這個模型已經在同一天內,全面推出到 GLM Coding Plan 的四個方案層級:Lite、Pro、Max 與 Team。今天則是更大範圍的正式釋出,代表任何團隊都能在它之上開發,不必依附於任何平台或服務商,現在就能透過 GMI Cloud 直接執行。

    這個模型採用 7,440 億參數的 Mixture-of-Experts 架構,每個 token 只會啟動 400 億參數。這樣的設計,讓推論成本貼近 40B 模型,卻能運用遠大於自身規模的模型,才具備的表徵深度。MIT 授權的開放權重,已經上架 Hugging Face,代表任何團隊都能自架、微調,並把它放進商業產品中直接出貨。

    改變工作流程的那個數字

    上下文長度聽起來只是規格表上的一個細節,直到你花一整個工作階段,看著程式 agent 忘記自己三步前才改過的檔案。GLM-5.2 解決的,正是這個問題。

    這個模型支援 1,000,000 token 的上下文視窗,大約 75 萬字。Z.ai 形容它是「可用的」,而不是行銷用的天花板數字,這個區別很重要。長週期任務的基礎,不是紙上寫著 1M 上下文視窗,而是讓這些上下文,在真實工程工作中都同樣可靠。GLM-5.2 已針對長週期程式 agent 的情境,進行了數個月的專門訓練,涵蓋大規模實作、自動化研究,以及效能最佳化。

    把整個程式碼庫、它的測試、設定檔與相依樹,一次載入單一提示詞中;把完整技術規格與實作一起餵進去,讓模型自己找出落差;跑上數百步的 agent 迴圈,也不會忘記一開始要做什麼。這才是 1M 可用 token,在實務上真正的樣子。

    數字說話

    根據 Z.AI 公佈的文件,在 Terminal-Bench 2.1、SWE-bench Pro、FrontierSWE、PostTrainBench 與 SWE-Marathon 等程式 benchmark 上,GLM-5.2 都是排名第一的開源模型。

    1M 上下文的投資效果,在長週期任務的表現上看得最清楚。在三項於真實工程條件下、以數小時為時限進行的自主任務 benchmark 中,GLM-5.2 都穩定名列全場前段,即使拿來和閉源模型相比,也不例外。

    兩種思考模式,一個務實選擇

    GLM-5.2 提供兩個推理 effort 層級:High 與 Max。Z.ai 建議複雜的多步驟程式任務使用 Max effort,能在大型程式碼庫上,獲得更深的推理鏈與更好的規劃;High 則適合速度更重要的輕量任務。認真的程式工作,請一律使用 reasoning_effort: max。

    在 Claude Code 裡,/effort 指令直接對應這些層級。只要在工作階段一開始就設成 max,模型就會自動掌握推理深度。

    與你已在用的工具相容

    GLM-5.2 透過 Anthropic 相容端點,接上多數團隊已經在跑的程式 agent。發布時的整合清單,包括 Claude Code、Cline、OpenCode、Roo Code、Goose,以及 OpenClaw。對多數設定來說,需要的改動只有更換 base URL 與更新模型 ID,agent 框架、提示詞與工作流程完全不必更動。

    Claude Code 設定:

    // ~/.claude/settings.json
    {
    "env": {
    "ANTHROPIC_BASE_URL": "https://api.gmi-serving.com/v1",
    "ANTHROPIC_DEFAULT_SONNET_MODEL": "zai-org/GLM-5.2-FP8",
    "CLAUDE_CODE_AUTO_COMPACT_WINDOW": "1000000"
    }
    }

    接著在工作階段開始時執行 /effort max。

    任何接受 OpenAI 相容 base URL 的工具,都能直接拿來使用。只要把 base URL 改成 https://api.gmi-serving.com/v1,模型設為 zai-org/GLM-5.2-FP8,你既有的 agent 框架、提示詞與工作流程,就完全不必更動。

    GMI Cloud 也原生支援 OpenClaw 與 Hermes,如果你已經在用其中之一,需要的改動就只是換一個端點而已。

    在 GMI Cloud 上執行 GLM-5.2

    GLM-5.2 已在 GMI Cloud Model Hub 上線,模型名稱為 zai-org/GLM-5.2-FP8。FP8 量化技術,讓推論在 NVIDIA H100 與 H200 基礎設施上維持高效率,也與 40B 啟動參數的架構相互呼應。

    curl --request POST \
    --url https://api.gmi-serving.com/v1/chat/completions \
    -H 'Content-Type: application/json' \
    -H 'Authorization: Bearer YOUR_GMI_API_KEY' \
    --data '{
    "model": "zai-org/GLM-5.2-FP8",
    "messages": [
    {
    "role": "system",
    "content": "You are a senior full-stack software engineer."
    },
    {
    "role": "user",
    "content": "Refactor this function for performance..."
    }
    ],
    "thinking": { "type": "enabled" },
    "reasoning_effort": "max",
    "temperature": 1.0,
    "max_tokens": 8192
    }'

    在正式投入部署前,可以先在 Playground 中快速評估這個模型:用你真正的提示詞與程式碼庫測一遍,等吞吐量需求明朗之後,再轉往專屬端點。

    實際運作給你看

    要理解 GLM-5.2 的能耐,最好的方式,就是看它真的做出一個東西來。在這段示範中,我在 Kilocode 裡透過 GMI Cloud API 使用 GLM-5.2,從零開始一步步打造一款完全可互動的 3D 足球遊戲:先從簡單的 2D 俯視畫面開始,再逐步演化成一場有球員操控、傳球,以及自動 CPU 對手的 3D 巴西對阿根廷賽事。我採取的做法是刻意的:把任務拆成小而聚焦的迭代,而不是一股腦全塞進單一提示詞裡。這正是 1M token 上下文視窗真正發光的地方。它在每一步之間,都把整個專案記在腦中,所以不會有任何東西,在工作階段之間掉包遺失。

    社群怎麼說

    發布當時 ,r/LocalLLaMA 的討論串,把 1M 上下文視窗與兩種思考模式,列為最突出的特色,社群成員也提到,它在長週期任務上表現不俗。透過 GLM Coding Plan beta 提早取得使用權的開發者則回報,它在長週期任務執行上更穩定,也更能遵循正式等級的工程規範,並且在行動裝置與用戶端的工作流程上,處理得更好,還支援完整的裝置端除錯。

    為什麼此刻這件事很重要

    2026 年,開放權重模型與專有前沿模型之間的差距,已經明顯縮小。差異化的關鍵,也越來越落在取用條件上:你能在什麼基礎上開發、擁有什麼,以及能在沒有依賴風險的情況下,部署什麼。

    GLM-5.2 的到來,就在美國出口管制,迫使數個前沿模型對國際使用者下線的短短幾天之後。一個 MIT 授權、1M 上下文、API 乾淨的模型,正是「當你需要一個持續可用的基礎時,該在哪裡開發」這個問題的直接答案。

    對正在評估推論堆疊的 AI 工程師來說,GMI Cloud 上的 GLM-5.2,提供了此刻難以匹敵的組合:前沿等級的上下文長度、開源第一的 benchmark 表現、寬鬆的授權條件,以及對已經在使用 Claude Code,或任何 OpenAI 相容工具的團隊而言,幾乎零整合成本。

    GLM-5.2 現在就在 GMI Cloud 上線。到 console 拿你的 API key,把工具指向該端點,就能立刻開始開發。推論速度快、上下文夠深,整合只要幾分鐘。

    在 GMI Cloud 上試用 GLM-5.2:console.gmicloud.ai

    文件:docs.gmicloud.ai

    Roan Weigert

    Roan Weigert

    DevRel @ GMI Cloud

    Build AI Without Limits

    GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies

    Ready to build?

    Explore powerful AI models and launch your project in just a few clicks.

    Get Started