GLM-5.2 帶著 1M token 上下文視窗與 MIT 授權登場,成為目前最容易部署的開放權重程式模型之一,現在就能在 GMI Cloud 上執行。
2026年6月16日
.png)
每隔幾個月,「實用」程式模型的門檻,就會被往上推一次。GLM-5.2 這次又推了一把。這次的轉變,關鍵不在原始 benchmark 分數,而在於這個模型真正讓你能打造什麼、部署什麼、擁有什麼。
GLM-5.2 現已在 MIT 授權下完全開源,任何人都能自架、微調,並用於商業部署。上週,這個模型已經在同一天內,全面推出到 GLM Coding Plan 的四個方案層級:Lite、Pro、Max 與 Team。今天則是更大範圍的正式釋出,代表任何團隊都能在它之上開發,不必依附於任何平台或服務商,現在就能透過 GMI Cloud 直接執行。
這個模型採用 7,440 億參數的 Mixture-of-Experts 架構,每個 token 只會啟動 400 億參數。這樣的設計,讓推論成本貼近 40B 模型,卻能運用遠大於自身規模的模型,才具備的表徵深度。MIT 授權的開放權重,已經上架 Hugging Face,代表任何團隊都能自架、微調,並把它放進商業產品中直接出貨。
上下文長度聽起來只是規格表上的一個細節,直到你花一整個工作階段,看著程式 agent 忘記自己三步前才改過的檔案。GLM-5.2 解決的,正是這個問題。
這個模型支援 1,000,000 token 的上下文視窗,大約 75 萬字。Z.ai 形容它是「可用的」,而不是行銷用的天花板數字,這個區別很重要。長週期任務的基礎,不是紙上寫著 1M 上下文視窗,而是讓這些上下文,在真實工程工作中都同樣可靠。GLM-5.2 已針對長週期程式 agent 的情境,進行了數個月的專門訓練,涵蓋大規模實作、自動化研究,以及效能最佳化。
把整個程式碼庫、它的測試、設定檔與相依樹,一次載入單一提示詞中;把完整技術規格與實作一起餵進去,讓模型自己找出落差;跑上數百步的 agent 迴圈,也不會忘記一開始要做什麼。這才是 1M 可用 token,在實務上真正的樣子。
根據 Z.AI 公佈的文件,在 Terminal-Bench 2.1、SWE-bench Pro、FrontierSWE、PostTrainBench 與 SWE-Marathon 等程式 benchmark 上,GLM-5.2 都是排名第一的開源模型。

1M 上下文的投資效果,在長週期任務的表現上看得最清楚。在三項於真實工程條件下、以數小時為時限進行的自主任務 benchmark 中,GLM-5.2 都穩定名列全場前段,即使拿來和閉源模型相比,也不例外。

GLM-5.2 提供兩個推理 effort 層級:High 與 Max。Z.ai 建議複雜的多步驟程式任務使用 Max effort,能在大型程式碼庫上,獲得更深的推理鏈與更好的規劃;High 則適合速度更重要的輕量任務。認真的程式工作,請一律使用 reasoning_effort: max。
在 Claude Code 裡,/effort 指令直接對應這些層級。只要在工作階段一開始就設成 max,模型就會自動掌握推理深度。
與你已在用的工具相容
GLM-5.2 透過 Anthropic 相容端點,接上多數團隊已經在跑的程式 agent。發布時的整合清單,包括 Claude Code、Cline、OpenCode、Roo Code、Goose,以及 OpenClaw。對多數設定來說,需要的改動只有更換 base URL 與更新模型 ID,agent 框架、提示詞與工作流程完全不必更動。
Claude Code 設定:
// ~/.claude/settings.json
{
"env": {
"ANTHROPIC_BASE_URL": "https://api.gmi-serving.com/v1",
"ANTHROPIC_DEFAULT_SONNET_MODEL": "zai-org/GLM-5.2-FP8",
"CLAUDE_CODE_AUTO_COMPACT_WINDOW": "1000000"
}
}接著在工作階段開始時執行 /effort max。
任何接受 OpenAI 相容 base URL 的工具,都能直接拿來使用。只要把 base URL 改成 https://api.gmi-serving.com/v1,模型設為 zai-org/GLM-5.2-FP8,你既有的 agent 框架、提示詞與工作流程,就完全不必更動。
GMI Cloud 也原生支援 OpenClaw 與 Hermes,如果你已經在用其中之一,需要的改動就只是換一個端點而已。
GLM-5.2 已在 GMI Cloud Model Hub 上線,模型名稱為 zai-org/GLM-5.2-FP8。FP8 量化技術,讓推論在 NVIDIA H100 與 H200 基礎設施上維持高效率,也與 40B 啟動參數的架構相互呼應。
curl --request POST \
--url https://api.gmi-serving.com/v1/chat/completions \
-H 'Content-Type: application/json' \
-H 'Authorization: Bearer YOUR_GMI_API_KEY' \
--data '{
"model": "zai-org/GLM-5.2-FP8",
"messages": [
{
"role": "system",
"content": "You are a senior full-stack software engineer."
},
{
"role": "user",
"content": "Refactor this function for performance..."
}
],
"thinking": { "type": "enabled" },
"reasoning_effort": "max",
"temperature": 1.0,
"max_tokens": 8192
}'在正式投入部署前,可以先在 Playground 中快速評估這個模型:用你真正的提示詞與程式碼庫測一遍,等吞吐量需求明朗之後,再轉往專屬端點。
要理解 GLM-5.2 的能耐,最好的方式,就是看它真的做出一個東西來。在這段示範中,我在 Kilocode 裡透過 GMI Cloud API 使用 GLM-5.2,從零開始一步步打造一款完全可互動的 3D 足球遊戲:先從簡單的 2D 俯視畫面開始,再逐步演化成一場有球員操控、傳球,以及自動 CPU 對手的 3D 巴西對阿根廷賽事。我採取的做法是刻意的:把任務拆成小而聚焦的迭代,而不是一股腦全塞進單一提示詞裡。這正是 1M token 上下文視窗真正發光的地方。它在每一步之間,都把整個專案記在腦中,所以不會有任何東西,在工作階段之間掉包遺失。
發布當時 ,r/LocalLLaMA 的討論串,把 1M 上下文視窗與兩種思考模式,列為最突出的特色,社群成員也提到,它在長週期任務上表現不俗。透過 GLM Coding Plan beta 提早取得使用權的開發者則回報,它在長週期任務執行上更穩定,也更能遵循正式等級的工程規範,並且在行動裝置與用戶端的工作流程上,處理得更好,還支援完整的裝置端除錯。
為什麼此刻這件事很重要
2026 年,開放權重模型與專有前沿模型之間的差距,已經明顯縮小。差異化的關鍵,也越來越落在取用條件上:你能在什麼基礎上開發、擁有什麼,以及能在沒有依賴風險的情況下,部署什麼。
GLM-5.2 的到來,就在美國出口管制,迫使數個前沿模型對國際使用者下線的短短幾天之後。一個 MIT 授權、1M 上下文、API 乾淨的模型,正是「當你需要一個持續可用的基礎時,該在哪裡開發」這個問題的直接答案。
對正在評估推論堆疊的 AI 工程師來說,GMI Cloud 上的 GLM-5.2,提供了此刻難以匹敵的組合:前沿等級的上下文長度、開源第一的 benchmark 表現、寬鬆的授權條件,以及對已經在使用 Claude Code,或任何 OpenAI 相容工具的團隊而言,幾乎零整合成本。
GLM-5.2 現在就在 GMI Cloud 上線。到 console 拿你的 API key,把工具指向該端點,就能立刻開始開發。推論速度快、上下文夠深,整合只要幾分鐘。
在 GMI Cloud 上試用 GLM-5.2:console.gmicloud.ai
Roan Weigert
DevRel @ GMI Cloud
GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies
