騰訊的 Hy3 已於 7 月 6 日正式上線。這是一款 Apache 2.0 授權的 295B MoE 模型(啟動參數 21B),支援 256K 上下文,且在 agent benchmark 上名列前茅,現在可直接部署在 GMI Cloud 上。
2026年7月07日

Hy3 是騰訊混元團隊最新的模型。它採用 Mixture-of-Experts 架構,總參數 2,950 億、共 192 個專家,每個 token 啟動其中 8 個。這讓推論時只需啟動 21B 參數,在運算量與智慧表現之間取得更好的平衡。
此模型支援 256K token 的上下文視窗,並內建一個 3.8B 參數的 multi-token prediction 層來加速解碼。騰訊以 Apache 2.0 授權釋出 Hy3,允許商業部署、代管服務與自訂微調。
繼 2026 年 4 月推出預覽版之後,完整的 GA 版本已在 2026 年 7 月 6 日上線,內容納入了擴充後的後訓練資料、規模化的強化學習,以及來自騰訊超過 50 個產品團隊的回饋。
關鍵規格一覽:
項目 | 內容 |
|---|---|
架構 | MoE,192 個專家,top-8 路由 |
總參數量 | 295B |
每 token 啟動參數 | 21B |
上下文視窗 | 256K token |
MTP 層 | 3.8B 參數 |
推理模式 |
|
授權 | Apache 2.0 |
精度 | BF16,另有 FP8 版本 |
Hy3 採用 80 層 transformer、64 個 attention head,並使用 8 個 KV head 的 grouped query attention;hidden size 為 4096,intermediate size 為 13,312。
MoE 設計讓實際運算需求落在 20B 等級模型的水準,而較大的總參數量則支撐複雜工作流程所需的推理能力。騰訊在 BF16 權重之外也提供 FP8 版本,讓部署團隊在多 GPU 服務堆疊上有另一種管理記憶體效率與吞吐量的選擇。
MoE 設計讓實際運算需求維持在 20B 等級模型的水準,而較大的總參數量,則能支撐複雜工作流程所需的推理能力。
4 月的預覽版,是騰訊重建訓練基礎設施後推出的第一個版本;這次的 GA 版本,則聚焦在穩定性、benchmark 表現,以及 agent 可靠度上。
GA 版本中可量測的改進包括:

根據騰訊公布的一項盲測評估,270 位領域專家參與評分,Hy3 在 4 分制中拿下 2.67 分,GLM-5.1 則為 2.51 分。主要的效能提升,出現在前端開發、資料與儲存任務,以及 CI/CD 作業上。
Hy3 在程式撰寫、推理與 agent 工作負載上都做了評測。GA 版本公布的分數如下:

Benchmark | 分數 |
|---|---|
SWE-Bench Verified | 78.0 |
SWE-Bench Pro | 57.9 |
GPQA Diamond | 90.4 |
WildClawBench | 53.6 |
HLE | 53.2 |
SkillsBench v1.1 | 55.3 |
Apex Agents | 25.6 |
對 agent 系統來說,WildClawBench 與 SkillsBench 量測的是多步驟任務執行與開放式行為的表現,這類指標比單輪評測更貼近實際的正式工作流程。
預覽版推出兩週內,Hy3 在 OpenRouter 上處理了 3.66 兆個 token,週增幅高達 298%。其中 token 消耗量最高的應用包括 Hermes Agent、Claude Code、Kilo Code、OpenClaw 與 Cline,顯示 Hy3 的採用者主要集中在程式 agent 與任務執行平台上。
開發者回報的應用場景重點包括:
長脈絡工作流程中的指令遵循
透過 API 參數控制的可調推理深度
跨不同 agent 框架的一致工具呼叫
儲存庫分析、程式碼生成與結構化萃取
騰訊表示,預覽版推出後,每日 token 消耗量成長了 20 倍;在內部 WorkBuddy 工具中,選用 Hy3 的使用者數量也成長了 6 倍。
GMI Cloud 團隊在最近一次發表於 X 上的評測中,讓 Hy3 與 GLM-5.2、GLM-5.1 及 DeepSeek V4 同場較勁,測試前端程式碼生成能力。結果顯示,在三組不同的網頁設計提示詞下,Hy3 的視覺輸出品質勝過 GLM-5.1 與 DeepSeek V4。
除了視覺表現之外,Hy3 在推論成本上也明顯更有優勢。同一組測試顯示,Hy3 的成本大約只有 GLM 5.x 系列的一半,與 DeepSeek V4 同樣走高效率的價格路線。對於打造 UI 生成器、或想把前端設計流程自動化的團隊來說,Hy3 等於是一個能提供高階視覺設計邏輯、卻不用付出高階價格的開源模型選擇。
根據 Artificial Analysis 的量測,GMI Cloud 在 Hy3 預覽版上的輸出吞吐量為每秒 171.4 個 token,SiliconFlow 則為每秒 175.5 個 token。
服務商 | 輸出速度 | 支援 function calling | 支援 JSON 模式 |
|---|---|---|---|
SiliconFlow | 175.5 t/s | 是 | 是 |
GMI Cloud | 171.4 t/s | 是 | 是 |
GMI Cloud 為 Hy3 支援 function calling 與結構化 JSON 輸出,這是把模型輸出整合進外部工具與 API 的必要功能。
GMI Cloud 是 Hy3 經過 benchmark 驗證的推論服務商。API 為 OpenAI 相容,只需更新 base URL 與 API key 即可。
import openai
client = openai.OpenAI(
api_key="YOUR_GMI_API_KEY",
base_url="https://api.gmi-serving.com/v1"
)
response = client.chat.completions.create(
model="tencent/Hy3",
messages=[
{"role": "user", "content": "Explain how MoE routing works in transformer models."}
],
)
print(response.choices[0].message.content)Hy3 提供三種推理模式。一般任務使用 no_think,程式或邏輯類工作負載使用 high。
response = client.chat.completions.create(
model="tencent/Hy3",
messages=[
{"role": "user", "content": "Solve this integral step by step."}
],
extra_body={
"reasoning": {"enabled": True, "effort": "high"}
}
)若要關閉推理,只要省略 reasoning 欄位即可:
messages = [
{"role": "user", "content": "Summarize this document in 3 bullets."}
]
response = client.chat.completions.create(
model="tencent/Hy3",
messages=messages,
)import openai
client = openai.OpenAI(
api_key="YOUR_GMI_API_KEY",
base_url="https://api.gmi-serving.com/v1"
)
with open("repo_dump.txt", "r") as f:
codebase = f.read()
response = client.chat.completions.create(
model="tencent/Hy3",
messages=[
{
"role": "user",
"content": f"Here is the full repository:\n\n{codebase}\n\nFind all SQL injection vulnerabilities and suggest fixes."
}
],
max_tokens=4096,
)
print(response.choices[0].message.content)256K 的上下文視窗,讓 Hy3 每次請求能處理約 20 萬字的程式碼或文件,可以支援完整的儲存庫審查,不必再採用切塊策略。
需要專屬基礎設施的團隊,可以在 GMI Cloud 的 GPU 叢集上自架 Hy3。騰訊同時提供 vLLM 與 SGLang 的部署設定。
建議的部署規格:
硬體:8 張 H100 或 H200 GPU
服務框架:vLLM 或 SGLang
精度:標準部署用 BF16,高吞吐量調校用 FP8
由於啟動參數只有 21B,Hy3 在服務時所需的硬體,會比同等總參數量的密集模型來得少。GPU 供應與設定資訊請見 console.gmicloud.ai。
Serverless API:console.gmicloud.ai
GPU 基礎設施:gmicloud.ai/en/gpus
API 文件:docs.gmicloud.ai
Roan Weigert
DevRel @ GMI Cloud
GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies
