• 運算
  • 客戶
  • 價格
登入
More Blog Posts
XDiscordLinkedInYouTube

產品

  • GPU
  • MaaS
  • Studio

開發者

  • 模型總覽
  • 技術文件
  • 詞彙表

公司

  • 關於我們
  • 部落格
  • 活動
  • 合作夥伴
  • 新創計劃
  • 職涯
  • 大使計畫
  • 使命與願景

熱門模型

    掌握 AI 最新動態

    提交即表示您瞭解我們會收集並使用您提交的資訊,其中可能包含個人資訊。

    XDiscordLinkedInYouTube

    Copyright ©2026 All rights reserved.

    隱私政策使用條款法律文件
    More Blog Posts
    Announcements

    跑起來像 20B 的 295B AI 模型:Hy3 改變了一切

    騰訊的 Hy3 已於 7 月 6 日正式上線。這是一款 Apache 2.0 授權的 295B MoE 模型(啟動參數 21B),支援 256K 上下文,且在 agent benchmark 上名列前茅,現在可直接部署在 GMI Cloud 上。

    2026年7月07日

    Hy3 是什麼?

    Hy3 是騰訊混元團隊最新的模型。它採用 Mixture-of-Experts 架構,總參數 2,950 億、共 192 個專家,每個 token 啟動其中 8 個。這讓推論時只需啟動 21B 參數,在運算量與智慧表現之間取得更好的平衡。

    此模型支援 256K token 的上下文視窗,並內建一個 3.8B 參數的 multi-token prediction 層來加速解碼。騰訊以 Apache 2.0 授權釋出 Hy3,允許商業部署、代管服務與自訂微調。

    繼 2026 年 4 月推出預覽版之後,完整的 GA 版本已在 2026 年 7 月 6 日上線,內容納入了擴充後的後訓練資料、規模化的強化學習,以及來自騰訊超過 50 個產品團隊的回饋。

    關鍵規格一覽:

    項目

    內容

    架構

    MoE,192 個專家,top-8 路由

    總參數量

    295B

    每 token 啟動參數

    21B

    上下文視窗

    256K token

    MTP 層

    3.8B 參數

    推理模式

    no_think、low、high

    授權

    Apache 2.0

    精度

    BF16,另有 FP8 版本

    架構細節

    Hy3 採用 80 層 transformer、64 個 attention head,並使用 8 個 KV head 的 grouped query attention;hidden size 為 4096,intermediate size 為 13,312。

    MoE 設計讓實際運算需求落在 20B 等級模型的水準,而較大的總參數量則支撐複雜工作流程所需的推理能力。騰訊在 BF16 權重之外也提供 FP8 版本,讓部署團隊在多 GPU 服務堆疊上有另一種管理記憶體效率與吞吐量的選擇。

    MoE 設計讓實際運算需求維持在 20B 等級模型的水準,而較大的總參數量,則能支撐複雜工作流程所需的推理能力。

    預覽版 vs. GA 版更新

    4 月的預覽版,是騰訊重建訓練基礎設施後推出的第一個版本;這次的 GA 版本,則聚焦在穩定性、benchmark 表現,以及 agent 可靠度上。

    GA 版本中可量測的改進包括:

    根據騰訊公布的一項盲測評估,270 位領域專家參與評分,Hy3 在 4 分制中拿下 2.67 分,GLM-5.1 則為 2.51 分。主要的效能提升,出現在前端開發、資料與儲存任務,以及 CI/CD 作業上。

    Benchmark 表現

    Hy3 在程式撰寫、推理與 agent 工作負載上都做了評測。GA 版本公布的分數如下:

    Benchmark

    分數

    SWE-Bench Verified

    78.0

    SWE-Bench Pro

    57.9

    GPQA Diamond

    90.4

    WildClawBench

    53.6

    HLE

    53.2

    SkillsBench v1.1

    55.3

    Apex Agents

    25.6

    對 agent 系統來說,WildClawBench 與 SkillsBench 量測的是多步驟任務執行與開放式行為的表現,這類指標比單輪評測更貼近實際的正式工作流程。

    使用情況與採用度

    預覽版推出兩週內,Hy3 在 OpenRouter 上處理了 3.66 兆個 token,週增幅高達 298%。其中 token 消耗量最高的應用包括 Hermes Agent、Claude Code、Kilo Code、OpenClaw 與 Cline,顯示 Hy3 的採用者主要集中在程式 agent 與任務執行平台上。

    開發者回報的應用場景重點包括:

    • 長脈絡工作流程中的指令遵循

    • 透過 API 參數控制的可調推理深度

    • 跨不同 agent 框架的一致工具呼叫

    • 儲存庫分析、程式碼生成與結構化萃取

    騰訊表示,預覽版推出後,每日 token 消耗量成長了 20 倍;在內部 WorkBuddy 工具中,選用 Hy3 的使用者數量也成長了 6 倍。

    前端生成與成本效率

    GMI Cloud 團隊在最近一次發表於 X 上的評測中,讓 Hy3 與 GLM-5.2、GLM-5.1 及 DeepSeek V4 同場較勁,測試前端程式碼生成能力。結果顯示,在三組不同的網頁設計提示詞下,Hy3 的視覺輸出品質勝過 GLM-5.1 與 DeepSeek V4。

    除了視覺表現之外,Hy3 在推論成本上也明顯更有優勢。同一組測試顯示,Hy3 的成本大約只有 GLM 5.x 系列的一半,與 DeepSeek V4 同樣走高效率的價格路線。對於打造 UI 生成器、或想把前端設計流程自動化的團隊來說,Hy3 等於是一個能提供高階視覺設計邏輯、卻不用付出高階價格的開源模型選擇。

    效能數據

    根據 Artificial Analysis 的量測,GMI Cloud 在 Hy3 預覽版上的輸出吞吐量為每秒 171.4 個 token,SiliconFlow 則為每秒 175.5 個 token。

    服務商

    輸出速度

    支援 function calling

    支援 JSON 模式

    SiliconFlow

    175.5 t/s

    是

    是

    GMI Cloud

    171.4 t/s

    是

    是

    GMI Cloud 為 Hy3 支援 function calling 與結構化 JSON 輸出,這是把模型輸出整合進外部工具與 API 的必要功能。

    在 GMI Cloud 上執行 Hy3

    GMI Cloud 是 Hy3 經過 benchmark 驗證的推論服務商。API 為 OpenAI 相容,只需更新 base URL 與 API key 即可。

    基本 chat completion

    import openai
    
    client = openai.OpenAI(
    api_key="YOUR_GMI_API_KEY",
    base_url="https://api.gmi-serving.com/v1"
    )
    
    response = client.chat.completions.create(
    model="tencent/Hy3",
    messages=[
    {"role": "user", "content": "Explain how MoE routing works in transformer models."}
    ],
    )
    
    print(response.choices[0].message.content)

    控制推理深度

    Hy3 提供三種推理模式。一般任務使用 no_think,程式或邏輯類工作負載使用 high。

    response = client.chat.completions.create(
    model="tencent/Hy3",
    messages=[
    {"role": "user", "content": "Solve this integral step by step."}
    ],
    extra_body={
    "reasoning": {"enabled": True, "effort": "high"}
    }
    )

    若要關閉推理,只要省略 reasoning 欄位即可:

    messages = [
    {"role": "user", "content": "Summarize this document in 3 bullets."}
    ]
    
    response = client.chat.completions.create(
    model="tencent/Hy3",
    messages=messages,
    )

    長脈絡儲存庫分析

    import openai
    
    client = openai.OpenAI(
    api_key="YOUR_GMI_API_KEY",
    base_url="https://api.gmi-serving.com/v1"
    )
    
    with open("repo_dump.txt", "r") as f:
    codebase = f.read()
    
    response = client.chat.completions.create(
    model="tencent/Hy3",
    messages=[
    {
    "role": "user",
    "content": f"Here is the full repository:\n\n{codebase}\n\nFind all SQL injection vulnerabilities and suggest fixes."
    }
    ],
    max_tokens=4096,
    )
    
    print(response.choices[0].message.content)

    256K 的上下文視窗,讓 Hy3 每次請求能處理約 20 萬字的程式碼或文件,可以支援完整的儲存庫審查,不必再採用切塊策略。

    在 GMI GPU 叢集上自架 Hy3

    需要專屬基礎設施的團隊,可以在 GMI Cloud 的 GPU 叢集上自架 Hy3。騰訊同時提供 vLLM 與 SGLang 的部署設定。

    建議的部署規格:

    • 硬體:8 張 H100 或 H200 GPU

    • 服務框架:vLLM 或 SGLang

    • 精度:標準部署用 BF16,高吞吐量調校用 FP8

    由於啟動參數只有 21B,Hy3 在服務時所需的硬體,會比同等總參數量的密集模型來得少。GPU 供應與設定資訊請見 console.gmicloud.ai。

    部署連結

    • Serverless API:console.gmicloud.ai

    • 模型目錄:gmicloud.ai/en/models

    • GPU 基礎設施:gmicloud.ai/en/gpus

    • 模型權重:huggingface.co/tencent/Hy3

    • API 文件:docs.gmicloud.ai

    • 社群支援:discord.gg/mbYhCJSbF6

    Roan Weigert

    Roan Weigert

    DevRel @ GMI Cloud

    Build AI Without Limits

    GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies

    Ready to build?

    Explore powerful AI models and launch your project in just a few clicks.

    Get Started