• 運算
  • 客戶
  • 價格
登入
More Blog Posts
XDiscordLinkedInYouTube

產品

  • GPU
  • MaaS
  • Studio

開發者

  • 模型總覽
  • 技術文件
  • 詞彙表

公司

  • 關於我們
  • 部落格
  • 活動
  • 合作夥伴
  • 新創計劃
  • 職涯
  • 大使計畫
  • 使命與願景

熱門模型

    掌握 AI 最新動態

    提交即表示您瞭解我們會收集並使用您提交的資訊,其中可能包含個人資訊。

    XDiscordLinkedInYouTube

    Copyright ©2026 All rights reserved.

    隱私政策使用條款法律文件
    More Blog Posts
    Announcements

    為什麼 DeepSeek 最便宜的模型,突然變成最強的那一個

    每隔幾個月,就會有一次模型發布重新洗牌開發者賴以為基礎的假設。今天這件事發生在 DeepSeek 自家的產品線裡,而勝出的是誰也沒料到的那個模型。

    2026年7月31日

    DeepSeek 今天推出 V4-Flash API 的官方公開測試版,正式脫離 preview 狀態。單就這件事來說,只是則小註腳。真正的重點在於:重新訓練後的 V4-Flash,如今在 agent benchmark 上已經超越 DeepSeek 自家的旗艦 V4-Pro,而且尺寸與成本都只有後者的一小部分。

    我們花了一個下午,把這件事拆開來看:改變了什麼、沒改變什麼,以及如果你已經在 GMI Cloud 上跑 DeepSeek,這又代表什麼。

    V4-Pro 完全維持原樣,還是 GMI Cloud 自 4 月 24 日以來提供的那個 1.6 兆參數模型,就是你已經熟悉的那一個。

    V4-Flash,則是被悄悄重新訓練過:同樣的尺寸、同樣的架構,只是多了一輪新的後訓練——如今,在每一項重要的 agent benchmark 上,都勝過了 Pro。一個數字就說完了整個故事:在 DeepSWE 上,Flash 從 7.3 跳到 54.4,進步 645%,而且沒有增加任何參數。

    數字並排比較

    Benchmark

    V4-Flash(官方版,0731)

    V4-Flash(舊 Preview)

    V4-Pro(Preview)

    Terminal Bench 2.1

    82.7

    61.8

    72.1

    DeepSWE

    54.4

    7.3

    12.8

    Toolathlon(verified)

    70.3

    49.7

    55.9

    NL2Repo

    54.2

    39.4

    38.5

    DSBench-FullStack

    68.7

    37.0

    41.8

    Flash 在這裡做到的不只是追平 Pro,而是在列出的每一個類別上都直接勝出。這也挑戰了多數評測流程默默奠基其上的那個假設:「模型愈大愈強」。

    為什麼是現在

    DeepSeek 自家的變更紀錄把這次定位為 Flash 從 preview 畢業:架構不變、重新訓練,而舊的 deepseek-chat 與 deepseek-reasoner 別名將在三個月後退場。V4-Pro 的正式(非 preview)版本仍然是「即將推出」,所以這週明顯是一次以 Flash 為先的動作。

    時間點也與市場其他動態相互呼應:這是在 OpenAI 宣布降價的隔天發布的,同一週,阿里巴巴與 MiniMax 也各自推出了更新。技術面的故事,本身就站得住腳;這個時間點,只是解釋了為什麼你的動態牆,現在滿是「AI 大新聞」的討論串。

    為什麼這是一則「能力」而非「降價」的新聞

    很容易把這件事,歸類成「變便宜了」,但價格其實完全沒動:V4-Flash 在 GMI Cloud 上的價格,維持不變,仍是每百萬 token 輸入 $0.14、輸出 $0.28。真正改變的,是每一塊錢換到的能力——而這是另一回事,需要用不同的方式去驗證。

    如果你的評測設定,遇到任何「agentic」的任務就預設丟給 Pro,這週正是拿 Flash 重新跑一次的時候:

    1. Coding agent 與終端機自動化 —— Flash 的 Terminal Bench 與 DeepSWE 分數如今直接領先 Pro,先測這一項。

    2. Tool calling 與多步驟工作流程 —— Toolathlon 與 NL2Repo 都大幅上升。用你自己的 tool schema 去驗,不要只看公開數字。

    3. 每完成一項任務的成本 —— 在每 token 價格約為 Pro 十分之一的情況下,Flash 的勝出會改變任何高流量 agent 管線的單位經濟結構。

    benchmark 表格告訴你該往哪裡看,剩下的答案在你自己的 prompt 裡。

    現在就在 GMI Cloud 上試試

    兩個模型都已上線,共用同一個與 OpenAI 相容的端點,所以切換只是改一行的事:

    from openai import OpenAI
    
    client = OpenAI(
        base_url="https://api.gmi-serving.com/v1",
        api_key="YOUR_GMI_API_KEY",
    )
    
    response = client.chat.completions.create(
        model="deepseek-ai/DeepSeek-V4-Flash-0731",
        messages=[
            {
                "role": "user",
                "content": "Find the failing test in this repo and explain the root cause."
            }
        ],
    )
    print(response.choices[0].message.content)

    想看它在真實的 coding 迴圈中運作,而不只是單次 completion?OpenCode,是搭配 V4-Flash 的好 harness,而 GMI Cloud是其中的原生 provider。直接在終端機連上你的 API key,就能在工作階段中途換模型,完全不需要改設定檔。

    還有一件事在路上

    截至今天下午,DeepSeek 仍在為 Hugging Face 準備帶 -0731 後綴的權重 repo。目前公開的 MIT 授權 repo 反映的仍是四月的 preview 世代。GMI Cloud 的線上端點跑的是 DeepSeek 的官方 API 版本,進度領先 open-weight 的發布。如果你需要的是原始權重以進行本地或專屬部署,而非 API 存取,那部分,還在路上。

    今天可以做的事

    • 在單純因為成本而預設選 Pro 之前,先拿 V4-Flash-0731 重跑一次你的 agent 與程式撰寫 benchmark

    • 追蹤「每完成一項任務的成本」,而不只是 token 價格;這兩者這週說的是完全不同的故事

    • 把 OpenCode(或你自己的 harness)指向 GMI Cloud,換模型只需要一行

    • 如果你需要的是 open weights 而非 API 存取,再給它一點時間,-0731 的 Hugging Face repo 正在路上

    開始使用

    DeepSeek-V4-Pro 與 DeepSeek-V4-Flash-0731,現在都能透過 GMI Cloud 與 OpenAI 相容的 API 使用。從 Playground 開始測試吧。

    Roan Weigert

    Roan Weigert

    DevRel @ GMI Cloud

    Build AI Without Limits

    GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies

    Ready to build?

    Explore powerful AI models and launch your project in just a few clicks.

    Get Started