每隔幾個月,就會有一次模型發布重新洗牌開發者賴以為基礎的假設。今天這件事發生在 DeepSeek 自家的產品線裡,而勝出的是誰也沒料到的那個模型。
2026年7月31日

DeepSeek 今天推出 V4-Flash API 的官方公開測試版,正式脫離 preview 狀態。單就這件事來說,只是則小註腳。真正的重點在於:重新訓練後的 V4-Flash,如今在 agent benchmark 上已經超越 DeepSeek 自家的旗艦 V4-Pro,而且尺寸與成本都只有後者的一小部分。
我們花了一個下午,把這件事拆開來看:改變了什麼、沒改變什麼,以及如果你已經在 GMI Cloud 上跑 DeepSeek,這又代表什麼。
V4-Pro 完全維持原樣,還是 GMI Cloud 自 4 月 24 日以來提供的那個 1.6 兆參數模型,就是你已經熟悉的那一個。
V4-Flash,則是被悄悄重新訓練過:同樣的尺寸、同樣的架構,只是多了一輪新的後訓練——如今,在每一項重要的 agent benchmark 上,都勝過了 Pro。一個數字就說完了整個故事:在 DeepSWE 上,Flash 從 7.3 跳到 54.4,進步 645%,而且沒有增加任何參數。
Benchmark | V4-Flash(官方版,0731) | V4-Flash(舊 Preview) | V4-Pro(Preview) |
|---|---|---|---|
Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
DeepSWE | 54.4 | 7.3 | 12.8 |
Toolathlon(verified) | 70.3 | 49.7 | 55.9 |
NL2Repo | 54.2 | 39.4 | 38.5 |
DSBench-FullStack | 68.7 | 37.0 | 41.8 |
Flash 在這裡做到的不只是追平 Pro,而是在列出的每一個類別上都直接勝出。這也挑戰了多數評測流程默默奠基其上的那個假設:「模型愈大愈強」。
DeepSeek 自家的變更紀錄把這次定位為 Flash 從 preview 畢業:架構不變、重新訓練,而舊的 deepseek-chat 與 deepseek-reasoner 別名將在三個月後退場。V4-Pro 的正式(非 preview)版本仍然是「即將推出」,所以這週明顯是一次以 Flash 為先的動作。
時間點也與市場其他動態相互呼應:這是在 OpenAI 宣布降價的隔天發布的,同一週,阿里巴巴與 MiniMax 也各自推出了更新。技術面的故事,本身就站得住腳;這個時間點,只是解釋了為什麼你的動態牆,現在滿是「AI 大新聞」的討論串。

很容易把這件事,歸類成「變便宜了」,但價格其實完全沒動:V4-Flash 在 GMI Cloud 上的價格,維持不變,仍是每百萬 token 輸入 $0.14、輸出 $0.28。真正改變的,是每一塊錢換到的能力——而這是另一回事,需要用不同的方式去驗證。
如果你的評測設定,遇到任何「agentic」的任務就預設丟給 Pro,這週正是拿 Flash 重新跑一次的時候:
Coding agent 與終端機自動化 —— Flash 的 Terminal Bench 與 DeepSWE 分數如今直接領先 Pro,先測這一項。
Tool calling 與多步驟工作流程 —— Toolathlon 與 NL2Repo 都大幅上升。用你自己的 tool schema 去驗,不要只看公開數字。
每完成一項任務的成本 —— 在每 token 價格約為 Pro 十分之一的情況下,Flash 的勝出會改變任何高流量 agent 管線的單位經濟結構。
benchmark 表格告訴你該往哪裡看,剩下的答案在你自己的 prompt 裡。
兩個模型都已上線,共用同一個與 OpenAI 相容的端點,所以切換只是改一行的事:
from openai import OpenAI
client = OpenAI(
base_url="https://api.gmi-serving.com/v1",
api_key="YOUR_GMI_API_KEY",
)
response = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V4-Flash-0731",
messages=[
{
"role": "user",
"content": "Find the failing test in this repo and explain the root cause."
}
],
)
print(response.choices[0].message.content)想看它在真實的 coding 迴圈中運作,而不只是單次 completion?OpenCode,是搭配 V4-Flash 的好 harness,而 GMI Cloud是其中的原生 provider。直接在終端機連上你的 API key,就能在工作階段中途換模型,完全不需要改設定檔。
截至今天下午,DeepSeek 仍在為 Hugging Face 準備帶 -0731 後綴的權重 repo。目前公開的 MIT 授權 repo 反映的仍是四月的 preview 世代。GMI Cloud 的線上端點跑的是 DeepSeek 的官方 API 版本,進度領先 open-weight 的發布。如果你需要的是原始權重以進行本地或專屬部署,而非 API 存取,那部分,還在路上。
在單純因為成本而預設選 Pro 之前,先拿 V4-Flash-0731 重跑一次你的 agent 與程式撰寫 benchmark
追蹤「每完成一項任務的成本」,而不只是 token 價格;這兩者這週說的是完全不同的故事
把 OpenCode(或你自己的 harness)指向 GMI Cloud,換模型只需要一行
如果你需要的是 open weights 而非 API 存取,再給它一點時間,-0731 的 Hugging Face repo 正在路上
DeepSeek-V4-Pro 與 DeepSeek-V4-Flash-0731,現在都能透過 GMI Cloud 與 OpenAI 相容的 API 使用。從 Playground 開始測試吧。
Roan Weigert
DevRel @ GMI Cloud
GMI Cloud helps you architect, deploy, optimize, and scale your AI strategies
