更快上線。彈性擴展。一個 Prime Inference 端點。

Prime Inference 提供專屬的單一租戶 GPU、針對開源或你自有模型調校的執行環境,以及協助你從原型走到正式環境 SLA 的 GMI 工程團隊。

前往平台

H200 · B300 · Blackwell

NVIDIA 認證硬體

99.9% 可用性*

正式環境 SLA

無伺服器定價是天花板。專屬部署帶你突破它。

我們在 Prime Inference 預留 GPU 上對最新的開源模型進行了基準測試 — 於 B200、B300 與 GB200 NVL72 上採用針對每個模型調校的執行環境。在持續負載下,專屬端點以不到無伺服器(MaaS)定價一半的成本處理相同的 token 量,同時提供單一租戶隔離、無冷啟動與可預期的延遲。

~35%

專屬部署與無伺服器打平的持續使用率 — 超過之後,每個 token 都更便宜

最高 5.6 倍

滿載使用時,相較於無伺服器定價每美元可得的 token 數(DeepSeek V4 Pro)

每 100 萬輸出 token 成本 — Prime Inference vs. 無伺服器

GPU 滿載下的有效成本,輸入 8K / 輸出 1K,FP4

DeepSeek V4 Pro (1.6T)

無伺服器定價

$1.13

專屬 · B200

$0.40

Dynamo + vLLM

-56%

專屬 · GB200 NVL72

$0.20

Dynamo + SGLang, multi-node

-82%

GLM-5.1 (744B)

無伺服器定價

$0.98

專屬 · B200

$0.43

SGLang, FP4

-56%

專屬 · GB200 NVL72

$0.20

Dynamo + SGLang, multi-node

-80%

Kimi K2.7 Code

無伺服器定價*

$1.01

專屬 · H200 node**

$0.46

-54%
*
Blended, 8K in / 1K out
**
720K TPM · 43 tok/s per user

無伺服器(MaaS)定價

Prime Inference — 單一節點

Prime Inference — GB200 NVL72 橫向擴展

測試方法:每個請求輸入 8K / 輸出 1K token,FP4 精度(H200 為 FP8),滿載的預留 GPU,並排除閒置時間。專屬成本 = 在 Prime Inference 預留容量上持續滿載時,每 100 萬 token 的有效美元成本。無伺服器基準 = 同一模型的 GMI Cloud MaaS 定價;Kimi K2.7 Code 則採用公開的無伺服器定價(輸入 $0.70/M、輸出 $3.50/M)依 8K/1K 工作負載混算。Kimi K2.7 Code 的數據來自單一 8× H200 節點的實際生產部署量測。你的損益平衡點取決於流量型態 — 歡迎與我們聯繫,我們會依你實際的 token 用量進行試算。

租用 GPU,掌握吞吐量。

預留容量能直接呼應實際的正式環境流量,而針對每個模型的執行階段最佳化更會隨著時間持續累積優勢。

經過最佳化的執行階段

不是通用堆疊,而是針對每個模型最佳化的核心、排程與路由。你只需選擇模型,引擎部分交給我們處理。

預設保持暖機狀態

預留 GPU 會預先載入權重並維持暖機狀態,每一次呼叫都能立即執行 — 沒有冷啟動延遲,也沒有首個 token 的抖動。

單一租戶隔離

GPU 完全保留給你的工作負載。沒有吵雜的鄰居、沒有負載下的競用,也不會有共用方案常見的意外狀況。

可使用自己的模型

支援任何開源、微調或自有權重。可從 Hugging Face、S3 或自己的儲存空間載入,並執行於專為服務該模型而打造的執行階段上。

為你常用的模型最佳化

我們的推理工程師會持續調校最常被部署的開源模型背後的執行階段 — 當你選好模型時,核心層的最佳化工作其實已經完成。

正式環境等級的引擎

vLLM、TensorRT-LLM 與 SGLang 已依不同 GPU 等級預先調校。量化可彈性設定,多 GPU 編排也由我們處理。

把服務部署在使用者附近。

可將端點釘選在指定區域以降低首個 token 延遲,或鎖定區域以符合資料駐留要求。

亞太地區

東京 · 新加坡 · 台灣 — 服務成長最快速的 AI 市場。

北美

美國西部、東部、中部與南部 — 適合高吞吐量的正式環境流量。

歐洲

歐盟合作夥伴資料中心 — 服務具備資料駐留與法遵需求的工作負載。

順著流量擴展。

在你需要穩定效能時提供預留容量;需求突增時提供突發容量;流量下降時自動收縮。你只需為實際使用的部分付費。

可突發的容量

尖峰流量會自動被吸收,不會有排隊、不需要手動擴展,也不會在展示或產品上線時失敗。

離峰也省錢

離峰時段成本更低。容量會在不中斷進行中的請求的情況下平順縮減。

單一全球資源池

當主要區域容量達到上限時,流量可從最近的鄰近區域借用容量,維持低延遲與服務不中斷。

從構想到正式上線端點,只需四個步驟。

選好模型、選好硬體,然後部署。平台會處理模型載入、資源編排與路由 — 從選擇到實際可用的 API,整個過程只要幾分鐘。

1

選擇模型

任何開源模型、Hugging Face 上的模型,或上傳你自己的權重皆可。

2

設定組態

選擇 GPU 類型、每個複本的 GPU 數量、複本數量與目標區域。

3

部署

可從控制台、CLI 或 API 啟動。端點在幾分鐘內就會上線,不必等好幾天。

4

營運與擴展

監控延遲與吞吐量。流量增加時自動突發、減少時自動收縮。

取用你想要的模型。

一鍵部署主流開源模型 — DeepSeek、Kimi、GLM、Llama、NVIDIA 等等。從尖端 LLM 到視覺、語音與多模態 — 選好模型,就能取得正式環境端點。

DeepSeek

DeepSeek V4

deepseek-ai

Reasoning · Code
MoonshotAI

Kimi K3

moonshot-ai

1M+ Context
Z.ai

GLM 5.2

z-ai

Agentic · Tool-use
Meta

Llama 4

meta-llama

General LLM
Nvidia

Nemotron Omni

nvidia

Vision · Audio

共用推理難以應付的工作負載。

在這些正式環境流量場景中,可預期性、吞吐量與工程協作能將可運作的原型轉變為穩定可靠的產品。

程式碼代理與開發者工具

代理與輔助工具

每個任務都會有許多短請求,使用者體驗主要取決於第一次呼叫的延遲。工具呼叫必須穩定,而不只是要求快。

每個代理叢集都有穩定端點 · 暖機容量 · 展示或產品上線時也不會冷啟動。

語音合成、轉錄與對話

即時語音

語音場景無法容忍效能波動。需要持續性的 WebSocket 連線搭配暖機容量,並透過區域釘選縮短往返時間。

首位元組 TTS 低於一秒 · 串流端點 · 不會出現共用方案常見的抖動。

規模化 RAG 與聊天服務

高吞吐

以硬體可承受的吞吐量支撐每日數百萬次查詢,並在長上下文工作負載中維持一致的尾端延遲。

KV-cache 已最佳化 · P95/P99 可控 · 沒有共用資源池的競用。

私有與符合法遵的部署

受規範產業

提供隔離的執行階段、稽核日誌與不留存的服務模式。可區域鎖定,適用於金融、醫療與公部門。

支援歐盟資料駐留 · 單一租戶隔離 · 企業級 SLA。

依任務選擇合適的 GPU。

Hopper、Hopper-refresh、Blackwell 與 Blackwell Ultra — 可依記憶體需求、上下文長度或前沿效能需求做選擇。

H100

H100

Hopper · 基準款

記憶體
80 GB HBM3
推理效能
1.0×(基準)

主力款 GPU,適合一般 LLM 與多模態推理,是大多數正式環境工作負載的起點。

H200

H200

Hopper 改版

記憶體
141 GB HBM3e
推理效能
記憶體與頻寬約 1.4×

適合記憶體密集型工作負載 — 長上下文、大型 KV-cache、大批次處理。

B200

B200

Blackwell · 前沿款

記憶體
192 GB HBM3e
推理效能
FP4 下最高約 2.5×

適合前沿模型、FP4 推理與最高吞吐量需求,是對效能要求極高工作負載的首選。

B300

B300

Blackwell Ultra · 前沿加強款

記憶體
288 GB HBM3e
推理效能
FP4 下最高約 4×(約 B200 的 1.5 倍)

單張 GPU 記憶體最大,專為兆級參數模型、超長上下文與最高吞吐量的 FP4 推理打造 — 當 B200 還不夠時的選擇。

領先 AI 團隊的共同選擇

PRIME INFERENCE · 專屬

適合持續的正式環境規模流量

  • 預留的單一租戶 GPU — 沒有吵鬧鄰居,也沒有冷啟動

  • 針對每個模型調校的執行環境:每張 GPU 最高 500K TPM(每分鐘 token 數)

  • 使用率越高,每個 token 的成本越低 — 每美元最多可得 5.6 倍的 token

  • 99.9%* 可用性 SLA,延遲可預期

  • 支援自訂與微調模型部署

  • 多區域**:APAC、北美、歐洲

無伺服器 (MAAS)

適合尖峰波動或早期階段的工作負載

  • 依 token 計費,無需承諾用量

  • 即開即用 — 適合原型開發與評估

  • 共用容量:吞吐量與延遲會隨平台負載變動

  • 無論擴展到多大規模,定價都維持不變

  • 持續使用率超過 ~35-45% 之後,會比專屬部署更貴

  • * 可用性 SLA 取決於 GPU 系列與部署配置。實際承諾的 SLA 依合約而異 — 多數正式環境部署落在 99.9% 的範圍。
  • ** 為目前提供的區域。若你的工作負載需要特定區域,我們可視容量情況個案評估。

FAQ

常見問題

等你準備好,我們隨時可以開始。

從控制台啟動 Prime Inference 端點 — 或聯絡銷售團隊,瞭解預留容量、客製化調校與試用額度。

前往平台