Kimi K3 自托管成本很高
Kimi K3 自托管至少要 8 张高端 GPU。對單個重度使用者來說,API 可能比自己租機器便宜約 40 倍。

Kimi K3 自托管至少要 8 張高端 GPU。對單個重度使用者來說,API 可能比自己租機器便宜約 40 倍。
Kimi K3 把一個老問題攤開了。模型很大,部署就不再只是軟體問題,而是伺服器和預算問題。這次的數字很直接,2.8 兆參數、約 1.4 TB 權重,單卡根本不用想。
更有意思的是,這篇分析把「能跑」和「划算」分得很清楚。對大多數團隊來說,按 Token 計費的 API 還是更省事。只有高併發、長時間滿載,或資料控制要求很高時,自托管才開始有談判空間。
| 指標 | 數值 | 意義 |
|---|---|---|
| 總參數 | 2.8 兆 | Kimi K3 的模型規模 |
| 推理激活參數 | 約 1040 億 | 每次請求實際參與計算的參數 |
| 4 位權重內存 | 約 1.4 TB | 只算模型權重的容量 |
| H100 80GB | 約 19 張 | 按基礎容量粗算 |
| H200 141GB | 約 11 張 | 按基礎容量粗算 |
| 官方 API 價格 | 輸入 $3 / 百萬 Token,輸出 $15 / 百萬 Token | 按量付費基準 |
| 8 張 MI350X 節點 | 約 $38 / 小時 | 原生 FP4 自托管的低門檻方案之一 |
Kimi K3 不是單卡模型
訂閱 AI 趨勢週報
每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。
不會寄垃圾信,隨時可取消。
Moonshot AI 的 Kimi K3 用的是 MoE 架構。它有 896 個專家,但每個 Token 只會激活其中 16 個,再加 2 個共享專家。這讓推理效率比全量激活模型好很多。

但效率高,不代表部署就輕鬆。文章裡的算法很直白,2.8 兆參數乘以 4 位,再除以 8,得到約 1.4 TB。這還只是權重,不含 KV cache、激活值和框架開銷。
把這些都加上去,單次請求接近 1.5 TB 的記憶體需求。這種量級下,單卡方案直接出局。即使是 NVIDIA H100 80GB,也要接近 19 張;NVIDIA H200 141GB 也要約 11 張。
- 2.8 兆參數,規模已經是資料中心等級。
- 4 位權重約 1.4 TB,只算模型本體。
- H100 80GB 約要 19 張,H200 141GB 約要 11 張。
- 真正要看的,是整套推理集群成本。
4 位權重沒讓部署變簡單
Kimi K3 的 4 位不是事後壓縮。它採用原生 MXFP4,還搭配量化感知訓練。這代表模型在訓練時就把量化誤差算進去了。
這種做法的好處很實際。模型在 4 位條件下學會怎麼工作,推理時就不必靠事後補救。對大型模型來說,這比單純把權重壓小更穩。
但硬體支援還是關卡。若 GPU 不支援原生 FP4,系統就得在執行時反量化,速度會打折。文章也提到,Hopper 和 AMD MI300X 雖然能載入 4 位權重,但不如直接用原生 MXFP4 的新卡省心。
“Kimi K3 由 Moonshot AI 於 2026 年 7 月發布,是截至目前規模最大的開放權重模型。”
這句話很直接,也點出一個現實。模型越大,部署越像基礎建設,不像一般 API 串接。開發者真正該算的,是每次呼叫要燒多少算力。
另外,Kimi K3 還用到 KDA,也就是 Kimi Delta Attention。它把注意力狀態固定下來,最多可把 KV cache 壓到原本的約 25%。這對長上下文很有用,但也讓前綴快取不能直接照搬。
自托管門檻比表面更高
vLLM 團隊給的部署建議很明確,較直接的方案是 8 張 AMD MI355X 或 8 張 NVIDIA B300,張量並行設為 8。這不是玩具級配置,已經是資料中心採購等級。

這裡還有一個工程現實。張量並行通常更適合 2、4、8 這類配置,6 張卡在排程和互聯上都很尷尬。雲端供應商也常常按整節點賣,不會剛好賣你 6 張。
所以就算理論上 6 張卡能塞下,實務上你還是很可能得買 8 張。這就是大型模型部署最煩的地方,算式看起來很乾淨,採購單卻很髒。
- 官方建議是 8 張 B300 或 8 張 MI355X。
- 張量並行更適合 2、4、8,不太適合 6。
- KDA 最多可減少約 75% 的 KV cache 佔用。
- 要跑得順,通常得搭配較新的 vLLM 版本。
API 和自托管差多少
價格是最容易下判斷的地方。Kimi K3 官方 API 的價格是,輸入每百萬 Token 3 美元,輸出每百萬 Token 15 美元,快取輸入每百萬 Token 0.30 美元。DigitalOcean 的無伺服器推理也給出相同定價。
自托管這邊,文章算的是一個原生 FP4 節點大約由 8 張 MI350X 組成,每張 GPU 每小時約 4.76 美元,整機約 38 美元每小時。若長期預留,一台 GPU Droplet 每月大約 27,800 美元。
最關鍵的是盈虧平衡點。要讓無伺服器推理追平這台節點,每月大約要消耗 18 億個輸出 Token,換算成持續輸出,約 700 Token / 秒。一般單路請求通常只有每秒幾十個 Token,很難碰到這個量級。
- 官方 API:輸入 $3 / 百萬 Token,輸出 $15 / 百萬 Token。
- 8 張 MI350X 節點:約 $38 / 小時。
- 長期預留 GPU Droplet:約 $27,800 / 月。
- 追平成本:約 18 億個輸出 Token / 月,約 700 Token / 秒。
所以單個重度使用者用 API,可能比自己租 GPU 便宜約 40 倍。這個差距很殘酷,但也很正常。只要用量沒有穩定到把機器吃滿,自托管就會被固定成本拖住。
什麼情況該自己部署
如果你在做原型、內部測試,或流量很不穩,API 幾乎一定更划算。你不用先買 8 張高階 GPU,也不用處理驅動、映像檔、張量並行和推理框架升級。
如果你有穩定高併發、長上下文、多使用者持續在線,或者資料駐留要求很嚴,自托管才有機會回本。這時候你買的不是模型,而是控制權和穩定性。
文章也提醒了一點,很多第三方推理服務商並不會存儲推理資料。所以「一定要自己托管才安全」這句話,很多時候只是情緒,不是事實。
另外,Kimi K3 用的是定制授權,不是 Apache 或 MIT。它允許使用、修改、微調、部署、分發和商業化,但對某些超大規模模型服務和超大商業產品有額外條件。產品要上線前,法務最好先看過。
這篇文章真正提醒了什麼
Kimi K3 的技術門檻已經低到可以公開使用,經濟門檻卻還很高。這種落差會直接影響產品設計,因為很多團隊最後會發現,最便宜的方案其實是先用 API。
我覺得接下來值得觀察的,是原生 FP4 硬體會不會更普及,以及推理框架會不會更快支援 KDA 這類定制結構。只要硬體和框架成熟,這種大模型的部署成本才會真的往下掉。
如果你現在就在評估 Kimi K3,我的建議很簡單:先算月 Token,再算 GPU 月租。只要你的用量還沒高到能把 8 張卡吃滿,先調 API 會比較務實。