[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-kimi-k3-gpu-api-cost-comparison-zh":3,"article-related-kimi-k3-gpu-api-cost-comparison-zh":32,"series-industry-fa5bffe8-c724-42ba-bbe5-94591fb9e766":77},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":25,"views":29,"created_at":30,"published_at":31,"topic_cluster_id":11},"fa5bffe8-c724-42ba-bbe5-94591fb9e766","kimi-k3-gpu-api-cost-comparison-zh","Kimi K3 自托管成本很高","\u003Cp data-speakable=\"summary\">Kimi K3 自托管至少要 8 張高端 GPU。對單個重度使用者來說，\u003Ca href=\"\u002Ftag\u002Fapi\">API\u003C\u002Fa> 可能比自己租機器便宜約 40 倍。\u003C\u002Fp>\u003Cp>Kimi K3 把一個老問題攤開了。模型很大，部署就不再只是軟體問題，而是伺服器和預算問題。這次的數字很直接，2.8 兆參數、約 1.4 TB 權重，單卡根本不用想。\u003C\u002Fp>\u003Cp>更有意思的是，這篇分析把「能跑」和「划算」分得很清楚。對大多數團隊來說，按 \u003Ca href=\"\u002Ftag\u002Ftoken\">Token\u003C\u002Fa> 計費的 API 還是更省事。只有高併發、長時間滿載，或資料控制要求很高時，自托管才開始有談判空間。\u003C\u002Fp>\u003Ctable>\u003Cthead>\u003Ctr>\u003Cth>指標\u003C\u002Fth>\u003Cth>數值\u003C\u002Fth>\u003Cth>意義\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd>總參數\u003C\u002Ftd>\u003Ctd>2.8 兆\u003C\u002Ftd>\u003Ctd>Kimi K3 的模型規模\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>推理激活參數\u003C\u002Ftd>\u003Ctd>約 1040 億\u003C\u002Ftd>\u003Ctd>每次請求實際參與計算的參數\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>4 位權重內存\u003C\u002Ftd>\u003Ctd>約 1.4 TB\u003C\u002Ftd>\u003Ctd>只算模型權重的容量\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>H100 80GB\u003C\u002Ftd>\u003Ctd>約 19 張\u003C\u002Ftd>\u003Ctd>按基礎容量粗算\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>H200 141GB\u003C\u002Ftd>\u003Ctd>約 11 張\u003C\u002Ftd>\u003Ctd>按基礎容量粗算\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>官方 API 價格\u003C\u002Ftd>\u003Ctd>輸入 $3 \u002F 百萬 Token，輸出 $15 \u002F 百萬 Token\u003C\u002Ftd>\u003Ctd>按量付費基準\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>8 張 MI350X 節點\u003C\u002Ftd>\u003Ctd>約 $38 \u002F 小時\u003C\u002Ftd>\u003Ctd>原生 FP4 自托管的低門檻方案之一\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Ch2>Kimi K3 不是單卡模型\u003C\u002Fh2>\u003Cp>\u003Ca href=\"https:\u002F\u002Fmoonshot.ai\" target=\"_blank\" rel=\"noopener\">Moonshot AI\u003C\u002Fa> 的 Kimi K3 用的是 MoE 架構。它有 896 個專家，但每個 Token 只會激活其中 16 個，再加 2 個共享專家。這讓推理效率比全量激活模型好很多。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786323790394-kbfm.png\" alt=\"Kimi K3 自托管成本很高\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>但效率高，不代表部署就輕鬆。文章裡的算法很直白，2.8 兆參數乘以 4 位，再除以 8，得到約 1.4 TB。這還只是權重，不含 \u003Ca href=\"\u002Ftag\u002Fkv-cache\">KV cache\u003C\u002Fa>、激活值和框架開銷。\u003C\u002Fp>\u003Cp>把這些都加上去，單次請求接近 1.5 TB 的記憶體需求。這種量級下，單卡方案直接出局。即使是 \u003Ca href=\"https:\u002F\u002Fwww.nvidia.com\u002Fen-us\u002Fdata-center\u002Fh100\u002F\" target=\"_blank\" rel=\"noopener\">NVIDIA H100\u003C\u002Fa> 80GB，也要接近 19 張；\u003Ca href=\"https:\u002F\u002Fwww.nvidia.com\u002Fen-us\u002Fdata-center\u002Fh200\u002F\" target=\"_blank\" rel=\"noopener\">NVIDIA H200\u003C\u002Fa> 141GB 也要約 11 張。\u003C\u002Fp>\u003Cul>\u003Cli>2.8 兆參數，規模已經是資料中心等級。\u003C\u002Fli>\u003Cli>4 位權重約 1.4 TB，只算模型本體。\u003C\u002Fli>\u003Cli>H100 80GB 約要 19 張，H200 141GB 約要 11 張。\u003C\u002Fli>\u003Cli>真正要看的，是整套推理集群成本。\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>4 位權重沒讓部署變簡單\u003C\u002Fh2>\u003Cp>Kimi K3 的 4 位不是事後壓縮。它採用原生 MXFP4，還搭配量化感知訓練。這代表模型在訓練時就把量化誤差算進去了。\u003C\u002Fp>\u003Cp>這種做法的好處很實際。模型在 4 位條件下學會怎麼工作，推理時就不必靠事後補救。對大型模型來說，這比單純把權重壓小更穩。\u003C\u002Fp>\u003Cp>但硬體支援還是關卡。若 GPU 不支援原生 FP4，系統就得在執行時反量化，速度會打折。文章也提到，Hopper 和 AMD MI300X 雖然能載入 4 位權重，但不如直接用原生 MXFP4 的新卡省心。\u003C\u002Fp>\u003Cblockquote>“Kimi K3 由 Moonshot AI 於 2026 年 7 月發布，是截至目前規模最大的開放權重模型。”\u003C\u002Fblockquote>\u003Cp>這句話很直接，也點出一個現實。模型越大，部署越像基礎建設，不像一般 API 串接。開發者真正該算的，是每次呼叫要燒多少算力。\u003C\u002Fp>\u003Cp>另外，Kimi K3 還用到 KDA，也就是 Kimi Delta Attention。它把注意力狀態固定下來，最多可把 KV cache 壓到原本的約 25%。這對\u003Ca href=\"\u002Ftag\u002F長上下文\">長上下文\u003C\u002Fa>很有用，但也讓前綴快取不能直接照搬。\u003C\u002Fp>\u003Ch2>自托管門檻比表面更高\u003C\u002Fh2>\u003Cp>\u003Ca href=\"https:\u002F\u002Fdocs.vllm.ai\" target=\"_blank\" rel=\"noopener\">vLLM\u003C\u002Fa> 團隊給的部署建議很明確，較直接的方案是 8 張 \u003Ca href=\"https:\u002F\u002Fwww.amd.com\u002Fen\u002Fproducts\u002Faccelerators\u002Finstinct\u002Fmi355x.html\" target=\"_blank\" rel=\"noopener\">AMD MI355X\u003C\u002Fa> 或 8 張 \u003Ca href=\"https:\u002F\u002Fwww.nvidia.com\u002Fen-us\u002Fdata-center\u002Fb300\u002F\" target=\"_blank\" rel=\"noopener\">NVIDIA B300\u003C\u002Fa>，張量並行設為 8。這不是玩具級配置，已經是\u003Ca href=\"\u002Ftag\u002F資料中心\">資料中心\u003C\u002Fa>採購等級。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786323790166-92un.png\" alt=\"Kimi K3 自托管成本很高\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這裡還有一個工程現實。張量並行通常更適合 2、4、8 這類配置，6 張卡在排程和互聯上都很尷尬。雲端供應商也常常按整節點賣，不會剛好賣你 6 張。\u003C\u002Fp>\u003Cp>所以就算理論上 6 張卡能塞下，實務上你還是很可能得買 8 張。這就是大型模型部署最煩的地方，算式看起來很乾淨，採購單卻很髒。\u003C\u002Fp>\u003Cul>\u003Cli>官方建議是 8 張 B300 或 8 張 MI355X。\u003C\u002Fli>\u003Cli>張量並行更適合 2、4、8，不太適合 6。\u003C\u002Fli>\u003Cli>KDA 最多可減少約 75% 的 KV cache 佔用。\u003C\u002Fli>\u003Cli>要跑得順，通常得搭配較新的 vLLM 版本。\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>API 和自托管差多少\u003C\u002Fh2>\u003Cp>價格是最容易下判斷的地方。Kimi K3 官方 API 的價格是，輸入每百萬 Token 3 美元，輸出每百萬 Token 15 美元，快取輸入每百萬 Token 0.30 美元。\u003Ca href=\"https:\u002F\u002Fwww.digitalocean.com\" target=\"_blank\" rel=\"noopener\">DigitalOcean\u003C\u002Fa> 的無伺服器推理也給出相同定價。\u003C\u002Fp>\u003Cp>自托管這邊，文章算的是一個原生 FP4 節點大約由 8 張 MI350X 組成，每張 GPU 每小時約 4.76 美元，整機約 38 美元每小時。若長期預留，一台 GPU Droplet 每月大約 27,800 美元。\u003C\u002Fp>\u003Cp>最關鍵的是盈虧平衡點。要讓無伺服器推理追平這台節點，每月大約要消耗 18 億個輸出 Token，換算成持續輸出，約 700 Token \u002F 秒。一般單路請求通常只有每秒幾十個 Token，很難碰到這個量級。\u003C\u002Fp>\u003Cul>\u003Cli>官方 API：輸入 $3 \u002F 百萬 Token，輸出 $15 \u002F 百萬 Token。\u003C\u002Fli>\u003Cli>8 張 MI350X 節點：約 $38 \u002F 小時。\u003C\u002Fli>\u003Cli>長期預留 GPU Droplet：約 $27,800 \u002F 月。\u003C\u002Fli>\u003Cli>追平成本：約 18 億個輸出 Token \u002F 月，約 700 Token \u002F 秒。\u003C\u002Fli>\u003C\u002Ful>\u003Cp>所以單個重度使用者用 API，可能比自己租 GPU 便宜約 40 倍。這個差距很殘酷，但也很正常。只要\u003Ca href=\"\u002Fnews\u002Fusage-limits-chatgpt-enterprise-edu-controls-zh\">用量\u003C\u002Fa>沒有穩定到把機器吃滿，自托管就會被固定\u003Ca href=\"\u002Fnews\u002Fdeepseek-codex-ai-coding-costs-reset-zh\">成本\u003C\u002Fa>拖住。\u003C\u002Fp>\u003Ch2>什麼情況該自己部署\u003C\u002Fh2>\u003Cp>如果你在做原型、內部測試，或流量很不穩，API 幾乎一定更划算。你不用先買 8 張高階 GPU，也不用處理驅動、映像檔、張量並行和推理框架升級。\u003C\u002Fp>\u003Cp>如果你有穩定高併發、長上下文、多使用者持續在線，或者資料駐留要求很嚴，自托管才有機會回本。這時候你買的不是模型，而是控制權和穩定性。\u003C\u002Fp>\u003Cp>文章也提醒了一點，很多第三方推理服務商並不會存儲推理資料。所以「一定要自己托管才安全」這句話，很多時候只是情緒，不是事實。\u003C\u002Fp>\u003Cp>另外，Kimi K3 用的是定制授權，不是 Apache 或 MIT。它允許使用、修改、微調、部署、分發和商業化，但對某些超大規模模型服務和超大商業產品有額外條件。產品要上線前，法務最好先看過。\u003C\u002Fp>\u003Ch2>這篇文章真正提醒了什麼\u003C\u002Fh2>\u003Cp>Kimi K3 的技術門檻已經低到可以公開使用，經濟門檻卻還很高。這種\u003Ca href=\"\u002Fnews\u002Fopenai-api-pricing-august-2026-token-costs-zh\">落差\u003C\u002Fa>會直接影響產品設計，因為很多團隊最後會發現，最便宜的方案其實是先用 API。\u003C\u002Fp>\u003Cp>我覺得接下來值得觀察的，是原生 FP4 硬體會不會更普及，以及推理框架會不會更快支援 KDA 這類定制結構。只要硬體和框架成熟，這種大模型的部署成本才會真的往下掉。\u003C\u002Fp>\u003Cp>如果你現在就在評估 Kimi K3，我的建議很簡單：先算月 Token，再算 GPU 月租。只要你的用量還沒高到能把 8 張卡吃滿，先調 API 會比較務實。\u003C\u002Fp>","Kimi K3 自托管至少要 8 张高端 GPU。對單個重度使用者來說，API 可能比自己租機器便宜約 40 倍。","zhuanlan.zhihu.com","https:\u002F\u002Fzhuanlan.zhihu.com\u002Fp\u002F2067640378094785740",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786323790394-kbfm.png","industry","zh","e113cf9f-096b-4742-b7bf-1c5b4b18ec3f",[17,18,19,20,21,22,23,24],"Kimi K3","GPU 成本","API 價格","自托管","vLLM","MoE","MXFP4","KDA",[26,27,28],"Kimi K3 需要至少 8 張高端 GPU 才像樣地自托管。","對單個重度使用者，API 可能比自建推理集群便宜約 40 倍。","只有高併發、長時間滿載或資料控制需求高時，自托管才比較有機會划算。",1,"2026-08-10T01:02:51.081557+00:00","2026-08-10T01:02:51.074+00:00",{"tags":33,"relatedLang":36,"relatedPosts":40},[34],{"name":21,"slug":35},"vllm",{"id":15,"slug":37,"title":38,"language":39},"kimi-k3-gpu-cost-self-hosted-vs-api-en","Kimi K3 Needs About 1.5 TB of Memory","en",[41,47,53,59,65,71],{"id":42,"slug":43,"title":44,"cover_image":45,"image_url":45,"created_at":46,"category":13},"2154ae8a-ee87-4b04-bf30-62619fbed031","crypto-infrastructure-era-ai-agents-zh","AI Agent 讓加密貨幣回到基礎設施","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786347179913-0eep.png","2026-08-10T07:32:31.882495+00:00",{"id":48,"slug":49,"title":50,"cover_image":51,"image_url":51,"created_at":52,"category":13},"742c1e45-13c7-43a9-84aa-33b10e58d9af","ai-weekly-2026-w33-zh","AI 週報：2026-08-03 ~ 2026-08-10","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786335622166-pb5e.png","2026-08-10T04:00:28.661553+00:00",{"id":54,"slug":55,"title":56,"cover_image":57,"image_url":57,"created_at":58,"category":13},"f5581f94-ba2b-4164-b3b0-5d634239e90a","cursor-should-not-copy-vs-code-design-zh","Cursor 不該跟著 VS Code 新版長相走","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786278763461-hkgn.png","2026-08-09T12:32:20.427633+00:00",{"id":60,"slug":61,"title":62,"cover_image":63,"image_url":63,"created_at":64,"category":13},"3d745dd7-d34a-427f-9403-94244d93e9ef","wall-street-tokenization-slowly-not-celebrate-pilot-zh","華爾街該慢慢代幣化資產，不該急著慶祝試點","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786237371565-bds4.png","2026-08-09T01:02:28.25862+00:00",{"id":66,"slug":67,"title":68,"cover_image":69,"image_url":69,"created_at":70,"category":13},"661c033e-8701-4b5d-ba69-1843545254a4","asset-tokenization-turns-ownership-into-software-zh","資產代幣化把權利寫成軟體","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786235588664-yp9g.png","2026-08-09T00:32:45.231134+00:00",{"id":72,"slug":73,"title":74,"cover_image":75,"image_url":75,"created_at":76,"category":13},"d9997b41-a0f6-49f5-8d2f-0fbf9733374e","institutional-crypto-tops-30b-tokenization-zh","機構加密資產突破 300 億美元","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786233783789-584a.png","2026-08-09T00:02:28.579957+00:00",[78,83,88,93,98,103,108,113,118,123],{"id":79,"slug":80,"title":81,"created_at":82},"ee073da7-28b3-4752-a319-5a501459fb87","ai-in-2026-what-actually-matters-now-zh","2026 AI 真正重要的事","2026-03-26T07:09:12.008134+00:00",{"id":84,"slug":85,"title":86,"created_at":87},"83bd1795-8548-44c9-9a7e-de50a0923f71","trump-ai-framework-power-speech-state-preemption-zh","川普 AI 框架瞄準電力、言論與州權","2026-03-26T07:12:18.695466+00:00",{"id":89,"slug":90,"title":91,"created_at":92},"ea6be18b-c903-4e54-97b7-5f7447a612e0","nvidia-gtc-2026-big-ai-announcements-zh","NVIDIA GTC 2026 重點拆解","2026-03-26T07:14:26.62638+00:00",{"id":94,"slug":95,"title":96,"created_at":97},"4bcec76f-4c36-4daa-909f-54cd702f7c93","claude-users-spreading-out-and-getting-better-zh","Claude 用戶更分散，也更會用","2026-03-26T07:22:52.325888+00:00",{"id":99,"slug":100,"title":101,"created_at":102},"bd903b15-2473-4178-9789-b7557816e535","openclaw-raises-hard-question-for-ai-models-zh","OpenClaw 逼問 AI 模型價值","2026-03-26T07:24:54.707486+00:00",{"id":104,"slug":105,"title":106,"created_at":107},"eeac6b9e-ad9d-4831-8eec-8bba3f9bca6a","gap-google-gemini-checkout-fashion-search-zh","Gap 把結帳搬進 Gemini","2026-03-26T07:28:23.937768+00:00",{"id":109,"slug":110,"title":111,"created_at":112},"0740e53f-605d-4d57-8601-c10beb126f3c","google-pushes-gemini-transition-to-march-2026-zh","Google 把 Gemini 轉換延到 2026 年 3…","2026-03-26T07:30:12.825269+00:00",{"id":114,"slug":115,"title":116,"created_at":117},"e660d801-2421-4529-8fa9-86b82b066990","metas-llama-4-benchmark-scandal-gets-worse-zh","Meta Llama 4 分數風波又擴大","2026-03-26T07:34:21.156421+00:00",{"id":119,"slug":120,"title":121,"created_at":122},"183f9e7c-e143-40bb-a6d5-67ba84a3a8bc","accenture-mistral-ai-sovereign-enterprise-deal-zh","Accenture 攜手 Mistral AI 賣主權 AI","2026-03-26T07:38:14.818906+00:00",{"id":124,"slug":125,"title":126,"created_at":127},"191d9b1b-768a-478c-978c-dd7431a38149","mistral-ai-faces-its-hardest-year-yet-zh","Mistral AI 迎來最硬的一年","2026-03-26T07:40:23.716374+00:00"]