[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-kimi-k3-benchmark-evaluation-guide-coding-agents-zh":3,"article-related-kimi-k3-benchmark-evaluation-guide-coding-agents-zh":31,"series-ai-agent-9f4b3a5e-132d-437c-8874-5c98f8302dcb":77},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":23,"views":27,"created_at":28,"published_at":29,"topic_cluster_id":30},"9f4b3a5e-132d-437c-8874-5c98f8302dcb","kimi-k3-benchmark-evaluation-guide-coding-agents-zh","Kimi K3 編碼代理評測操作指南","\u003Cp data-speakable=\"summary\">67.3 分與 88.3 分只是起點，這篇教你用同一套任務、同一個測試框架，實際比較 \u003Ca href=\"\u002Fnews\u002Fkimi-k3-intelligence-performance-price-analysis-zh\">Kimi\u003C\u002Fa> K3 與其他編碼代理。\u003C\u002Fp>\u003Cp>這篇給要做模型評測、工具鏈驗證、或代理式程式開發選型的工程師看。你照著做完，會得到一份可重跑的評測計畫、一個版本固定的測試框架，還能算出「每次接受變更成本」，而不是只看宣傳分數。\u003C\u002Fp>\u003Ch2>開始之前\u003C\u002Fh2>\u003Cul>\u003Cli>Moonshot 帳號，且已開通 Kimi K3 API 權限\u003C\u002Fli>\u003Cli>可用的 \u003Ca href=\"https:\u002F\u002Fgithub.com\u002Fmoonshot-ai\u002Fkimi-code\" target=\"_blank\" rel=\"noopener noreferrer\">Kimi Code GitHub 倉庫\u003C\u002Fa>\u003C\u002Fli>\u003Cli>可查閱的 \u003Ca href=\"https:\u002F\u002Fwww.kimi.com\u002Fdocs\" target=\"_blank\" rel=\"noopener noreferrer\">Kimi 官方文件\u003C\u002Fa>\u003C\u002Fli>\u003Cli>Node 20+ 或 Python 3.11+\u003C\u002Fli>\u003Cli>Git 2.40+\u003C\u002Fli>\u003Cli>至少一個真實專案，內含測試、lint，且有已知錯誤或待辦事項\u003C\u002Fli>\u003Cli>足夠的評測預算，因為代理評測需要多次重跑\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>Step 1: 定義任務形狀\u003C\u002Fh2>\u003Cp>這一步的產出是「任務範圍清單」。先決定你要比的是修 bug、終端機操作、長流程功能開發，還是模型輔助研究，再挑出和日常工作相似的題型。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784574187634-d3v3.png\" alt=\"Kimi K3 編碼代理評測操作指南\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>任務數量先少後多，先用 3 到 10 個就好。每個任務都要能用自動化方式驗收，例如依賴升級、失敗測試、或有明確回歸條件的 issue。\u003C\u002Fp>\u003Cpre>\u003Ccode># 任務清單範例：每列都要有唯一驗收條件\n# task_id | repo  | branch        | acceptance_check\n# 001     | app-a | bugfix\u002F001    | npm test\n# 002     | app-b | bugfix\u002F002    | pytest -q\n# 003     | app-c | bugfix\u002F003    | make verify\u003C\u002Fcode>\u003C\u002Fpre>\u003Cp>你應該看到一份每項只對應一個明確通過條件的清單。如果你沒辦法用一句話寫出驗收條件，這個任務就太模糊，不適合拿來做代理評測。\u003C\u002Fp>\u003Ch2>Step 2: 固定框架與模型版本\u003C\u002Fh2>\u003Cp>這一步的產出是「可重現環境設定檔」。把模型識別碼、系統提示、工具權限、上下文政策、歷史壓縮規則都先鎖定，\u003Ca href=\"\u002Fnews\u002Fapple-reclaims-top-market-cap-nvidia-slips-en-zh\">第一\u003C\u002Fa>輪測試前就不要再改。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784574189426-ko6q.png\" alt=\"Kimi K3 編碼代理評測操作指南\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>同一套框架要套在所有模型上。若 K3 在 \u003Ca href=\"\u002Fnews\u002Fkimik3-ai-model-market-impact-zh\">Kimi\u003C\u002Fa> Code 裡保留了較完整的推理歷史，其他比較對象也要盡量走相近的執行路徑，不然結果沒有可比性。\u003C\u002Fp>\u003Cpre>\u003Ccode>export MODEL_ID=\"kimi-k3\"\nexport HARNESS_VERSION=\"kimi-code@1.0.0\"\nexport EVAL_SEED=42\nexport MAX_ATTEMPTS=3\nexport TOOL_MODE=\"restricted\"\n\nnpm run eval -- \\\n  --model \"$MODEL_ID\" \\\n  --harness \"$HARNESS_VERSION\" \\\n  --seed \"$EVAL_SEED\" \\\n  --attempts \"$MAX_ATTEMPTS\"\u003C\u002Fcode>\u003C\u002Fpre>\u003Cp>你應該看到每次執行紀錄裡的模型名稱與框架版本都一致。如果紀錄開始漂移，就代表你其實已經在比不同系統。\u003C\u002Fp>\u003Ch2>Step 3: 重複跑代理試驗\u003C\u002Fh2>\u003Cp>這一步的產出是「試驗結果資料夾」。每個任務都要跑不只一次，因為代理表現會受工具錯誤、重試次數、上下文長度影響，單次結果很容易失真。\u003C\u002Fp>\u003Cp>每次試驗都要保留完整對話、命令輸出、\u003Ca href=\"\u002Ftag\u002Ftoken\">token\u003C\u002Fa> 數量與完成狀態。若 K3 或其他模型產生較長的推理內容，這些成本都要一起記錄。\u003C\u002Fp>\u003Cp>建議每個 trial 各放一個資料夾，至少保存輸入、輸出、時間戳與失敗原因。這樣你之後要回放失敗案例時，才找得到完整脈絡。\u003C\u002Fp>\u003Cp>你應該看到每個任務都有成功與失敗紀錄，而不只是成功案例。若失敗樣本不見了，通常代表你的評測流程把難題藏起來了。\u003C\u002Fp>\u003Ch2>Step 4: 以接受變更計分\u003C\u002Fh2>\u003Cp>這一步的產出是「計分表」。不要用主觀印象打分，優先採用可重現的檢查，例如測試、lint、型別檢查、或 golden output 比對。\u003C\u002Fp>\u003Cp>先把每次嘗試標成接受或拒絕，再算出接受率與每次接受變更成本。這樣你得到的不是單純通過率，而是能直接拿來做採購或選型的判斷指標。\u003C\u002Fp>\u003Cpre>\u003Ccode># 接受準則範例\n# accepted = 測試全過 AND patch 變更小 AND 沒有改到敏感檔案\n# rejected = 測試失敗 OR 任務未完成 OR 需要人工回滾\n\naccepted_changes=$(jq '[.runs[] | select(.status==\"accepted\")] | length' results.json)\ntotal_cost=$(jq '.billing.total_usd' results.json)\n\nprintf \"accepted=%s\\n\" \"$accepted_changes\"\nprintf \"cost_per_accept=%.2f\\n\" \"$(echo \"$total_cost \u002F $accepted_changes\" | bc -l)\"\u003C\u002Fcode>\u003C\u002Fpre>\u003Cp>你應該看到重複試跑後的接受率相對穩定。如果數值上下跳很大，通常不是模型突然變強或變弱，而是框架或任務設計太吵。\u003C\u002Fp>\u003Ch2>Step 5: 對照基準版本\u003C\u002Fh2>\u003Cp>這一步的產出是「比較表」。把 K3 跟你現有模型、開源基準、或較便宜的替代方案放在同一批任務上比較，而且一定要沿用同一套計分規則。\u003C\u002Fp>\u003Cp>比較時只看對團隊有意義的指標。若你做的是維護型代理，就看每美元可接受修正數；若你做的是研究型代理，就看長流程完成率與工具失敗率。\u003C\u002Fp>\u003Cp>你應該看到一個在核心指標上明確勝出的結果，而不是模糊的「感覺不錯」。如果 K3 品質較高但成本也高很多，最後可能還是別的模型更適合上線。\u003C\u002Fp>\u003Ctable>\u003Cthead>\u003Ctr>\u003Cth>指標\u003C\u002Fth>\u003Cth>基準／優化前\u003C\u002Fth>\u003Cth>結果／優化後\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd>DeepSWE 共用框架分數\u003C\u002Ftd>\u003Ctd>mini-SWE-agent 基準\u003C\u002Ftd>\u003Ctd>K3 報告為 67.3\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>Terminal-Bench 2.1 分數\u003C\u002Ftd>\u003Ctd>前沿比較組\u003C\u002Ftd>\u003Ctd>K3 報告為 88.3\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>輸出 token 吞吐\u003C\u002Ftd>\u003Ctd>比較中位數約 72\u003C\u002Ftd>\u003Ctd>K3 測得 62\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>總評測成本\u003C\u002Ftd>\u003Ctd>中位數約 63M 輸出 token 類別\u003C\u002Ftd>\u003Ctd>K3 評測成本 2,690.80 美元\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Ch2>常見錯誤\u003C\u002Fh2>\u003Cul>\u003Cli>不同模型混用不同框架。修法：所有模型都走同一個代理迴圈、同一套權限、同一組停止條件。\u003C\u002Fli>\u003Cli>把原始 benchmark 分數當成上線證據。修法：回到你自己的專案任務，用可重現的驗收條件驗證。\u003C\u002Fli>\u003Cli>忽略 token 花費與重試次數。修法：記錄每次接受變更成本，而不是只看通過率。\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>接下來可以看什麼\u003C\u002Fh2>\u003Cp>當你的對照流程跑順後，可以把它擴成每月一次的評測套件，固定資料集、保存逐輪紀錄，並加上回歸告警。這樣你就能持續追蹤 Kimi K3，或任何替代模型，是否還值得留在你的編碼代理清單裡。\u003C\u002Fp>","這篇教你用同一套任務與評測框架，實際比較 Kimi K3 與其他編碼代理，最後算出可重現的接受率與每次接受變更成本。","www.nxcode.io","https:\u002F\u002Fwww.nxcode.io\u002Fresources\u002Fnews\u002Fkimi-k3-benchmarks-coding-agent-evaluation-guide-2026",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784574187634-d3v3.png","ai-agent","zh","84a889fc-bcc9-48c7-9dc6-8d44f9b5e5e6",[17,18,19,20,21,22],"Kimi K3","benchmark","coding agent","Kimi Code","Node 20+","Git",[24,25,26],"先定義真實任務與單一驗收條件，再做代理評測。","固定模型版本、框架版本與權限設定，避免比較失真。","用接受率與每次接受變更成本，取代只看原始分數的判斷。",0,"2026-07-20T19:02:39.109567+00:00","2026-07-20T19:02:39.101+00:00","40896490-6a09-4520-b3b8-b46fcf32907a",{"tags":32,"relatedLang":36,"relatedPosts":40},[33,35],{"name":19,"slug":34},"coding-agent",{"name":18,"slug":18},{"id":15,"slug":37,"title":38,"language":39},"kimi-k3-benchmark-evaluation-guide-coding-agents-en","Kimi K3 Benchmark Evaluation Guide for Coding Agents","en",[41,47,53,59,65,71],{"id":42,"slug":43,"title":44,"cover_image":45,"image_url":45,"created_at":46,"category":13},"9a3274e4-cb7d-44f4-a56b-264180d66c8c","ai-coding-winning-edge-is-orchestration-zh","AI 编程的勝負手不是最強模型，而是最強編排","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784484194465-hxbs.png","2026-07-19T18:02:42.351329+00:00",{"id":48,"slug":49,"title":50,"cover_image":51,"image_url":51,"created_at":52,"category":13},"1c561993-b2dc-4223-877c-5fbad7795b6e","claude-code-terminal-workflow-template-zh","Claude Code 把聊天變成終端工作","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784466203065-x30z.png","2026-07-19T13:02:53.40535+00:00",{"id":54,"slug":55,"title":56,"cover_image":57,"image_url":57,"created_at":58,"category":13},"61a1d47c-0b67-48a2-b763-05e6d66121c4","decentralized-ai-compliance-agent-rails-zh","分散式 AI 合規必須寫進 agent rails，而不是事後補丁","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784464366778-vhp1.png","2026-07-19T12:32:19.457146+00:00",{"id":60,"slug":61,"title":62,"cover_image":63,"image_url":63,"created_at":64,"category":13},"520bcebc-da4d-4846-8438-73fbf26a0d57","open-source-ai-agent-frameworks-compared-langfuse-zh","開源 AI Agent 框架實作比較與追蹤","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784401377614-3fuv.png","2026-07-18T19:02:25.980472+00:00",{"id":66,"slug":67,"title":68,"cover_image":69,"image_url":69,"created_at":70,"category":13},"31657b75-a18e-418e-a5d6-bca5095e2780","codex-micro-macropad-ai-control-deck-zh","Codex Micro 讓控制面板變安全","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784291589427-erc8.png","2026-07-17T12:32:45.179803+00:00",{"id":72,"slug":73,"title":74,"cover_image":75,"image_url":75,"created_at":76,"category":13},"ee3c0a0e-0117-4f79-b94b-308d08b43669","automate-web3-grant-screening-ai-scoring-zh","Web3 補助金 AI 篩選流程實作","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784187173996-8c2e.png","2026-07-16T07:32:23.745459+00:00",[78,83,88,93,98,103,108,113,118,123],{"id":79,"slug":80,"title":81,"created_at":82},"4ae1e197-1d3d-4233-8733-eafe9cb6438b","claude-now-uses-your-pc-to-finish-tasks-zh","Claude 開始幫你操作電腦","2026-03-26T07:20:48.457387+00:00",{"id":84,"slug":85,"title":86,"created_at":87},"5bede67f-e21c-413d-9ab8-54a3c3d26227","googles-2026-ai-agent-report-decoded-zh","Google 2026 AI Agent 報告解讀","2026-03-26T11:15:22.651956+00:00",{"id":89,"slug":90,"title":91,"created_at":92},"2987d097-563f-46c7-b76f-b558d8ef7c2b","kimi-k25-review-stronger-still-not-legend-zh","Kimi K2.5 評測：更強，但還不是神作","2026-03-27T07:15:55.277513+00:00",{"id":94,"slug":95,"title":96,"created_at":97},"95c9053b-e3f4-4cb5-aace-5c54f4c9e044","claude-code-controls-mac-desktop-zh","Claude Code 也能操控 Mac 了","2026-03-28T03:01:58.58121+00:00",{"id":99,"slug":100,"title":101,"created_at":102},"dc58e153-e3a8-4c06-9b96-1aa64eabbf5f","cloudflare-100x-faster-ai-agent-sandbox-zh","Cloudflare 的 AI 沙箱跑超快","2026-03-28T03:09:44.142236+00:00",{"id":104,"slug":105,"title":106,"created_at":107},"1c8afc56-253f-47a2-979f-1065ff072f2a","openai-backs-isara-agent-swarm-bet-zh","OpenAI 挺 Isara 的 agent swarm …","2026-03-28T03:15:27.513155+00:00",{"id":109,"slug":110,"title":111,"created_at":112},"7379b422-576e-45df-ad5a-d57a0d9dd467","openai-plan-automated-ai-researcher-zh","OpenAI 想做自動化 AI 研究員","2026-03-28T03:17:42.090548+00:00",{"id":114,"slug":115,"title":116,"created_at":117},"48c9889e-86df-450b-a356-e4a4b7c83c5b","harness-engineering-ai-agent-reliability-2026-zh","駕馭工程：從「馬具」到「作業系統」，AI Agent 可靠性的終極密碼","2026-03-31T06:42:53.556721+00:00",{"id":119,"slug":120,"title":121,"created_at":122},"96d8e8c8-1edd-475d-9145-b1e7a1b02b65","mcp-explained-from-prompts-to-production-zh","MCP 怎麼把提示詞變工作流","2026-04-01T09:24:39.321274+00:00",{"id":124,"slug":125,"title":126,"created_at":127},"f2ca7720-b471-4ce5-9336-2a9ac2a876fd","amazon-bedrock-agents-multi-agent-workflows-zh","Amazon Bedrock Agents 進入多代理工作流","2026-04-01T09:30:29.945429+00:00"]