[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-claude-opus-5-benchmarks-developers-zh":3,"article-related-claude-opus-5-benchmarks-developers-zh":29,"series-model-release-f01d383b-1d9a-496b-8e2b-9bd4dd6aa079":73},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"f01d383b-1d9a-496b-8e2b-9bd4dd6aa079","claude-opus-5-benchmarks-developers-zh","Claude Opus 5 開發者基準與路由清單","\u003Cp data-speakable=\"summary\">97%+ 的 HumanEval 表現，仍需要用成本路由把\u003Ca href=\"\u002Fnews\u002Frust-best-work-this-week-simpler-systems-zh\">簡單\u003C\u002Fa>工作分給\u003Ca href=\"\u002Fnews\u002Fgrok-4-6-cheaper-frontier-ai-builders-zh\">更便宜\u003C\u002Fa>的模型。\u003C\u002Fp>\u003Cp>這篇給要評估 \u003Ca href=\"\u002Ftag\u002Fclaude\">Claude\u003C\u002Fa> Opus 5 的開發者看，目標是把「值不值得用」變成可重複的測試流程。照做完，你會拿到一份可比對的 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 清單、一張自己的成本表，以及一條清楚的模型路由規則。\u003C\u002Fp>\u003Cp>你也會知道它最適合放在什麼地方：高難度程式題、延伸推理、以及需要長時間思考的 agent 工作。本文資料來自 Anthropic 的 \u003Ca href=\"https:\u002F\u002Fdocs.anthropic.com\u002F\" target=\"_blank\" rel=\"noopener\">Claude docs\u003C\u002Fa> 與 \u003Ca href=\"https:\u002F\u002Fgithub.com\u002Fanthropics\u002Fanthropic-sdk-typescript\" target=\"_blank\" rel=\"noopener\">Anthropic SDK repo\u003C\u002Fa>，並參考官方與社群整理的 benchmark 結果。\u003C\u002Fp>\u003Ch2>開始之前\u003C\u002Fh2>\u003Cul>\u003Cli>Anthropic 帳號，且已開通 API 存取\u003C\u002Fli>\u003Cli>Claude Opus 5 API key\u003C\u002Fli>\u003Cli>Node.js 20+ 或 Python 3.11+\u003C\u002Fli>\u003Cli>一份可安全測試的程式碼庫或題目集\u003C\u002Fli>\u003Cli>預算可支應 premium 模型呼叫，尤其是啟用 extended thinking 時\u003C\u002Fli>\u003Cli>可選：OpenAI 與 Google API key，用來做對照測試\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>Step 1: 釘住基準題集\u003C\u002Fh2>\u003Cp>目的：先做出一份和你日常工作一致的測試集，後面所有模型都用同一批題目比。請挑 20 到 50 題，涵蓋 bug 修正、\u003Ca href=\"\u002Ftag\u002Fcode-review\">code review\u003C\u002Fa>、重構、架構判斷，並固定題目內容不變。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786930368498-wvik.png\" alt=\"Claude Opus 5 開發者基準與路由清單\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cpre>\u003Ccode>export BENCHMARK_SET=benchmarks\u002Fdev-workload.json\nexport MODEL=claude-opus-5\u003C\u002Fcode>\u003C\u002Fpre>\u003Cp>驗收：你應該看到一份固定的 prompt 清單，並且每題都有分類與預期輸出。如果每次執行題目都不同，結果就不能比較。\u003C\u002Fp>\u003Ch2>Step 2: 跑出便宜模型基線\u003C\u002Fh2>\u003Cp>目的：先取得 Sonnet 4、GPT-4.1 這類較便宜模型的基準分數，作為品質、延遲與 token 成本的參考。所有模型都要用相同 prompt、temperature 與輸出格式。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786930370278-u85v.png\" alt=\"Claude Opus 5 開發者基準與路由清單\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cpre>\u003Ccode>curl https:\u002F\u002Fapi.anthropic.com\u002Fv1\u002Fmessages \\\n  -H \"x-api-key: $ANTHROPIC_API_KEY\" \\\n  -H \"anthropic-version: 2023-06-01\" \\\n  -d '{\"model\":\"claude-sonnet-4\",\"max_tokens\":1024,\"messages\":[{\"role\":\"user\",\"content\":\"Review this diff for logic bugs\"}]}'\u003C\u002Fcode>\u003C\u002Fpre>\u003Cp>驗收：你應該看到完整回應，外加 API metadata 裡的 token 使用量。把這份輸出存起來，後面才能和 Opus 5 做同題對照。\u003C\u002Fp>\u003Ch2>Step 3: 測 Opus 5 難題表現\u003C\u002Fh2>\u003Cp>目的：只在真正需要深度推理的題目上看 Opus 5 是否有優勢，例如多步驟除錯、跨檔案分析、或工具使用。官方與社群 benchmark 常把它放在 \u003Ca href=\"\u002Ftag\u002Fswe-bench-verified\">SWE-bench Verified\u003C\u002Fa>、LiveCodeBench、GPQA 類型任務上觀察。\u003C\u002Fp>\u003Cpre>\u003Ccode>{\n  \"model\": \"claude-opus-5\",\n  \"thinking\": {\"type\": \"enabled\", \"budget_tokens\": 4096},\n  \"max_tokens\": 1024,\n  \"messages\": [\n    {\"role\": \"user\", \"content\": \"Explain why this distributed job sometimes double-runs\"}\n  ]\n}\u003C\u002Fcode>\u003C\u002Fpre>\u003Cp>驗收：你應該看到更完整的推理內容，而且通常會比非 thinking 執行更慢。如果在最難的題目上沒有明顯進步，代表 premium 成本不一定划算。\u003C\u002Fp>\u003Ch2>Step 4: 記錄延遲與 token 成本\u003C\u002Fh2>\u003Cp>目的：把「好不好」換成「每題花多少錢、花多久」。官方資料提到 Opus 5 的價格是每 100 萬 input tokens 15 \u003Ca href=\"\u002Fnews\u002Fanthropic-q2-revenue-tops-11point5-billion-zh\">美元\u003C\u002Fa>、每 100 萬 output tokens 75 美元，context window 為 200K；非正式測試中，time-to-first-token 約比 Sonnet 4 慢 2 到 4 倍。\u003C\u002Fp>\u003Cp>請量測每次呼叫的 input tokens、output tokens、time to first token 與總 wall time，然後改用「每個任務的成本」比較，而不是只看每百萬 tokens 的單價。這樣你才知道真實工作流裡的花費。\u003C\u002Fp>\u003Cp>驗收：你應該看到一張可對照的成本表。若一般題目上差距很小，就把這些請求分流到更便宜的模型。\u003C\u002Fp>\u003Ch2>Step 5: 寫出路由規則\u003C\u002Fh2>\u003Cp>目的：把測試結果變成可上線的模型選擇策略。高難度推理、資安審查、複雜重構交給 Opus 5；autocomplete、短程生成、高量批次任務交給 Sonnet 4 或 Haiku。\u003C\u002Fp>\u003Cpre>\u003Ccode>if task in {\"deep_debug\", \"architecture_review\", \"security_analysis\"}:\n    model = \"claude-opus-5\"\nelse:\n    model = \"claude-sonnet-4\"\u003C\u002Fcode>\u003C\u002Fpre>\u003Cp>驗收：你應該看到整體花費下降，而且常見工作不會明顯掉品質。若路由正確，只有最難的 prompt 會打到 Opus 5。\u003C\u002Fp>\u003Ch2>Step 6: 驗證 context 上限\u003C\u002Fh2>\u003Cp>目的：確認你的工作負載是否真的適合 200K context window。Opus 5 的上下文對多數檔案級或模組級任務已足夠，但比起 1M window 的 GPT-4.1 與 \u003Ca href=\"\u002Ftag\u002Fgemini\">Gemini\u003C\u002Fa> 2.5 Pro，超大倉庫分析更可能需要 retrieval 或 chunking。\u003C\u002Fp>\u003Cp>請測一個低於 100K tokens 的 prompt，再測一個接近上限的 prompt，觀察答案是否開始漏細節。不要直接假設 200K 在所有位置都表現一致。\u003C\u002Fp>\u003Cp>驗收：你應該看到小 prompt 的回答更穩定，大 prompt 較容易出現漂移。如果模型開始忽略前段資訊，就改成 retrieval-augmented workflow。\u003C\u002Fp>\u003Ctable>\u003Cthead>\u003Ctr>\u003Cth>指標\u003C\u002Fth>\u003Cth>基準／優化前\u003C\u002Fth>\u003Cth>結果／優化後\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd>HumanEval pass@1\u003C\u002Ftd>\u003Ctd>多數前沿模型落在高 90%\u003C\u002Ftd>\u003Ctd>Opus 5 約 97%+\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>延遲\u003C\u002Ftd>\u003Ctd>Sonnet 4 作為基線\u003C\u002Ftd>\u003Ctd>Opus 5 約慢 2 到 4 倍\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>Input pricing\u003C\u002Ftd>\u003Ctd>Sonnet 4 每 100 萬 tokens 3 美元\u003C\u002Ftd>\u003Ctd>Opus 5 每 100 萬 tokens 15 美元\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>Context window\u003C\u002Ftd>\u003Ctd>GPT-4.1 與 Gemini 2.5 Pro 為 1M\u003C\u002Ftd>\u003Ctd>Opus 5 為 200K\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Ch2>常見錯誤\u003C\u002Fh2>\u003Cul>\u003Cli>把 Opus 5 用在每一個請求。修法：先把例行生成與 autocomplete 分流到便宜模型，再保留 Opus 5 給難題與審查。\u003C\u002Fli>\u003Cli>用不同 prompt 或不同 temperature 比模型。修法：先鎖定 benchmark 題集、sampling 參數與輸出格式，再開始測。\u003C\u002Fli>\u003Cli>只看 input 成本，忽略 output 成本。修法：同時追蹤 input 與 output usage，因為 Opus 5 的輸出單價明顯更高。\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>接下來可以看什麼\u003C\u002Fh2>\u003Cp>等你的 routing 與 benchmark harness 建好後，可以把同一套方法套到其他 frontier model，並加上 latency、cost、answer quality 的 regression check，讓升級流程變成可重複的工程步驟。\u003C\u002Fp>","這篇教你先做基準測試，再用成本與延遲決定何時把 Claude Opus 5 用在難題上。","www.sitepoint.com","https:\u002F\u002Fwww.sitepoint.com\u002Fclaude-opus-5-performance\u002F",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786930368498-wvik.png","model-release","zh","2a151c6e-e731-468d-8924-c4ee731edb1e",[17,18,19,20,21],"Claude Opus 5","benchmark","token cost","model routing","Node.js",[23,24,25],"先用固定題集比對品質，再決定是否值得用 Opus 5。","把成本、延遲與上下文限制一起量測，不要只看答案品質。","用路由規則把難題交給 Opus 5，把例行工作留給更便宜的模型。",0,"2026-08-17T01:32:26.16127+00:00","2026-08-17T01:32:26.154+00:00",{"tags":30,"relatedLang":32,"relatedPosts":36},[31],{"name":18,"slug":18},{"id":15,"slug":33,"title":34,"language":35},"claude-opus-5-benchmarks-developers-en","Claude Opus 5 Benchmarks for Developers","en",[37,43,49,55,61,67],{"id":38,"slug":39,"title":40,"cover_image":41,"image_url":41,"created_at":42,"category":13},"51bed36f-bfd7-45a0-9659-4e6901f981a5","claude-text-marking-all-products-cloud-access-zh","Claude文本標記擴大到全產品與雲端接入","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786906988205-mfro.png","2026-08-16T19:02:39.407337+00:00",{"id":44,"slug":45,"title":46,"cover_image":47,"image_url":47,"created_at":48,"category":13},"8c1f4524-a785-44bf-9940-00d3dee2d93b","anthropic-ipo-talks-skip-valuation-zh","Anthropic 先談上市，不先談估值","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786708972051-yjph.png","2026-08-14T12:02:28.025247+00:00",{"id":50,"slug":51,"title":52,"cover_image":53,"image_url":53,"created_at":54,"category":13},"93e19c1d-1ffc-4f12-a336-f39afb16e8ac","gemini-3-7-flash-launch-coding-gains-zh","Gemini 3.7 Flash 提速上線，寫程式更強","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786667574559-xeyj.png","2026-08-14T00:32:28.7611+00:00",{"id":56,"slug":57,"title":58,"cover_image":59,"image_url":59,"created_at":60,"category":13},"d6e0d4ac-1b63-4296-9d7a-8a6552b5f21f","claude-kimi-multimodal-benchmark-2026-08-zh","Claude 文本領先，Kimi 編碼更強","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786473205481-pcsz.png","2026-08-11T18:32:47.271125+00:00",{"id":62,"slug":63,"title":64,"cover_image":65,"image_url":65,"created_at":66,"category":13},"1299c9a0-be8c-4b31-a0dc-0c9164cf1099","qwen38-max-alibaba-pricing-and-performance-zh","Qwen3.8-Max 把價格壓下來了","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786149189506-m2ez.png","2026-08-08T00:32:52.987339+00:00",{"id":68,"slug":69,"title":70,"cover_image":71,"image_url":71,"created_at":72,"category":13},"8b6f5cee-1836-4999-b4ae-7e30d74c4799","qwen38-max-is-built-for-delivery-not-chat-zh","Qwen3.8-Max不是更会聊天，而是更会交付","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785844982253-8ssv.png","2026-08-04T12:02:31.629566+00:00",[74,79,84,89,94,99,104,109,114,119],{"id":75,"slug":76,"title":77,"created_at":78},"58b64033-7eb6-49b9-9aab-01cf8ae1b2f2","nvidia-rubin-six-chips-one-ai-supercomputer-zh","NVIDIA Rubin 把六顆晶片塞進 AI 機櫃","2026-03-26T07:18:45.861277+00:00",{"id":80,"slug":81,"title":82,"created_at":83},"0dcc2c61-c2a6-480d-adb8-dd225fc68914","march-2026-ai-model-news-what-mattered-zh","2026 年 3 月 AI 模型新聞重點","2026-03-26T07:32:08.386348+00:00",{"id":85,"slug":86,"title":87,"created_at":88},"214ab08b-5ce5-4b5c-8b72-47619d8675dd","why-small-models-are-winning-on-device-ai-zh","小模型為何吃下裝置端 AI","2026-03-26T07:36:30.488966+00:00",{"id":90,"slug":91,"title":92,"created_at":93},"785624b2-0355-4b82-adc3-de5e45eecd88","midjourney-v8-faster-images-higher-costs-zh","Midjourney V8 變快了，也變貴了","2026-03-26T07:52:03.562971+00:00",{"id":95,"slug":96,"title":97,"created_at":98},"9e1044b4-946d-47fe-9e2a-c2ee032e1164","xiaomi-mimo-v2-pro-1t-moe-agents-zh","小米 MiMo-V2-Pro 登場：1T MoE 模型","2026-03-28T03:06:19.002353+00:00",{"id":100,"slug":101,"title":102,"created_at":103},"c4b6186f-bd84-4598-997e-c6e31d543c0d","cursor-composer-2-agentic-coding-model-zh","Cursor Composer 2 走向代理式寫碼","2026-03-28T03:13:06.422716+00:00",{"id":105,"slug":106,"title":107,"created_at":108},"e112e76f-ec3b-408f-810e-e93ae21a888a","apple-siri-gemini-distilled-models-zh","Apple Siri 牽手 Gemini 的真相","2026-03-29T04:52:57.886544+00:00",{"id":110,"slug":111,"title":112,"created_at":113},"c679b51f-194a-463b-87fc-7695256ff752","mimo-v2-pro-vs-omni-vs-flash-2026-zh","MiMo V2 Pro、Omni、Flash 怎麼選","2026-04-02T01:18:43.576128+00:00",{"id":115,"slug":116,"title":117,"created_at":118},"3b988fd7-6749-4f01-ba25-c0ad7486dc31","z-ai-glm-5v-turbo-design2code-claude-zh","GLM-5V-Turbo 在 Design2Code 贏了…","2026-04-02T04:03:36.31741+00:00",{"id":120,"slug":121,"title":122,"created_at":123},"975a7aef-030e-41a6-9401-1c6a342be68e","april-2026-ai-model-releases-zh","2026年4月 AI 模型更新追蹤","2026-04-02T08:45:33.308563+00:00"]