[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-opus-5-cut-cost-without-losing-quality-zh":3,"article-related-opus-5-cut-cost-without-losing-quality-zh":29,"series-model-release-af7c62ff-db44-4ed0-a37d-06c1075be3da":72},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"af7c62ff-db44-4ed0-a37d-06c1075be3da","opus-5-cut-cost-without-losing-quality-zh","Opus 5 讓你降成本不降品質","\u003Cp data-speakable=\"summary\">以前我只看模型夠不夠強，現在我\u003Ca href=\"\u002Fnews\u002Fstablecoin-rules-digital-dollars-work-zh\">先看\u003C\u002Fa>它能不能降成本還不把品質搞爛。\u003C\u002Fp>\u003Cp>我用大模型一陣子了，最煩的就是每次升級都像在賭。要嘛模型很聰明，帳單也很聰明；要嘛便宜是便宜，但你得自己補一堆 guardrail，免得它答非所問。這種事我看多了，demo 都很漂亮，真正上線後，\u003Ca href=\"\u002Ftag\u002Ftoken\">token\u003C\u002Fa> 成本、延遲、fallback、prompt 漂移一起來，整個人就只剩下想把儀表板關掉。\u003C\u002Fp>\u003Cp>這次讓我停下來看的，是 \u003Ca href=\"\u002Ftag\u002Fclaude\">Claude\u003C\u002Fa> Opus 5 的說法：品質先別掉，成本先下來。我是從這篇中文整理和 Anthropic 官方頁面開始追的：\u003Ca href=\"https:\u002F\u002Fzhuanlan.zhihu.com\u002Fp\u002F2064338482990952939\">Zhihu 原文\u003C\u002Fa>，以及 \u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\u002F\">Anthropic 官方網站\u003C\u002Fa>。我不是把它當研究論文讀，我是把它當一個訊號：這次講的不是更大顆的模型，而是更好塞進產品裡的模型。\u003C\u002Fp>\u003Ch2>我先不買「更強」這張票\u003C\u002Fh2>\u003Cblockquote>Claude Opus 5 的核心賣點，是在維持高品質的前提下，把使用成本壓下來。\u003C\u002Fblockquote>\u003Cp>翻譯一下就是，這次的重點不是再做一個只適合拿來拍 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 截圖的東西，而是讓你在真實產品裡比較敢用。這差很多。因為多數團隊卡住的點，從來不是「有沒有最強模型」，而是「我敢不敢把它設成預設」。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785607383846-0d63.png\" alt=\"Opus 5 讓你降成本不降品質\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>我自己踩過這個坑。以前只要模型一貴，產品經理就開始問：這個功能一定要叫旗艦模型嗎？客服問答能不能便宜一點？摘要是不是可以縮短？最後整個團隊都在做成本腦內審核，功能還沒上，先把自己嚇死。\u003C\u002Fp>\u003Cp>實操上，我會把模型升級當成單位經濟問題，不先當成技術浪漫問題。你要看的不是「每 token 多便宜」，而是「每個成功任務到底花多少」。\u003C\u002Fp>\u003Cul>\u003Cli>先算 cost per successful task\u003C\u002Fli>\u003Cli>再看真實 prompt 長度下的 latency\u003C\u002Fli>\u003Cli>最後看 fallback 觸發率有沒有下降\u003C\u002Fli>\u003C\u002Ful>\u003Cp>如果新模型讓成功率持平，成本下降，那才叫升級。只是在簡報上看起來漂亮，我不會動。\u003C\u002Fp>\u003Ch2>真實世界的 prompt 都很髒\u003C\u002Fh2>\u003Cp>模型發表文最愛拿乾淨輸入來秀，這件事我早就看膩了。真實產品裡的 prompt 哪有那麼乖？系統提示詞通常是半年來東補西補的，工具 schema 是從不同 repo 拼來的，使用者還會故意把問題寫得像在跟客服吵架。這種場景才是模型真正要活下去的地方。\u003C\u002Fp>\u003Cp>我看到這篇整理時，最有感的不是它把 Opus 5 講得多厲害，而是它把這個版本放在一個很實用的框架裡看：不是只看能力，而是看它能不能真的進工作流。這點我很買單，因為我在意的是它面對爛輸入時會不會崩。\u003C\u002Fp>\u003Cp>白話講，就是你不要拿整理過的範例測它，要拿你現在 production 裡最難看的那些 prompt 測它。\u003C\u002Fp>\u003Cp>我自己會做一份小型 torture set，通常長這樣：\u003C\u002Fp>\u003Cul>\u003Cli>半句話就結束的需求\u003C\u002Fli>\u003Cli>缺欄位的 tool call\u003C\u002Fli>\u003Cli>前後互相打架的 follow-up\u003C\u002Fli>\u003Cli>長上下文裡藏著一個很晚才出現的限制\u003C\u002Fli>\u003C\u002Ful>\u003Cp>\u003Ca href=\"\u002Fnews\u002Frust-compiler-speed-wins-july-2026-zh\">實作\u003C\u002Fa>時，我會先拿現有流量抽 50 到 100 筆，直接跑新舊模型比對。不要先看漂亮案例，先看那些會讓你皺眉的案例。模型如果連這種都能撐住，我才會繼續往下談。\u003C\u002Fp>\u003Ch2>降價有用，前提是你真的改預設\u003C\u002Fh2>\u003Cp>很多人看到價格下降就很興奮，然後什麼都不改，這我真的看不懂。你如果只是把 spreadsheet 上的數字改掉，架構不動、路由不動、fallback 不動，那你省下來的錢只會\u003Ca href=\"\u002Fnews\u002Fcognizant-claude-partnership-pilots-to-production-zh\">變成\u003C\u002Fa>心理安慰。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785607387495-j08y.png\" alt=\"Opus 5 讓你降成本不降品質\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>真正有用的情況，是這個降價讓你能把更多任務往上搬一層。原本覺得太貴不敢用的地方，現在可以直接用旗艦模型；原本要拆成兩段處理的流程，現在可以縮成一段。這種改法通常比加一個新功能更有感，因為它會直接減少分支和 bug。\u003C\u002Fp>\u003Cp>我以前做內部助理時就遇過這種事。原本太貴的模型，一旦成本降下來，就能拿去做 drafting、summarizing、tool planning。結果不是只有品質提升，連 glue code 都少了很多。少掉那些奇怪的 if else，晚上也少接幾次事故電話。\u003C\u002Fp>\u003Cp>實操上，我會這樣切：\u003C\u002Fp>\u003Cul>\u003Cli>便宜但夠強的模型先做第一輪生成\u003C\u002Fli>\u003Cli>超簡單任務交給小模型做分類和路由\u003C\u002Fli>\u003Cli>高風險任務才叫更貴的 fallback 出來\u003C\u002Fli>\u003C\u002Ful>\u003Cp>你要做的不是追新名詞，而是重新決定哪個模型該當預設。只要預設一變，整個產品的成本結構就會跟著變。\u003C\u002Fp>\u003Ch2>安全討論已經不是旁白\u003C\u002Fh2>\u003Cp>這次的整理也提到 \u003Ca href=\"\u002Ftag\u002Fanthropic\">Anthropic\u003C\u002Fa> 跟美國政府互動的時點，還有整個產業最近被安全事件拉高的敏感度。這種背景我不會拿來炒作，但我也不會假裝它不重要。現在模型選型早就不是單純工程師喜不喜歡，還牽涉產品風險、合規風險，甚至品牌風險。\u003C\u002Fp>\u003Cp>所以我現在看一個旗艦模型，第一個問題不是 benchmark，而是 failure mode。它拒答會不會太保守？正常工作流會不會被它搞得像在過安檢？它是真的比較安全，還是只是比較愛說不？這些東西最後都會反映在客服單量上。\u003C\u002Fp>\u003Cp>也就是說，你要測的不只是答案好不好，還有拒答的形狀對不對。太保守的模型，常常會把正常任務也弄成半拒絕狀態，使用者只會覺得你產品變笨了。\u003C\u002Fp>\u003Cp>我會把安全 regression 直接放進評估流程：\u003C\u002Fp>\u003Cul>\u003Cli>應該正常回答的問題\u003C\u002Fli>\u003Cli>應該拒絕的問題\u003C\u002Fli>\u003Cli>需要先問清楚的模糊問題\u003C\u002Fli>\u003Cli>未經確認不能執行的工具動作\u003C\u002Fli>\u003C\u002Ful>\u003Cp>如果新模型讓拒答風格整個變掉，我希望自己先知道，不要等使用者先罵。尤其是旗艦模型，貴不代表可以亂來。\u003C\u002Fp>\u003Ch2>把它當路由問題，不要當英雄故事\u003C\u002Fh2>\u003Cp>我很討厭一種習慣：把一顆 flagship 模型當成萬能主角。這種做法最後通常會得到一個超長 prompt、一張超大帳單，外加一堆人假裝這樣很正常。比較好的做法，是把模型放進路由系統裡，讓它做它擅長的事。\u003C\u002Fp>\u003Cp>如果 Opus 5 的定位真的是「品質還在、成本更好」，那它的價值不是讓你膜拜，而是讓你敢把更多工作交給它。像是 synthesis、複雜規劃、混亂上下文、multi-step tool use 這些地方，旗艦模型本來就比較值得。\u003C\u002Fp>\u003Cp>實作上，我會直接把任務切成三層：\u003C\u002Fp>\u003Cul>\u003Cli>低複雜度：分類、擷取、路由\u003C\u002Fli>\u003Cli>中複雜度：草稿、摘要、改寫\u003C\u002Fli>\u003Cli>高複雜度：推理、規劃、多步驟工具使用\u003C\u002Fli>\u003C\u002Ful>\u003Cp>然後把模型對應到層級。若 Opus 5 真的夠強又夠便宜，它就往中高複雜度預設靠。這才是實際收益，不是「我們用了最新模型」這種空話。\u003C\u002Fp>\u003Ch2>我只信自己的 logs，不信漂亮圖\u003C\u002Fh2>\u003Cp>我被 benchmark 騙過太多次了，所以現在看到圖表都會先冷靜一下。benchmark 有參考價值沒錯，但它不會告訴你使用者會不會亂問、工具會不會延遲、某個壞答案會不會一路炸到客服。真實世界的痛點，通常都藏在 logs 裡。\u003C\u002Fp>\u003Cp>這篇整理把 Opus 5 放在一個很有壓力的產業背景裡看，我覺得合理。但對我來說，最後還是只有一個問題：它有沒有減少我產品裡真正的摩擦？\u003C\u002Fp>\u003Cp>所以我不會直接喊換。我會先做 controlled migration，拿同一批流量去比，然後留 rollback。這才是上線，不是朝聖。\u003C\u002Fp>\u003Cp>實操時我會看這幾個指標：\u003C\u002Fp>\u003Cul>\u003Cli>抽 100 到 500 筆真實 request\u003C\u002Fli>\u003Cli>用內部 rubric 評分答案品質\u003C\u002Fli>\u003Cli>量 latency 和 retry rate\u003C\u002Fli>\u003Cli>看使用者可見失敗，不只看模型輸出\u003C\u002Fli>\u003C\u002Ful>\u003Cp>如果 Opus 5 在你的 logs 裡贏了，那就上；如果只是 demo 贏了，我會繼續用原本那套，省得自己找麻煩。\u003C\u002Fp>\u003Ch2>可抄的模板\u003C\u002Fh2>\u003Cpre>\u003Ccode># Claude Opus 5 rollout template for a real product\n\n## Goal\nAdopt Opus 5 only if it keeps quality stable while reducing total model cost.\n\n## Decision rule\nShip the new model when all three are true:\n- cost per successful task goes down\n- latency stays within your acceptable range\n- user-visible quality does not drop on real traffic\n\n## Evaluation set\nUse 50-100 real production prompts, including:\n- clean requests\n- messy requests\n- contradictory follow-ups\n- long-context prompts\n- tool-use prompts with missing or partial fields\n\n## Scoring rubric\nRate each response from 1-5 on:\n- correctness\n- completeness\n- instruction following\n- refusal behavior\n- tool-call quality\n- latency\n\n## Routing policy\n- low complexity: extract, classify, route\n- medium complexity: draft, summarize, rewrite\n- high complexity: reason, plan, multi-step tool use\n\n## Rollout plan\n1. Shadow test on real traffic\n2. Compare old and new outputs side by side\n3. Measure cost, latency, and failure rate\n4. Roll out to 10%\n5. Roll out to 50%\n6. Roll out to 100% only if metrics hold\n\n## Safety checks\nAdd regression cases for:\n- normal requests that should be answered\n- requests that should be refused\n- ambiguous prompts that need clarification\n- tool actions that require confirmation\n\n## Rollback trigger\nRevert if any of these happen:\n- quality drops on core tasks\n- refusal rate rises unexpectedly\n- latency spikes beyond threshold\n- support tickets increase after rollout\n\n## Notes\nKeep the old model available for at least one release cycle so rollback stays cheap and boring.\n\u003C\u002Fcode>\u003C\u002Fpre>\u003Cp>這段模板就是我會直接拿去做 Opus 5 評估的版本。它故意寫得很無聊，因為無聊才代表你真的有機會把模型換上去，而不是把自己送進事故處理群組。\u003C\u002Fp>\u003Cp>原始來源是 \u003Ca href=\"https:\u002F\u002Fzhuanlan.zhihu.com\u002Fp\u002F2064338482990952939\">這篇 Zhihu 整理\u003C\u002Fa>，它再指向 \u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\u002F\">Anthropic 官方頁面\u003C\u002Fa>。上面關於 rollout、路由、評估和模板的部分，是我根據這個脈絡做的實作版整理，不是原文逐字複製。","我拆 Claude Opus 5 的定價與表現說法，整理成可直接套用的模型升級與 rollout 模板。","zhuanlan.zhihu.com","https:\u002F\u002Fzhuanlan.zhihu.com\u002Fp\u002F2064338482990952939",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785607383846-0d63.png","model-release","zh","40da5e56-c978-4c19-b039-71d4121a46eb",[17,18,19,20,21],"Claude Opus 5","model routing","unit economics","prompt evaluation","rollout template",[23,24,25],"先算每個成功任務的成本，不要只看每 token 價格。","用真實、髒的 prompts 測模型，別只看 demo 和 benchmark。","降價有價值的前提，是你真的把預設模型和路由策略改掉。",0,"2026-08-01T18:02:40.319298+00:00","2026-08-01T18:02:40.303+00:00",{"tags":30,"relatedLang":31,"relatedPosts":35},[],{"id":15,"slug":32,"title":33,"language":34},"opus-5-cut-cost-without-losing-quality-en","Opus 5 lets you cut cost without losing quality","en",[36,42,48,54,60,66],{"id":37,"slug":38,"title":39,"cover_image":40,"image_url":40,"created_at":41,"category":13},"39170c12-7e99-4fb8-aebc-d4f155953b6f","openai-cuts-gpt-56-prices-ai-bills-zh","OpenAI 降價 GPT-5.6，AI 成本戰升溫","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785542570368-7qsi.png","2026-08-01T00:02:27.913994+00:00",{"id":43,"slug":44,"title":45,"cover_image":46,"image_url":46,"created_at":47,"category":13},"5c2585a3-075b-460e-a94c-8074cef9fd5c","opus-5-anthropic-pricing-declaration-zh","Opus 5 不是便宜替代品，而是 Anthropic 的定价宣言","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785499377637-rvq1.png","2026-07-31T12:02:29.120933+00:00",{"id":49,"slug":50,"title":51,"cover_image":52,"image_url":52,"created_at":53,"category":13},"7f3ab4f9-0379-43be-bec5-cfcecadb2c16","openai-free-gpt56-access-scientists-zh","OpenAI免費開放GPT-5.6給科學家","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785434587853-kd60.png","2026-07-30T18:02:38.330087+00:00",{"id":55,"slug":56,"title":57,"cover_image":58,"image_url":58,"created_at":59,"category":13},"1b42790d-8acd-4eba-822d-0e389f6ecca6","google-gemini-3-6-flash-pro-missing-zh","谷歌先推 Gemini 3.6 Flash，Pro 仍缺席","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785144807813-mfup.png","2026-07-27T09:32:52.865424+00:00",{"id":61,"slug":62,"title":63,"cover_image":64,"image_url":64,"created_at":65,"category":13},"b2c2e5ae-86cb-42c9-8fb2-88433cfd908e","kimi-k3-forces-silicon-valley-to-pick-sides-zh","Kimi K3 逼矽谷選邊站","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785139414565-q4vu.png","2026-07-27T08:03:09.48247+00:00",{"id":67,"slug":68,"title":69,"cover_image":70,"image_url":70,"created_at":71,"category":13},"4fce0081-1ca3-44a1-91a7-1756615c769e","opus-5-fewer-refusals-ship-faster-zh","Opus 5 讓你少碰拒答","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785045786200-pciu.png","2026-07-26T06:02:43.075148+00:00",[73,78,83,88,93,98,103,108,113,118],{"id":74,"slug":75,"title":76,"created_at":77},"58b64033-7eb6-49b9-9aab-01cf8ae1b2f2","nvidia-rubin-six-chips-one-ai-supercomputer-zh","NVIDIA Rubin 把六顆晶片塞進 AI 機櫃","2026-03-26T07:18:45.861277+00:00",{"id":79,"slug":80,"title":81,"created_at":82},"0dcc2c61-c2a6-480d-adb8-dd225fc68914","march-2026-ai-model-news-what-mattered-zh","2026 年 3 月 AI 模型新聞重點","2026-03-26T07:32:08.386348+00:00",{"id":84,"slug":85,"title":86,"created_at":87},"214ab08b-5ce5-4b5c-8b72-47619d8675dd","why-small-models-are-winning-on-device-ai-zh","小模型為何吃下裝置端 AI","2026-03-26T07:36:30.488966+00:00",{"id":89,"slug":90,"title":91,"created_at":92},"785624b2-0355-4b82-adc3-de5e45eecd88","midjourney-v8-faster-images-higher-costs-zh","Midjourney V8 變快了，也變貴了","2026-03-26T07:52:03.562971+00:00",{"id":94,"slug":95,"title":96,"created_at":97},"9e1044b4-946d-47fe-9e2a-c2ee032e1164","xiaomi-mimo-v2-pro-1t-moe-agents-zh","小米 MiMo-V2-Pro 登場：1T MoE 模型","2026-03-28T03:06:19.002353+00:00",{"id":99,"slug":100,"title":101,"created_at":102},"c4b6186f-bd84-4598-997e-c6e31d543c0d","cursor-composer-2-agentic-coding-model-zh","Cursor Composer 2 走向代理式寫碼","2026-03-28T03:13:06.422716+00:00",{"id":104,"slug":105,"title":106,"created_at":107},"e112e76f-ec3b-408f-810e-e93ae21a888a","apple-siri-gemini-distilled-models-zh","Apple Siri 牽手 Gemini 的真相","2026-03-29T04:52:57.886544+00:00",{"id":109,"slug":110,"title":111,"created_at":112},"c679b51f-194a-463b-87fc-7695256ff752","mimo-v2-pro-vs-omni-vs-flash-2026-zh","MiMo V2 Pro、Omni、Flash 怎麼選","2026-04-02T01:18:43.576128+00:00",{"id":114,"slug":115,"title":116,"created_at":117},"3b988fd7-6749-4f01-ba25-c0ad7486dc31","z-ai-glm-5v-turbo-design2code-claude-zh","GLM-5V-Turbo 在 Design2Code 贏了…","2026-04-02T04:03:36.31741+00:00",{"id":119,"slug":120,"title":121,"created_at":122},"975a7aef-030e-41a6-9401-1c6a342be68e","april-2026-ai-model-releases-zh","2026年4月 AI 模型更新追蹤","2026-04-02T08:45:33.308563+00:00"]