[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-coderescue-budget-calibrated-recovery-routing-zh":3,"article-related-coderescue-budget-calibrated-recovery-routing-zh":30,"series-research-a2a16ea8-c295-4a4e-a887-89294bd40f74":73},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":29},"a2a16ea8-c295-4a4e-a887-89294bd40f74","coderescue-budget-calibrated-recovery-routing-zh","CodeRescue 用預算路由修復代理","\u003Cp>CodeRescue 怎麼決定 coding \u003Ca href=\"\u002Ftag\u002Fagent\">agent\u003C\u002Fa> 失敗後要不要繼續便宜修復？\u003C\u002Fp>\u003Cp data-speakable=\"summary\">CodeRescue 讓寫程式代理在失敗後，依預算決定先便宜修復，還是直接升級更強模型。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：35% 的 mean recovery cost\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：Supervised recovery router plus CRC budget calibration\u003C\u002Fli>\u003C\u002Ful>\u003Cp>這篇論文在處理一個很實際的問題：coding agent 不是只會「答對」或「答錯」。它常常是先失敗，然後留下 runtime、測試或錯誤訊息，這些訊號其實還有用。問題就變成，失敗之後要怎麼走下一步，才不會把預算浪費在不必要的升級上。\u003C\u002Fp>\u003Cp>CodeRescue 的核心想法很直接。不要把失敗當成單純的升級開關。它把失敗後的處理，改\u003Ca href=\"\u002Fnews\u002Frag17-sod1-als-nature-medicine-template-zh\">寫成\u003C\u002Fa>一個 recovery routing 問題：哪些案例值得再用低成本方式修一次，哪些案例應該直接\u003Ca href=\"\u002Fnews\u002Fanthropic-meta-compute-dependence-zh\">交給\u003C\u002Fa>更強、也更貴的模型。論文再加上一層校準，讓同一個 routing policy 可以在不同預算下部署，不必每次都重訓。\u003C\u002Fp>\u003Ch2>這篇在解什麼痛點\u003C\u002Fh2>\u003Cp>對做 coding agent 的團隊來說，第一輪輸出常常不是終點。程式跑起來之後，系統會回傳錯誤、測試失敗或執行結果。這些回饋會透露很多資訊，甚至足以讓一次便宜的修復嘗試把問題救回來。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784703788706-iyd6.png\" alt=\"CodeRescue 用預算路由修復代理\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>但很多 cost-aware 系統的做法還是太粗。它們常見的模式是 cascade：先用便宜模型，失敗就把難題升級給更強的模型。這種做法在「失敗就是死路」時很合理，可是在 coding agent 場景裡，失敗往往只是中途訊號，不一定代表要立刻升級。\u003C\u002Fp>\u003Cp>所以這篇論文要修的是\u003Ca href=\"\u002Fnews\u002Fappearance-pointers-region-control-dits-zh\">控制\u003C\u002Fa>邏輯，不是單純換模型。它問的不是「這題難不難」，而是「看過失敗回饋後，哪一種 recovery action 的成本與成功率最划算」。這就是 CodeRescue 想處理的 routing 決策。\u003C\u002Fp>\u003Ch2>方法怎麼運作\u003C\u002Fh2>\u003Cp>方法分兩層。第一層是把 post-failure decision 定義成在 heterogeneous actions 之間做 recovery routing。白話一點，就是 router 不再只做「便宜 vs. 昂貴」的二選一，而是根據情況挑不同的修復路徑。\u003C\u002Fp>\u003Cp>第二層是訓練方式。論文說這個 router 是用 supervised 的方式，根據 execution rollouts 來學。摘要沒有把所有特徵、模型架構或標註細節寫滿，但主軸很清楚：把過去失敗後的執行歷史和結果拿來學，讓系統知道在什麼情況下哪種 recovery action 比較容易成功。\u003C\u002Fp>\u003Cp>真正讓它能部署在不同預算下的，是 CRC，也就是 Conformal Risk Control。論文把 CRC 加進來，當成一個 calibration layer，用來在部署時選擇 cost penalty，而且不用重訓 router。這點很重要，因為實務上的預算不是固定的。有時候你想省錢，有時候你又想衝 solve rate，如果每換一次目標就要重訓，維運成本會很高。\u003C\u002Fp>\u003Cp>作者還把這層校準描述成能在 exchangeability 假設下，提供 marginal expected-cost control。講白話，就是它想讓這個「預算旋鈕」不只是經驗法則，而是有統計意義的控制手段。對操作端來說，這比單純調 heuristic 更有可預期性。\u003C\u002Fp>\u003Ch2>論文實際證明了什麼\u003C\u002Fh2>\u003Cp>評估是用五個 coding \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 的 held-out failures。摘要沒有列出 benchmark 名稱，也沒有公開完整的每項分數，所以這裡看不到完整 benchmark 細節。能確認的是，便宜修復和升級處理在這些失敗案例上呈現互補的成功模式。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784703831614-1noi.png\" alt=\"CodeRescue 用預算路由修復代理\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這個互補性是整篇論文最重要的實證訊號。它表示選擇不是「便宜一定比較差」或「昂貴一定比較穩」。有些失敗值得再做一次低成本修復，有些則應該直接升級。CodeRescue 的目標，就是把這兩類 case 分開，而不是硬塞進同一條 cascade。\u003C\u002Fp>\u003Cp>摘要還說，經過校準的 frontier 比 fixed actions、prompt-only routers 和 binary cascade baseline 都更好。最明確的數字是：在主 GPT-5.4-nano \u002F GPT-5.4 設定裡，某個 CRC-calibrated frontier point 的 solve rate 超過 always-escalate，而且只用了它平均 recovery cost 的 35%。\u003C\u002Fp>\u003Cp>這個結果對實作者很有意思，因為它不是單純拿準確率換成本。至少在那個操作點上，它可以比「一律升級」更會解題，同時把 recovery 成本壓得很低。不過摘要沒有給完整 frontier 曲線，所以無法從這段資料判斷這個優勢在所有 budget 下是否都穩定。\u003C\u002Fp>\u003Ch2>對開發者的實際影響\u003C\u002Fh2>\u003Cp>如果你在做 coding agent，這篇論文最直接的提醒是：失敗處理本身就是一個 budgeted control problem，不只是 fallback。一次失敗的執行結果，常常是有價值的訊號。下一步不一定要立刻丟給最大模型，也可能先用便宜的 recovery 再試一次更划算。\u003C\u002Fp>\u003Cp>這對產品和基礎設施都很有感。產品面上，它有機會在不把所有難題都送去最貴路徑的前提下，提高 solve rate。基礎設施面上，它提供一個更明確的方式去管理失敗後的推理支出。很多 agent workflow 的預算，其實就是在這些「失敗後再試一次」的環節慢慢燒掉的。\u003C\u002Fp>\u003Cp>CRC 的校準角度也很實用。部署預算通常不會永遠固定，今天要省、明天要衝，臨時改 cost target 很常見。如果能直接調 penalty，而不是每次重訓一個 router，操作上會乾淨很多。前提當然是你的資料分佈和論文假設夠接近。\u003C\u002Fp>\u003Ch2>限制與還沒回答的問題\u003C\u002Fh2>\u003Cp>摘要把方法講得很清楚，但實作細節留得不少。它沒有交代 router 的具體架構、supervised label 怎麼做、五個 benchmark 分別是什麼，也沒有說 recovery actions 的完整形式。這些資訊對要重現系統，或拿來跟自家 agent stack 比較的人來說，都很重要。\u003C\u002Fp>\u003Cp>還有一個統計上的限制。CRC 依賴 exchangeability 假設，並且給的是 marginal expected-cost control。這種保證有用，但不代表在 production 裡一定穩。只要你的工作負載分佈變了、工具鏈變了、測試環境 drift 了，這個假設就可能開始鬆動。\u003C\u002Fp>\u003Cp>最後，摘要只報告一個強的 operating point，沒有完整部署故事。我們知道它在 35% 的 mean recovery cost 下能超過 always-escalate solve rate，但不知道 latency 會怎麼變，也不知道它對不同 coding 任務、不同模型配對的敏感度有多高。這些都會影響真實上線價值。\u003C\u002Fp>\u003Ch2>總結\u003C\u002Fh2>\u003Cp>CodeRescue 想做的事，其實很務實：讓 coding agent 在第一次失敗後，別急著全數升級，而是先判斷哪種 recovery 路徑最划算。它把失敗視為有資訊的狀態，再用 supervised router 加上 CRC 校準，把預算控制做得更細。\u003C\u002Fp>\u003Cp>對開發者來說，這篇的訊息很明確。post-failure routing 不是小題目，而是會直接影響成本與 solve rate 的核心控制問題。這篇論文展示了一條可行路徑，但摘要也留下不少空白。真正的考驗，會是它能不能在論文列出的 benchmark 之外，還維持同樣的成本品質平衡。\u003C\u002Fp>\u003Cul>\u003Cli>失敗後的執行回饋，可以當成有用訊號來路由。\u003C\u002Fli>\u003Cli>CRC 讓同一個 recovery policy 能對不同預算做校準。\u003C\u002Fli>\u003Cli>摘要中的最佳點，是 35% mean recovery cost 下仍能超過 always-escalate。\u003C\u002Fli>\u003C\u002Ful>","CodeRescue 讓寫程式代理在失敗後，依預算決定先便宜修復，還是直接升級更強模型。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.19338",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784703788706-iyd6.png","research","zh","302ac5a7-8d8f-462e-88ea-739f7aa89fb1",[17,18,19,20,21],"coding agents","recovery routing","Conformal Risk Control","budget calibration","cascade baseline",[23,24,25],"失敗後的 coding agent 不一定要立刻升級，先做便宜修復可能更划算。","CodeRescue 用 supervised router 搭配 CRC，讓同一策略可依預算調整。","摘要只公開一個關鍵 operating point，完整 benchmark 與實作細節仍未揭露。",0,"2026-07-22T07:02:32.818231+00:00","2026-07-22T07:02:32.796+00:00","6a7b7661-e0a0-458f-8e6f-9dab45397d15",{"tags":31,"relatedLang":32,"relatedPosts":36},[],{"id":15,"slug":33,"title":34,"language":35},"coderescue-budget-calibrated-recovery-routing-en","CodeRescue routes coding-agent recovery by budget","en",[37,43,49,55,61,67],{"id":38,"slug":39,"title":40,"cover_image":41,"image_url":41,"created_at":42,"category":13},"b6f7330a-8146-4acf-ab45-c9367c3e61e1","appearance-pointers-region-control-dits-zh","Appearance Pointers 讓 DiT 支援區域控制","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784701999191-3ruf.png","2026-07-22T06:32:27.754954+00:00",{"id":44,"slug":45,"title":46,"cover_image":47,"image_url":47,"created_at":48,"category":13},"b00fe485-a4d9-4916-954c-398d66830a22","gear-cuts-copying-long-context-reasoning-zh","GEAR 讓長上下文少抄多想","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784700182832-nc4d.png","2026-07-22T06:02:29.644263+00:00",{"id":50,"slug":51,"title":52,"cover_image":53,"image_url":53,"created_at":54,"category":13},"584d0e47-4c7e-469e-8d28-236966c00188","rag17-sod1-als-nature-medicine-template-zh","RAG-17 把 SOD1-ALS 寫成可抄模板","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784678591746-wzd8.png","2026-07-22T00:02:47.756002+00:00",{"id":56,"slug":57,"title":58,"cover_image":59,"image_url":59,"created_at":60,"category":13},"f039531b-dbe8-43e5-a037-5ad6ca590524","survey-of-large-language-models-zh","大型語言模型全景整理","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784629980760-ftkd.png","2026-07-21T10:32:29.369537+00:00",{"id":62,"slug":63,"title":64,"cover_image":65,"image_url":65,"created_at":66,"category":13},"55d40b40-0d7a-4ffb-906b-18b284fb3a3a","evaluating-memory-in-llm-agents-zh","用多輪互動測 LLM 記憶","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784628186159-2km8.png","2026-07-21T10:02:36.154394+00:00",{"id":68,"slug":69,"title":70,"cover_image":71,"image_url":71,"created_at":72,"category":13},"828339d3-50c4-47fd-ba13-1a50f8430793","persona-steering-llm-capabilities-analysis-zh","Persona steering 會改變模型能力嗎","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784626389337-g5ex.png","2026-07-21T09:32:27.763156+00:00",[74,79,84,89,94,99,104,109,114,119],{"id":75,"slug":76,"title":77,"created_at":78},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":80,"slug":81,"title":82,"created_at":83},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":85,"slug":86,"title":87,"created_at":88},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":90,"slug":91,"title":92,"created_at":93},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":95,"slug":96,"title":97,"created_at":98},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":100,"slug":101,"title":102,"created_at":103},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":105,"slug":106,"title":107,"created_at":108},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":110,"slug":111,"title":112,"created_at":113},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":115,"slug":116,"title":117,"created_at":118},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":120,"slug":121,"title":122,"created_at":123},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]