[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-long-horizon-agents-need-harnesses-first-zh":3,"article-related-long-horizon-agents-need-harnesses-first-zh":29,"series-research-5ad81825-9899-4eb5-a4c3-321f076983ad":77},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"5ad81825-9899-4eb5-a4c3-321f076983ad","long-horizon-agents-need-harnesses-first-zh","長程代理先做護欄，不要先拚更大模型","\u003Cp data-speakable=\"summary\">955 個 stars 指向同一件事：長程\u003Ca href=\"\u002Fnews\u002Fdeepseek-plugin-harness-turns-agents-into-tools-zh\">代理\u003C\u002Fa>最快的進步來自護欄工程，不是只靠模型變大。\u003C\u002Fp>\u003Cp>我站在護欄先行這一邊：長程代理要先把 runtime、記憶、工具、驗證做穩，才談得上更大的模型。RUC-NLPIR 的 survey 把外部化的 \u003Ca href=\"\u002Ftag\u002Fharness-engineering\">harness engineering\u003C\u002Fa> 放在前面，這不是分類習慣，而是現實排序。因為真正卡住代理的，常常不是推理能力，而是跨步驟的狀態保存、錯誤恢復、工具調度與結果校驗。\u003C\u002Fp>\u003Ch2>第一個論點\u003C\u002Fh2>\u003Cp>第一個證據很直接：該 survey 的 \u003Ca href=\"\u002Ftag\u002Fgithub\">GitHub\u003C\u002Fa> repository 有 955 個 stars，代表這個方向不是紙上談兵，而是已經形成明確共識。更重要的是，它把 loops、workflows、context、memory、tools、orchestration、hooks、verification 排在 fine-tuning 與 RL 前面，這等於承認一件事：長程任務的第一瓶頸是執行可靠性，不是再多一點參數。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786842161557-ugs3.png\" alt=\"長程代理先做護欄，不要先拚更大模型\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>具體案例也支持這個排序。現在很多 \u003Ca href=\"\u002Ftag\u002Fagent\">agent\u003C\u002Fa> demo 看起來會規劃、會反思、會呼叫工具，但一旦任務拉長到十幾步，就會在中途丟失狀態、重複操作或忽略失敗回報。這時候加大模型，效果常常只是在單步推理上更漂亮；真正讓任務完成率上升的，是加入 checkpoint、retry、fallback、verifier 這些工程機制。\u003C\u002Fp>\u003Ch2>第二個論點\u003C\u002Fh2>\u003Cp>第二個證據來自時間軸。survey 描述了從 2020 到 2023 的 \u003Ca href=\"\u002Ftag\u002Fprompt-engineering\">prompt engineering\u003C\u002Fa>，到 2023 到 2025 的 context engineering，再到 2025 之後的 runtime harnesses。這條路線很清楚：產業重心不是往「更會說話的模型」移，而是往「更能把事做完的系統」移。這不是理論推演，而是整個領域的演進方向。\u003C\u002Fp>\u003Cp>再看長程能力的增長速度，資料顯示 frontier \u003Ca href=\"\u002Ftag\u002Fai-agents\">AI agents\u003C\u002Fa> 的 time horizon 正在以「大約每幾個月翻倍」的速度成長。這個現象最能說明問題：同一個 base model，因為外層系統更會管理狀態、分支、重試與驗證，就能撐過更多回合。換句話說，市場買到的不是單純的模型智力，而是被 harness 放大的持續作戰能力。\u003C\u002Fp>\u003Ch2>反方可能怎麼說\u003C\u002Fh2>\u003Cp>最強的反對意見是：護欄只是補丁。若一個系統需要大量 orchestration、memory、retry 和 verification，代表模型本身不夠 agentic。真正的進步應該來自把策略內化到模型裡，讓外層系統越來越薄，最後只剩一個更強的 policy。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786842166082-16xe.png\" alt=\"長程代理先做護欄，不要先拚更大模型\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>另一個合理批評是成本。runtime 系統會增加延遲、工程複雜度與失敗面，對簡單任務甚至是浪費。若產品場景只需要一次性回答，堆太多 harness 不但不划算，還會拖慢體驗。\u003C\u002Fp>\u003Cp>但這些批評不推翻護欄先行，只是提醒護欄不是永久替代品。長程代理今天的核心問題，是如何把有限的模型能力轉成可重複完成的行動。這件事靠 harness 最快，因為它能立刻\u003Ca href=\"\u002Fnews\u002Fglm-5-3-coding-gains-post-training-zh\">提升\u003C\u002Fa>完成率，還能在運行中產生 trajectories、failure cases 與 feedback，反過來餵給後續的內化訓練。先把系統做穩，再把穩定性訓進模型，才是正路。\u003C\u002Fp>\u003Ch2>你能做什麼\u003C\u002Fh2>\u003Cp>如果你是工程師，先設計 state、recovery、tool routing、verification，再去追新 checkpoint；如果你是 PM，把成功指標改成多步任務完成率與失敗恢復率，而不是單輪流暢度；如果你是創辦人，先\u003Ca href=\"\u002Fnews\u002Fdefi-development-x-spaces-investor-theater-zh\">投資\u003C\u002Fa>可重用的 runtime 基礎設施，因為那才是能跨模型累積的護城河。\u003C\u002Fp>","長程代理的進步，主要來自護欄式系統設計與執行層工程，而不是單靠把模型做更大。","github.com","https:\u002F\u002Fgithub.com\u002FRUC-NLPIR\u002FAwesome-Long-Horizon-Agents",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786842161557-ugs3.png","research","zh","8c60629c-8f58-4dd5-885d-8b04cd39cc68",[17,18,19,20,21],"長程代理","harness engineering","runtime","context engineering","verification",[23,24,25],"長程代理的第一瓶頸是執行可靠性，不是單步推理能力。","護欄工程能同時提升當下完成率，並為後續模型內化提供資料。","把成功定義為多步任務完成，而不是單輪回答漂亮。",1,"2026-08-16T01:02:19.951812+00:00","2026-08-16T01:02:19.916+00:00",{"tags":30,"relatedLang":36,"relatedPosts":40},[31,34],{"name":32,"slug":33},"Harness Engineering","harness-engineering",{"name":20,"slug":35},"context-engineering",{"id":15,"slug":37,"title":38,"language":39},"long-horizon-agents-need-harnesses-first-en","Long-horizon agents need harnesses first, not bigger models","en",[41,47,53,59,65,71],{"id":42,"slug":43,"title":44,"cover_image":45,"image_url":45,"created_at":46,"category":13},"fd42a2a4-6021-413a-8fbc-7e012bd1ff57","grok-46-frontier-intelligence-cost-efficiency-zh","Grok 4.6 把前沿智商壓回預算內","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786816989117-lvef.png","2026-08-15T18:02:42.300845+00:00",{"id":48,"slug":49,"title":50,"cover_image":51,"image_url":51,"created_at":52,"category":13},"a4b2608a-12d1-4e01-b1d7-9d5d05fd1515","anthropic-watermark-copy-paste-dev-workflow-zh","Anthropic 水印在真實開發流程失靈","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786775572720-vnxl.png","2026-08-15T06:32:25.385868+00:00",{"id":54,"slug":55,"title":56,"cover_image":57,"image_url":57,"created_at":58,"category":13},"f42a268c-f48c-42cb-89a2-7f39a848bf1a","neura-ai-benchmark-index-claude-grok-zh","Neura 指數把 Claude 與 Grok 推上前段班","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786730587164-15w7.png","2026-08-14T18:02:37.974144+00:00",{"id":60,"slug":61,"title":62,"cover_image":63,"image_url":63,"created_at":64,"category":13},"70584f73-54b3-4548-944b-7c596e1e3db5","humantracker-human-aligned-motion-tracking-benchmark-zh","HumanTracker補上人形評測盲點","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786690974820-0s3o.png","2026-08-14T07:02:30.412806+00:00",{"id":66,"slug":67,"title":68,"cover_image":69,"image_url":69,"created_at":70,"category":13},"6bbeb865-a249-440c-839f-cf1763be8ab2","omni-scientist-full-stack-ai-science-zh","OmniScientist：AI 科學家先看原始證據","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786689182933-w118.png","2026-08-14T06:32:31.082995+00:00",{"id":72,"slug":73,"title":74,"cover_image":75,"image_url":75,"created_at":76,"category":13},"3a451f17-5483-4c4f-930c-3e58a97760a1","autodesign-meta-harness-optimization-posters-zh","AutoDesign：讓海報生成自己變強","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786687383071-oaq0.png","2026-08-14T06:02:26.50133+00:00",[78,83,88,93,98,103,108,113,118,123],{"id":79,"slug":80,"title":81,"created_at":82},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":84,"slug":85,"title":86,"created_at":87},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":89,"slug":90,"title":91,"created_at":92},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":94,"slug":95,"title":96,"created_at":97},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":99,"slug":100,"title":101,"created_at":102},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":104,"slug":105,"title":106,"created_at":107},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":109,"slug":110,"title":111,"created_at":112},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":114,"slug":115,"title":116,"created_at":117},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":119,"slug":120,"title":121,"created_at":122},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":124,"slug":125,"title":126,"created_at":127},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]