[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-argus-self-evolving-runtime-long-tasks-zh":3,"article-related-argus-self-evolving-runtime-long-tasks-zh":29,"series-research-9ffcddf6-f52b-4ca8-99f5-a927ec5261b4":72},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"9ffcddf6-f52b-4ca8-99f5-a927ec5261b4","argus-self-evolving-runtime-long-tasks-zh","Argus：會自我演化的長任務 runtime","\u003Cp>Argus 怎麼讓代理在長任務裡不走偏？\u003C\u002Fp>\u003Cp data-speakable=\"summary\">Argus 把長任務代理的重點放在 runtime：固定模型權重，靠可驗證狀態與角色化審查，讓流程能在長流程中修正、延續與演化。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：SWE-Bench Pro 約 78%\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：可驗證狀態自我演化\u003C\u002Fli>\u003C\u002Ful>\u003Cp>長任務代理最怕的，不是第一步答錯，而是做了十幾步之後才發現整條路都歪了。這篇論文的重點，就是把這個問題當成 runtime 設計來處理，而不是只靠模型本身更會猜。Argus 的做法很直接：模型權重固定不動，真正會變的是 runtime 裡的狀態、流程與驗證機制。\u003C\u002Fp>\u003Cp>這個切法對開發者很重要。很多 agent 失敗，不是因為模型完全不會\u003Ca href=\"\u002Fnews\u002Freasoning-core-procedural-reasoning-data-zh\">推理\u003C\u002Fa>，而是卡在記憶、路由、協作、回頭修正這些系統層問題。Argus 想做的，就是把這些東西\u003Ca href=\"\u002Fnews\u002Fsource-2-swaps-bsp-for-meshes-and-octrees-zh\">變成\u003C\u002Fa>可管理、可審查、可保留的工作流，而不是一個黑箱式的對話迴圈。\u003C\u002Fp>\u003Ch2>它想解的痛點是什麼\u003C\u002Fh2>\u003Cp>原始摘要把長程推理描述成一個 runtime 問題。代理要能在證據支持時持續前進，也要能在量測結果顯示失敗、隱藏限制，或目標其實被定錯時，及時轉向。這代表系統不能只會「回答一次」，而是要能跨很多步驟持續工作，還要保留已經學到的東西。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785997980205-qk1s.png\" alt=\"Argus：會自我演化的長任務 runtime\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>Argus 的設計，是把使用者意圖和執行層目標分開。使用者真正想要的東西保持穩定；但操作目標、限制條件、驗證標準，可以隨著任務進展調整。這種分層很像工程實務裡的需求管理：需求不一定變，但解法會一直修。\u003C\u002Fp>\u003Cp>摘要裡提到，Argus 是一個 persistent、self-evolving runtime，讓 Manager、Planner、Engineer、Reviewer 四種角色在持久化的 project state 上執行 bounded missions。這不是單純多幾個 agent 名稱而已，而是把協作拆成不同職責，讓每一步都有明確的審查與交接點。\u003C\u002Fp>\u003Cp>對開發者來說，這種設計的價值在於，它把「代理會記得什麼」和「代理憑什麼記得」講清楚了。不是所有內容都能直接寫進長期記憶。只有經過 role-owned review，且在可用時通過 task-native verification 的資訊，才會變成可持久化的狀態。這能降低壞捷徑被永久保存的風險。\u003C\u002Fp>\u003Ch2>方法到底怎麼運作\u003C\u002Fh2>\u003Cp>Argus 最核心的決定，是固定模型權重。也就是說，它不把線上學習放在模型參數上，而是放在 runtime 本身。系統的「學習」發生在持久化狀態與控制策略裡，這些狀態可以在 operator-owned escalation points 之間持續運作。\u003C\u002Fp>\u003Cp>白話一點，Argus 想拆開三件常被混在一起的事：使用者要什麼、系統現在怎麼做、以及哪些東西已經被驗證過。這樣做的好處是，系統不會因為某次臨時的捷徑就把錯誤路線內建成未來行為。\u003C\u002Fp>\u003Cp>摘要提到，runtime 內可以保存 memories、\u003Ca href=\"\u002Ftag\u002Fskills\">skills\u003C\u002Fa>、procedures、verifiers、routing decisions，甚至 rejected routes。重點不是「有沒有記錄」，而是「哪些記錄經過審查後才准進入可重用狀態」。這讓 Argus 比一般 memory-augmented agent 更像一個有治理機制的工作系統。\u003C\u002Fp>\u003Cp>四個角色的分工也很有意思。Manager 負責協調，Planner 負責規劃下一步，Engineer \u003Ca href=\"\u002Fnews\u002Fgolang-basics-for-beginners-2026-zh\">實作\u003C\u002Fa>，Reviewer 檢查。摘要沒有把每條內部規則全部展開，但它已經明確指出，review 和 verification 不是附加功能，而是讓 state 變成 durable 的必要條件。\u003C\u002Fp>\u003Cp>這也解釋了為什麼 Argus 不是單純「多一層記憶」。它維護的是一個 persistent project state，裡面不只放成功路徑，也保留被拒絕的路線，方便之後分析。這種結構化軌跡，對長任務的可追蹤性很有幫助。\u003C\u002Fp>\u003Ch2>論文實際證明了什麼\u003C\u002Fh2>\u003Cp>摘要給出的數字，主要圍繞七個 GPT-5.5 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 場景。最明確的一筆是 \u003Ca href=\"\u002Ftag\u002Fswe-bench\">SWE-Bench\u003C\u002Fa> Pro：約 78%，對照 Direct \u003Ca href=\"\u002Ftag\u002Fcopilot\">Copilot\u003C\u002Fa> 的 59%。同時，Argus 使用的是 1.41 倍的 aggregate tokens。這代表它不是用更省資源換來更高分，而是用更多上下文與流程成本，換取更穩的結果。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785997984704-tri8.png\" alt=\"Argus：會自我演化的長任務 runtime\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>摘要還提到 Argus 在 AARRI-Bench 達到 76.8%，以及在 mathematical data synthesis 上有 28.0 個百分點的差距。不過，原始摘要沒有公開完整 benchmark 細節，所以這裡能確認的是方向與部分結果，還不能補出完整表格或所有 baseline。\u003C\u002Fp>\u003Cp>另一個重要訊號，是 verification-gated self-evolution 帶來的效率變化。在成熟的 SWE-Bench waves 中，Argus 每個任務的 solve-input tokens 減少 21%，active workflow time 也少了 15%。摘要同時提到 34 verifier recoveries 和 22 strict review-loop rescues，顯示系統不只是在成功時累積經驗，也能在中途卡關時把流程救回來。\u003C\u002Fp>\u003Cp>除了 benchmark，摘要還列出幾個具體任務結果。包含一個 optimized RWKV6 kernel 被合併 upstream、一個多日數學 campaign 保留了 falsified routes 與 proof-backed frontier updates，以及六個 paper pipelines 完成 254 個 missions，過程中有 16 次 stage rollbacks。這些案例的共同點，是 Argus 被用在多步驟、可回滾、需要證據累積的工作上。\u003C\u002Fp>\u003Cp>換句話說，這篇論文想證明的不是「模型更大所以更強」，而是「把代理當成 runtime 系統來管，長任務表現可以更穩，而且能保留可驗證的進展」。\u003C\u002Fp>\u003Ch2>對開發者的實際影響\u003C\u002Fh2>\u003Cp>如果你在做 coding agent、研究助手，或任何要跨很多步驟完成工作的自動化流程，Argus 提供了一個很實用的方向：長任務可靠性，也許不該先從更聰明的 base model 開始，而是先從更嚴格的 runtime 開始。\u003C\u002Fp>\u003Cp>這篇摘要最值得抄的，不是某個單點技巧，而是它把 verification、routing、review 都變成一等公民。對團隊來說，這很像把 agent 從「會回答」升級成「會被管理」。只要任務夠長，這種差別就會變得很大，因為錯誤不再只是錯一次，而是會一路累積。\u003C\u002Fp>\u003Cp>摘要也提到，這個系統會產生 structured trajectories，未來可供 supervised learning 與 \u003Ca href=\"\u002Ftag\u002Freinforcement-learning\">reinforcement learning\u003C\u002Fa> 使用。這代表 runtime 不只是拿來跑任務，還能順便產出更好的訓練資料。對做 agent 基礎建設的人來說，這點很有價值：今天的執行痕跡，可能就是明天的訓練素材。\u003C\u002Fp>\u003Cp>但限制也要看清楚。摘要沒有給完整實驗設定，也沒有公開所有 benchmark 細節。結果主要綁在論文挑選的幾個場景上，所以不能直接推論到所有領域。另外，Argus 在 SWE-Bench Pro 上用了更多 aggregate tokens，表示它不是免費提效，runtime 的治理與驗證本身有成本。\u003C\u002Fp>\u003Cp>所以，這篇論文比較像是在提醒大家：長任務 agent 的競爭點，正在從 prompt 技巧和單次推理，往 runtime 架構移動。能不能把狀態管好、把錯誤攔住、把驗證做成流程，可能比單次回答多漂亮更關鍵。\u003C\u002Fp>\u003Ch2>值得繼續觀察的地方\u003C\u002Fh2>\u003Cp>第一，要看這種 role-based runtime 的模式，能不能離開論文的 benchmark 場景，真的進到更雜的實務任務。第二，要看 token overhead 到底值不值得。當系統用更多上下文換更好的恢復能力，這個交換比在不同場景裡可能差很多。\u003C\u002Fp>\u003Cp>第三，structured trajectories 會不會真的幫助後續的 supervised 或 RL 訓練，這也值得追。若答案是肯定的，Argus 這類 runtime 的價值就不只在執行，還會延伸到資料生成與訓練閉環。\u003C\u002Fp>\u003Cp>總結來說，Argus 提供了一個很清楚的訊號：下一波 agent 進步，可能不只是模型更大，而是 runtime 更會管事。對工程團隊來說，這是很值得拿來拆設計圖的方向。\u003C\u002Fp>\u003Cul>\u003Cli>長任務代理的關鍵，可能在 runtime 治理，不只在模型能力。\u003C\u002Fli>\u003Cli>驗證門檻、角色分工、持久化狀態，都是可落地的設計點。\u003C\u002Fli>\u003Cli>更高準確率可能伴隨更多 token 成本，效率需要一起算。\u003C\u002Fli>\u003C\u002Ful>","Argus 把長任務代理的重點放在 runtime：固定模型權重，靠可驗證狀態與角色化審查，讓流程能在長流程中修正、延續與演化。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.05144",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785997980205-qk1s.png","research","zh","011efa03-c54d-430a-8810-01f0a5422ad2",[17,18,19,20,21],"agent runtime","long-horizon tasks","verification","persistent state","self-evolution",[23,24,25],"Argus 把長任務代理問題改寫成 runtime 設計問題。","它用固定權重、可驗證狀態與角色化審查來保留有效進展。","摘要顯示它能提升部分 benchmark 表現，但也帶來 token 成本。",0,"2026-08-06T06:32:34.986144+00:00","2026-08-06T06:32:34.951+00:00",{"tags":30,"relatedLang":31,"relatedPosts":35},[],{"id":15,"slug":32,"title":33,"language":34},"argus-self-evolving-runtime-long-tasks-en","Argus: a self-evolving runtime for long tasks","en",[36,42,48,54,60,66],{"id":37,"slug":38,"title":39,"cover_image":40,"image_url":40,"created_at":41,"category":13},"a2ae5975-7c35-4094-9d13-922f15cb1034","octolong-cross-repository-code-contexts-zh","OctoLong 用跨倉庫程式脈絡訓練長上下文模型","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785999778532-gdas.png","2026-08-06T07:02:26.875328+00:00",{"id":43,"slug":44,"title":45,"cover_image":46,"image_url":46,"created_at":47,"category":13},"975385e8-e9e9-4c95-a671-8698277cd71c","reasoning-core-procedural-reasoning-data-zh","Reasoning Core 讓程序推理資料更好用","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785996216956-aq0n.png","2026-08-06T06:03:09.482977+00:00",{"id":49,"slug":50,"title":51,"cover_image":52,"image_url":52,"created_at":53,"category":13},"499d414d-4573-44b3-a643-dbfb8c269d8e","anthropic-shikong-ceshi-ai-anquan-weiguo-zh","Anthropic的失控测试：AI安全还没过关","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785931378812-l2ud.png","2026-08-05T12:02:33.709216+00:00",{"id":55,"slug":56,"title":57,"cover_image":58,"image_url":58,"created_at":59,"category":13},"ea21ed90-eaf8-4d46-97c9-4e495ed14c83","worldcup-arena-live-llm-forecasting-zh","WorldCup Arena：LLM 直播預測實測","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785913378717-go7u.png","2026-08-05T07:02:29.072783+00:00",{"id":61,"slug":62,"title":63,"cover_image":64,"image_url":64,"created_at":65,"category":13},"fa03dc7f-4db2-4122-ab50-729e2f795964","societybench-social-event-forecasting-benchmark-zh","SocietyBench：測 LLM 社會事件預測","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785911578272-io30.png","2026-08-05T06:32:28.944853+00:00",{"id":67,"slug":68,"title":69,"cover_image":70,"image_url":70,"created_at":71,"category":13},"44310f51-8114-47f6-97c9-14e51bec9bfa","parvl-parallel-scaling-multimodal-llms-zh","ParVL：把多模態算力拆成平行分支","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785909776069-mqs4.png","2026-08-05T06:02:26.916098+00:00",[73,78,83,88,93,98,103,108,113,118],{"id":74,"slug":75,"title":76,"created_at":77},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":79,"slug":80,"title":81,"created_at":82},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":84,"slug":85,"title":86,"created_at":87},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":89,"slug":90,"title":91,"created_at":92},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":94,"slug":95,"title":96,"created_at":97},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":99,"slug":100,"title":101,"created_at":102},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":104,"slug":105,"title":106,"created_at":107},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":109,"slug":110,"title":111,"created_at":112},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":114,"slug":115,"title":116,"created_at":117},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":119,"slug":120,"title":121,"created_at":122},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]