[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-test-time-harnesses-weak-model-transfer-zh":3,"article-related-test-time-harnesses-weak-model-transfer-zh":29,"series-research-a212bb55-ce9d-4c3e-870d-8d6cd0ff3b76":73},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"a212bb55-ce9d-4c3e-870d-8d6cd0ff3b76","test-time-harnesses-weak-model-transfer-zh","測試時外掛讓弱模型升級","\u003Cp data-speakable=\"summary\">以前要靠重訓練把弱模型變強，現在強模型可直接在測試時替它搭外掛，且不改任何參數。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：平均表現從 0.49 升到 0.91\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：強模型迭代建構測試時外掛\u003C\u002Fli>\u003C\u002Ful>\u003Cp>這篇論文在問一個很實際的問題：如果模型已經部署了，還能不能不重訓練，就讓它在測試時變得更可靠？作者的答案是可以，而且做法不是改權重，而是讓更強的模型去替弱模型設計一層「harness」包在外面。\u003C\u002Fp>\u003Cp>這個\u003Ca href=\"\u002Fnews\u002Fclaude-invisible-watermark-right-direction-zh\">方向\u003C\u002Fa>很像把能力轉移，從「訓練時搬進模型裡」改成「推論時搬到系統外層」。對開發者來說，差別很大。因為重訓練通常要資料、時間、算力，還會牽動部署流程；但如果只是調整推論流程，很多場景會更快、更便宜，也比較容易在既有系統上落地。\u003C\u002Fp>\u003Ch2>這篇論文要解什麼痛點\u003C\u002Fh2>\u003Cp>傳統的能力轉移，通常發生在訓練階段。大模型當老師，小模型當學生，透過 teacher forcing 或 on-policy distillation 之類的方法，把能力塞進學生模型裡。問題是，這些方法都要更新目標模型的參數。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786604574332-ails.png\" alt=\"測試時外掛讓弱模型升級\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>作者想處理的痛點很直接：如果模型已經訓練完、甚至已經上線，還有沒有辦法繼續幫它補強？尤其是在不能動權重的前提下，能不能只靠測試時的系統設計，把弱模型的輸出拉穩？\u003C\u002Fp>\u003Cp>這也是為什麼這篇不是在談新的訓練法，而是在談 \u003Ca href=\"\u002Ftag\u002Finference\">inference\u003C\u002Fa>-time harness。作者把一部分原本要靠模型自己完成的工作，搬到模型外面處理。這個外層結構可以幫忙約束輸出、路由輸入，或把不穩定的推理步驟交給 deterministic \u003Ca href=\"\u002Fnews\u002Fava-encoder-agent-native-video-representation-zh\">code\u003C\u002Fa>。\u003C\u002Fp>\u003Ch2>方法到底怎麼做\u003C\u002Fh2>\u003Cp>論文把這招稱為 \u003Cem>strong-to-weak scaffolding\u003C\u002Fem>。概念上，就是由一個更強的 builder model，替一個較弱的 target model 建立測試時外掛，然後再反覆迭代修正。\u003C\u002Fp>\u003Cp>摘要裡提到的流程是：builder model 會用 5% 的資料當 validation set 來調整 harness，之後再把調好的版本拿去完整 test set 上評估。整個過程中，target model 完全不更新參數。也就是說，模型本體是 frozen 的，變的是外部包裝。\u003C\u002Fp>\u003Cp>這裡的 harness 不是單純的 prompt，也不是一般的 adapter。從摘要能看出的特徵是，它可以包含 deterministic code、\u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa>-specific routing，以及嚴格的 answer-format enforcement。白話一點，就是外層系統幫弱模型把容易出錯的部分先收掉，讓它在受控條件下作答。\u003C\u002Fp>\u003Cp>作者還提到，這個 harness 是 iterative refinement 出來的，不是一次寫好就結束。強模型會一輪一輪修，直到外掛在驗證集上表現更穩。這種設計的\u003Ca href=\"\u002Fnews\u002Fpixel-11-launch-live-google-reveals-zh\">重點\u003C\u002Fa>，不是讓弱模型「想得更多」，而是讓整個推論流程「更不容易亂掉」。\u003C\u002Fp>\u003Ch2>論文實際證明了什麼\u003C\u002Fh2>\u003Cp>摘要給出的主結果很明確：平均 target-model performance 從 0.49 提升到 0.91。這是很大的差距，而且是在不更新 target model 參數的情況下達成的。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786604569160-cjdw.png\" alt=\"測試時外掛讓弱模型升級\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>作者也試著拆解這個提升到底從哪裡來。摘要指出，主要增益來自把不穩定的模型推理卸載到 deterministic code、加入 benchmark-specific routing，以及強制更嚴格的輸出格式。換句話說，提升不是主要來自讓模型自己多想幾步，或多抽樣幾次，而是來自外層結構把流程管住。\u003C\u002Fp>\u003Cp>另外，摘要還提到三個趨勢。第一，builder model 的 reasoning effort 越高，harness 品質就越好，而且是單調改善。第二，平台效應相對小，沒有 builder model 本身能力那麼關鍵。第三，越弱的 target model，得到的收益越大。\u003C\u002Fp>\u003Cp>最後這點很重要。因為它暗示這種方法最適合的，可能不是已經很強的模型，而是那些你想低成本部署、但又希望它不要太不穩的弱模型。對實務來說，這正是很多產品團隊會碰到的情境。\u003C\u002Fp>\u003Ch2>對開發者有什麼影響\u003C\u002Fh2>\u003Cp>這篇論文最大的啟發，是它把優化重心從訓練搬到推論。以前大家習慣問的是：怎麼訓練出更強的模型？現在作者提出另一個問題：怎麼設計更好的外層系統，讓同一個模型現在就表現得更好？\u003C\u002Fp>\u003Cp>這對開發者很有用，因為很多場景下，模型本體未必能常常重訓練，但推論流程可以改。你可以把驗證、路由、格式檢查、甚至部分脆弱推理，放到 harness 裡處理。這樣一來，可靠性提升不一定要靠改權重。\u003C\u002Fp>\u003Cp>它也補了一個 distillation 之外的想像。過去我們常把大模型幫小模型，理解成「把答案或梯度教進去」。這篇則顯示，強模型也能把某種「推理結構」轉移出去，讓弱模型在外掛保護下更穩定地工作。\u003C\u002Fp>\u003Cp>不過，這不代表所有系統都能直接套用。摘要沒有提供 runtime cost、latency 影響，也沒有說 harness 需要多少人工設計。對實務團隊來說，這些都是落地時一定會問的問題，但摘要沒有公開完整 benchmark 細節，所以無法從這份 raw 資料判斷代價。\u003C\u002Fp>\u003Ch2>限制與未解問題\u003C\u002Fh2>\u003Cp>先說最明顯的限制：摘要沒有列出四個 Theory-of-Mind benchmark 的名稱，也沒有提供逐項分數。這表示我們只能知道整體趨勢，不知道每個任務上的表現差異。\u003C\u002Fp>\u003Cp>第二個限制是範圍。這篇只明確說自己做在 Theory-of-Mind benchmarks 上，摘要沒有宣稱更廣泛的跨領域泛化。因此，現在還不能直接把結果外推到所有任務類型。\u003C\u002Fp>\u003Cp>第三個限制是依賴 builder model。摘要雖然說 builder 的 reasoning effort 越高，harness 越好，但這也代表方法的上限，仍然受限於 builder 本身的能力。換句話說，外掛不是憑空生出能力，而是把更強模型的結構化能力，轉成對弱模型有用的推論流程。\u003C\u002Fp>\u003Cp>最後，摘要也沒有說明平台效應為什麼相對小。這代表跨模型家族、跨部署環境的可移植性，還需要更多資料才能判斷。對工程實作來說，這些細節會影響你能不能把這套方法複製到自己的 stack。\u003C\u002Fp>\u003Ch2>結語\u003C\u002Fh2>\u003Cp>這篇論文證明了一件事：不改模型權重，也能靠強模型在測試時替弱模型搭出有效外掛，讓表現大幅提升。\u003C\u002Fp>\u003Cp>如果你在做 AI 系統，這個結果的意思很直接。除了訓練、微調、蒸餾之外，推論層本身也可以是能力提升的主戰場。尤其當你手上的模型已經固定、又想提高穩定性時，harness 可能是值得研究的工程方向。\u003C\u002Fp>\u003Cp>但它目前仍是個有明確邊界的方法。摘要能證明它在特定 benchmark 上有效，卻還沒有給出完整的成本、延遲與泛化證據。對開發者來說，這很像一個很強的原型：方向值得注意，但落地前還要補很多工程答案。\u003C\u002Fp>\u003Cul>\u003Cli>能力轉移不一定要發生在訓練階段。\u003C\u002Fli>\u003Cli>外層 harness 能把部分不穩定推理移出模型本體。\u003C\u002Fli>\u003Cli>摘要只證明特定 benchmark 上有效，成本與泛化仍待補齊。\u003C\u002Fli>\u003C\u002Ful>","強模型可在不改權重下，替弱模型打造測試時外掛，讓表現幾乎翻倍。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.12307",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786604574332-ails.png","research","zh","5a953549-e09c-43e6-856c-63c394e85997",[17,18,19,20,21],"test-time harness","strong-to-weak scaffolding","distillation","inference-time","Theory-of-Mind",[23,24,25],"強模型可以在不更新參數下，替弱模型設計測試時外掛。","主要增益來自 deterministic code、路由與格式約束，不是單純多想幾步。","摘要只提供整體結果，缺少 benchmark 名稱、成本與延遲細節。",1,"2026-08-13T07:02:25.318901+00:00","2026-08-13T07:02:25.305+00:00",{"tags":30,"relatedLang":32,"relatedPosts":36},[31],{"name":19,"slug":19},{"id":15,"slug":33,"title":34,"language":35},"test-time-harnesses-weak-model-transfer-en","Test-Time Harnesses Transfer Skills Without Retraining","en",[37,43,49,55,61,67],{"id":38,"slug":39,"title":40,"cover_image":41,"image_url":41,"created_at":42,"category":13},"363b733e-eb27-4be3-a234-4b3044e0eb3e","dreamfly-aerial-vln-memory-planning-zh","DreamFly 讓空中 VLN 更會記、會算","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786602773313-9vlj.png","2026-08-13T06:32:23.836363+00:00",{"id":44,"slug":45,"title":46,"cover_image":47,"image_url":47,"created_at":48,"category":13},"01d1a149-5977-4846-938a-6199ae59fc70","ava-encoder-agent-native-video-representation-zh","AVA-Encoder 把影片變知識圖譜","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786600969140-3p0h.png","2026-08-13T06:02:21.397513+00:00",{"id":50,"slug":51,"title":52,"cover_image":53,"image_url":53,"created_at":54,"category":13},"2aa54cfd-2caf-4c34-834c-e771e1308747","sparse-autoencoders-set-level-instability-zh","SAE 不是特徵袋","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786518181678-0ycl.png","2026-08-12T07:02:31.647391+00:00",{"id":56,"slug":57,"title":58,"cover_image":59,"image_url":59,"created_at":60,"category":13},"1544300b-d8fc-4341-ac8a-530391b179b2","convawg-controlled-vawg-dialogue-generation-zh","ConVAWG 讓 VAWG 對話可控生成","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786516377717-xygt.png","2026-08-12T06:32:30.301717+00:00",{"id":62,"slug":63,"title":64,"cover_image":65,"image_url":65,"created_at":66,"category":13},"51473b63-b17b-492a-8dc0-b12069a19b49","surgical-wam-video-pretraining-robot-control-zh","Surgical WAM 用影片訓練手術機器人控制","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786514588496-1uqy.png","2026-08-12T06:02:32.223678+00:00",{"id":68,"slug":69,"title":70,"cover_image":71,"image_url":71,"created_at":72,"category":13},"97ecb84d-bd2a-437b-839e-6e8a416d4a94","swe-bench-verified-model-leaderboard-limit-zh","SWE-bench Verified 已不再是乾淨的模型排行榜","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786498365710-5zg7.png","2026-08-12T01:32:19.598349+00:00",[74,79,84,89,94,99,104,109,114,119],{"id":75,"slug":76,"title":77,"created_at":78},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":80,"slug":81,"title":82,"created_at":83},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":85,"slug":86,"title":87,"created_at":88},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":90,"slug":91,"title":92,"created_at":93},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":95,"slug":96,"title":97,"created_at":98},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":100,"slug":101,"title":102,"created_at":103},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":105,"slug":106,"title":107,"created_at":108},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":110,"slug":111,"title":112,"created_at":113},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":115,"slug":116,"title":117,"created_at":118},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":120,"slug":121,"title":122,"created_at":123},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]