[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-relay-opd-fixes-prefix-failure-distillation-zh":3,"article-related-relay-opd-fixes-prefix-failure-distillation-zh":29,"series-research-b66c78dd-4d97-455a-a6a7-a1f74bcdf18b":72},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"b66c78dd-4d97-455a-a6a7-a1f74bcdf18b","relay-opd-fixes-prefix-failure-distillation-zh","Relay-OPD 修補失敗前綴","\u003Cp data-speakable=\"summary\">以前是學生一旦前綴走歪就一路錯到底；Relay-OPD 改成讓老師在關鍵點短暫接手修補，再交回學生繼續學。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：訓練軌跡長度減少 50% 以上\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：無標籤接手修補前綴\u003C\u002Fli>\u003C\u002Ful>\u003Cp>這篇論文處理的是一個很實際的蒸餾痛點：學生\u003Ca href=\"\u002Fnews\u002Fclaude-opus-5-behavior-audit-lowest-score-zh\">模型\u003C\u002Fa>在生成推理軌跡時，只要前面一步走錯，後面常常不是修正，而是繼續沿著錯誤方向延伸。對 on-policy distillation 來說，這很麻煩，因為訓練雖然是沿著學生自己產生的軌跡進行，但如果軌跡本身\u003Ca href=\"\u002Fnews\u002Frisc-v-is-a-real-platform-now-zh\">已經\u003C\u002Fa>歪掉，後面的監督就會變得又吵又浪費算力。\u003C\u002Fp>\u003Cp>\u003Ca href=\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.26057\">Pass the Baton: Trajectory-Relayed On-Policy Distillation\u003C\u002Fa> 的核心想法很直接：不要讓錯誤前綴一路污染整條 rollout。當系統偵測到學生前綴明顯偏離時，就讓老師模型短暫接手，把路修回來，再把控制權交回學生。它不是把整段生成都交給老師，而是只在最關鍵的地方插手。\u003C\u002Fp>\u003Ch2>它要解的痛點是什麼\u003C\u002Fh2>\u003Cp>on-policy distillation 的初衷，本來是讓學生在自己的軌跡上學，這樣訓練和真實推理更一致。但問題也正出在這裡：學生如果一開始就走錯路，後面 \u003Ca href=\"\u002Ftag\u002Ftoken\">token\u003C\u002Fa> 的學習目標就會被錯誤前綴綁架。老師雖然還在，但它看到的是一條已經偏掉的路，能提供的修正效果會打折扣。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785304970727-9vzo.png\" alt=\"Relay-OPD 修補失敗前綴\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>摘要裡提到一個很關鍵的現象：failed prefixes 會出現 continuation asymmetry。意思是說，前綴一旦失敗，老師通常會把路徑導回正確方向，但學生往往會繼續往同一個錯誤方向走。Relay-OPD 就是把這個差異變成一個訊號，用來決定何時該切換控制權。\u003C\u002Fp>\u003Cp>這個設計背後的思路，不是把老師變成全程監工，而是把老師當成「修路工」。對蒸餾來說，這很重要，因為太依賴老師，學生就會離自己的 policy 太遠；太放任學生，又會把壞軌跡學進去。Relay-OPD 想站在中間。\u003C\u002Fp>\u003Ch2>方法怎麼運作\u003C\u002Fh2>\u003Cp>論文把這種混合軌跡叫做 relay trajectories。訓練開始時，學生照常生成。當系統判定某個位置需要介入，老師就會短暫接手，補上一段 teacher leg。接著學生再回來，沿著這條混合後的軌跡繼續被優化。\u003C\u002Fp>\u003Cp>\u003Ca href=\"\u002Fnews\u002Ffuerteventura-2026-freestyle-crowned-two-winners-zh\">重點\u003C\u002Fa>在於它的 trigger 是 label-free。這代表它不是靠額外人工標註來判斷哪裡錯了，而是直接利用老師與學生在失敗前綴上的 continuation asymmetry 來做切換。換句話說，接手條件是從模型行為本身推導出來的，不需要另開一條標註流程。\u003C\u002Fp>\u003Cp>摘要也提到有一個有限的 relay budget。這表示老師不會到處插手，而是把介入集中在關鍵、通常也是較早的前綴位置。這樣做有兩個好處：一是保留學生自己的生成風格，二是避免整條軌跡都被老師主導，讓訓練成本失控。\u003C\u002Fp>\u003Cp>如果用工程語言來講，Relay-OPD 做的事其實很好理解：先讓小模型自己跑，發現前綴壞掉就讓大模型救火，救完再讓小模型接著學。新意不在於「有老師」，而在於老師只在失敗前綴上短暫接棒，而且這個接棒是自動、可控的。\u003C\u002Fp>\u003Ch2>論文證明了什麼\u003C\u002Fh2>\u003Cp>摘要列出的評估設定，是用 Qwen3-4B-Instruct-2507 當 teacher，搭配 Qwen3-0.6B 和 Qwen3-1.7B-Non-Thinking 當 student，並在八個數學推理 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 上測試。摘要沒有公開完整 benchmark 名稱，所以這裡只能確認它覆蓋了八個數學推理任務，不能補更多細節。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785304980488-6wjw.png\" alt=\"Relay-OPD 修補失敗前綴\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>結果面，摘要給了幾個明確數字。對 1.7B student 來說，Relay-OPD 在每個 benchmark 上都拿到最佳或次佳結果；相較標準 OPD，平均提升 5.73%；相較最強 baseline FastOPD，平均再高 1.49%。對 0.6B student，也有一致的提升。\u003C\u002Fp>\u003Cp>另一個很值得注意的數字，是訓練軌跡長度減少超過 50%。這代表方法不只是把分數拉高，也確實減少了在明顯錯誤推理路徑上浪費的訓練步數。對蒸餾這種本來就很吃算力的流程來說，這種效率改善很有價值。\u003C\u002Fp>\u003Cp>不過，摘要沒有提供完整 benchmark 表格、每個任務的逐項成績、訓練時間拆解，也沒有在這份來源文字裡交代 ablation 或失敗案例。所以目前能下的結論是：在它報告的數學推理場景裡，Relay-OPD 的表現與效率都不錯；但如果你想知道它到底在哪些題型特別有效，或在哪些情況會失靈，這份摘要還不夠。\u003C\u002Fp>\u003Ch2>對開發者有什麼影響\u003C\u002Fh2>\u003Cp>如果你在做小模型推理蒸餾，這篇最有感的地方，是它正面處理了一個常見問題：錯誤前綴會把整條軌跡帶歪。傳統 token-level 蒸餾如果只是在壞軌跡上持續訓練，很可能不是在教模型修正，而是在強化偏差。Relay-OPD 提供了一個更像「先修再學」的做法。\u003C\u002Fp>\u003Cp>這對數學助理、推理型聊天模型、或任何需要把大模型能力壓到小模型上的場景，都有參考價值。尤其是當你的學生模型已經會部分推理，但常常在早期步驟犯錯時，這種 selective relay 的設計可能比全程教師監督更划算。\u003C\u002Fp>\u003Cp>它也給了一個很實用的系統設計方向：老師不一定要永遠在線，也不一定要管每個 token。只要在「會把整條路帶歪」的地方介入，就可能拿到更高的訓練效率。這種思路對資源有限的團隊特別有吸引力，因為它不是單純把 teacher 用得更多，而是用得更準。\u003C\u002Fp>\u003Cp>但限制也很明顯。首先，摘要只提到八個數學推理 benchmark，所以目前不能直接推論它對程式碼、開放式生成，或其他更長尾的任務同樣有效。其次，因為來源沒有提供完整實驗細節，我們也無法從這份文字判斷 relay trigger 是否容易調參、是否對不同 teacher-student 組合都穩定。\u003C\u002Fp>\u003Cp>換句話說，Relay-OPD 的價值，不在於它發明了全新的訓練範式，而在於它把一個老問題——壞前綴污染蒸餾——變成一個可以被控制的 relay 機制。對實作端來說，這類方法最值得關注的地方，通常不是概念有多漂亮，而是它能不能在不大幅增加流程複雜度的前提下，真的少走冤枉路。\u003C\u002Fp>\u003Ch2>總結\u003C\u002Fh2>\u003Cp>Relay-OPD 的結論很清楚：當學生模型的前綴走歪時，讓老師短暫接手，比起硬著頭皮把整條錯路學完，更能提升 on-policy distillation 的品質與效率。摘要顯示它在數學推理任務上有穩定增益，還把訓練軌跡長度砍掉一半以上。\u003C\u002Fp>\u003Cp>對\u003Ca href=\"\u002Ftag\u002F台灣開發者\">台灣開發者\u003C\u002Fa>來說，這篇的重點不是某個特定 benchmark 的分數，而是它提供了一個可落地的訓練控制思路：把老師當成「局部修復器」，而不是全程代打。這種做法如果能穩定擴展，會是小模型推理蒸餾很值得試的一條路。\u003C\u002Fp>\u003Cul>\u003Cli>錯誤前綴會污染整條推理軌跡，Relay-OPD 專門修這個問題。\u003C\u002Fli>\u003Cli>它用無標籤的接手條件，讓老師只在關鍵位置短暫介入。\u003C\u002Fli>\u003Cli>摘要顯示它同時改善數學推理表現，並把訓練軌跡長度減少 50% 以上。\u003C\u002Fli>\u003C\u002Ful>","Relay-OPD 讓老師模型在前綴走歪時短暫接手，修補 on-policy distillation 的失敗軌跡，並把訓練軌跡長度減少 50% 以上。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.26057",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785304970727-9vzo.png","research","zh","e2f21eaf-1f13-4f5a-9796-87b499de7422",[17,18,19,20,21],"on-policy distillation","trajectory relaying","prefix failure","teacher-student training","math reasoning",[23,24,25],"Relay-OPD 把老師模型的介入縮成關鍵前綴修補，不再全程代打。","摘要顯示它在八個數學推理 benchmark 上優於標準 OPD，且軌跡長度減少 50% 以上。","這篇的實用價值在於，讓蒸餾流程更像「先修路再學路」，而不是在錯路上硬訓練。",0,"2026-07-29T06:02:30.51071+00:00","2026-07-29T06:02:30.476+00:00",{"tags":30,"relatedLang":31,"relatedPosts":35},[],{"id":15,"slug":32,"title":33,"language":34},"relay-opd-fixes-prefix-failure-distillation-en","Relay-OPD fixes prefix failure in distillation","en",[36,42,48,54,60,66],{"id":37,"slug":38,"title":39,"cover_image":40,"image_url":40,"created_at":41,"category":13},"7d00f7e4-000b-4921-94bf-cf06b1da1ceb","care-confidence-adaptive-routing-lora-zh","CARE 用信心分派 LoRA 專家","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785308583150-1gha.png","2026-07-29T07:02:29.165929+00:00",{"id":43,"slug":44,"title":45,"cover_image":46,"image_url":46,"created_at":47,"category":13},"0ff5f275-dc86-4cc7-924d-48ee394c81a7","pir2-reactive-real-time-flow-policies-zh","πR² 讓流式策略即時反應","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785306783936-ijjo.png","2026-07-29T06:32:33.987717+00:00",{"id":49,"slug":50,"title":51,"cover_image":52,"image_url":52,"created_at":53,"category":13},"596ed05a-61b7-43f9-83ad-be1ce4df20c1","learning-from-multiple-data-providers-zh","多資料來源下的可學性地圖","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785222177037-wkxs.png","2026-07-28T07:02:26.764157+00:00",{"id":55,"slug":56,"title":57,"cover_image":58,"image_url":58,"created_at":59,"category":13},"dab55461-2d6f-4a34-936f-105cdb409535","certified-parallel-sinkhorn-dynamic-ot-zh","TemporalSinkhorn 讓動態 OT 平行化","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785220375358-3eit.png","2026-07-28T06:32:27.966514+00:00",{"id":61,"slug":62,"title":63,"cover_image":64,"image_url":64,"created_at":65,"category":13},"84fb7607-8711-40cb-9a04-02bad626d32f","clinfusion-vision-centric-medical-mllm-zh","ClinFusion 先把醫療影像看懂","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785218580863-y4ut.png","2026-07-28T06:02:28.426162+00:00",{"id":67,"slug":68,"title":69,"cover_image":70,"image_url":70,"created_at":71,"category":13},"ac1e5ec4-001e-4ecb-b8d0-0742f3b0287c","explainable-rl-air-traffic-control-zh","可解釋強化學習管空管路由","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785135782953-1dba.png","2026-07-27T07:02:29.948161+00:00",[73,78,83,88,93,98,103,108,113,118],{"id":74,"slug":75,"title":76,"created_at":77},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":79,"slug":80,"title":81,"created_at":82},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":84,"slug":85,"title":86,"created_at":87},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":89,"slug":90,"title":91,"created_at":92},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":94,"slug":95,"title":96,"created_at":97},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":99,"slug":100,"title":101,"created_at":102},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":104,"slug":105,"title":106,"created_at":107},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":109,"slug":110,"title":111,"created_at":112},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":114,"slug":115,"title":116,"created_at":117},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":119,"slug":120,"title":121,"created_at":122},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]