[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-gear-cuts-copying-long-context-reasoning-zh":3,"article-related-gear-cuts-copying-long-context-reasoning-zh":30,"series-research-b00fe485-a4d9-4916-954c-398d66830a22":75},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":29},"b00fe485-a4d9-4916-954c-398d66830a22","gear-cuts-copying-long-context-reasoning-zh","GEAR 讓長上下文少抄多想","\u003Cp>GEAR 怎麼讓長上下文\u003Ca href=\"\u002Fnews\u002Fsurvey-of-large-language-models-zh\">模型\u003C\u002Fa>少抄、多想？\u003C\u002Fp>\u003Cp data-speakable=\"summary\">GEAR 用證據導向獎勵與干擾懲罰，減少長上下文推理時的複製行為，並提升整體表現。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：最高提升 +4.6 平均分\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：加入 grounding reward 與 distractor penalty\u003C\u002Fli>\u003C\u002Ful>\u003Cp>這篇論文在處理一個很實際的問題：長上下文給得越多，模型不一定想得越好，反而可能開始大量複製輸入內容。對開發者來說，這不是單純的輸出風格問題，而是長上下文推理是否真的有在使用關鍵證據的問題。\u003C\u002Fp>\u003Cp>作者的觀察很直接。當上下文變長，模型更容易在推理過程中重複貼回原文，表面上看起來很完整，實際上卻可能只是把提示詞換句話說。這種現象和「grounding 不足」綁得很緊，也就是模型沒有把注意力放在真正相關的證據上。\u003C\u002Fp>\u003Ch2>這篇論文想解什麼痛點\u003C\u002Fh2>\u003Cp>論文聚焦在一個叫做 repetitive copying 的失敗模式。簡單講，就是模型在長上下文推理時，會把輸入裡的大段文字重新抄進自己的 reasoning trace。這種輸出看起來很像有在思考，但不代表它真的有在解題。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784700182832-nc4d.png\" alt=\"GEAR 讓長上下文少抄多想\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>作者指出，這個問題在多個 frontier long-context LLM 上都看得到，而且上下文越長，情況越嚴重。這表示問題不是某一個模型特別差，而是長上下文推理本身就可能把模型推向「看很多、抓不準」的狀態。\u003C\u002Fp>\u003Cp>為了分析原因，論文把提示內容拆成兩部分：跟任務相關的 key evidence，以及無關的 distractor context。這個切法很重要，因為它可以測出模型到底是在抓對的證據，還是在亂抄周圍文字。作者的結論是，grounding 不足很可能是核心原因。\u003C\u002Fp>\u003Cp>對工程實作來說，這個 framing 很有用。當你的模型輸出越來越像在複述輸入時，問題不一定是「上下文太長」本身，而可能是訓練訊號沒有教它怎麼在雜訊裡挑證據。\u003C\u002Fp>\u003Ch2>GEAR 到底怎麼運作\u003C\u002Fh2>\u003Cp>方法名稱是 GEAR，全名是 Grounding Evidence-Aware Reward。它是一種 \u003Ca href=\"\u002Ftag\u002Freinforcement-learning\">reinforcement learning\u003C\u002Fa> 的 reward shaping。和只看最終答案對不對的做法不同，GEAR 多加了兩個訊號：一個是針對 key evidence 的 grounding reward，另一個是針對 irrelevant context 的 distractor penalty。\u003C\u002Fp>\u003Cp>白話一點說，模型不只被要求「答對」，還被鼓勵「用對材料」。如果推理過程有抓到關鍵證據，就給正向獎勵；如果它去依賴那些不相關的內容，就扣分。這樣一來，訓練目標就不只是結果導向，也開始管模型怎麼走到答案。\u003C\u002Fp>\u003Cp>這個設計看起來不複雜，但重點在於它把 evidence use 明確寫進優化目標。也就是說，模型的 reasoning trace 不再只是副產品，而是訓練時要被約束的行為。\u003C\u002Fp>\u003Cp>論文還做了一個自動化 pipeline，用來把任意文件轉成帶有 evidence 標註的訓練資料。這點很實用，因為真實世界的長上下文資料通常很雜，不會天然就有人工標好的證據區段。這個 pipeline 讓 GEAR 不只停留在手工整理的小型資料集。\u003C\u002Fp>\u003Ch2>論文實際證明了什麼\u003C\u002Fh2>\u003Cp>摘要裡公開的結果是：相較於只用 accuracy-based rewards 的標準 RL，GEAR 最高可帶來 +4.6 average points 的提升。論文也說，這種提升在更長的上下文下更明顯，剛好對應到 repetitive copying 最嚴重的區域。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784700177030-4mod.png\" alt=\"GEAR 讓長上下文少抄多想\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>另外，摘要還提到 GEAR 會降低 repetitive copying 和 thinking length。這代表它不只是把分數往上推，也可能真的\u003Ca href=\"\u002Fnews\u002Fpersona-steering-llm-capabilities-analysis-zh\">改變模型\u003C\u002Fa>使用上下文的方式。只是摘要沒有提供完整 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 細節、各資料集分數，或複製率與思考長度的精確下降數字，所以這些部分目前只能知道方向，不能知道完整幅度。\u003C\u002Fp>\u003Cp>不過，單就摘要來看，訊號已經很清楚：如果你直接獎勵模型去用關鍵證據，它在長上下文裡的表現就會變好。這暗示不少 long-context failure，不一定是資訊不夠，而是模型沒有把正確資訊挑出來。\u003C\u002Fp>\u003Cp>這也補了一個常見盲點。很多人以為長上下文模型的問題主要在 retrieval，但這篇論文指出，光是把資料塞進去還不夠。模型要能在噪音裡找到該信的那一段，才算真的會推理。\u003C\u002Fp>\u003Ch2>對開發者有什麼影響\u003C\u002Fh2>\u003Cp>如果你在做 retrieval-heavy assistant、文件分析工具，或任何需要吃長提示詞的 \u003Ca href=\"\u002Ftag\u002Fagent\">agent\u003C\u002Fa>，這篇論文其實在提醒一件事：模型就算拿得到正確證據，也不代表它會用。這和 retrieval 品質是兩回事，這篇把它明確當成 grounding 問題來處理。\u003C\u002Fp>\u003Cp>這對產品設計很重要。因為很多系統只看最終答案準不準，卻沒看模型是不是在靠近相關證據。若你的應用很重視可追蹤性、除錯、或推理軌跡品質，那麼「有沒有抄」可能和「答對沒」一樣重要。\u003C\u002Fp>\u003Cp>論文的 evidence-annotation pipeline 也有工程上的啟發。長上下文訓練常常卡在資料整理成本，而這裡提供了一個把任意文件轉\u003Ca href=\"\u002Fnews\u002Frag17-sod1-als-nature-medicine-template-zh\">成可\u003C\u002Fa>訓練資料的方法方向。只是摘要沒有把 pipeline 細節講完，所以它到底多穩、多貴、能不能直接落地，還無法從這份資料判斷。\u003C\u002Fp>\u003Cp>換句話說，GEAR 提供的不是一個更大的上下文窗，而是一個更會挑證據的訓練方式。對開發者來說，這是很實際的差別：很多長上下文系統的瓶頸，可能不是 \u003Ca href=\"\u002Ftag\u002Ftoken\">token\u003C\u002Fa> 不夠，而是模型不會在 token 裡做取捨。\u003C\u002Fp>\u003Ch2>限制與還沒回答的問題\u003C\u002Fh2>\u003Cp>摘要的結果雖然正面，但它沒有宣稱這是一個萬用解法。它只說在多個模型規模與 benchmark 上有改善，沒有說 copying 被完全消除。也沒有列出完整 benchmark 名稱、詳細 ablation，或 evidence 標註蒐集的總成本。\u003C\u002Fp>\u003Cp>另一個還沒回答的問題，是泛化能力。論文主張，隨著 long-context evaluation 從單純檢索走向更複雜的推理，對相關證據的 grounding 仍然不可少。這個方向很合理，但摘要本身沒有告訴我們，GEAR 在不同領域、不同提示風格、或不同推理格式下會不會一樣有效。\u003C\u002Fp>\u003Cp>還有一點要注意：論文說的是「降低」複製與思考長度，不是徹底解決。這意味著它比較像是一個能把模型往正確方向推的訓練訊號，而不是把長上下文所有問題一次清掉的魔法。\u003C\u002Fp>\u003Cp>即便如此，這篇還是把重點講得很清楚。長上下文能力不只是把更多文字塞進視窗，也不是單純把答案做對。真正的關鍵，是教模型在那堆文字裡知道該信誰、該看哪裡。\u003C\u002Fp>\u003Ch2>結論\u003C\u002Fh2>\u003Cp>GEAR 的核心想法很簡單：如果你希望模型在長上下文裡真的會推理，就要獎勵它用對證據，而不是只獎勵它答對。這篇論文把「少複製、多 grounding」變成可訓練的目標，並且在摘要中展示了最高 +4.6 平均分的提升。\u003C\u002Fp>\u003Cp>對\u003Ca href=\"\u002Ftag\u002F台灣開發者\">台灣開發者\u003C\u002Fa>來說，這篇的價值在於它把長上下文的瓶頸講得更精準。問題不一定是 context window 不夠大，而是模型還不夠會在雜訊裡找證據。這正是 GEAR 想補上的那一塊。\u003C\u002Fp>\u003Cul>\u003Cli>長上下文推理的失敗，不只是答錯，還包括大量複製輸入。\u003C\u002Fli>\u003Cli>GEAR 用 grounding reward 和 distractor penalty 直接改訓練目標。\u003C\u002Fli>\u003Cli>摘要公開的最佳提升是 +4.6 average points，且長上下文效果更明顯。\u003C\u002Fli>\u003C\u002Ful>\u003C\u002Fp>","GEAR 用證據導向獎勵與干擾懲罰，減少長上下文推理時的複製行為，並提升整體表現。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.19345",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784700182832-nc4d.png","research","zh","5df4c442-0663-4423-b917-00de6965f627",[17,18,19,20,21],"long-context reasoning","reinforcement learning","grounding","evidence selection","distractor penalty",[23,24,25],"GEAR 把證據使用直接納入 RL 獎勵，降低長上下文中的複製行為。","摘要公開的結果是最高 +4.6 平均分，且長上下文下提升更明顯。","這篇更像是在修正模型怎麼用上下文，而不只是讓它看到更多上下文。",0,"2026-07-22T06:02:29.644263+00:00","2026-07-22T06:02:29.633+00:00","8bd0970b-2703-409b-a9ec-bbfda12a3ba4",{"tags":31,"relatedLang":34,"relatedPosts":38},[32],{"name":18,"slug":33},"reinforcement-learning",{"id":15,"slug":35,"title":36,"language":37},"gear-cuts-copying-long-context-reasoning-en","GEAR cuts copying in long-context reasoning","en",[39,45,51,57,63,69],{"id":40,"slug":41,"title":42,"cover_image":43,"image_url":43,"created_at":44,"category":13},"a2a16ea8-c295-4a4e-a887-89294bd40f74","coderescue-budget-calibrated-recovery-routing-zh","CodeRescue 用預算路由修復代理","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784703788706-iyd6.png","2026-07-22T07:02:32.818231+00:00",{"id":46,"slug":47,"title":48,"cover_image":49,"image_url":49,"created_at":50,"category":13},"b6f7330a-8146-4acf-ab45-c9367c3e61e1","appearance-pointers-region-control-dits-zh","Appearance Pointers 讓 DiT 支援區域控制","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784701999191-3ruf.png","2026-07-22T06:32:27.754954+00:00",{"id":52,"slug":53,"title":54,"cover_image":55,"image_url":55,"created_at":56,"category":13},"584d0e47-4c7e-469e-8d28-236966c00188","rag17-sod1-als-nature-medicine-template-zh","RAG-17 把 SOD1-ALS 寫成可抄模板","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784678591746-wzd8.png","2026-07-22T00:02:47.756002+00:00",{"id":58,"slug":59,"title":60,"cover_image":61,"image_url":61,"created_at":62,"category":13},"f039531b-dbe8-43e5-a037-5ad6ca590524","survey-of-large-language-models-zh","大型語言模型全景整理","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784629980760-ftkd.png","2026-07-21T10:32:29.369537+00:00",{"id":64,"slug":65,"title":66,"cover_image":67,"image_url":67,"created_at":68,"category":13},"55d40b40-0d7a-4ffb-906b-18b284fb3a3a","evaluating-memory-in-llm-agents-zh","用多輪互動測 LLM 記憶","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784628186159-2km8.png","2026-07-21T10:02:36.154394+00:00",{"id":70,"slug":71,"title":72,"cover_image":73,"image_url":73,"created_at":74,"category":13},"828339d3-50c4-47fd-ba13-1a50f8430793","persona-steering-llm-capabilities-analysis-zh","Persona steering 會改變模型能力嗎","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1784626389337-g5ex.png","2026-07-21T09:32:27.763156+00:00",[76,81,86,91,96,101,106,111,116,121],{"id":77,"slug":78,"title":79,"created_at":80},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":82,"slug":83,"title":84,"created_at":85},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":87,"slug":88,"title":89,"created_at":90},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":92,"slug":93,"title":94,"created_at":95},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":97,"slug":98,"title":99,"created_at":100},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":102,"slug":103,"title":104,"created_at":105},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":107,"slug":108,"title":109,"created_at":110},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":112,"slug":113,"title":114,"created_at":115},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":117,"slug":118,"title":119,"created_at":120},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":122,"slug":123,"title":124,"created_at":125},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]