[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-octolong-cross-repository-code-contexts-zh":3,"article-related-octolong-cross-repository-code-contexts-zh":30,"series-research-a2ae5975-7c35-4094-9d13-922f15cb1034":75},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":23,"views":27,"created_at":28,"published_at":29,"topic_cluster_id":11},"a2ae5975-7c35-4094-9d13-922f15cb1034","octolong-cross-repository-code-contexts-zh","OctoLong 用跨倉庫程式脈絡訓練長上下文模型","\u003Cp>寫程式時最常卡住的，不是看不懂單一檔案，而是線索散在另一個 repo、另一個 package，甚至另一層引用裡。一般\u003Ca href=\"\u002Ftag\u002F長上下文\">長上下文\u003C\u002Fa>模型能吃很多 \u003Ca href=\"\u002Ftag\u002Ftoken\">token\u003C\u002Fa>，卻不一定真的會追依賴。\u003C\u002Fp>\u003Cp data-speakable=\"summary\">OctoLong 用跨倉庫、依賴密集的程式脈絡做中期訓練，讓長上下文模型更會追引用、抓狀態，也更能處理 repo 級\u003Ca href=\"\u002Fnews\u002Fargus-self-evolving-runtime-long-tasks-zh\">任務\u003C\u002Fa>。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：~6.2B OctoLong tokens，納入約 50B-token mixture\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：遞迴式程式引用檢索\u003C\u002Fli>\u003C\u002Ful>\u003Cp>\u003Ca href=\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.05141\">OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling\u003C\u002Fa> 走的就是這條路。它不是單純把上下文拉長，而是想辦法讓訓練資料本身更像真實大型程式系統。\u003C\u002Fp>\u003Ch2>它要解的痛點是什麼\u003C\u002Fh2>\u003Cp>這篇論文鎖定的是長上下文模型的資料問題。現在很多模型都能處理更長的輸入，但長上下文語料常常偏向書籍、論文，或是結構比較有限的程式片段。這些資料可以訓練模型「看很多字」，卻不一定會逼模型學會跨檔案、跨 package、跨 repository 追依賴。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785999778532-gdas.png\" alt=\"OctoLong 用跨倉庫程式脈絡訓練長上下文模型\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>對開發者來說，這個差異很實際。很多 coding 任務不是找一段文字，而是找一串關聯：某個 symbol 的定義在哪、這個 \u003Ca href=\"\u002Ftag\u002Fapi\">API\u003C\u002Fa> 怎麼被呼叫、另一個 repo 裡的相依套件怎麼影響結果。若訓練資料沒有這種長距離依賴，模型即使上下文窗很大，也可能還是抓不到重點。\u003C\u002Fp>\u003Cp>OctoLong 的核心想法，就是不要只餵一般長文本，而是製造「依賴關係很重」的 code context。摘要提到，這類 context 最長可以到百萬 token 等級，這跟一般 snippet 或單一 repo 快照不是同一種訓練訊號。\u003C\u002Fp>\u003Ch2>OctoLong 怎麼做\u003C\u002Fh2>\u003Cp>作者把 OctoLong 描述成一個 context engineering pipeline。它串了三個元件：AST parser、language server backend，還有 package manager。三者一起工作，做的是遞迴式引用檢索。\u003C\u002Fp>\u003Cp>白話說，就是從一段程式碼出發，持續把它依賴到的東西找回來。包含定義、被引用的 symbol、相關檔案、以及 package 層級的脈絡。最後拼出來的，不只是更多 code，而是和真實軟體系統一樣有連結關係的 code。\u003C\u002Fp>\u003Cp>這也是這篇最重要的技術點。它沒有在摘要裡主打新的 tokenizer，也沒有主打新的 attention 架構。它是在改訓練資料的形狀，讓模型在 mid-training 階段看到更多跨倉庫、依賴密集的結構。\u003C\u002Fp>\u003Cp>接著，這些資料被用來訓練 OctoLong-Instruct，一組 open long-context language models。摘要提到，這些 base models 的規模從 600M 到 14B 參數不等。訓練分兩階段：先做 context-extension mid-training，資料混合量約 50B tokens，其中約 6.2B tokens 來自 OctoLong code contexts；再做約 10B tokens 的 instruction tuning。\u003C\u002Fp>\u003Ch2>它實際證明了什麼\u003C\u002Fh2>\u003Cp>這篇摘要有規模數字，但沒有公開完整 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 細節。換句話說，如果你想直接看到 leaderboard 式的分數，摘要本身沒有列出來。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785999772741-88wg.png\" alt=\"OctoLong 用跨倉庫程式脈絡訓練長上下文模型\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>不過，摘要還是給了幾個明確訊號。作者說，他們把 OctoLong 的資料拿去做 ablation 和 evaluation，對比了 18 個最先進的 open-weight long-context LMs。結果顯示，只要把傳統 context-extension corpora 裡的 12% 換成 OctoLong 資料，就能在多個任務上帶來明顯提升。\u003C\u002Fp>\u003Cp>這些任務包括 long-range retrieval、long-term state tracking、repository-level code understanding，還有 downstream agentic tasks。摘要還特別提到，OctoLong 也能改善短上下文 coding 場景中的 API usage。這點很值得注意，因為代表它的收益不只出現在超長 prompt，也可能反映到一般程式使用習慣上。\u003C\u002Fp>\u003Cp>從研究角度看，這個結果支持一個很實際的判斷：長上下文模型的能力，不只是「能裝多少 token」，而是「訓練時看過什麼樣的依賴關係」。如果資料本身更像真實 repo，模型就更容易學會追引用、保狀態、抓結構。\u003C\u002Fp>\u003Ch2>對開發者的意義\u003C\u002Fh2>\u003Cp>如果你在做 coding assistant、repo \u003Ca href=\"\u002Ftag\u002Fagent\">agent\u003C\u002Fa>，或任何要讀大型 codebase 的工具，這篇論文給的訊號很直接：長上下文的品質，關鍵在資料，不只在窗口大小。模型若看過更多依賴密集的 code context，就更有機會跨檔案追線索，也更會用 API。\u003C\u002Fp>\u003Cp>這對 agentic workflow 特別重要。因為 agent 在工作時，往往不是一次性回答，而是要規劃、檢查、修改、再延續。這種\u003Ca href=\"\u002Fnews\u002Fsource-2-swaps-bsp-for-meshes-and-octrees-zh\">流程\u003C\u002Fa>最常見的失敗，不是完全沒上下文，而是中途丟掉 repository 裡的關聯。\u003C\u002Fp>\u003Cp>從訓練策略來看，這篇也提供一個相對務實的方向。摘要指出，只要用 OctoLong 資料替換 12% 的傳統 context-extension corpora，就能看到提升。若這個結果能在更多場景重現，代表你未必需要整個重做長上下文資料管線，才有機會改善 repo 理解。\u003C\u002Fp>\u003Cp>但它也不是萬靈丹。這套 pipeline 依賴 AST parsing、language server 整合與 package management，代表它很強，但也很專門。這不是隨手抓網頁文本就能複製的資料集，而是高度整理過的工程管線。\u003C\u002Fp>\u003Ch2>還有哪些限制要看清楚\u003C\u002Fh2>\u003Cp>摘要沒有把完整 benchmark 數字公開，所以外界還不能只靠這份摘要判斷提升幅度有多大。它也沒有交代約 50B-token mixture 裡，除了 OctoLong 之外的資料組成細節。\u003C\u002Fp>\u003Cp>另一個限制是泛化範圍。這篇明確談的是 code contexts，證據也集中在程式理解、檢索、狀態追蹤與 agentic tasks。摘要沒有主張這種做法能直接解決所有領域的長上下文\u003Ca href=\"\u002Fnews\u002Freasoning-core-procedural-reasoning-data-zh\">推理\u003C\u002Fa>。\u003C\u002Fp>\u003Cp>不過就工程實務來看，這篇的訊息已經很清楚。若你想讓模型更會處理大型 repository，訓練資料就要更像大型 repository。OctoLong 做的事，是把這種依賴結構顯式化，然後在 scale 上拿來訓練。\u003C\u002Fp>\u003Ch2>結論\u003C\u002Fh2>\u003Cp>OctoLong 是一篇很資料導向的長上下文研究。它證明了一件事：把跨倉庫、依賴密集的程式脈絡放進中期訓練，長上下文模型就更能處理 repo 級任務。\u003C\u002Fp>\u003Cp>對開發者來說，這代表模型不只是多吃一些 token，而是更有機會真的跟上程式碼之間的關聯，像個能追脈絡的助手，而不是只會背上下文長度的工具。\u003C\u002Fp>","OctoLong 用跨倉庫、依賴密集的程式脈絡做中期訓練，讓長上下文模型更會追引用、抓狀態，也更能處理 repo 級任務。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.05141",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785999778532-gdas.png","research","zh","53a5becc-78b2-4c0a-b794-5c45df5bcf41",[17,18,19,20,21,22],"long-context modeling","cross-repository code","context engineering","AST","language server","instruction tuning",[24,25,26],"OctoLong 的重點不是拉長上下文窗，而是讓訓練資料具備跨倉庫依賴結構。","摘要指出，用約 12% 的 OctoLong 資料替換傳統 context-extension corpora，就能在多項 code 任務上帶來提升。","它的限制也很明確：摘要沒有公開完整 benchmark 數字，而且方法高度依賴 AST、language server 與 package manager。",0,"2026-08-06T07:02:26.875328+00:00","2026-08-06T07:02:26.866+00:00",{"tags":31,"relatedLang":34,"relatedPosts":38},[32],{"name":19,"slug":33},"context-engineering",{"id":15,"slug":35,"title":36,"language":37},"octolong-cross-repository-code-contexts-en","OctoLong trains LMs on cross-repo code context","en",[39,45,51,57,63,69],{"id":40,"slug":41,"title":42,"cover_image":43,"image_url":43,"created_at":44,"category":13},"9ffcddf6-f52b-4ca8-99f5-a927ec5261b4","argus-self-evolving-runtime-long-tasks-zh","Argus：會自我演化的長任務 runtime","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785997980205-qk1s.png","2026-08-06T06:32:34.986144+00:00",{"id":46,"slug":47,"title":48,"cover_image":49,"image_url":49,"created_at":50,"category":13},"975385e8-e9e9-4c95-a671-8698277cd71c","reasoning-core-procedural-reasoning-data-zh","Reasoning Core 讓程序推理資料更好用","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785996216956-aq0n.png","2026-08-06T06:03:09.482977+00:00",{"id":52,"slug":53,"title":54,"cover_image":55,"image_url":55,"created_at":56,"category":13},"499d414d-4573-44b3-a643-dbfb8c269d8e","anthropic-shikong-ceshi-ai-anquan-weiguo-zh","Anthropic的失控测试：AI安全还没过关","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785931378812-l2ud.png","2026-08-05T12:02:33.709216+00:00",{"id":58,"slug":59,"title":60,"cover_image":61,"image_url":61,"created_at":62,"category":13},"ea21ed90-eaf8-4d46-97c9-4e495ed14c83","worldcup-arena-live-llm-forecasting-zh","WorldCup Arena：LLM 直播預測實測","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785913378717-go7u.png","2026-08-05T07:02:29.072783+00:00",{"id":64,"slug":65,"title":66,"cover_image":67,"image_url":67,"created_at":68,"category":13},"fa03dc7f-4db2-4122-ab50-729e2f795964","societybench-social-event-forecasting-benchmark-zh","SocietyBench：測 LLM 社會事件預測","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785911578272-io30.png","2026-08-05T06:32:28.944853+00:00",{"id":70,"slug":71,"title":72,"cover_image":73,"image_url":73,"created_at":74,"category":13},"44310f51-8114-47f6-97c9-14e51bec9bfa","parvl-parallel-scaling-multimodal-llms-zh","ParVL：把多模態算力拆成平行分支","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785909776069-mqs4.png","2026-08-05T06:02:26.916098+00:00",[76,81,86,91,96,101,106,111,116,121],{"id":77,"slug":78,"title":79,"created_at":80},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":82,"slug":83,"title":84,"created_at":85},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":87,"slug":88,"title":89,"created_at":90},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":92,"slug":93,"title":94,"created_at":95},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":97,"slug":98,"title":99,"created_at":100},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":102,"slug":103,"title":104,"created_at":105},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":107,"slug":108,"title":109,"created_at":110},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":112,"slug":113,"title":114,"created_at":115},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":117,"slug":118,"title":119,"created_at":120},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":122,"slug":123,"title":124,"created_at":125},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]