[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-reasoning-core-procedural-reasoning-data-zh":3,"article-related-reasoning-core-procedural-reasoning-data-zh":29,"series-research-975385e8-e9e9-4c95-a671-8698277cd71c":72},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"975385e8-e9e9-4c95-a671-8698277cd71c","reasoning-core-procedural-reasoning-data-zh","Reasoning Core 讓程序推理資料更好用","\u003Cp>很多團隊都想用合成資料補推理訓練，但常常卡在同一件事：資料看起來對，訓練起來卻不一定有用。這篇論文就是在處理這個落差。\u003C\u002Fp>\u003Cp data-speakable=\"summary\">Reasoning Core 用 50 個生成器與語意評分、難度控制，證明廣泛的程序化資料能強化 completion-supervised 推理訓練。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：50 generators\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：廣泛程序化蒐集\u003C\u002Fli>\u003C\u002Ful>\u003Cp>這篇論文提出 \u003Ca href=\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.05148\">Reasoning Core\u003C\u002Fa>，一套專門給 completion-supervised reasoning training 用的程序化資料庫。它不是只做單一題型，而是把數學、邏輯、規劃、狀態追蹤、形式語言、結構化資料、遊戲、因果推理和程式碼都放進來。重點不是「有合成資料」而已，而是「怎麼把合成資料做成真的可訓練訊號」。\u003C\u002Fp>\u003Ch2>這篇想修的痛點是什麼\u003C\u002Fh2>\u003Cp>程序化生成器的優點很直觀：可以大量產生可驗證的推理題，成本也比人工標註低。對訓練推理\u003Ca href=\"\u002Fnews\u002Fopencode-go-open-coding-models-affordable-zh\">模型\u003C\u002Fa>來說，這很誘人。問題是，這類資料一直有個老毛病：量上得去，不代表品質跟得上。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785996216956-aq0n.png\" alt=\"Reasoning Core 讓程序推理資料更好用\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>摘要直接點出，這個領域作為 completion-supervised fine-tuning 的資料來源，受到的重視還不夠。也就是說，很多人知道可以用程序化資料，但不一定有一套成熟的方法，去確保這些題目真的在教模型想學的能力。\u003C\u002Fp>\u003Cp>這裡的關鍵在 completion-supervised。它不是單純讓模型看 prompt 和 response 的配對，而是讓模型從目標完成內容本身學習。如果題目太簡單、太吵、或是跟目標能力對不齊，模型即使「看過很多題」，也可能沒有學到什麼實質東西。\u003C\u002Fp>\u003Cp>Reasoning Core 要解的，就是這個「合成了很多，但訓練效果不穩」的問題。論文的立場很明確：程序化生成本身不夠，生成器、目標、評分方式都要一起設計。\u003C\u002Fp>\u003Ch2>Reasoning Core 到底怎麼做\u003C\u002Fh2>\u003Cp>Reasoning Core 的核心是 50 個 generators。每個 generator 都會產生可驗證的推理問題，而且覆蓋多種任務域。摘要列出的範圍很廣，包含數學、邏輯、規劃、狀態追蹤、形式語言、結構化資料、遊戲、因果推理與程式碼。\u003C\u002Fp>\u003Cp>這代表它不是在做單一 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 專用資料，而是在做一個跨任務的程序化資料庫。對訓練來說，這種設計的價值在於可以把推理能力拆成不同面向，讓模型不只練一種題型，而是接觸到更廣的推理結構。\u003C\u002Fp>\u003Cp>但\u003Ca href=\"\u002Fnews\u002Fsystem-design-resources-that-actually-help-you-prep-zh\">真正\u003C\u002Fa>讓它和一般合成題庫拉開差距的，是附加在生成器外面的控制層。摘要提到 semantic scorers、difficulty controls 和 task evaluators。白話一點，就是系統不只負責出題，還會判斷題目有沒有意義、控制難度高低，並檢查任務渲染與評分是否正確。\u003C\u002Fp>\u003Cp>這點很重要。因為在合成資料流程裡，最怕的不是「完全錯」，而是「看起來沒錯」。如果題目格式、答案目標、評分規則之間有細微不一致，模型可能會學到偏掉的訊號。Reasoning Core 的設計就是在減少這種隱性錯誤。\u003C\u002Fp>\u003Cp>論文還做了 audits，而且不是只做一次。摘要寫到，他們用 model-assisted review、human adjudication 和 regression testing，並把這些檢查用在 Reasoning Core 的開發過程，也用在比較用的資料集合上。這透露出一個訊息：這篇不只是比資料量，更是在比資料工程的嚴謹度。\u003C\u002Fp>\u003Ch2>論文證明了什麼\u003C\u002Fh2>\u003Cp>作者用 matched completion-supervised protocol 來評估，並把 Reasoning Core 跟 Procedural Warmup、Reasoning Gym、SynLogic 做比較。比較範圍涵蓋四種 base-model 設定，以及多個訓練時長。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785996216339-k8rg.png\" alt=\"Reasoning Core 讓程序推理資料更好用\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>在主要的 3B 比較裡，Reasoning Core 在 DROP、LogiQA、ARC-Challenge 的平均分數最高。摘要也說，它超過了沒有使用程序化資料的基線，以及另外三套替代的程序化資料集合。\u003C\u002Fp>\u003Cp>不過，這篇摘要沒有公開完整 benchmark 數字，所以我們無法只靠來源文本說它到底贏多少。能確認的是，作者聲稱效果不是只出現在單一資料集或單一模型設定，而是至少在主要 3B 設定下成立，且他們確實測了多個 base-model 設定與不同訓練長度。\u003C\u002Fp>\u003Cp>另一個值得注意的結論是 task-level analysis。摘要明講，semantic validity 並不保證 training utility。這句話很有份量，因為它直接打臉一種常見直覺：只要題目語意上合理，就應該能拿來訓練。論文的觀察是，事情沒那麼簡單。\u003C\u002Fp>\u003Cp>換句話說，一個生成器就算能產出「看起來正確」的題目，也不代表這些題目真的能有效推動模型學習。對資料工程來說，這是很實際的提醒。\u003C\u002Fp>\u003Ch2>對開發者有什麼影響\u003C\u002Fh2>\u003Cp>如果你在做 \u003Ca href=\"\u002Ftag\u002Fllm\">LLM\u003C\u002Fa> 訓練、評測或合成資料管線，這篇的訊息其實很直接：synthetic 不等於高品質。你不能只看覆蓋率，也不能只看能不能自動生成。\u003C\u002Fp>\u003Cp>對 completion-supervised 設定來說，目標完成內容本身就是訓練訊號。這表示資料設計要很在意幾件事：目標要夠精簡、難度要可調、題目渲染後還要保持和原本想訓練的解空間一致。只要其中一環歪掉，訓練效果就可能被稀釋。\u003C\u002Fp>\u003Cp>這篇論文也給出一個很實務的工作流方向。若團隊自己做合成推理資料，至少要考慮 semantic scoring、difficulty controls，還有對生成、渲染、目標和評分之間的 mismatch 做 audit。摘要甚至明說，他們在審核過程中找到了細微的不一致，這代表這類 bug 真的會藏在流程裡。\u003C\u002Fp>\u003Cp>對產品團隊來說，這也意味著程序化資料不是「丟進去就會變強」的外掛。它更像一套需要持續校準的資料系統。你要管的不只是題目數量，還有題目的可學性。\u003C\u002Fp>\u003Ch2>限制與還沒回答的問題\u003C\u002Fh2>\u003Cp>這篇摘要的方向很清楚，但它也留了不少空白。最直接的就是：沒有公開完整 benchmark 數字、沒有每個任務的細項差距，也沒有說明到底是哪一類 generator 對提升貢獻最大。\u003C\u002Fp>\u003Cp>我們也不知道這些 audits 的成本有多高，維護 50 個 generators 會不會很吃工程資源，或者這套設計在實務上是不是容易擴充。這些都會影響它能不能\u003Ca href=\"\u002Fnews\u002Fsource-2-swaps-bsp-for-meshes-and-octrees-zh\">變成\u003C\u002Fa>可重用的訓練配方。\u003C\u002Fp>\u003Cp>另一個問題是可轉移性。摘要能確認的是，作者在主要 3B 設定下看到 DROP、LogiQA、ARC-Challenge 的優勢，也說測了多個 base-model 設定與訓練時長。但它沒有告訴我們，這套程序化設計原則是否同樣適用於其他模型大小、其他推理 benchmark，甚至非推理任務。\u003C\u002Fp>\u003Cp>所以這篇比較像是把方向立住：程序化推理資料要有效，重點不只是「有沒有生成」，而是「有沒有被設計成真的能學」。\u003C\u002Fp>\u003Ch2>結論\u003C\u002Fh2>\u003Cp>Reasoning Core 不是單純擴大合成資料庫，而是把程序化推理資料做成更適合 completion-supervised training 的形狀。它靠的是廣泛任務覆蓋、語意評分、難度控制和嚴格審核，而不是只靠資料量堆上去。\u003C\u002Fp>\u003Cp>對開發者來說，這篇最實際的提醒是：做推理資料時，先問自己資料有沒有「可訓練性」，再問它有沒有「可生成性」。前者如果沒處理好，後者再漂亮也只是看起來很忙。\u003C\u002Fp>\u003Cp>如果你在做合成資料管線，這篇提供的不是一個神奇公式，而是一個更務實的標準：有效的程序化資料，得同時顧到語意、難度、目標與評分一致性。\u003C\u002Fp>\u003Cul>\u003Cli>廣泛的程序化資料，能在 completion-supervised 推理訓練中勝過較窄的合成集合。\u003C\u002Fli>\u003Cli>語意正確不等於訓練有效，目標設計和難度控制同樣重要。\u003C\u002Fli>\u003Cli>對生成、渲染、目標與評分做 audit，能抓出合成管線裡的隱性錯誤。\u003C\u002Fli>\u003C\u002Ful>","Reasoning Core 用 50 個生成器與語意評分、難度控制，證明廣泛的程序化資料能強化 completion-supervised 推理訓練。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.05148",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785996216956-aq0n.png","research","zh","1da09543-ebdc-421b-9864-b527badfe6f7",[17,18,19,20,21],"procedural data","completion-supervised learning","reasoning training","semantic scoring","difficulty control",[23,24,25],"Reasoning Core 用 50 個生成器，把多種推理任務做成可驗證的程序化資料庫。","論文強調，資料語意正確不代表就能有效訓練，目標與難度設計很關鍵。","摘要沒有公開完整 benchmark 數字，但作者聲稱它在主要 3B 比較中優於多個基線與其他程序化集合。",0,"2026-08-06T06:03:09.482977+00:00","2026-08-06T06:03:09.47+00:00",{"tags":30,"relatedLang":31,"relatedPosts":35},[],{"id":15,"slug":32,"title":33,"language":34},"reasoning-core-procedural-reasoning-data-en","Reasoning Core builds better procedural reasoning data","en",[36,42,48,54,60,66],{"id":37,"slug":38,"title":39,"cover_image":40,"image_url":40,"created_at":41,"category":13},"a2ae5975-7c35-4094-9d13-922f15cb1034","octolong-cross-repository-code-contexts-zh","OctoLong 用跨倉庫程式脈絡訓練長上下文模型","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785999778532-gdas.png","2026-08-06T07:02:26.875328+00:00",{"id":43,"slug":44,"title":45,"cover_image":46,"image_url":46,"created_at":47,"category":13},"9ffcddf6-f52b-4ca8-99f5-a927ec5261b4","argus-self-evolving-runtime-long-tasks-zh","Argus：會自我演化的長任務 runtime","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785997980205-qk1s.png","2026-08-06T06:32:34.986144+00:00",{"id":49,"slug":50,"title":51,"cover_image":52,"image_url":52,"created_at":53,"category":13},"499d414d-4573-44b3-a643-dbfb8c269d8e","anthropic-shikong-ceshi-ai-anquan-weiguo-zh","Anthropic的失控测试：AI安全还没过关","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785931378812-l2ud.png","2026-08-05T12:02:33.709216+00:00",{"id":55,"slug":56,"title":57,"cover_image":58,"image_url":58,"created_at":59,"category":13},"ea21ed90-eaf8-4d46-97c9-4e495ed14c83","worldcup-arena-live-llm-forecasting-zh","WorldCup Arena：LLM 直播預測實測","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785913378717-go7u.png","2026-08-05T07:02:29.072783+00:00",{"id":61,"slug":62,"title":63,"cover_image":64,"image_url":64,"created_at":65,"category":13},"fa03dc7f-4db2-4122-ab50-729e2f795964","societybench-social-event-forecasting-benchmark-zh","SocietyBench：測 LLM 社會事件預測","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785911578272-io30.png","2026-08-05T06:32:28.944853+00:00",{"id":67,"slug":68,"title":69,"cover_image":70,"image_url":70,"created_at":71,"category":13},"44310f51-8114-47f6-97c9-14e51bec9bfa","parvl-parallel-scaling-multimodal-llms-zh","ParVL：把多模態算力拆成平行分支","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785909776069-mqs4.png","2026-08-05T06:02:26.916098+00:00",[73,78,83,88,93,98,103,108,113,118],{"id":74,"slug":75,"title":76,"created_at":77},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":79,"slug":80,"title":81,"created_at":82},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":84,"slug":85,"title":86,"created_at":87},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":89,"slug":90,"title":91,"created_at":92},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":94,"slug":95,"title":96,"created_at":97},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":99,"slug":100,"title":101,"created_at":102},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":104,"slug":105,"title":106,"created_at":107},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":109,"slug":110,"title":111,"created_at":112},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":114,"slug":115,"title":116,"created_at":117},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":119,"slug":120,"title":121,"created_at":122},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]