[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-pir2-reactive-real-time-flow-policies-zh":3,"article-related-pir2-reactive-real-time-flow-policies-zh":29,"series-research-0ff5f275-dc86-4cc7-924d-48ee394c81a7":72},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"0ff5f275-dc86-4cc7-924d-48ee394c81a7","pir2-reactive-real-time-flow-policies-zh","πR² 讓流式策略即時反應","\u003Cp>做機器人控制的人很熟這個痛點：\u003Ca href=\"\u002Fnews\u002Fclaude-opus-5-behavior-audit-lowest-score-zh\">模型\u003C\u002Fa>先吐出一整段動作，結果環境早就變了，手還在照舊往前走。\u003C\u002Fp>\u003Cp data-speakable=\"summary\">πR² 讓流式策略在執行中就能反應，靠快慢雙通道與單步延遲自適應去噪，把重規劃速度拉高。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：最高提升 30% 實機成功率\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：快慢輸入分流\u003C\u002Fli>\u003C\u002Ful>\u003Cp>這篇論文要解的，不是「模型會不會做」，而是「模型來不來得及做」。在機器手臂、抓取、操作這類任務裡，政策常常是一次產生一段 action chunk，再一路執行到結束。這種做法在靜態場景還行，但只要物體滑了一點、手臂姿態變了、或感測更新慢了，原本那段動作就可能變成過期指令。\u003C\u002Fp>\u003Cp>作者的切入點很直接：不要放棄大型 pretrained backbone，也不要放棄多動作預測，但要讓策略能在閉迴路裡更快重規劃。換句話說，問題不是「策略夠不夠強」，而是「策略能不能跟得上真實世界的節奏」。\u003C\u002Fp>\u003Ch2>πR² 想改什麼\u003C\u002Fh2>\u003Cp>πR² 建在 diffusion forcing 的 per-position noise schedule 上，再往上加兩個設計。第一個是把 conditioning 拆成快、慢兩條路。proprioception 走快通道，每個 tick 都更新；vision-language 特徵走慢通道，可以非同步刷新。這樣一來，機器人的即時身體狀態可以先被看見，不必等較重的視覺語意特徵一起更新。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785306783936-ijjo.png\" alt=\"πR² 讓流式策略即時反應\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>第二個是 latency-adaptive 的 flow schedule。它不再假設每次推理都要經過固定多步去噪才吐出一段動作，而是把執行中的動作當成 inpainting conditioning，讓每次呼叫只做一步去噪就能輸出動作。這個做法的重點很務實：把每個控制週期壓到夠便宜，模型才有機會在硬體延遲變動時仍然維持反應速度。\u003C\u002Fp>\u003Cp>這也解釋了為什麼論文把 latency 當成一等公民。真實系統不會永遠跑在理想時序上。\u003Ca href=\"\u002Ftag\u002Fgpu\">GPU\u003C\u002Fa> 負載、感測器同步、模型大小，都會影響 policy 能多久重規劃一次。πR² 嘗試吸收這些波動，而不是要求整個系統硬體與排程都完美配合。\u003C\u002Fp>\u003Ch2>方法怎麼運作\u003C\u002Fh2>\u003Cp>可以把這個策略想成兩種輸入來源。第一種是機器人的即時身體狀態，例如關節位置、夾爪狀態、其他 proprioceptive 訊號。這些東西每個控制 tick 都在變。第二種是比較重的上下文，像視覺與語言特徵。這些資訊更新較慢，但對長一點的動作分塊仍然重要。\u003C\u002Fp>\u003Cp>πR² 的重點是：這兩種資訊不該用同一種更新節奏處理。因為它們的「新鮮度」本來就不同。手現在在哪裡，應該立刻反映；相機 embedding 就算慢幾毫秒，對 chunked policy 來說未必致命。這不是理論上最華麗的改法，但很像真正會落地的工程取捨。\u003C\u002Fp>\u003Cp>延遲自適應那一塊也很實際。作者不是假設永遠有固定算力預算，而是讓模型根據可用時間調整，並把 in-flight actions 當作 inpainting 的條件。結果就是，每次控制循環都能盡量維持便宜，讓同一個訓練好的模型在不同硬體延遲下都還能用。\u003C\u002Fp>\u003Cp>對開發者來說，這裡不必先被 diffusion 名詞卡住。重點是：這個 policy 不是等整段推理做完才動，而是設計成能在執行途中持續修正，讓閉迴路控制更接近真實需求。\u003C\u002Fp>\u003Ch2>論文實際證明了什麼\u003C\u002Fh2>\u003Cp>摘要給了一個很具體的部署故事：作者把 πR² 從預訓練策略 GR00T-N1.7 微調而來，並在 xArm6+XHand 的實機\u003Ca href=\"\u002Fnews\u002Frisc-v-is-a-real-platform-now-zh\">平台\u003C\u002Fa>上測試。根據摘要，這個方法讓 closed-loop replan 的速度比原始策略快約 4 倍，在 A5000 GPU 上可達約 25 Hz，並且能每 40 ms 接收一次新觀測。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785306776140-6frl.png\" alt=\"πR² 讓流式策略即時反應\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這是摘要裡最有感的結果。它不是在說機器人突然變聰明很多，而是在說控制迴圈終於夠快，能跟上環境變化。對操作型任務來說，這種「來得及反應」本身就是性能的一大部分。\u003C\u002Fp>\u003Cp>摘要也提到，πR² 在模擬與實機操作任務上都有成功率提升。數字上，模擬最高提升 23%，實機最高提升 30%，相對於最強 baseline。這些數字很值得注意，但摘要沒有公開完整 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 細節，也沒有列出任務清單、逐項結果或 baseline 的完整身份，所以不能再往外延伸。\u003C\u002Fp>\u003Cp>同樣重要的是，摘要沒有提供完整的 benchmark 表、信賴區間、ablation 數據或\u003Ca href=\"\u002Fnews\u002Frelay-opd-fixes-prefix-failure-distillation-zh\">失敗\u003C\u002Fa>案例統計。也沒有說快慢通道與 latency-adaptive schedule 各自貢獻多少。也就是說，從摘要能確定的是「整體方案有效」，但還不能精準拆解是哪一個設計帶來最大增益。\u003C\u002Fp>\u003Ch2>為什麼這對開發者有用\u003C\u002Fh2>\u003Cp>如果你在做機器人系統，這篇很像是把「模型能力」和「系統延遲」綁在一起看。很多 policy 工作默認模型可以先思考、再慢慢輸出動作。但真實機器人沒有這種奢侈。它需要的是能跟物理世界同步更新的策略。\u003C\u002Fp>\u003Cp>πR² 的有趣之處在於，它沒有要求工程師放棄大型 pretrained backbone，也沒有放棄多動作預測。它做的是把這些東西變得更適合閉迴路控制，而且看起來不需要整個架構重寫。對部署端來說，這代表可以用 finetune 的方式延續既有策略，而不是從零重建一個控制器。\u003C\u002Fp>\u003Cp>這也帶出一個更大的系統觀念：延遲不是事後補丁，而是設計條件。對 embodied AI 來說，紙面上最強的 policy，不一定是硬體上最有用的 policy。只要反應慢一步，就可能在實際操作裡失分。\u003C\u002Fp>\u003Ch2>還有哪些限制\u003C\u002Fh2>\u003Cp>即使有這些提升，摘要仍留下不少問題。它沒有說這個方法在不同機器人本體、不同感測配置、或不同算力預算下是否同樣穩定。也沒有說 one-step denoising 在需要更長期規劃、或更複雜多模態推理的任務裡，是否還能維持效果。\u003C\u002Fp>\u003Cp>另一個未解點是 latency-adaptive schedule 的泛化範圍。摘要說同一個訓練好的模型可以適應不同硬體延遲，這很吸引人，但沒有交代測試過的延遲範圍，也沒有說當條件變差時，表現會怎麼退化。\u003C\u002Fp>\u003Cp>所以這篇的結論應該講得保守一點：它證明了大型 flow policy 不必只能慢慢跑，也可以被改造成接近即時反應的閉迴路控制器。但摘要本身還不足以讓我們判斷，這套方法在更廣泛的硬體與任務條件下會不會同樣漂亮。\u003C\u002Fp>\u003Ch2>對實作的直接啟發\u003C\u002Fh2>\u003Cp>如果你要把這篇想成工程建議，最值得記住的是兩件事。第一，輸入的更新頻率可以分層，不必把所有感測都綁成同一個節拍。第二，推理流程可以依延遲調整，不一定要死守固定步數的去噪流程。\u003C\u002Fp>\u003Cp>這兩點合在一起，才是 πR² 的核心價值。它不是單純把模型做小，而是把模型的反應節奏改得更像真實控制系統。對做 manipulation、抓取、或任何需要即時修正的任務來說，這種設計比單純再加大模型更接近可部署。\u003C\u002Fp>\u003Cp>如果你的系統現在也卡在「模型會做，但來不及修正」，這篇提供的是一條很明確的路：保留大策略的表達能力，然後把 runtime 做成可反應、可重規劃、可適應延遲的形狀。這就是它真正的工程意義。\u003C\u002Fp>\u003Cul>\u003Cli>快慢雙通道把即時 proprioception 和較慢的 vision-language 特徵分開處理。\u003C\u002Fli>\u003Cli>單步、延遲自適應去噪讓重規劃更接近即時控制。\u003C\u002Fli>\u003Cli>摘要中的實驗結果顯示，實機成功率最高可提升 30%，且 closed-loop 重規劃約快 4 倍。\u003C\u002Fli>\u003C\u002Ful>\u003Cp>對做機器人策略的人來說，這篇的訊息很清楚：flow policy 不一定要犧牲反應速度，才能保留大模型的能力。\u003C\u002Fp>","πR² 讓動作分塊的 flow policy 能在執行中即時重規劃，靠快慢雙通道與單步去噪把控制迴圈拉回可反應的速度。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.26055",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785306783936-ijjo.png","research","zh","4347dd8c-0949-4bd2-9e36-bbbf1d467b4b",[17,18,19,20,21],"flow policy","diffusion forcing","closed-loop control","latency-adaptive","robot manipulation",[23,24,25],"把快慢輸入分流，讓即時狀態先進控制迴圈。","用單步去噪與延遲自適應排程，縮短重規劃時間。","摘要顯示實機成功率最高提升 30%，但完整 benchmark 細節未公開。",0,"2026-07-29T06:32:33.987717+00:00","2026-07-29T06:32:33.95+00:00",{"tags":30,"relatedLang":31,"relatedPosts":35},[],{"id":15,"slug":32,"title":33,"language":34},"pir2-reactive-real-time-flow-policies-en","πR² makes flow policies react in real time","en",[36,42,48,54,60,66],{"id":37,"slug":38,"title":39,"cover_image":40,"image_url":40,"created_at":41,"category":13},"7d00f7e4-000b-4921-94bf-cf06b1da1ceb","care-confidence-adaptive-routing-lora-zh","CARE 用信心分派 LoRA 專家","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785308583150-1gha.png","2026-07-29T07:02:29.165929+00:00",{"id":43,"slug":44,"title":45,"cover_image":46,"image_url":46,"created_at":47,"category":13},"b66c78dd-4d97-455a-a6a7-a1f74bcdf18b","relay-opd-fixes-prefix-failure-distillation-zh","Relay-OPD 修補失敗前綴","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785304970727-9vzo.png","2026-07-29T06:02:30.51071+00:00",{"id":49,"slug":50,"title":51,"cover_image":52,"image_url":52,"created_at":53,"category":13},"596ed05a-61b7-43f9-83ad-be1ce4df20c1","learning-from-multiple-data-providers-zh","多資料來源下的可學性地圖","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785222177037-wkxs.png","2026-07-28T07:02:26.764157+00:00",{"id":55,"slug":56,"title":57,"cover_image":58,"image_url":58,"created_at":59,"category":13},"dab55461-2d6f-4a34-936f-105cdb409535","certified-parallel-sinkhorn-dynamic-ot-zh","TemporalSinkhorn 讓動態 OT 平行化","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785220375358-3eit.png","2026-07-28T06:32:27.966514+00:00",{"id":61,"slug":62,"title":63,"cover_image":64,"image_url":64,"created_at":65,"category":13},"84fb7607-8711-40cb-9a04-02bad626d32f","clinfusion-vision-centric-medical-mllm-zh","ClinFusion 先把醫療影像看懂","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785218580863-y4ut.png","2026-07-28T06:02:28.426162+00:00",{"id":67,"slug":68,"title":69,"cover_image":70,"image_url":70,"created_at":71,"category":13},"ac1e5ec4-001e-4ecb-b8d0-0742f3b0287c","explainable-rl-air-traffic-control-zh","可解釋強化學習管空管路由","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785135782953-1dba.png","2026-07-27T07:02:29.948161+00:00",[73,78,83,88,93,98,103,108,113,118],{"id":74,"slug":75,"title":76,"created_at":77},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":79,"slug":80,"title":81,"created_at":82},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":84,"slug":85,"title":86,"created_at":87},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":89,"slug":90,"title":91,"created_at":92},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":94,"slug":95,"title":96,"created_at":97},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":99,"slug":100,"title":101,"created_at":102},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":104,"slug":105,"title":106,"created_at":107},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":109,"slug":110,"title":111,"created_at":112},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":114,"slug":115,"title":116,"created_at":117},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":119,"slug":120,"title":121,"created_at":122},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]