[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-surgical-wam-video-pretraining-robot-control-zh":3,"article-related-surgical-wam-video-pretraining-robot-control-zh":29,"series-research-51473b63-b17b-492a-8dc0-b12069a19b49":72},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"51473b63-b17b-492a-8dc0-b12069a19b49","surgical-wam-video-pretraining-robot-control-zh","Surgical WAM 用影片訓練手術機器人控制","\u003Cp>這篇論文在講什麼？\u003C\u002Fp>\u003Cp data-speakable=\"summary\">Surgical WAM 證明，先用無動作的內視鏡影片預訓練，再接少量示範微調，能提升閉迴路手術機器人控制表現。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：平均成功率從 63.5% 提升到 77.8%\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：同時學影像與動作\u003C\u002Fli>\u003C\u002Ful>\u003Cp>手術機器人不好教，原因很直接：有動作標註的示範太貴、太慢，但影片資料相對好拿。這篇論文的重點，就是把原本常被當成「只有看圖有用」的內視鏡影片，變成可以幫助控制器學得更好的訓練素材。\u003C\u002Fp>\u003Cp>作者要解的不是一般的影像理解問題，而是閉迴路控制。也就是說，模型不只要看懂畫面，還要能在環境變化時持續修正動作，真的推得動機器人做事。\u003C\u002Fp>\u003Ch2>這篇在修哪個痛點\u003C\u002Fh2>\u003Cp>論文一開始就鎖定一個機器人學習的老問題：動作標註的示範資料太稀缺。對手術場景來說，帶有同步運動學資訊的遠端操作軌跡，蒐集成本高、速度慢，還要仰賴專門設備與操\u003Ca href=\"\u002Fnews\u002F5-banking-workflow-patterns-sas-viya-governed-zh\">作流\u003C\u002Fa>程。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786514588496-1uqy.png\" alt=\"Surgical WAM 用影片訓練手術機器人控制\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>但內視鏡影片就不一樣了。影片本身比較容易累積，數量也能拉得更大。問題在於，很多流程只把影片拿去做感知或離線分析，沒有真正把它轉成控制能力。作者認為，這正是手術 world model 還沒被充分用起來的地方。\u003C\u002Fp>\u003Cp>所以這篇的核心問題很明確：在動作標註預算固定的情況下，純影片預訓練，能不能真的改善閉迴路手術操作？\u003C\u002Fp>\u003Ch2>Surgical WAM 怎麼做\u003C\u002Fh2>\u003Cp>這個方法叫 Surgical WAM，全名是 Surgical World-Action Model。摘要把它描述成建立在 Cosmos Policy 上的統一生成模型。\u003C\u002Fp>\u003Cp>它的設計重點，是不把「看影片」和「做控制」拆成兩條完全不同的路。模型同時學兩件事：預測未來的內視鏡畫面，以及預測可執行的手術機器人動作區塊。這讓它不只是單純的場景預測器，而是朝控制器靠攏的世界模型。\u003C\u002Fp>\u003Cp>訓練流程分兩階段。第一階段先用沒有動作標註的影片學手術視覺動態。第二階段再用固定預算下、少量帶動作標註的示範做微調。這種做法的重點，是先讓模型對手術場景有比較好的先驗，再把有限的示範資料用在刀口上。\u003C\u002Fp>\u003Cp>部署時，它不是一次把長長的動作序列全部丟出去，而是用 receding-horizon 的閉迴路控制方式運作。也就是先執行預測動作區塊的一小段前綴，觀察實際結果，再根據新畫面重新規劃。這種方式比較適合手術場景，因為接觸狀態和畫面變化都很快，不能太依賴開迴路長推演。\u003C\u002Fp>\u003Ch2>論文證明了什麼\u003C\u002Fh2>\u003Cp>摘要中的評估是在四個模擬手術操作任務上進行。結果顯示，加入影片預訓練後，平均成功率從 63.5% 提升到 77.8%。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786514579980-r7bh.png\" alt=\"Surgical WAM 用影片訓練手術機器人控制\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這是 14.3 個百分點的絕對提升。摘要另外點名 PegTransfer 的提升幅度達 20 個百分點。作者也特別提到，增幅最大的地方出現在接觸密集與雙手協作任務，這很合理，因為這類任務最吃短期視覺線索與互動動態。\u003C\u002Fp>\u003Cp>不過，摘要沒有公開更完整的 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 細節，所以目前只能根據這些數字判斷趨勢，還不能做更廣泛的性能比較。就摘要可見的證據來看，結論是清楚的：在固定動作標註預算下，先用無動作影片預訓練，確實能讓控制器有更好的起點。\u003C\u002Fp>\u003Cul>\u003Cli>平均成功率：63.5% → 77.8%\u003C\u002Fli>\u003Cli>PegTransfer：+20 個百分點\u003C\u002Fli>\u003Cli>最大增益：接觸密集、雙手任務\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>對開發者代表什麼\u003C\u002Fh2>\u003Cp>對做機器人系統的人來說，這篇最有意思的地方，不只是模型能不能預測影片，而是它把學到的視覺動態直接拿去當控制先驗。這比只把影片當成離線資料來看，更接近實際部署需求。\u003C\u002Fp>\u003Cp>如果這個結果能延伸到更真實的設定，對手術機器人資料策略會很有啟發：先大量收集無標註的內視鏡影片，再把有限的動作示範留給最關鍵的微調階段。這有機會降低對大規模遠端操作資料集的依賴，而那正是手術機器人學習最難補的成本。\u003C\u002Fp>\u003Cp>receding-horizon 的設計也很實用。手術過程中，接觸狀態可能瞬間變化。只執行短前綴、再重新規劃，能讓控制器根據實際結果修正，而不是死守一條長長的開迴路軌跡。\u003C\u002Fp>\u003Ch2>限制與還不能下的結論\u003C\u002Fh2>\u003Cp>這篇摘要只報告模擬環境的結果，沒有看到真實手術室部署，也沒有實體手術機器人的硬體驗證。這是很重要的邊界，因為模擬表現好，不代表上機就一定能維持。\u003C\u002Fp>\u003Cp>另外，摘要沒有提供四個任務以外的完整 benchmark 細節，所以也很難判斷這個方法在不同手術流程、不同相機配置，或不同機器人平台上的泛化能力。\u003C\u002Fp>\u003Cp>因此，這篇論文目前最穩妥的結論只能說：在摘要所列的模擬任務裡，動作自由的影片預訓練，確實幫助了閉迴路控制。它還不能直接證明，這套方法已經足以跨出模擬環境。\u003C\u002Fp>\u003Cp>但方向是有價值的。它把「便宜的影片資料」和「昂貴的動作示範」接起來，讓資料蒐集策略\u003Ca href=\"\u002Fnews\u002Fswe-bench-verified-model-leaderboard-limit-zh\">不再\u003C\u002Fa>只能靠大量同步標註硬堆。對想做手術機器人學習的團隊來說，這是很實際的一步。\u003C\u002Fp>\u003Ch2>總結\u003C\u002Fh2>\u003Cp>Surgical WAM 的重點很清楚：內視鏡影片不只是背景資料，也可以變成控制訓練訊號。只要先學到手術場景的視覺動態，再用少量示範微調，閉迴路手術控制就有機會明顯變好。\u003C\u002Fp>\u003Cp>對\u003Ca href=\"\u002Fnews\u002Fmcp-servers-8-developer-workflow-gains-2026-zh\">開發\u003C\u002Fa>者來說，這篇最值得記住的一句話是：如果動作標註是瓶頸，那就先把影片用到極致。這不是把資料問題消掉，而是把昂貴資料的價值放大。\u003C\u002Fp>","Surgical WAM 證明，先用無動作的內視鏡影片預訓練，再接少量示範微調，能提升閉迴路手術機器人控制表現。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.11204",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786514588496-1uqy.png","research","zh","4c94994e-d58b-4f24-a480-ad026fd60e04",[17,18,19,20,21],"surgical robotics","world model","video pretraining","closed-loop control","endoscopic video",[23,24,25],"無動作內視鏡影片預訓練可提升手術機器人控制表現。","模型同時預測未來影像與可執行動作區塊。","目前證據來自模擬任務，尚未驗證真實手術部署。",1,"2026-08-12T06:02:32.223678+00:00","2026-08-12T06:02:32.206+00:00",{"tags":30,"relatedLang":31,"relatedPosts":35},[],{"id":15,"slug":32,"title":33,"language":34},"surgical-wam-video-pretraining-robot-control-en","Surgical WAM uses video to train robot control","en",[36,42,48,54,60,66],{"id":37,"slug":38,"title":39,"cover_image":40,"image_url":40,"created_at":41,"category":13},"2aa54cfd-2caf-4c34-834c-e771e1308747","sparse-autoencoders-set-level-instability-zh","SAE 不是特徵袋","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786518181678-0ycl.png","2026-08-12T07:02:31.647391+00:00",{"id":43,"slug":44,"title":45,"cover_image":46,"image_url":46,"created_at":47,"category":13},"1544300b-d8fc-4341-ac8a-530391b179b2","convawg-controlled-vawg-dialogue-generation-zh","ConVAWG 讓 VAWG 對話可控生成","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786516377717-xygt.png","2026-08-12T06:32:30.301717+00:00",{"id":49,"slug":50,"title":51,"cover_image":52,"image_url":52,"created_at":53,"category":13},"97ecb84d-bd2a-437b-839e-6e8a416d4a94","swe-bench-verified-model-leaderboard-limit-zh","SWE-bench Verified 已不再是乾淨的模型排行榜","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786498365710-5zg7.png","2026-08-12T01:32:19.598349+00:00",{"id":55,"slug":56,"title":57,"cover_image":58,"image_url":58,"created_at":59,"category":13},"0299c84e-cdca-4d9f-821c-437119627dbf","dutch-government-llm-benchmark-values-zh","荷蘭政府 LLM 不能只看準確率","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786431771084-my8i.png","2026-08-11T07:02:25.893246+00:00",{"id":61,"slug":62,"title":63,"cover_image":64,"image_url":64,"created_at":65,"category":13},"b076a7b7-f01a-4438-8d49-548201e9ccec","mmdiff-multimodal-feature-discovery-control-zh","MMDiff：把多模態特徵變成控制旋鈕","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786429980947-qtkn.png","2026-08-11T06:32:30.336974+00:00",{"id":67,"slug":68,"title":69,"cover_image":70,"image_url":70,"created_at":71,"category":13},"f5a1bf22-1f75-4be1-873e-f2bd717c2397","tts-evaluators-miss-more-than-naturalness-zh","TTS 評測不只看自然度","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786428174396-4b56.png","2026-08-11T06:02:28.652133+00:00",[73,78,83,88,93,98,103,108,113,118],{"id":74,"slug":75,"title":76,"created_at":77},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":79,"slug":80,"title":81,"created_at":82},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":84,"slug":85,"title":86,"created_at":87},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":89,"slug":90,"title":91,"created_at":92},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":94,"slug":95,"title":96,"created_at":97},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":99,"slug":100,"title":101,"created_at":102},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":104,"slug":105,"title":106,"created_at":107},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":109,"slug":110,"title":111,"created_at":112},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":114,"slug":115,"title":116,"created_at":117},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":119,"slug":120,"title":121,"created_at":122},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]