[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-mmdiff-multimodal-feature-discovery-control-zh":3,"article-related-mmdiff-multimodal-feature-discovery-control-zh":30,"series-research-b076a7b7-f01a-4438-8d49-548201e9ccec":73},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":23,"views":27,"created_at":28,"published_at":29,"topic_cluster_id":11},"b076a7b7-f01a-4438-8d49-548201e9ccec","mmdiff-multimodal-feature-discovery-control-zh","MMDiff：把多模態特徵變成控制旋鈕","\u003Cp>這篇論文證明了什麼？\u003C\u002Fp>\u003Cp data-speakable=\"summary\">MMDiff 用多模態 SAE 比對基座與微調模型，找出被多模態訓練改寫的關鍵特徵，並可用來稽核、移除或定向操控 MLLM 行為。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：多模態安全攻擊成功率降低 24%\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：比對 SAE 取出因果特徵\u003C\u002Fli>\u003C\u002Ful>\u003Cp>這篇論文不是只在做「可解釋性展示」。它想解的是更實際的問題：多模態大型語言模型裡，哪些內部特徵真的跟視覺理解、OCR、或安全行為有關，而且能不能直接拿來控制。對開發者來說，這差很多。能看懂不等於能干預；能找出特徵，也不代表能把行為拉回來。\u003C\u002Fp>\u003Cp>MMDiff 的核心就是把這件事往前推一步。它把 multimodal sparse autoencoder，簡稱多模態 SAE，拿來跟基座模型的 SAE 做差分。這個「diff」不是單純比對權重，而是想找出多模態訓練後被改動的特徵方向。作者的主張很直接：如果你能知道哪些特徵是多模態訓練新長出來的、哪些特徵又真的對某個任務有因果作用，那這些方向就\u003Ca href=\"\u002Fnews\u002Ftts-evaluators-miss-more-than-naturalness-zh\">不只\u003C\u002Fa>是解釋工具，也能變成控制介面。\u003C\u002Fp>\u003Ch2>這篇在補哪個洞\u003C\u002Fh2>\u003Cp>摘要先點出一個老問題。多模態 \u003Ca href=\"\u002Ftag\u002Fllm\">LLM\u003C\u002Fa> 的 hidden states 可以被 sparse autoencoder 分解成比較好懂的 feature directions，但這些方向通常只告訴你「有這個特徵」，不會告訴你「這個特徵是不是多模態訓練帶來的變化」，更不會直接告訴你怎麼對它動手。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786429980947-qtkn.png\" alt=\"MMDiff：把多模態特徵變成控制旋鈕\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這就是 MMDiff 要補的洞。它不是把 interpretability 當成最後的觀察報告，而是把它往稽核與干預延伸。這對實務很重要，因為很多模型問題不是「看不懂」，而是「看得懂一點，但沒辦法精準改」。如果一個特徵跟某種不安全回應有關，你希望的是能針對它下手，\u003Ca href=\"\u002Fnews\u002Frust-serious-gpu-programming-language-zh\">而不是\u003C\u002Fa>只能整層關掉。\u003C\u002Fp>\u003Cp>所以這篇的定位很清楚：它想把多模態可解釋性，從被動分析變成主動控制。這種轉向，對研究和產品端都算有價值，因為它把「診斷」跟「修正」接在一起了。\u003C\u002Fp>\u003Ch2>MMDiff 怎麼運作\u003C\u002Fh2>\u003Cp>方法上，MMDiff 被描述成一個 multimodal model-diffing framework。作者先訓練多模態 SAE，再把基座語言模型的 SAE 跟多模態適配後的 SAE 做比較。這一步的目標，是把多模態訓練改變過的特徵分離出來。\u003C\u002Fp>\u003Cp>接著，這個框架有三個用途。第一，特徵隔離：透過比對基座模型與多模態模型的 SAE，找出被改動的特徵。第二，任務特定特徵偵測：用 per-\u003Ca href=\"\u002Ftag\u002Ftoken\">token\u003C\u002Fa> contrastive firing analysis 去鎖定某個任務真正有因果作用的特徵。第三，特徵層級控制：把找出來的特徵方向拿去做 causal removal 或 steering，也就是移除或定向操控。\u003C\u002Fp>\u003Cp>白話講，MMDiff 不是只回答「模型裡有什麼特徵」，而是一路往下追到「哪些特徵是訓練造成的變化」、「哪些特徵對某個行為真的有用」，最後再問「我能不能把這個行為拉走或推過去」。這種工作流很像把 interpretability 做成一個可操作的控制台，而不是只做成一張圖。\u003C\u002Fp>\u003Cp>這也是它和一般事後分析不同的地方。很多方法停在觀察；MMDiff 把觀察結果直接接到 intervention。對工程師來說，這才是能落地的部分，因為最終要處理的是模型行為，不只是模型內部結構。\u003C\u002Fp>\u003Ch2>論文實際證明了什麼\u003C\u002Fh2>\u003Cp>摘要有寫清楚作者測了哪些模型。MMDiff 的 multimodal SAEs 是在三個 MLLM 家族上訓練：LLaVA-MORE、PaliGemma 2、InternVL3.5。評估範圍則包含 visual-spatial understanding、multimodal safety、OCR。摘要沒有公開完整 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 表格，所以這裡看不到更細的資料集拆分或逐項分數。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786429974764-rcoz.png\" alt=\"MMDiff：把多模態特徵變成控制旋鈕\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>但摘要至少給了幾個具體結果。第一，MMDiff 找到的是 sparse、而且具因果性的特徵；把這些特徵移除後，目標行為會被選擇性削弱。作者報告的平均效果是 spatial tasks 下降 12%，OCR 下降 17%。這代表它不是亂砍一通，而是對特定\u003Ca href=\"\u002Fnews\u002Fbaidu-wenxin-search-to-agent-template-zh\">能力\u003C\u002Fa>有比較精準的打擊。\u003C\u002Fp>\u003Cp>第二，在 multimodal safety attacks 上，移除這些特徵能把 attack success rate 降低 24%。摘要還特別說，這件事沒有影響 VQA performance。這句很關鍵，因為它暗示干預有一定選擇性，不是把模型整體弄鈍。\u003C\u002Fp>\u003Cp>第三，作者也測了 steering，不只是 removal。當把發現的特徵拿去 steer 時，spatial 與 OCR accuracy 平均比 standard single-layer steering baseline 高出 +3.6% 與 +1.8%。這表示同一套特徵方向，不只可拿來壓制行為，也能拿來把模型往更好的方向推。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>測試模型\u003C\u002Fstrong>：LLaVA-MORE、PaliGemma 2、InternVL3.5\u003C\u002Fli>\u003Cli>\u003Cstrong>評估任務\u003C\u002Fstrong>：視覺空間理解、多模態安全、OCR\u003C\u002Fli>\u003Cli>\u003Cstrong>摘要公開結果\u003C\u002Fstrong>：空間任務下降 12%、OCR 下降 17%、安全攻擊成功率降 24%\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>對開發者有什麼實際意義\u003C\u002Fh2>\u003Cp>如果你在做多模態系統，這篇最有價值的地方是控制粒度。很多時候你只能靠 prompt、adapter、或整層 steering 去調模型，但那種做法常常太粗。MMDiff 提供的是 feature-level interface，意思是你可以更精準地知道哪個內部方向跟某種行為綁在一起。\u003C\u002Fp>\u003Cp>這對安全尤其重要。摘要明確說，移除發現的特徵可以降低多模態安全攻擊成功率，而且不影響 VQA。對產品團隊來說，這種結果很有吸引力，因為它暗示你有機會在不犧牲主要功能的前提下，修掉某些脆弱點。當然，這只是摘要層級的結果，還不能直接推論到所有模型或所有攻擊型態，但方向是清楚的。\u003C\u002Fp>\u003Cp>另一個值得注意的點，是 steering 的結果比 standard single-layer steering baseline 更好。這代表這套方法不只適合做防守，也可能進入調校流程。也就是說，interpretability 工具不一定只是 debug 用，它也可能變成性能調整的一部分。對想做可控 MLLM 的團隊，這是很實用的想像。\u003C\u002Fp>\u003Cp>不過，這篇也有明顯限制。摘要沒有公開完整 benchmark 細節，沒有訓練成本、延遲開銷、資料集大小，也沒有說特徵在不同 prompt、不同領域、不同模型尺度下有多穩定。這些都會影響實作時的可信度。尤其是 feature discovery 類方法，最常被問的就是可重現性與可遷移性，而摘要目前還沒回答到這麼細。\u003C\u002Fp>\u003Ch2>這篇還沒證明什麼\u003C\u002Fh2>\u003Cp>從摘要能看到的是方法方向與幾個結果，但還不能直接說它已經是一個可廣泛部署的控制方案。它證明的是：在作者測的三個模型與三類任務上，multimodal SAE 的 diffing 可以找出具因果性的特徵，而且這些特徵能被拿來做 removal 或 steering。\u003C\u002Fp>\u003Cp>但它沒有證明所有多模態模型都能這樣做，也沒有證明每一種行為都能被同樣方式分離。換句話說，這是一個有說服力的原型，不是終局答案。對研究來說，這已經很有份量；對工程落地來說，還需要更多穩定性與成本面資料。\u003C\u002Fp>\u003Cp>不過，MMDiff 的概念本身很清楚，也很對題。它把多模態 interpretability 從「看懂 hidden state」往前推到「找出改變、定位因果、實際干預」。如果你關心的是怎麼讓 MLLM 更可稽核、也更可控，這篇提供的是一條很值得追的路。\u003C\u002Fp>\u003Cp>總結來說，MMDiff 證明了一件事：把基座模型和多模態模型的 SAE 拿來做差分，不只能看到特徵變化，還能把這些變化變成可操作的控制旋鈕。這讓多模態可解釋性，第一次比較像工程工具，而不只是研究展示。\u003C\u002Fp>","MMDiff 用多模態 SAE 比對基座與微調模型，找出被多模態訓練改寫的關鍵特徵，並可用來稽核、移除或定向操控 MLLM 行為。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.09928",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786429980947-qtkn.png","research","zh","999ef42b-6d1d-40b3-bdf0-dc87c93f3c89",[17,18,19,20,21,22],"multimodal SAE","feature steering","model diffing","MLLM","OCR","model interpretability",[24,25,26],"MMDiff 把多模態 SAE 差分變成找特徵、稽核與控制的流程。","摘要報告的結果包含安全攻擊成功率降低 24%，且不影響 VQA。","這篇有方法與原型價值，但摘要沒有公開完整 benchmark、成本與穩定性細節。",1,"2026-08-11T06:32:30.336974+00:00","2026-08-11T06:32:30.312+00:00",{"tags":31,"relatedLang":32,"relatedPosts":36},[],{"id":15,"slug":33,"title":34,"language":35},"mmdiff-multimodal-feature-discovery-control-en","MMDiff maps and steers multimodal features","en",[37,43,49,55,61,67],{"id":38,"slug":39,"title":40,"cover_image":41,"image_url":41,"created_at":42,"category":13},"0299c84e-cdca-4d9f-821c-437119627dbf","dutch-government-llm-benchmark-values-zh","荷蘭政府 LLM 不能只看準確率","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786431771084-my8i.png","2026-08-11T07:02:25.893246+00:00",{"id":44,"slug":45,"title":46,"cover_image":47,"image_url":47,"created_at":48,"category":13},"f5a1bf22-1f75-4be1-873e-f2bd717c2397","tts-evaluators-miss-more-than-naturalness-zh","TTS 評測不只看自然度","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786428174396-4b56.png","2026-08-11T06:02:28.652133+00:00",{"id":50,"slug":51,"title":52,"cover_image":53,"image_url":53,"created_at":54,"category":13},"f0e72c1b-c247-4238-b1a1-a90597871048","rust-serious-gpu-programming-language-zh","Rust 應被視為嚴肅的 GPU 程式語言，而不是副專案","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786372389159-glbr.png","2026-08-10T14:32:23.128002+00:00",{"id":56,"slug":57,"title":58,"cover_image":59,"image_url":59,"created_at":60,"category":13},"01ff45d6-76b3-4cdb-99bf-95d620b383fb","coinrag-fine-grained-kv-cache-reuse-rag-zh","CoinRAG 用細粒度 KV 快取加速 RAG","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786345391816-qqol.png","2026-08-10T07:02:33.206316+00:00",{"id":62,"slug":63,"title":64,"cover_image":65,"image_url":65,"created_at":66,"category":13},"2af77412-f711-4abb-915d-5b7d1b5275a7","creativeinstruct-llms-quality-creativity-diversity-zh","CreativeInstruct 讓 LLM 保留創意","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786343577690-m544.png","2026-08-10T06:32:27.403714+00:00",{"id":68,"slug":69,"title":70,"cover_image":71,"image_url":71,"created_at":72,"category":13},"69b80aa9-fd04-4b88-aadd-c5ebdb9a5be8","mirrorworld-mirror-reflection-video-diffusion-zh","MirrorWorld 讓鏡中倒影更一致","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786341773135-zkin.png","2026-08-10T06:02:26.712866+00:00",[74,79,84,89,94,99,104,109,114,119],{"id":75,"slug":76,"title":77,"created_at":78},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":80,"slug":81,"title":82,"created_at":83},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":85,"slug":86,"title":87,"created_at":88},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":90,"slug":91,"title":92,"created_at":93},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":95,"slug":96,"title":97,"created_at":98},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":100,"slug":101,"title":102,"created_at":103},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":105,"slug":106,"title":107,"created_at":108},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":110,"slug":111,"title":112,"created_at":113},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":115,"slug":116,"title":117,"created_at":118},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":120,"slug":121,"title":122,"created_at":123},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]