[RSCH] 7 分鐘閱讀OraCore 編輯部

MMDiff:把多模態特徵變成控制旋鈕

MMDiff 用多模態 SAE 比對基座與微調模型,找出被多模態訓練改寫的關鍵特徵,並可用來稽核、移除或定向操控 MLLM 行為。

分享 LinkedIn
MMDiff:把多模態特徵變成控制旋鈕

這篇論文證明了什麼?

MMDiff 用多模態 SAE 比對基座與微調模型,找出被多模態訓練改寫的關鍵特徵,並可用來稽核、移除或定向操控 MLLM 行為。

  • 研究機構:arXiv 摘要未明確標註
  • 核心數據:多模態安全攻擊成功率降低 24%
  • 突破點:比對 SAE 取出因果特徵

這篇論文不是只在做「可解釋性展示」。它想解的是更實際的問題:多模態大型語言模型裡,哪些內部特徵真的跟視覺理解、OCR、或安全行為有關,而且能不能直接拿來控制。對開發者來說,這差很多。能看懂不等於能干預;能找出特徵,也不代表能把行為拉回來。

MMDiff 的核心就是把這件事往前推一步。它把 multimodal sparse autoencoder,簡稱多模態 SAE,拿來跟基座模型的 SAE 做差分。這個「diff」不是單純比對權重,而是想找出多模態訓練後被改動的特徵方向。作者的主張很直接:如果你能知道哪些特徵是多模態訓練新長出來的、哪些特徵又真的對某個任務有因果作用,那這些方向就不只是解釋工具,也能變成控制介面。

這篇在補哪個洞

訂閱 AI 趨勢週報

每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。

不會寄垃圾信,隨時可取消。

摘要先點出一個老問題。多模態 LLM 的 hidden states 可以被 sparse autoencoder 分解成比較好懂的 feature directions,但這些方向通常只告訴你「有這個特徵」,不會告訴你「這個特徵是不是多模態訓練帶來的變化」,更不會直接告訴你怎麼對它動手。

MMDiff:把多模態特徵變成控制旋鈕

這就是 MMDiff 要補的洞。它不是把 interpretability 當成最後的觀察報告,而是把它往稽核與干預延伸。這對實務很重要,因為很多模型問題不是「看不懂」,而是「看得懂一點,但沒辦法精準改」。如果一個特徵跟某種不安全回應有關,你希望的是能針對它下手,而不是只能整層關掉。

所以這篇的定位很清楚:它想把多模態可解釋性,從被動分析變成主動控制。這種轉向,對研究和產品端都算有價值,因為它把「診斷」跟「修正」接在一起了。

MMDiff 怎麼運作

方法上,MMDiff 被描述成一個 multimodal model-diffing framework。作者先訓練多模態 SAE,再把基座語言模型的 SAE 跟多模態適配後的 SAE 做比較。這一步的目標,是把多模態訓練改變過的特徵分離出來。

接著,這個框架有三個用途。第一,特徵隔離:透過比對基座模型與多模態模型的 SAE,找出被改動的特徵。第二,任務特定特徵偵測:用 per-token contrastive firing analysis 去鎖定某個任務真正有因果作用的特徵。第三,特徵層級控制:把找出來的特徵方向拿去做 causal removal 或 steering,也就是移除或定向操控。

白話講,MMDiff 不是只回答「模型裡有什麼特徵」,而是一路往下追到「哪些特徵是訓練造成的變化」、「哪些特徵對某個行為真的有用」,最後再問「我能不能把這個行為拉走或推過去」。這種工作流很像把 interpretability 做成一個可操作的控制台,而不是只做成一張圖。

這也是它和一般事後分析不同的地方。很多方法停在觀察;MMDiff 把觀察結果直接接到 intervention。對工程師來說,這才是能落地的部分,因為最終要處理的是模型行為,不只是模型內部結構。

論文實際證明了什麼

摘要有寫清楚作者測了哪些模型。MMDiff 的 multimodal SAEs 是在三個 MLLM 家族上訓練:LLaVA-MORE、PaliGemma 2、InternVL3.5。評估範圍則包含 visual-spatial understanding、multimodal safety、OCR。摘要沒有公開完整 benchmark 表格,所以這裡看不到更細的資料集拆分或逐項分數。

MMDiff:把多模態特徵變成控制旋鈕

但摘要至少給了幾個具體結果。第一,MMDiff 找到的是 sparse、而且具因果性的特徵;把這些特徵移除後,目標行為會被選擇性削弱。作者報告的平均效果是 spatial tasks 下降 12%,OCR 下降 17%。這代表它不是亂砍一通,而是對特定能力有比較精準的打擊。

第二,在 multimodal safety attacks 上,移除這些特徵能把 attack success rate 降低 24%。摘要還特別說,這件事沒有影響 VQA performance。這句很關鍵,因為它暗示干預有一定選擇性,不是把模型整體弄鈍。

第三,作者也測了 steering,不只是 removal。當把發現的特徵拿去 steer 時,spatial 與 OCR accuracy 平均比 standard single-layer steering baseline 高出 +3.6% 與 +1.8%。這表示同一套特徵方向,不只可拿來壓制行為,也能拿來把模型往更好的方向推。

  • 測試模型:LLaVA-MORE、PaliGemma 2、InternVL3.5
  • 評估任務:視覺空間理解、多模態安全、OCR
  • 摘要公開結果:空間任務下降 12%、OCR 下降 17%、安全攻擊成功率降 24%

對開發者有什麼實際意義

如果你在做多模態系統,這篇最有價值的地方是控制粒度。很多時候你只能靠 prompt、adapter、或整層 steering 去調模型,但那種做法常常太粗。MMDiff 提供的是 feature-level interface,意思是你可以更精準地知道哪個內部方向跟某種行為綁在一起。

這對安全尤其重要。摘要明確說,移除發現的特徵可以降低多模態安全攻擊成功率,而且不影響 VQA。對產品團隊來說,這種結果很有吸引力,因為它暗示你有機會在不犧牲主要功能的前提下,修掉某些脆弱點。當然,這只是摘要層級的結果,還不能直接推論到所有模型或所有攻擊型態,但方向是清楚的。

另一個值得注意的點,是 steering 的結果比 standard single-layer steering baseline 更好。這代表這套方法不只適合做防守,也可能進入調校流程。也就是說,interpretability 工具不一定只是 debug 用,它也可能變成性能調整的一部分。對想做可控 MLLM 的團隊,這是很實用的想像。

不過,這篇也有明顯限制。摘要沒有公開完整 benchmark 細節,沒有訓練成本、延遲開銷、資料集大小,也沒有說特徵在不同 prompt、不同領域、不同模型尺度下有多穩定。這些都會影響實作時的可信度。尤其是 feature discovery 類方法,最常被問的就是可重現性與可遷移性,而摘要目前還沒回答到這麼細。

這篇還沒證明什麼

從摘要能看到的是方法方向與幾個結果,但還不能直接說它已經是一個可廣泛部署的控制方案。它證明的是:在作者測的三個模型與三類任務上,multimodal SAE 的 diffing 可以找出具因果性的特徵,而且這些特徵能被拿來做 removal 或 steering。

但它沒有證明所有多模態模型都能這樣做,也沒有證明每一種行為都能被同樣方式分離。換句話說,這是一個有說服力的原型,不是終局答案。對研究來說,這已經很有份量;對工程落地來說,還需要更多穩定性與成本面資料。

不過,MMDiff 的概念本身很清楚,也很對題。它把多模態 interpretability 從「看懂 hidden state」往前推到「找出改變、定位因果、實際干預」。如果你關心的是怎麼讓 MLLM 更可稽核、也更可控,這篇提供的是一條很值得追的路。

總結來說,MMDiff 證明了一件事:把基座模型和多模態模型的 SAE 拿來做差分,不只能看到特徵變化,還能把這些變化變成可操作的控制旋鈕。這讓多模態可解釋性,第一次比較像工程工具,而不只是研究展示。