[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-sparse-autoencoders-set-level-instability-zh":3,"article-related-sparse-autoencoders-set-level-instability-zh":29,"series-research-2aa54cfd-2caf-4c34-834c-e771e1308747":72},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"2aa54cfd-2caf-4c34-834c-e771e1308747","sparse-autoencoders-set-level-instability-zh","SAE 不是特徵袋","\u003Cp>稀疏自編碼器的特徵，真的能像「特徵袋」一樣穩定組合嗎？\u003C\u002Fp>\u003Cp data-speakable=\"summary\">這篇論文指出，SAE 的活躍 latent 集合反映的是模型內部相似性，不是人類概念邊界。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：摘要無公開 benchmark 數字\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：用活躍集合重算相似度\u003C\u002Fli>\u003C\u002Ful>\u003Cp>這篇論文把一個常見的直覺拿來重測：如果 sparse autoencoder（SAE）真的能把模型內部特徵拆得很清楚，那它們在輸入變動時，應該也能像人類概念那樣保持可解釋的組合關係。作者的結論很直接：在真實語料與一般設定下，事情沒有這麼單純。\u003C\u002Fp>\u003Cp>他們不是在問 SAE 能不能找出有意義的特徵，而是在問另一個更麻煩的問題：當你比較「整組活躍 latent」時，這些集合到底是在對齊人類概念，還是在反映模型自己學到的內部相似性？這個差別很大，因為前者支持可讀的概念解釋，後者則比較像模型自己的幾何結構。\u003C\u002Fp>\u003Ch2>這篇在解什麼痛點\u003C\u002Fh2>\u003Cp>論文的出發點，來自一條最近的詮釋線索：先前工作發現，大型語言模型的表示大致能重建人類的 category boundary，但對 category 內部的 typicality 細節就沒那麼準。那類分析用的是 dense representation 的 cosine similarity。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786518181678-0ycl.png\" alt=\"SAE 不是特徵袋\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這篇作者想知道：如果把相似度改成 sparse autoencoder 的 latent overlap，結論會不會變？這不是小改動。因為 SAE 在很多人眼中，就是比較「可讀」的模型內部視角。它把一個密集向量拆成稀疏的 active features，看起來更像人類可以命名、可以追蹤的訊號。\u003C\u002Fp>\u003Cp>但可解釋工具有一個硬條件：語義要穩。如果一個 feature 在不同輸入下的變化，和人類概念變化不是同一套邏輯，那它就不太像真正穩定的概念單元。這篇論文就是在壓測這個假設。\u003C\u002Fp>\u003Cp>換句話說，作者不是只想證明 SAE 有沒有用，而是想拆掉一個常見誤會：稀疏，\u003Ca href=\"\u002Fnews\u002Fbenchmark-scores-dont-predict-your-bill-zh\">不等於\u003C\u002Fa>概念上可組合；看起來像 feature bag，也不代表真的能用 bag-of-features 的方式理解。\u003C\u002Fp>\u003Ch2>方法怎麼做\u003C\u002Fh2>\u003Cp>這篇的核心方法很簡單，但方向很不一樣。它\u003Ca href=\"\u002Fnews\u002Fswe-bench-verified-model-leaderboard-limit-zh\">不再\u003C\u002Fa>比較 dense vector 的 cosine similarity，而是改看 sparse autoencoder 的 active latent set overlap。白話就是：兩個輸入各自會點亮一組 latent，作者就看這兩組「亮起來的特徵」重疊多少，拿這個重疊量當作相似度訊號。\u003C\u002Fp>\u003Cp>這個改法的重要性在於，它把比較單位從「向量距離」換成「集合關係」。如果 SAEs 真的是一種更接近概念的表示方式，那集合層級的 overlap 也許會更貼近人類對類別與典型性的直覺。\u003C\u002Fp>\u003Cp>作者先做了驗證，避免這個 overlap 指標只是空有形式。他們用受控的 toy model 來測試，看看 SAE latent set 能不能恢復類似 union 的組合結構。接著也把方法放到自然文本上，檢查得到的鄰域是否有語義一致性。\u003C\u002Fp>\u003Cp>這一步很關鍵。因為如果 overlap 指標連基本的組合或語義鄰近都抓不到，後面的分析就沒有意義。論文的說法是：這個指標確實能在簡化情境中抓到某種組合結構，也能在文本上產生看起來合理的語義鄰域。\u003C\u002Fp>\u003Cp>也就是說，問題不在於方法完全失靈。相反地，方法是有訊號的，只是那個訊號未必是人類概念語義。\u003C\u002Fp>\u003Ch2>它實際證明了什麼\u003C\u002Fh2>\u003Cp>主結果是負面的，但很有價值：SAE 的 activation set 並沒有比 dense embeddings 或 residual-stream states 更好地重建人類的 category boundary，也沒有更準確地捕捉 category 內的 typicality。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786518180491-tiz1.png\" alt=\"SAE 不是特徵袋\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這句話很重要，因為它直接打破一個常見期待：更稀疏、更可分的表示，應該更容易對齊人類概念。至少在這篇的設定裡，沒有看到這件事成立。\u003C\u002Fp>\u003Cp>作者進一步指出，這些 set overlap 更像是在追蹤模型內部的相似性結構。也就是說，SAE 看起來很有語義，不代表它的語義是「人類式」的。它可能只是把模型自己覺得相近的東西，拆成更好看的 sparse 形式。\u003C\u002Fp>\u003Cp>接著他們把焦點放到受控的語義修改上，觀察 active latent set 在概念變動時怎麼變。結果顯示，人類對「概念變了多少」的判斷，和 SAE active set 的變化之間，有明顯落差。\u003C\u002Fp>\u003Cp>這個落差把論文的核心觀點講得很清楚：在一般情況下，SAE 特徵不太像可以用簡單 bag-of-features 方式組合的東西。不是說它們沒有結構，而是說這個結構不是人類直覺裡那種加法式、拼圖式的概念結構。\u003C\u002Fp>\u003Ch2>對開發者代表什麼\u003C\u002Fh2>\u003Cp>如果你在做 mechanistic interpretability、feature discovery，或是想用 SAE 幫模型除錯，這篇是個提醒：稀疏特徵可以有用，但不要自動把它們等同於人類概念。\u003C\u002Fp>\u003Cp>實作上，這代表你不能只看幾個漂亮案例，就推論某個 latent 是穩定的概念單元。當輸入稍微變一下，特徵集合是否還保持同樣語義，才是更重要的測試。尤其如果你的工作流依賴 feature attribution、概念編輯，或是以 feature 為單位做解釋，那你需要驗證它在 semantic perturbation 下是否仍然可讀。\u003C\u002Fp>\u003Cp>這篇也提醒一個評估上的盲點：某個 similarity measure 在 toy setting 裡有效，不代表它在真實語言資料中就能對齊你在意的概念結構。對工程端來說，這表示你要同時看兩件事：局部鄰域是否語義一致，以及更高層的 compositional behavior 是否成立。\u003C\u002Fp>\u003Cp>如果只看前者，很容易高估 SAE 的人類可解釋性。因為一組 feature 看起來很整齊，不代表它在概念變動時也會維持同樣的語義邊界。\u003C\u002Fp>\u003Ch2>限制與還沒回答的事\u003C\u002Fh2>\u003Cp>這篇摘要沒有公開完整 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 數字，所以沒有 accuracy、correlation 或 effect size 可以拿來量化差距。讀這篇時，比較適合把它當成一個方向性的結果：作者證明了 mismatch 存在，但摘要沒有告訴你 mismatch 到底有多大。\u003C\u002Fp>\u003Cp>另外，這篇聚焦的是 SAE latent set 當作 similarity lens，不是對所有 SAE \u003Ca href=\"\u002Fnews\u002Fsurgical-wam-video-pretraining-robot-control-zh\">訓練\u003C\u002Fa>方式、所有模型層、或所有語言模型的全面總結。所以它比較像是在反對「簡單的特徵袋語義」，而不是宣告所有 SAE-based interpretability 都沒價值。\u003C\u002Fp>\u003Cp>真正留下來的研究問題是：如果不是人類概念，SAE 特徵到底穩定對齊什麼？論文目前給的答案是模型內部相似性。這已經比完全沒有訊號好很多，但也意味著它的語義更條件式，不是那種可以直接拿來當人類詞義替代品的表示。\u003C\u002Fp>\u003Cp>對\u003Ca href=\"\u002Ftag\u002F台灣開發者\">台灣開發者\u003C\u002Fa>來說，這篇的實際意義很實在：做可解釋性工具時，別把「稀疏」誤認成「可組合」；也別把「看起來語義化」誤認成「真的對齊人類概念」。這兩件事不是同一件事，而這篇論文正是在提醒你，它們差很多。\u003C\u002Fp>\u003Cul>\u003Cli>SAE 的活躍集合可以提供有意義的相似度訊號。\u003C\u002Fli>\u003Cli>但它們不會自動比 dense 表示更貼近人類分類邊界。\u003C\u002Fli>\u003Cli>做 interpretability 時，特徵要先經過 semantic stress test。\u003C\u002Fli>\u003C\u002Ful>\u003Cp>所以，如果你的工作是把模型內部變得更可懂，這篇的態度可以濃縮成一句話：先把 SAE 當成模型內部結構的探針，不要先把它當成人類概念的保證書。\u003C\u002Fp>","這篇論文指出，SAE 的活躍 latent 集合反映的是模型內部相似性，不是人類概念邊界。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.11197",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786518181678-0ycl.png","research","zh","b400fb5d-3c21-4a6a-8383-988225159548",[17,18,19,20,21],"sparse autoencoder","activation set","mechanistic interpretability","latent overlap","language model representations",[23,24,25],"SAE active sets 有訊號，但不等於人類概念邊界。","集合層級 overlap 比 dense cosine 更像模型內部相似性。","做可解釋性工具時，要測 semantic change 下的穩定性。",0,"2026-08-12T07:02:31.647391+00:00","2026-08-12T07:02:31.638+00:00",{"tags":30,"relatedLang":31,"relatedPosts":35},[],{"id":15,"slug":32,"title":33,"language":34},"sparse-autoencoders-set-level-instability-en","Sparse Autoencoders Don’t Behave Like Feature Bags","en",[36,42,48,54,60,66],{"id":37,"slug":38,"title":39,"cover_image":40,"image_url":40,"created_at":41,"category":13},"1544300b-d8fc-4341-ac8a-530391b179b2","convawg-controlled-vawg-dialogue-generation-zh","ConVAWG 讓 VAWG 對話可控生成","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786516377717-xygt.png","2026-08-12T06:32:30.301717+00:00",{"id":43,"slug":44,"title":45,"cover_image":46,"image_url":46,"created_at":47,"category":13},"51473b63-b17b-492a-8dc0-b12069a19b49","surgical-wam-video-pretraining-robot-control-zh","Surgical WAM 用影片訓練手術機器人控制","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786514588496-1uqy.png","2026-08-12T06:02:32.223678+00:00",{"id":49,"slug":50,"title":51,"cover_image":52,"image_url":52,"created_at":53,"category":13},"97ecb84d-bd2a-437b-839e-6e8a416d4a94","swe-bench-verified-model-leaderboard-limit-zh","SWE-bench Verified 已不再是乾淨的模型排行榜","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786498365710-5zg7.png","2026-08-12T01:32:19.598349+00:00",{"id":55,"slug":56,"title":57,"cover_image":58,"image_url":58,"created_at":59,"category":13},"0299c84e-cdca-4d9f-821c-437119627dbf","dutch-government-llm-benchmark-values-zh","荷蘭政府 LLM 不能只看準確率","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786431771084-my8i.png","2026-08-11T07:02:25.893246+00:00",{"id":61,"slug":62,"title":63,"cover_image":64,"image_url":64,"created_at":65,"category":13},"b076a7b7-f01a-4438-8d49-548201e9ccec","mmdiff-multimodal-feature-discovery-control-zh","MMDiff：把多模態特徵變成控制旋鈕","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786429980947-qtkn.png","2026-08-11T06:32:30.336974+00:00",{"id":67,"slug":68,"title":69,"cover_image":70,"image_url":70,"created_at":71,"category":13},"f5a1bf22-1f75-4be1-873e-f2bd717c2397","tts-evaluators-miss-more-than-naturalness-zh","TTS 評測不只看自然度","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786428174396-4b56.png","2026-08-11T06:02:28.652133+00:00",[73,78,83,88,93,98,103,108,113,118],{"id":74,"slug":75,"title":76,"created_at":77},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":79,"slug":80,"title":81,"created_at":82},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":84,"slug":85,"title":86,"created_at":87},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":89,"slug":90,"title":91,"created_at":92},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":94,"slug":95,"title":96,"created_at":97},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":99,"slug":100,"title":101,"created_at":102},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":104,"slug":105,"title":106,"created_at":107},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":109,"slug":110,"title":111,"created_at":112},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":114,"slug":115,"title":116,"created_at":117},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":119,"slug":120,"title":121,"created_at":122},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]