[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-care-confidence-adaptive-routing-lora-zh":3,"article-related-care-confidence-adaptive-routing-lora-zh":29,"series-research-7d00f7e4-000b-4921-94bf-cf06b1da1ceb":72},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"7d00f7e4-000b-4921-94bf-cf06b1da1ceb","care-confidence-adaptive-routing-lora-zh","CARE 用信心分派 LoRA 專家","\u003Cp>當\u003Ca href=\"\u002Fnews\u002Fclaude-opus-5-behavior-audit-lowest-score-zh\">模型\u003C\u002Fa>把每個 \u003Ca href=\"\u002Ftag\u002Ftoken\">token\u003C\u002Fa> 都當成一樣處理時，算力很容易花在簡單題上，真正難的地方反而不夠用。\u003C\u002Fp>\u003Cp data-speakable=\"summary\">CARE 依照 router 信心動態分派 LoRA 專家，讓不確定 token 用更多算力、簡單 token 用更少。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：八個 commonsense benchmarks\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：信心驅動的專家納入\u003C\u002Fli>\u003C\u002Ful>\u003Cp>\u003Ca href=\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.26052\">Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA\u003C\u002Fa> 要解的，是 \u003Ca href=\"\u002Ftag\u002Fmoe\">MoE\u003C\u002Fa>-LoRA 很常見的一個浪費：固定 top-k 路由不管 token 難不難，都給同樣數量的專家。摘要的意思很直接，模型其實\u003Ca href=\"\u002Fnews\u002Frisc-v-is-a-real-platform-now-zh\">已經\u003C\u002Fa>在 router 輸出裡留下了不確定性線索，只是過去沒有把這條線索拿來做路由決策。CARE 做的事，就是把這個訊號變成每個 token 的動態規則。\u003C\u002Fp>\u003Cp>這種想法對做模型工程的人很有感。你如果已經在用 MoE-LoRA，就會知道路由不是附加功能，而是算力分配器。固定分派看起來簡單，實際上卻可能把專家容量浪費在容易的 token 上，難的 token 反而拿不到更多幫助。CARE 想做的不是再加一層複雜控制器，而是讓既有 router 自己決定該不該多花一點算力。\u003C\u002Fp>\u003Ch2>它想修正什麼痛點\u003C\u002Fh2>\u003Cp>傳統 MoE 版本的 LoRA，常見做法是每個 token 固定送進 k 個專家。這種 top-k 路由好實作，也容易理解，但它背後其實有個假設：每個 token 都值得同樣多的專家容量。摘要明確指出，這個假設不太合理，因為不同 token 的不確定性差很多。有些 token 本來就很穩，基座模型就能處理；有些 token 則需要更多專家介入。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785308583150-1gha.png\" alt=\"CARE 用信心分派 LoRA 專家\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>CARE 的核心觀察是，router 的輸出分佈本身就能反映不確定性。分佈越尖，代表 router 越清楚該選哪些專家。分佈越平，代表它越猶豫。與其硬性規定每個 token 都要拿一樣多的專家，不如直接用這個訊號來決定資源分配。\u003C\u002Fp>\u003Cp>這不是單純的效率調整，而是整個 MoE 系統裡的資源管理\u003Ca href=\"\u002Fnews\u002Fpir2-reactive-real-time-flow-policies-zh\">策略\u003C\u002Fa>。路由決定模型把有限的 expert budget 花在哪裡。如果路由策略不對，就會同時發生兩件事：簡單 token 被過度服務，難 token 卻沒有拿到足夠幫助。CARE 的目標，就是讓這筆預算更精準。\u003C\u002Fp>\u003Ch2>CARE 怎麼運作\u003C\u002Fh2>\u003Cp>CARE 是 Confidence-Adaptive Routing of Experts。名字已經把方法講得很白話：用信心來調整專家路由。它不是固定選 k 個專家，而是依照 router 權重由高到低往下加，直到累積機率質量達到某個門檻。這個概念有點像 nucleus sampling，只是採樣對象不是 token，而是專家。\u003C\u002Fp>\u003Cp>摘要還提到一個額外機制：如果被納入的專家彼此出現分歧，CARE 允許再做小幅擴展。作者把這種分歧視為一種 epistemic 訊號，也就是模型對這個輸入還沒完全定案，可能值得再多給一點專家容量。這個設計的重點不是把路由做得更炫，而是把「猶豫」這件事直接轉成資源增加的理由。\u003C\u002Fp>\u003Cp>但只靠信心門檻還不夠。因為如果完全照分佈走，平均活躍專家數可能飄來飄去，最後算力預算失控。CARE 因此加了一個 budget thermostat，用來校準門檻，讓平均啟用的專家數貼近目標預算。這個設計很實際，因為很多動態路由方法理論上很漂亮，最後卻卡在平均成本不好控。\u003C\u002Fp>\u003Cp>從工程角度看，這套方法有兩個吸引人的地方。第一，它是 drop-in 規則，可以直接接到既有 MoE-LoRA 架構。第二，它是 single-pass，而且不需要額外參數。這表示它沒有引入第二次前向、沒有多一個控制器，也沒有逼你重訓一個新模組。對想做效率優化的團隊來說，這種改動成本很低。\u003C\u002Fp>\u003Ch2>論文實際證明了什麼\u003C\u002Fh2>\u003Cp>摘要說明，作者在 LLaMA-3.1-8B 和 Qwen2.5-7B 上，跑了八個 commonsense benchmarks，另外還包含 math、code 和 knowledge 類任務。這代表它不是只挑單一領域測試，而是試著看這種路由策略能不能跨不同型態的工作都站得住腳。對路由法來說，這很重要，因為只在單一 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 變好，說服力通常有限。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785308575017-boon.png\" alt=\"CARE 用信心分派 LoRA 專家\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>結果上，CARE 在 matched compute 的情況下優於固定 top-k 的 MoE-LoRA。摘要也說，它能在啟用較少專家的情況下，達到固定 k=4 baseline 的表現。這裡沒有公開完整 benchmark 數字，所以不能直接拿出提升幾分來說，但方向很清楚：同樣算力下表現更好，或是同樣表現下用更少專家。\u003C\u002Fp>\u003Cp>另一個值得注意的點，是摘要提到同樣的 confidence 和 disagreement 訊號，也能改善 out-of-distribution detection，表現優於 MSP、entropy 和 multi-pass proxies。這對實務很有意思，因為路由不確定性和 OOD 偵測，本質上都在問同一件事：模型對這筆輸入到底有多有把握。若一套訊號能同時用在兩個地方，實作價值就更高。\u003C\u002Fp>\u003Cp>摘要也提到作者用 nucleus fidelity、budget optimality，和對 disagreement 的 epistemic 解讀來支撐設計。不過這部分摘要沒有展開細節，所以我們只能知道它們是論證的一部分，不能進一步推測分析方法的完整內容。至少從摘要看，作者不是只丟一個 heuristic，而是想同時從經驗結果和概念層面說服讀者。\u003C\u002Fp>\u003Ch2>對開發者有什麼影響\u003C\u002Fh2>\u003Cp>如果你正在做 MoE-LoRA 或類似的參數高效率微調，CARE 提供了一個很實用的方向：不要把路由當成固定配額，而是把它當成動態算力分配器。這對算力敏感的場景特別有用，因為它試圖在不犧牲品質的前提下，減少簡單 token 的不必要專家啟用。\u003C\u002Fp>\u003Cp>它也讓路由策略變得比較可解釋。固定 k 路由雖然簡單，但你很難說明為什麼某個 token 跟另一個 token 要用一樣多的專家。CARE 的規則就直觀很多：越不確定，越多專家；專家彼此越分歧，越可能值得再往上加一點。這種敘事對 debug 和系統溝通都比較友善。\u003C\u002Fp>\u003Cp>不過，摘要也留下幾個空白。第一，沒有公開完整 benchmark 數字，所以讀者無法從摘要判斷實際提升幅度。第二，摘要沒有交代 thermostat 對不同目標預算有多敏感，也沒有說在更多架構或資料集上是否同樣穩定。第三，雖然 OOD detection 的結果看起來不錯，但摘要沒有說路由本身在更強烈的 distribution shift 下會不會失準。\u003C\u002Fp>\u003Cp>所以，CARE 比較像是一個可落地的路由規則，而不是一個已經把所有系統問題都解完的新架構。它的優點是簡單、單次前向、沒有額外參數，缺點則是摘要沒有把可復現的細節講滿。對開發者來說，這代表它值得關注，但還需要看完整論文才能評估導入成本與穩定性。\u003C\u002Fp>\u003Ch2>你可以怎麼理解這篇工作\u003C\u002Fh2>\u003Cp>最簡單的說法是，CARE 把 router 的信心值變成專家預算的開關。它不是想讓 MoE-LoRA 更大，而是讓它更會花錢。簡單 token 少花一點，難 token 多花一點，整體算力就有機會用得更有效率。\u003C\u002Fp>\u003Cp>這篇工作的訊息也很清楚：router 輸出不只是選擇分數，還可以是每個 token 的不確定性訊號。只要你把這個訊號拿來做動態分派，就有機會同時改善 matched-compute 表現、維持單次推理流程，甚至順手把 OOD detection 一起拉上來。對做效率型模型的人來說，這是一個值得記住的設計模式。\u003C\u002Fp>\u003Cul>\u003Cli>CARE 用 router 信心取代固定 k，讓專家數量隨 token 難度變動。\u003C\u002Fli>\u003Cli>它維持 single-pass、無額外參數，適合直接接進既有 MoE-LoRA 系統。\u003C\u002Fli>\u003Cli>摘要主張它在八個 commonsense benchmarks 與其他任務上有效，但沒有公開完整數字。\u003C\u002Fli>\u003C\u002Ful>","CARE 依照 router 信心動態分派 LoRA 專家，讓不確定 token 用更多算力、簡單 token 用更少。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.26052",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785308583150-1gha.png","research","zh","459e2d94-412c-472f-991b-1fe9d42bb684",[17,18,19,20,21],"MoE-LoRA","routing","confidence-adaptive","LoRA","OOD detection",[23,24,25],"CARE 把固定 top-k 路由改成信心驅動的動態專家納入。","方法維持 single-pass，且不需要額外參數。","摘要主張它能在較少專家下維持表現，並改善 OOD detection，但未公開完整 benchmark 數字。",0,"2026-07-29T07:02:29.165929+00:00","2026-07-29T07:02:29.152+00:00",{"tags":30,"relatedLang":31,"relatedPosts":35},[],{"id":15,"slug":32,"title":33,"language":34},"care-confidence-adaptive-routing-lora-en","CARE routes LoRA experts by confidence","en",[36,42,48,54,60,66],{"id":37,"slug":38,"title":39,"cover_image":40,"image_url":40,"created_at":41,"category":13},"c8c4d82d-7dd9-46e7-98a0-f6f2c6b86c1e","openai-agent-hack-forces-tighter-eval-controls-zh","OpenAI 事件逼你收緊 eval","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785326587078-rzpe.png","2026-07-29T12:02:45.792562+00:00",{"id":43,"slug":44,"title":45,"cover_image":46,"image_url":46,"created_at":47,"category":13},"0ff5f275-dc86-4cc7-924d-48ee394c81a7","pir2-reactive-real-time-flow-policies-zh","πR² 讓流式策略即時反應","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785306783936-ijjo.png","2026-07-29T06:32:33.987717+00:00",{"id":49,"slug":50,"title":51,"cover_image":52,"image_url":52,"created_at":53,"category":13},"b66c78dd-4d97-455a-a6a7-a1f74bcdf18b","relay-opd-fixes-prefix-failure-distillation-zh","Relay-OPD 修補失敗前綴","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785304970727-9vzo.png","2026-07-29T06:02:30.51071+00:00",{"id":55,"slug":56,"title":57,"cover_image":58,"image_url":58,"created_at":59,"category":13},"596ed05a-61b7-43f9-83ad-be1ce4df20c1","learning-from-multiple-data-providers-zh","多資料來源下的可學性地圖","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785222177037-wkxs.png","2026-07-28T07:02:26.764157+00:00",{"id":61,"slug":62,"title":63,"cover_image":64,"image_url":64,"created_at":65,"category":13},"dab55461-2d6f-4a34-936f-105cdb409535","certified-parallel-sinkhorn-dynamic-ot-zh","TemporalSinkhorn 讓動態 OT 平行化","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785220375358-3eit.png","2026-07-28T06:32:27.966514+00:00",{"id":67,"slug":68,"title":69,"cover_image":70,"image_url":70,"created_at":71,"category":13},"84fb7607-8711-40cb-9a04-02bad626d32f","clinfusion-vision-centric-medical-mllm-zh","ClinFusion 先把醫療影像看懂","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785218580863-y4ut.png","2026-07-28T06:02:28.426162+00:00",[73,78,83,88,93,98,103,108,113,118],{"id":74,"slug":75,"title":76,"created_at":77},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":79,"slug":80,"title":81,"created_at":82},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":84,"slug":85,"title":86,"created_at":87},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":89,"slug":90,"title":91,"created_at":92},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":94,"slug":95,"title":96,"created_at":97},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":99,"slug":100,"title":101,"created_at":102},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":104,"slug":105,"title":106,"created_at":107},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":109,"slug":110,"title":111,"created_at":112},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":114,"slug":115,"title":116,"created_at":117},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":119,"slug":120,"title":121,"created_at":122},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]