[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-coinrag-fine-grained-kv-cache-reuse-rag-zh":3,"article-related-coinrag-fine-grained-kv-cache-reuse-rag-zh":29,"series-research-01ff45d6-76b3-4cdb-99bf-95d620b383fb":76},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"01ff45d6-76b3-4cdb-99bf-95d620b383fb","coinrag-fine-grained-kv-cache-reuse-rag-zh","CoinRAG 用細粒度 KV 快取加速 RAG","\u003Cp data-speakable=\"summary\">5.3% 的平均 F1 相對提升，說明 CoinRAG 用細粒度 nugget \u003Ca href=\"\u002Ftag\u002Fkv-cache\">KV cache\u003C\u002Fa> 重用，能在\u003Ca href=\"\u002Ftag\u002F長上下文\">長上下文\u003C\u002Fa> \u003Ca href=\"\u002Ftag\u002Frag\">RAG\u003C\u002Fa> 裡同時壓低 prefill \u003Ca href=\"\u002Fnews\u002Fkimi-k3-gpu-api-cost-comparison-zh\">成本\u003C\u002Fa>並守住答案品質。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：5.3% 平均 F1 相對提升\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：細粒度 nugget KV 重用\u003C\u002Fli>\u003C\u002Ful>\u003Cp>CoinRAG 想解的，是長上下文 RAG 一個很現實的痛點：模型在真正開始回答前，先花太多算力去讀檢索回來的內容。對開發者來說，這段 prefill 往往就是\u003Ca href=\"\u002Fnews\u002Fdeepseek-codex-ai-coding-costs-reset-zh\">成本\u003C\u002Fa>和延遲的主要來源。\u003C\u002Fp>\u003Cp>這篇論文的切法不是把檢索內容整包塞進模型，而是把語意上有用的部分拆得更細。它主張，chunk-level 的快取重用還不夠精準，因為一整段 chunk 裡常常混著重複資訊、無關句子，甚至只是湊長度的內容。\u003C\u002Fp>\u003Cp>CoinRAG 的重點，就是把計算花在真正有用的片段上。它不是追求把所有上下文都算得更快，而是想在低 prefill latency 的前提下，盡量保住回答品質，重新拉出更好的效能與準確率平衡點。\u003C\u002Fp>\u003Ch2>它在解什麼問題\u003C\u002Fh2>\u003Cp>RAG 的基本流程很直白：先檢索外部資料，再把檢索結果餵給模型生成答案。問題是，一旦檢索回來的內容變長，prefill 階段就會變得很貴。模型還沒開始輸出字，前面就已經先燒掉不少算力。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786345391816-qqol.png\" alt=\"CoinRAG 用細粒度 KV 快取加速 RAG\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>過去有些方法嘗試在 chunk 層級重用 KV cache，確實能省一部分成本。但摘要指出，這種粗粒度做法仍然會把很多冗餘或不相關的材料留在計算路徑上。也就是說，雖然省了一點，但還是不夠精準。\u003C\u002Fp>\u003Cp>CoinRAG 要補的就是這個缺口。它試圖在低延遲條件下，做出更好的 Pareto frontier。白話講，就是不要只看快，也不要只看準，而是想辦法把兩者一起往上推。\u003C\u002Fp>\u003Cp>這個問題對實務很熟悉。當你在做多跳問答、長文件問答，或任何需要多段檢索上下文的系統時，真正卡住的常常不是生成，而是前面的上下文處理。只要 prefill 沒壓下來，服務成本和延遲就很難漂亮。\u003C\u002Fp>\u003Ch2>方法怎麼運作\u003C\u002Fh2>\u003Cp>CoinRAG 的核心想法，是把 chunk 再切小，變成論文稱作 information nuggets 的語意單位。它不是只把整段檢索內容當成一個整體，而是先找出和查詢相關的 nugget，再重用這些小片段對應的離線 KV cache。\u003C\u002Fp>\u003Cp>這裡的關鍵不是單純「切更碎」，而是切得更有語意。摘要寫得很清楚：系統會先找出 query-relevant semantic units，再把這些 sliced KV representation 和 chunk-level context 組合起來。也就是說，它不是把片段硬拼起來，而是\u003Ca href=\"\u002Fnews\u002Fcreativeinstruct-llms-quality-creativity-diversity-zh\">保留\u003C\u002Fa>一定程度的整體上下文。\u003C\u002Fp>\u003Cp>這個設計很重要。因為純粹只看小片段，模型可能失去上下文連貫性；但如果只看整個 chunk，又會浪費很多算力。CoinRAG 走的是中間路線：用更小的可重用單位減少重算，再用 chunk-level context 維持語意完整。\u003C\u002Fp>\u003Cp>摘要還提到這是一個 two-stage retrieval。第一階段先在檢索到的 chunk 裡定位和問題相關的語意單位，第二階段再把這些單位的 sliced KV 表示和更大的上下文合成。至於這兩階段具體怎麼做，摘要沒有展開，所以選擇器、切片器和組裝流程的細節，還得看全文。\u003C\u002Fp>\u003Cp>從系統角度看，這其實是在重新定義「可重用的上下文」粒度。不是把整包文本視為快取單位，而是把語意有效、計算密度高的部分抽出來，讓 cache reuse 更貼近實際需求。\u003C\u002Fp>\u003Ch2>論文證明了什麼\u003C\u002Fh2>\u003Cp>這篇摘要的評估場景是 LongBench 的 multi-hop question answering 任務。它沒有列出完整 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 清單，也沒有公開各子任務的細節、延遲數字或記憶體數據，所以目前只能從摘要知道大方向。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786345384068-l7lc.png\" alt=\"CoinRAG 用細粒度 KV 快取加速 RAG\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>摘要明確說，CoinRAG 能顯著降低營運成本，並且在標準 fast prefill latency budget 下超越 baseline，形成新的 Pareto frontier。唯一具體數字是平均 5.3% 的 answer quality 相對提升，指標是 F1。\u003C\u002Fp>\u003Cp>這個結果的意義，不只是「更快」或「更準」其中之一，而是兩者一起改善。對任何要上線的 RAG 系統來說，這種結果都比單點最佳化更有價值，因為部署時很少只看單一指標。\u003C\u002Fp>\u003Cp>不過，摘要也留下不少空白。它沒有說明絕對延遲省了多少、快取記憶體省了多少，也沒有列出具體打敗哪些 baseline。換句話說，我們知道它有效，但還不知道效益分布有多廣。\u003C\u002Fp>\u003Cp>另外，5.3% 是平均值，摘要沒有說明改善是否均勻分布在所有題型，還是集中在某些較依賴多跳推理的案例。這會影響實務判斷，因為不同產品情境對穩定性和覆蓋率的要求不一樣。\u003C\u002Fp>\u003Ch2>對開發者有什麼影響\u003C\u002Fh2>\u003Cp>如果你正在做長上下文 RAG，這篇最直接的啟發是：真正的成本中心常常在 prefill，不在生成。只要檢索回來的內容夠長，模型在吐第一個 \u003Ca href=\"\u002Ftag\u002Ftoken\">token\u003C\u002Fa> 前就可能先被上下文處理拖慢。\u003C\u002Fp>\u003Cp>CoinRAG 提醒大家，chunk-level cache reuse 可能還不夠細。當 chunk 裡只有少數句子真的和問題有關時，把整個 chunk 當成一個單位來重用，還是會浪費算力。更細粒度的 nugget 重用，理論上能把這些浪費壓下來。\u003C\u002Fp>\u003Cp>對工程實作來說，這意味著你的檢索、索引、快取和 prompt 組裝流程，可能都要重新思考。上下文不一定要被當成一整塊文本，而可以被拆成可重用的語意單元。這會影響資料前處理、離線快取建立，以及推理時的組裝邏輯。\u003C\u002Fp>\u003Cp>但它也不是免費午餐。摘要沒有交代 nugget 抽取的成本，也沒說離線建立 sliced KV cache 要花多少工程量。若要把這種方法放進真實服務，預處理與線上編排的額外複雜度，可能就是下一個要算的帳。\u003C\u002Fp>\u003Ch2>限制與未解問題\u003C\u002Fh2>\u003Cp>摘要最明顯的限制，是細節不夠。它沒有公開完整 benchmark 數字，也沒有提供不同模型規模、不同檢索品質或不同任務類型下的泛化結果。這代表目前只能先把它看成一個方向明確、證據還不完整的優化方法。\u003C\u002Fp>\u003Cp>另一個問題是可移植性。摘要只提到 LongBench multi-hop QA，沒有說這套方法在其他 RAG 場景是否同樣有效。像是單跳問答、摘要、企業知識庫檢索，效果可能會不一樣。\u003C\u002Fp>\u003Cp>還有一個現實的考量是系統複雜度。細粒度 KV cache reuse 聽起來很漂亮，但它需要更細的語意切分、更多 cache 管理，以及更複雜的上下文組裝。這些額外成本是否值得，摘要沒有給出完整答案。\u003C\u002Fp>\u003Cp>即便如此，CoinRAG 的方向很清楚：它不是要把 RAG 做得更大，而是把 RAG 做得更精準。對想在固定延遲預算內榨出更多品質的團隊來說，這種從粗粒度走向語意粒度的思路，值得繼續追。\u003C\u002Fp>\u003Cp>如果把這篇論文濃縮成一句話，就是它證明了：在長上下文 RAG 裡，快取重用不必停在整段 chunk，切到更細的語意單位後，確實有機會同時壓低 prefill 成本並提升答案品質。\u003C\u002Fp>\u003Cul>\u003Cli>長上下文 RAG 的瓶頸常在 prefill，不在生成。\u003C\u002Fli>\u003Cli>CoinRAG 用 nugget 級 KV cache 重用，取代粗粒度 chunk reuse。\u003C\u002Fli>\u003Cli>摘要只公開 5.3% 平均 F1 提升，完整 benchmark 細節未揭露。\u003C\u002Fli>\u003C\u002Ful>","CoinRAG 透過重用細粒度 nugget KV cache，降低長上下文 RAG 的 prefill 成本，並在 LongBench multi-hop QA 上帶來 5.3% 的平均 F1 相對提升。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.07458",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786345391816-qqol.png","research","zh","1f0b474d-49e9-4ce1-a3bb-a6b6561ed107",[17,18,19,20,21],"RAG","KV cache","prefill","LongBench","multi-hop QA",[23,24,25],"CoinRAG 把快取重用粒度從 chunk 下修到 nugget。","它在 LongBench multi-hop QA 上報告 5.3% 平均 F1 相對提升。","摘要沒有公開完整 benchmark、延遲與記憶體細節。",1,"2026-08-10T07:02:33.206316+00:00","2026-08-10T07:02:33.187+00:00",{"tags":30,"relatedLang":35,"relatedPosts":39},[31,33],{"name":17,"slug":32},"rag",{"name":18,"slug":34},"kv-cache",{"id":15,"slug":36,"title":37,"language":38},"coinrag-fine-grained-kv-cache-reuse-rag-en","CoinRAG Reuses Fine-Grained KV Caches for RAG","en",[40,46,52,58,64,70],{"id":41,"slug":42,"title":43,"cover_image":44,"image_url":44,"created_at":45,"category":13},"2af77412-f711-4abb-915d-5b7d1b5275a7","creativeinstruct-llms-quality-creativity-diversity-zh","CreativeInstruct 讓 LLM 保留創意","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786343577690-m544.png","2026-08-10T06:32:27.403714+00:00",{"id":47,"slug":48,"title":49,"cover_image":50,"image_url":50,"created_at":51,"category":13},"69b80aa9-fd04-4b88-aadd-c5ebdb9a5be8","mirrorworld-mirror-reflection-video-diffusion-zh","MirrorWorld 讓鏡中倒影更一致","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786341773135-zkin.png","2026-08-10T06:02:26.712866+00:00",{"id":53,"slug":54,"title":55,"cover_image":56,"image_url":56,"created_at":57,"category":13},"3fa5a446-8c57-4050-8677-57969a8249e3","claude-4-5-ai-progress-still-accelerating-zh","Claude 4.5 證明 AI 進步還在加速","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786257168178-wg32.png","2026-08-09T06:32:26.842354+00:00",{"id":59,"slug":60,"title":61,"cover_image":62,"image_url":62,"created_at":63,"category":13},"32185438-867e-45f5-a048-b23ed209d20b","mage-vl-compressed-video-token-pipeline-zh","Mage-VL把视频Token壓到25%","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786170811727-2ctz.png","2026-08-08T06:33:05.78696+00:00",{"id":65,"slug":66,"title":67,"cover_image":68,"image_url":68,"created_at":69,"category":13},"04a3925a-33c0-4954-89b7-41e51365cc40","astra-turns-long-math-tasks-into-multi-agent-work-zh","Astra 把長任務拆成多代理工作","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786088000695-2qtf.png","2026-08-07T07:32:51.483837+00:00",{"id":71,"slug":72,"title":73,"cover_image":74,"image_url":74,"created_at":75,"category":13},"01da4d83-b580-43fe-a4aa-0e4285e056c0","evidence-linked-feature-engineering-heart-failure-zh","心衰 EHR 特徵工程可追證據","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786086179831-hiwd.png","2026-08-07T07:02:30.845188+00:00",[77,82,87,92,97,102,107,112,117,122],{"id":78,"slug":79,"title":80,"created_at":81},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":83,"slug":84,"title":85,"created_at":86},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":88,"slug":89,"title":90,"created_at":91},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":93,"slug":94,"title":95,"created_at":96},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":98,"slug":99,"title":100,"created_at":101},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":103,"slug":104,"title":105,"created_at":106},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":108,"slug":109,"title":110,"created_at":111},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":113,"slug":114,"title":115,"created_at":116},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":118,"slug":119,"title":120,"created_at":121},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":123,"slug":124,"title":125,"created_at":126},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]