[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-extractbench-schema-guided-document-extraction-zh":3,"article-related-extractbench-schema-guided-document-extraction-zh":29,"series-research-2dabbf39-7875-4653-91da-0b7cd9db4185":73},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"2dabbf39-7875-4653-91da-0b7cd9db4185","extractbench-schema-guided-document-extraction-zh","ExtractBench 盯住企業文件抽取","\u003Cp>企業文件抽取最常卡在同一種地方：欄位有抓到，整份紀錄卻漏了；看起來像 JSON，卻說不清來源在哪。\u003C\u002Fp>\u003Cp data-speakable=\"summary\">ExtractBench 把企業文件抽取拆成準確、完整、可追溯與成本四件事一起評估。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：4,869 頁\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：四維度一起評分\u003C\u002Fli>\u003C\u002Ful>\u003Cp>這篇論文想處理的，不是單純 OCR 或一般資訊擷取，而是更接近企業真實需求的「schema-guided extraction」。意思是，文件進來後，系統要照使用者指定的 schema 輸出，還要能把每個答案對回原始文件。對開發者來說，這比把文字抓進 JSON 難得多，因為它同時考驗格式遵循、記錄完整性、來源證據，以及實際可部署的成本。\u003C\u002Fp>\u003Ch2>這篇在解什麼痛點\u003C\u002Fh2>\u003Cp>在企業流程裡，抽取結果不能只是「大致正確」。採購單、合約、申請表、報表這些文件，常常不是只有一個欄位，而是一整串結構化資料。少一筆、截斷一段、或是對不到來源，後面就可能影響審核、除錯、稽核，甚至合規。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785738798200-jk2q.png\" alt=\"ExtractBench 盯住企業文件抽取\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>ExtractBench 的出發點，就是把這些失敗模式攤開來看。它不只測模型有沒有抓到值，還看有沒有把整個 record 抽完整，有沒有照 schema 輸出，以及有沒有把答案和原文建立可追溯關係。這種設計很直接，因為企業場景裡，抽取系統真正怕的不是「答錯一題」，而是「看似成功，實際上不能上線」。\u003C\u002Fp>\u003Cp>摘要裡提到，這個 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 涵蓋 4,869 頁、370 份企業文件、8 個商業領域與 67 種文件類型。這代表它不是只拿幾份乾淨文件做示範，而是刻意把不同長度、不同版型、不同任務難度放進同一個評估框架。對開發者來說，這種覆蓋面很重要，因為短表單和長列表，對模型的壓力完全不是同一件事。\u003C\u002Fp>\u003Ch2>benchmark 怎麼做出來的\u003C\u002Fh2>\u003Cp>這篇的資料建置方式也很務實。摘要寫到，它用三種蒐集 ground truth 的方法來擴大規模：真實文件採用獨立系統一致性，合成列表用已知值，表單則加入人工驗證。這不是炫技，而是承認一個現實：企業文件標註很貴，且不同文件類型不能用同一種方法硬做到底。\u003C\u002Fp>\u003Cp>這種混合式做法的好處，是可以在不把標註成本炸掉的前提下，維持一個可用的評估集。對 benchmark 來說，這很關鍵。因為如果 ground truth 本身不可靠，後面所有分數都只是漂亮數字。\u003C\u002Fp>\u003Cp>ExtractBench 也強調，它在目前已知的範圍內，可能是第一個把 value accuracy、record completeness、grounding 和 measured cost 放在同一個 benchmark 裡一起評分的系統。這個設計重點很明確：抽取不是單一指標問題，而是多目標問題。你不能只問「對不對」，還要問「全不全」、「能不能指回來源」、「值不值得跑」。\u003C\u002Fp>\u003Cul>\u003Cli>Value accuracy 用 order-insensitive value F1 衡量。\u003C\u002Fli>\u003Cli>Grounding 用 word-level 與 page-level F1 衡量。\u003C\u002Fli>\u003Cli>Cost 和品質指標一起看，不再被忽略。\u003C\u002Fli>\u003C\u002Ful>\u003Cp>這裡最有意思的地方，是它把 grounding 拉進來當正式評估項目。很多系統可以輸出看似合理的欄位值，但如果沒有來源證據，實務上很難過審。尤其是企業文件流程，最後常常不是模型自己說了算，而是人要能回頭核對。\u003C\u002Fp>\u003Ch2>論文實際證明了什麼\u003C\u002Fh2>\u003Cp>先講限制：摘要沒有公開完整 benchmark 表格，也沒有列出所有精確分數。所以如果你想看每個模型在每個子任務上的數字，這份摘要本身還不夠。能確定的是資料規模、評估維度，以及幾個方向性的結果。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785738803479-5nn7.png\" alt=\"ExtractBench 盯住企業文件抽取\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>摘要指出，商用 VLM 在短文件上表現不錯，但在長文件上常常會截斷 record list。這是很實際的警訊。因為很多團隊在 demo 階段看\u003Ca href=\"\u002Fnews\u002Fnvidia-bets-big-on-ssi-ai-safety-core-zh\">到模型\u003C\u002Fa>能抓欄位，就以為可以直接上線；但一旦文件變長、列表變多、版面變複雜，系統就可能開始漏資料。\u003C\u002Fp>\u003Cp>相對地，coding agents 雖然準確度較高，但成本也高很多。這點對\u003Ca href=\"\u002Fnews\u002Fclaude-2026-limit-changes-capacity-story-zh\">產品\u003C\u002Fa>團隊很重要，因為企業系統不是只看分數，還要看每次跑完的總成本、延遲和維運壓力。ExtractBench 把這個 tradeoff 顯性化，讓人不能只用單一準確率來美化結果。\u003C\u002Fp>\u003Cp>摘要還說，LlamaExtract Agentic Plus 在三個指標上都排第一，而且它的 accuracy 可和 coding agents 相比，但成本只要一小部分。這裡要注意，摘要沒有提供精確數值，所以不能把它解讀成固定倍率或具體差距；但方向很清楚：agentic extraction 系統有機會在品質和成本之間找到更實際的平衡點。\u003C\u002Fp>\u003Cp>換句話說，這篇論文證明的不是「某模型全面碾壓」，而是「企業文件抽取的評估方式要改」。如果只看單一準確率，很多重要問題會被藏起來；如果把完整性、可追溯性和成本一起納入，系統之間的差異才會真正浮現。\u003C\u002Fp>\u003Ch2>對開發者有什麼影響\u003C\u002Fh2>\u003Cp>如果你在做文件管線、供應商資料進件、法遵工具，或任何把 PDF 轉成結構化資料的流程，ExtractBench 的價值在於它測的是「真實會壞掉的地方」。一個模型就算欄位值抓得準，如果漏掉 record、截斷\u003Ca href=\"\u002Fnews\u002Ftry-claude-opus-4-7-benchmarks-safety-zh\">清單\u003C\u002Fa>、或無法回指來源，實務上還是不能算好用。\u003C\u002Fp>\u003Cp>這也提醒開發者，評估抽取系統時不要只看最終輸出長什麼樣。對企業來說，grounding 很重要，因為資料被人工複核、稽核、比對時，需要知道每個欄位是從哪一頁、哪一段來的。摘要裡提到的 word-level 和 page-level F1，就是把這種可追溯性正式納入比較。\u003C\u002Fp>\u003Cp>成本則是另一個常被低估的問題。很多團隊先挑「準確率最高」的方案，結果上線後才發現推理或編排成本太高，根本撐不起規模。ExtractBench 把 cost 放進同一張評估表，等於逼大家把「能不能用」和「值不值得用」一起想清楚。\u003C\u002Fp>\u003Cp>對實作來說，這也意味著你不能只優化單點能力。schema-guided extraction 需要系統同時處理格式遵循、長文件穩定性、來源對齊，以及成本控制。任何一項掉鏈子，最後都會反映在企業流程裡。\u003C\u002Fp>\u003Ch2>還有哪些限制\u003C\u002Fh2>\u003Cp>第一個限制很明顯：摘要沒有公開完整 benchmark 數字，也沒有提供每個類別的詳細分數。因此，現在能看到的是方向和設計理念，不是完整的比較表。若要做嚴格選型，還需要看論文全文的實驗章節。\u003C\u002Fp>\u003Cp>第二個限制是，benchmark 再大也還是 benchmark。即使有 370 份企業文件、8 個領域、67 種文件類型，它仍然只能近似真實世界，不可能完全覆蓋每個 schema、每種掃描品質、每種排版雜訊。換句話說，它能幫你看清問題，但不能替代 production testing。\u003C\u002Fp>\u003Cp>第三個限制是，摘要只告訴我們「哪些模型表現較好」和「有哪些 tradeoff」，沒有把所有 challenge tags 的行為拆開來講。所以如果你關心某一種特殊文件型態，不能直接把整體排名當成你的場景答案。\u003C\u002Fp>\u003Cp>即便如此，ExtractBench 還是把一件事講得很清楚：企業文件抽取不該只看一個分數。準確、完整、可追溯、成本，這四件事本來就要一起看。對開發者來說，這比單純追求一個漂亮的 accuracy 數字更接近真實世界。\u003C\u002Fp>\u003Cp>也因為這樣，ExtractBench 比較像是在重新定義「好抽取」是什麼，而不只是介紹一個新模型。對做系統的人來說，這種 benchmark 往往比單篇模型改良更有參考價值。\u003C\u002Fp>","ExtractBench 把企業文件抽取拆成準確、完整、可追溯與成本四件事一起評估。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.29677",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785738798200-jk2q.png","research","zh","1d615153-f127-4b7a-8043-ba4b2701c1a8",[17,18,19,20,21],"document extraction","schema-guided extraction","grounding","enterprise documents","benchmark",[23,24,25],"它把企業文件抽取從單一準確率，改成同時看準確、完整、可追溯與成本。","摘要顯示商用 VLM 在長文件會截斷列表，coding agents 較準但成本更高。","LlamaExtract Agentic Plus 在三項指標排第一，但摘要沒有公開完整分數表。",0,"2026-08-03T06:32:48.454298+00:00","2026-08-03T06:32:48.443+00:00",{"tags":30,"relatedLang":32,"relatedPosts":36},[31],{"name":21,"slug":21},{"id":15,"slug":33,"title":34,"language":35},"extractbench-schema-guided-document-extraction-en","ExtractBench benchmarks schema-guided document extraction","en",[37,43,49,55,61,67],{"id":38,"slug":39,"title":40,"cover_image":41,"image_url":41,"created_at":42,"category":13},"480a1f71-36fb-40c2-abef-8d1fa18dd390","private-mode-finding-regression-clustering-zh","私有模式估計逼近最優","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785740576520-rgql.png","2026-08-03T07:02:29.463583+00:00",{"id":44,"slug":45,"title":46,"cover_image":47,"image_url":47,"created_at":48,"category":13},"09f65a63-1e3d-461e-8a61-e03207bc5c8f","toktier-stateful-tokenization-agentic-llm-serving-zh","TokTier 省掉代理式 LLM 分詞開銷","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785736981865-pjj3.png","2026-08-03T06:02:29.725458+00:00",{"id":50,"slug":51,"title":52,"cover_image":53,"image_url":53,"created_at":54,"category":13},"cb1ef9ed-b3cb-4c1e-8d4b-ba6cdebc0e0e","openai-hugging-face-breach-agents-hard-limits-zh","OpenAI 與 Hugging Face 事件證明：AI agents 必須…","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785654169827-uf2w.png","2026-08-02T07:02:22.957846+00:00",{"id":56,"slug":57,"title":58,"cover_image":59,"image_url":59,"created_at":60,"category":13},"be49fd87-e80c-43e5-87b9-159611e54bdc","systema-virtual-cell-evaluation-reframed-zh","Systema把虚拟细胞评估改成另一套玩法","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785632614431-hy24.png","2026-08-02T01:03:08.934034+00:00",{"id":62,"slug":63,"title":64,"cover_image":65,"image_url":65,"created_at":66,"category":13},"5063caeb-1afb-4dce-94b8-93393e17d5eb","stablecoin-remittances-hit-9-percent-bank-italy-test-zh","義大利測試：USDC 匯款最高近 9%","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785591176809-t9nq.png","2026-08-01T13:32:32.282347+00:00",{"id":68,"slug":69,"title":70,"cover_image":71,"image_url":71,"created_at":72,"category":13},"04dabd9d-7737-49e7-8c20-6993e31af5ad","stablecoins-hit-308b-as-svbs-shock-echoes-zh","穩定幣衝上3080億美元","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785585769972-mjx7.png","2026-08-01T12:02:27.954058+00:00",[74,79,84,89,94,99,104,109,114,119],{"id":75,"slug":76,"title":77,"created_at":78},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":80,"slug":81,"title":82,"created_at":83},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":85,"slug":86,"title":87,"created_at":88},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":90,"slug":91,"title":92,"created_at":93},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":95,"slug":96,"title":97,"created_at":98},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":100,"slug":101,"title":102,"created_at":103},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":105,"slug":106,"title":107,"created_at":108},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":110,"slug":111,"title":112,"created_at":113},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":115,"slug":116,"title":117,"created_at":118},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":120,"slug":121,"title":122,"created_at":123},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]