ExtractBench 盯住企業文件抽取
ExtractBench 把企業文件抽取拆成準確、完整、可追溯與成本四件事一起評估。

企業文件抽取最常卡在同一種地方:欄位有抓到,整份紀錄卻漏了;看起來像 JSON,卻說不清來源在哪。
ExtractBench 把企業文件抽取拆成準確、完整、可追溯與成本四件事一起評估。
- 研究機構:arXiv 摘要未明確標註
- 核心數據:4,869 頁
- 突破點:四維度一起評分
這篇論文想處理的,不是單純 OCR 或一般資訊擷取,而是更接近企業真實需求的「schema-guided extraction」。意思是,文件進來後,系統要照使用者指定的 schema 輸出,還要能把每個答案對回原始文件。對開發者來說,這比把文字抓進 JSON 難得多,因為它同時考驗格式遵循、記錄完整性、來源證據,以及實際可部署的成本。
這篇在解什麼痛點
訂閱 AI 趨勢週報
每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。
不會寄垃圾信,隨時可取消。
在企業流程裡,抽取結果不能只是「大致正確」。採購單、合約、申請表、報表這些文件,常常不是只有一個欄位,而是一整串結構化資料。少一筆、截斷一段、或是對不到來源,後面就可能影響審核、除錯、稽核,甚至合規。

ExtractBench 的出發點,就是把這些失敗模式攤開來看。它不只測模型有沒有抓到值,還看有沒有把整個 record 抽完整,有沒有照 schema 輸出,以及有沒有把答案和原文建立可追溯關係。這種設計很直接,因為企業場景裡,抽取系統真正怕的不是「答錯一題」,而是「看似成功,實際上不能上線」。
摘要裡提到,這個 benchmark 涵蓋 4,869 頁、370 份企業文件、8 個商業領域與 67 種文件類型。這代表它不是只拿幾份乾淨文件做示範,而是刻意把不同長度、不同版型、不同任務難度放進同一個評估框架。對開發者來說,這種覆蓋面很重要,因為短表單和長列表,對模型的壓力完全不是同一件事。
benchmark 怎麼做出來的
這篇的資料建置方式也很務實。摘要寫到,它用三種蒐集 ground truth 的方法來擴大規模:真實文件採用獨立系統一致性,合成列表用已知值,表單則加入人工驗證。這不是炫技,而是承認一個現實:企業文件標註很貴,且不同文件類型不能用同一種方法硬做到底。
這種混合式做法的好處,是可以在不把標註成本炸掉的前提下,維持一個可用的評估集。對 benchmark 來說,這很關鍵。因為如果 ground truth 本身不可靠,後面所有分數都只是漂亮數字。
ExtractBench 也強調,它在目前已知的範圍內,可能是第一個把 value accuracy、record completeness、grounding 和 measured cost 放在同一個 benchmark 裡一起評分的系統。這個設計重點很明確:抽取不是單一指標問題,而是多目標問題。你不能只問「對不對」,還要問「全不全」、「能不能指回來源」、「值不值得跑」。
- Value accuracy 用 order-insensitive value F1 衡量。
- Grounding 用 word-level 與 page-level F1 衡量。
- Cost 和品質指標一起看,不再被忽略。
這裡最有意思的地方,是它把 grounding 拉進來當正式評估項目。很多系統可以輸出看似合理的欄位值,但如果沒有來源證據,實務上很難過審。尤其是企業文件流程,最後常常不是模型自己說了算,而是人要能回頭核對。
論文實際證明了什麼
先講限制:摘要沒有公開完整 benchmark 表格,也沒有列出所有精確分數。所以如果你想看每個模型在每個子任務上的數字,這份摘要本身還不夠。能確定的是資料規模、評估維度,以及幾個方向性的結果。

摘要指出,商用 VLM 在短文件上表現不錯,但在長文件上常常會截斷 record list。這是很實際的警訊。因為很多團隊在 demo 階段看到模型能抓欄位,就以為可以直接上線;但一旦文件變長、列表變多、版面變複雜,系統就可能開始漏資料。
相對地,coding agents 雖然準確度較高,但成本也高很多。這點對產品團隊很重要,因為企業系統不是只看分數,還要看每次跑完的總成本、延遲和維運壓力。ExtractBench 把這個 tradeoff 顯性化,讓人不能只用單一準確率來美化結果。
摘要還說,LlamaExtract Agentic Plus 在三個指標上都排第一,而且它的 accuracy 可和 coding agents 相比,但成本只要一小部分。這裡要注意,摘要沒有提供精確數值,所以不能把它解讀成固定倍率或具體差距;但方向很清楚:agentic extraction 系統有機會在品質和成本之間找到更實際的平衡點。
換句話說,這篇論文證明的不是「某模型全面碾壓」,而是「企業文件抽取的評估方式要改」。如果只看單一準確率,很多重要問題會被藏起來;如果把完整性、可追溯性和成本一起納入,系統之間的差異才會真正浮現。
對開發者有什麼影響
如果你在做文件管線、供應商資料進件、法遵工具,或任何把 PDF 轉成結構化資料的流程,ExtractBench 的價值在於它測的是「真實會壞掉的地方」。一個模型就算欄位值抓得準,如果漏掉 record、截斷清單、或無法回指來源,實務上還是不能算好用。
這也提醒開發者,評估抽取系統時不要只看最終輸出長什麼樣。對企業來說,grounding 很重要,因為資料被人工複核、稽核、比對時,需要知道每個欄位是從哪一頁、哪一段來的。摘要裡提到的 word-level 和 page-level F1,就是把這種可追溯性正式納入比較。
成本則是另一個常被低估的問題。很多團隊先挑「準確率最高」的方案,結果上線後才發現推理或編排成本太高,根本撐不起規模。ExtractBench 把 cost 放進同一張評估表,等於逼大家把「能不能用」和「值不值得用」一起想清楚。
對實作來說,這也意味著你不能只優化單點能力。schema-guided extraction 需要系統同時處理格式遵循、長文件穩定性、來源對齊,以及成本控制。任何一項掉鏈子,最後都會反映在企業流程裡。
還有哪些限制
第一個限制很明顯:摘要沒有公開完整 benchmark 數字,也沒有提供每個類別的詳細分數。因此,現在能看到的是方向和設計理念,不是完整的比較表。若要做嚴格選型,還需要看論文全文的實驗章節。
第二個限制是,benchmark 再大也還是 benchmark。即使有 370 份企業文件、8 個領域、67 種文件類型,它仍然只能近似真實世界,不可能完全覆蓋每個 schema、每種掃描品質、每種排版雜訊。換句話說,它能幫你看清問題,但不能替代 production testing。
第三個限制是,摘要只告訴我們「哪些模型表現較好」和「有哪些 tradeoff」,沒有把所有 challenge tags 的行為拆開來講。所以如果你關心某一種特殊文件型態,不能直接把整體排名當成你的場景答案。
即便如此,ExtractBench 還是把一件事講得很清楚:企業文件抽取不該只看一個分數。準確、完整、可追溯、成本,這四件事本來就要一起看。對開發者來說,這比單純追求一個漂亮的 accuracy 數字更接近真實世界。
也因為這樣,ExtractBench 比較像是在重新定義「好抽取」是什麼,而不只是介紹一個新模型。對做系統的人來說,這種 benchmark 往往比單篇模型改良更有參考價值。