SocietyBench:測 LLM 社會事件預測
SocietyBench 用匿名化反事實時間線,測 LLM 能不能預測真實社會事件怎麼演變,而不只是答題。

以前多半只看模型會不會答題,現在 SocietyBench 改成看它能不能預測社會事件怎麼演變。
- 研究機構:arXiv 摘要未明確標註
- 核心數據:五個事件、125 個預測點,最高 75.0/100
- 突破點:匿名化反事實時間線
這篇論文想補的是一個很常被忽略的缺口:很多 LLM 評測在看「能不能把任務做完」,但真實應用常常更在乎「能不能看懂事件怎麼一路變化」。如果模型只能整理資訊,卻抓不到時間脈絡與社會反應的轉折,它在新聞、輿情、風險監控這類場景就會顯得表面很強、實際很弱。
SocietyBench 就是為了測這件事而生。它不是單純的問答集,也不是只比檢索準不準,而是把真實社會事件整理成可追蹤的時間線,再拿每個截點去問模型:接下來會怎麼發展。這讓評測重點從「記不記得答案」轉成「能不能根據當下資訊做時間推理」。
SocietyBench 在解什麼問題
訂閱 AI 趨勢週報
每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。
不會寄垃圾信,隨時可取消。
作者認為,現有 benchmark 很常偏向任務完成,例如修 bug、操作瀏覽器、跑 GUI。這些能力當然重要,但它們沒有測到另一種同樣關鍵的社會能力:對真實社會事件的演變做預測。

SocietyBench 的設計方式很直接。它先從一個事件主題出發,收集新聞與社群貼文,來源橫跨五個平台,再把資料整理成按日期索引的時間線。這條時間線還會分成兩層:一層是事實事件,一層是公共意見或輿論信號。接著,時間線上的每個 cutoff date 都會變成一組預測題。
這種設計的重點在於,它考的不是靜態知識,而是演化。模型必須知道在某一天之前,哪些資訊已經出現,哪些還沒發生,然後再去推測下一步。對開發者來說,這跟一般摘要、分類、檢索的差別很大,因為它更接近真實系統面對動態世界時的需求。
方法怎麼做成「反事實」
SocietyBench 先建時間線,再在時間線上出題。這條時間線刻意把兩種資訊分開:一種是事件本身的事實順序,另一種是圍繞事件的輿情變化。這樣做的好處是,模型不會只靠單一訊號就蒙對答案。
更關鍵的是,benchmark 在模型看到資料前,先做了三階段匿名化處理。它會替換命名實體,並把每個事件的日期整體平移一個固定常數。這樣一來,原本真實世界裡的事件軌跡,就會變成一個結構相似、但不再直接對應原始名稱與日期的反事實社會世界。
這個做法的目的很明確:降低捷徑學習。模型不該因為看過某個知名事件、或在 pre-training 裡記住過精確日期,就直接把題目做對。換句話說,SocietyBench 想測的是結構推理,而不是背誦能力。
每一道預測題還會分成兩個 100 分軸來評分:probability calibration 和 temporal accuracy。這個拆法很重要,因為作者認為「有多可能」和「什麼時候發生」是兩種不同能力,不應該硬塞成同一個分數。
對實作來說,這也代表模型可能在一個面向表現好,另一個面向卻明顯失手。若只看總分,很容易把真正的弱點藏起來。
論文實際證明了什麼
這份評測涵蓋五個異質事件,以及 125 個預測點,並提供中英文版本。六個前沿 LLM 裡,最強者拿到 75.0 分,對照一個 50 分的 trivial anchor,確實拉開差距,但也沒有到壓倒性領先。

作者也指出,兩個評分軸常常不一致。有些模型在概率校準上比較好,但時間判斷較弱;也有相反情況。這表示如果只看單一總分,會錯過很多真實失敗模式。對做產品的人來說,這很像模型表面上「大致猜對」,但在關鍵時間點還是會亂掉。
論文還測了三種建立在同一 base model 上的 agent framework。結果是,沒有一種能超過那個 base model。另有兩個不靠模型的 heuristic,表現又比所有測試過的 LLM 更差。
另一個明顯訊號是事件差異很大。作者報告單一評分軸上,event-to-event 的差距可大到 21.4 分。這代表 SocietyBench 不適合只看一個事件就下結論,因為不同事件的難度與訊號型態可能差很多。
不過,摘要沒有公開完整 benchmark 表、各模型細部拆分,也沒有更完整的 ablation 數字。就目前能確認的資訊來看,這篇論文證明的是:社會事件預測是一個難題,而且現有 frontier 模型離穩定做好還有距離。
對開發者有什麼實際影響
如果你在做會讀新聞、看社群、追事件進度的 agent,這篇的訊息很直接:知道發生了什麼,不等於知道接下來會怎樣。很多系統可以摘要、可以分類、可以檢索,但一旦要把事件的時間脈絡接起來,就開始不穩。
這對產品設計的影響很實際。像風險監控、趨勢分析、事件驅動告警這類工作,系統不只要辨識事實,還要分得出事實層和輿情層。如果模型把兩者混在一起,或只會抓表面訊號,輸出就會很脆弱。
SocietyBench 的反事實設計也有一個工程價值:它讓記憶捷徑更難走。這對想確認模型到底是在推理,還是在回想訓練資料的人,很有幫助。尤其是當你在評估一個新 agent 架構時,這種設計能更接近真實壓力測試。
限制與還沒回答完的問題
這篇 benchmark 很有方向感,但摘要也留下不少空白。像是完整事件清單、五個平台各是哪些、評分規則細節、每個 cutoff date 的題型,摘要都沒有展開。也就是說,公開資訊足以看懂概念,但還不足以完整重做整個評測流程。
另一個問題是匿名化到底有多強。摘要沒有說明反事實處理後,是否還可能留下某些線索,讓模型或人類仍能猜到原始事件。這很重要,因為只要捷徑還在,benchmark 的壓力就會被削弱。
一般化能力也是一個待解題。論文雖然用了五個異質事件,但這仍然只是社會世界的一小部分。作者自己也用「多事件評估」來強調,不該拿單一事件就判定模型能力。
最後,這篇也提醒一件事:加上 agent scaffolding 不一定會變強。三種 agent framework 都沒有贏過 shared base model,這對那些以為「多包一層流程就會更會推理」的團隊,是個很實用的警訊。
總結
SocietyBench 提供了一種新的評測角度:不是只看 LLM 能不能回答問題,而是看它能不能預測社會事件的演變。對台灣開發者來說,這很貼近新聞理解、輿情監控、事件追蹤這些真實場景。
它最重要的貢獻不是某個單一模型跑了多高,而是把匿名化時間線、問題集、標註與評分框架組成一個可用的 benchmark。結果也很直接:就算是前沿模型,在這種時間性社會推理上,還是有明顯進步空間。