[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-worldcup-arena-live-llm-forecasting-zh":3,"article-related-worldcup-arena-live-llm-forecasting-zh":29,"series-research-ea21ed90-eaf8-4d46-97c9-4e495ed14c83":72},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"ea21ed90-eaf8-4d46-97c9-4e495ed14c83","worldcup-arena-live-llm-forecasting-zh","WorldCup Arena：LLM 直播預測實測","\u003Cp data-speakable=\"summary\">WorldCup Arena 用世界盃直播賽事，測六個前沿 \u003Ca href=\"\u002Ftag\u002Fllm\">LLM\u003C\u002Fa> 在賽前做無洩漏預測的表現。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：4,494 筆評分預測\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：賽前即時評測\u003C\u002Fli>\u003C\u002Ful>\u003Cp>這篇論文不是在比誰會講球評，而是在測 LLM 到底能不能在答案還沒上網前，真的做出預測。研究團隊把評測搬到 2026 FIFA World Cup 的直播賽事上，讓模型在每場開踢前先交卷，直接避開傳統 forecasting \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 最常見的資料洩漏問題。\u003C\u002Fp>\u003Cp>對開發者來說，這種設計很重要。因為它測到的不是「模型能不能查到答案」，而是「模型在有工具、能思考、能搜尋的情況下，是否真的有預測能力」。這也讓 WorldCup Arena 比一般回頭看結果的 benchmark 更接近真實部署情境。\u003C\u002Fp>\u003Ch2>這篇論文想修掉什麼痛點\u003C\u002Fh2>\u003Cp>傳統 LLM forecasting benchmark 最大的麻煩，是測試時答案早就存在網路上。就算研究者努力過濾，也很難完全排除模型記憶、搜尋或資料污染帶來的影響。結果看起來像預測，實際上\u003Ca href=\"\u002Fnews\u002Fclarity-act-edits-stablecoin-rules-zh\">可能\u003C\u002Fa>只是回收已知資訊。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785913378717-go7u.png\" alt=\"WorldCup Arena：LLM 直播預測實測\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這篇論文的解法很直接：把評測放到賽事進行中，而且每場比賽都在開踢前提問。這樣一來，官方結果還沒出現，網路上也沒有正解可抄，洩漏問題不是事後清理，而是從流程上就被消掉。\u003C\u002Fp>\u003Cp>作者評的不只是單一勝負題目。他們讓模型填寫每場比賽的七種預測欄位，外加 12 個分組第一，以及賽前整體奪冠預測。這樣的設計同時涵蓋局部問題與整體問題，也比較能看出模型在不同層級上的判斷方式。\u003C\u002Fp>\u003Ch2>方法到底怎麼跑\u003C\u002Fh2>\u003Cp>評測橫跨 2026 FIFA World Cup 的 39 天。六個前沿 LLM 在每場開踢前被逐一詢問。因為問題發出時比賽還沒開始，所以結果尚未存在，這讓整個 archive 可以說是「by construction」的無洩漏評測。\u003C\u002Fp>\u003Cp>論文也明講，這些模型都啟用了 extended thinking 和 native server-side web search。這一點很關鍵，因為它測的不是裸模型，而是現在真實產品裡常見的工具型代理：會推理，也會上網。換句話說，這不是單純的文字生成測試，而是在看完整系統行為。\u003C\u002Fp>\u003Cp>研究團隊最後把這批預測凍結起來，總共評分了 4,494 筆預測。摘要也提到，他們釋出了 briefing dossiers、fixtures、official results 和 scoring code。也就是說，這篇不只是報告結果，還把重現評測所需的材料一起公開成 benchmark。\u003C\u002Fp>\u003Cul>\u003Cli>每場比賽都在開踢前提問\u003C\u002Fli>\u003Cli>每場含七種預測市場\u003C\u002Fli>\u003Cli>外加 12 個分組第一與整體冠軍預測\u003C\u002Fli>\u003Cli>凍結後共評分 4,494 筆預測\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>論文實際證明了什麼\u003C\u002Fh2>\u003Cp>第一個重點是，六個系統的行為很像。論文指出，它們在 match outcome 上平均是 63.9%，大致相當於押 bookmaker 的熱門方。這代表模型沒有明顯超車一個很直觀的基準，也提醒大家：前沿 LLM 不等於自動會成為更準的預測器。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785913383800-6utf.png\" alt=\"WorldCup Arena：LLM 直播預測實測\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>第二個重點更有意思：模型彼此的答案常常比它們真的答對還一致。這表示如果你想靠\u003Ca href=\"\u002Fnews\u002Fparvl-parallel-scaling-multimodal-llms-zh\">多模\u003C\u002Fa>型投票來提升預測，未必有效。當錯誤高度相關時，更多模型只是在重複同一個偏誤，不會自然變成更好的 ensemble。\u003C\u002Fp>\u003Cp>論文也觀察到，模型對平局和進球數偏保守，比分選擇會集中到少數典型結果。白話講，就是它們不太願意把分布打開，常常往一個安全的中間值收斂。這種現象對 forecasting 很致命，因為真正難的不是猜一個最常見答案，而是把不確定性表達出來。\u003C\u002Fp>\u003Cp>另外，準確率會隨著比賽是否一面倒而變動。越懸殊的對戰，模型越容易答對；越接近的比賽，表現就越差。這很值得注意，因為最難預測的場次，往往也是資料最豐富、賽前 dossier 最完整的場次。也就是說，更多上下文不保證更好的判斷。\u003C\u002Fp>\u003Cp>相較之下，關於整個賽事的題目，模型表現比較好。這暗示它們更擅長處理總體結構，而不是細粒度的場次不確定性。對做摘要工具、\u003Ca href=\"\u002Fnews\u002Fsocietybench-social-event-forecasting-benchmark-zh\">事件\u003C\u002Fa>總結工具的人來說，這是好消息；對做真預測的人來說，這是警訊。\u003C\u002Fp>\u003Ch2>對開發者有什麼影響\u003C\u002Fh2>\u003Cp>如果你在做 \u003Ca href=\"\u002Ftag\u002Fagent\">agent\u003C\u002Fa> 或帶搜尋功能的 LLM，這篇論文在提醒一件事：有工具，不代表有 forecasting 能力。即使模型能 extended thinking、能 web search，它們最後還是可能收斂到相近的先驗，而且這些先驗往往太保守。\u003C\u002Fp>\u003Cp>這也代表評測設計本身就是產品能力的一部分。回頭看結果的 benchmark 很容易被洩漏污染，分數高不一定代表真會預測。像 WorldCup Arena 這種 prospective、pre-kickoff 的設計，才比較能看出系統是不是在根據當下可得資訊推理，而不是從網路撈答案。\u003C\u002Fp>\u003Cp>另一個實作上的啟發，是不要太快相信多模型投票。論文已經明確指出，這些 frontier models 彼此同意的程度高於它們答對的程度。對 ensemble、routing 或多代理協作設計來說，重點不是模型數量，而是模型之間有沒有真的不同。\u003C\u002Fp>\u003Ch2>限制與還沒回答的問題\u003C\u002Fh2>\u003Cp>這篇摘要有清楚講行為觀察，但沒有在我們看到的內容裡列出完整 per-model benchmark 表。除了 63.9% 和 4,494 筆評分預測之外，摘要沒有公開更多 benchmark 數字，所以如果你想比較每個模型的細節，得看全文或附錄。\u003C\u002Fp>\u003Cp>另外，這個任務本身也很特化。世界盃是高訊號、時間有限、規則固定的 live event，很適合拿來做無洩漏評測，但不代表能直接外推到所有 forecasting 場景。也就是說，它很適合當方法論示範，不一定能直接當通用答案。\u003C\u002Fp>\u003Cp>不過，這篇論文的價值就在這裡。它把問題定義得很乾淨：不是問模型事後能不能說對，而是問它事前能不能預測。對現在越來越多帶工具的 LLM 來說，這可能才是更值得量測的能力。\u003C\u002Fp>\u003Cp>如果你在做模型評估、代理系統，或是任何需要處理不確定性的產品，WorldCup Arena 提供了一個很實際的方向：把測試搬到答案還不存在的時候。這樣量到的，才比較接近真正的預測能力。\u003C\u002Fp>","WorldCup Arena 用世界盃直播賽事，測六個前沿 LLM 在賽前做無洩漏預測的表現。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.04008",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785913378717-go7u.png","research","zh","c3d7a875-9f48-40e7-9ab3-d3065c677f26",[17,18,19,20,21],"LLM forecasting","live evaluation","data leakage","web search","FIFA World Cup",[23,24,25],"用直播賽事做賽前評測，可避免答案已上網的洩漏問題。","六個前沿 LLM 在勝負預測上平均 63.9%，沒有明顯超過簡單熱門方基準。","模型彼此一致性高於正確率，代表多模型投票不一定能改善預測。",0,"2026-08-05T07:02:29.072783+00:00","2026-08-05T07:02:29.066+00:00",{"tags":30,"relatedLang":31,"relatedPosts":35},[],{"id":15,"slug":32,"title":33,"language":34},"worldcup-arena-live-llm-forecasting-en","WorldCup Arena Tests LLM Forecasting Live","en",[36,42,48,54,60,66],{"id":37,"slug":38,"title":39,"cover_image":40,"image_url":40,"created_at":41,"category":13},"499d414d-4573-44b3-a643-dbfb8c269d8e","anthropic-shikong-ceshi-ai-anquan-weiguo-zh","Anthropic的失控测试：AI安全还没过关","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785931378812-l2ud.png","2026-08-05T12:02:33.709216+00:00",{"id":43,"slug":44,"title":45,"cover_image":46,"image_url":46,"created_at":47,"category":13},"fa03dc7f-4db2-4122-ab50-729e2f795964","societybench-social-event-forecasting-benchmark-zh","SocietyBench：測 LLM 社會事件預測","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785911578272-io30.png","2026-08-05T06:32:28.944853+00:00",{"id":49,"slug":50,"title":51,"cover_image":52,"image_url":52,"created_at":53,"category":13},"44310f51-8114-47f6-97c9-14e51bec9bfa","parvl-parallel-scaling-multimodal-llms-zh","ParVL：把多模態算力拆成平行分支","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785909776069-mqs4.png","2026-08-05T06:02:26.916098+00:00",{"id":55,"slug":56,"title":57,"cover_image":58,"image_url":58,"created_at":59,"category":13},"94868bb8-090d-45e6-aad1-cb6ef1832e1a","onepot-bench-0-lab-aware-chemistry-benchmarks-zh","onepot-Bench 0：化學模型要會看實驗室","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785826985297-kz8q.png","2026-08-04T07:02:33.831627+00:00",{"id":61,"slug":62,"title":63,"cover_image":64,"image_url":64,"created_at":65,"category":13},"0c15b021-0f9e-4010-9bf2-b763c62bf4a1","aurora-lm-continuous-latent-diffusion-text-zh","AURORA-LM 把擴散搬進文字潛空間","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785823373617-amg6.png","2026-08-04T06:02:30.179771+00:00",{"id":67,"slug":68,"title":69,"cover_image":70,"image_url":70,"created_at":71,"category":13},"f166a46b-2275-4add-b15f-fd573fc4313c","kimi-k3-jiu-kai-shi-gei-zi-ji-da-gong-liao-zh","Kimi K3 已經開始替自己打工：模型開發正在變成生產力","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785808984848-jffx.png","2026-08-04T02:02:34.758032+00:00",[73,78,83,88,93,98,103,108,113,118],{"id":74,"slug":75,"title":76,"created_at":77},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":79,"slug":80,"title":81,"created_at":82},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":84,"slug":85,"title":86,"created_at":87},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":89,"slug":90,"title":91,"created_at":92},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":94,"slug":95,"title":96,"created_at":97},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":99,"slug":100,"title":101,"created_at":102},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":104,"slug":105,"title":106,"created_at":107},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":109,"slug":110,"title":111,"created_at":112},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":114,"slug":115,"title":116,"created_at":117},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":119,"slug":120,"title":121,"created_at":122},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]