SWE-bench Verified 已不再是乾淨的模型排行榜
97% 的天花板把頂尖 coding 模型擠成一團,SWE-bench Verified 已不適合再拿來當乾淨的排序工具。

97.00% 的天花板把頂尖 coding 模型擠成一團,SWE-bench Verified 已不適合再拿來當乾淨的排序工具。
SWE-bench Verified 現在更像門檻測試,不像排行榜。Vals 最新結果顯示,Claude Opus 5 來到 97.00%,GPT-5.6 Sol 也在 95% 以上,79 個模型裡有 3 個達到 95% 或更高;當最前段擠進這麼窄的區間,這個基準測到的是誰少犯一點錯,不是誰跨出一個等級。
第一個論點
訂閱 AI 趨勢週報
每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。
不會寄垃圾信,隨時可取消。
頂端分數已經擠到幾乎沒有辨識度。第一名只有 97.00%,距離滿分差 3 個百分點,這不是「壓倒性領先」,而是幾乎進入拍照完賽。對一個包含 500 題的基準來說,幾個額外修對的 patch 就足以改變名次,但不一定改變模型在真實開發中的價值。

更關鍵的是,前段差距不再像過去那樣能清楚分出陣營。Kimi K3 為 93.40%,Claude Opus 4.8 為 88.60%,Grok 4.5 為 86.60%。這些數字都很高,也都代表能幹活,但它們更像同一個能力帶上的不同點位,而不是三個不同世代。拿這種分布去做採購決策,容易高估 2 到 4 分的意義。
第二個論點
這個榜單本來就不是純模型智力測驗,而是模型加上工具習慣的綜合題。Vals 用的是同一套最小化 bash-only harness,公平是公平,但它也把命題改寫成「誰更會在 shell 裡找路、改檔、重試」。這會放大命令列熟練度、搜尋策略與 patch 風格的差異,而不只是推理本身。
Vals 也指出,差距最明顯的地方,常出現在需要 15 分鐘到 1 小時才能完成的任務。這正是 agent 行為開始主導結果的區段:不是單次答對,而是一路排錯、定位、修補、再驗證。這種設計很有現實感,但它也意味著 SWE-bench Verified 測到的是「能不能把活做完」,不是「純模型能力」;兩者相關,卻不相同。
反方可能怎麼說
最強的反方說法是:即使頂端擠在一起,SWE-bench Verified 仍然是少數真正貼近軟體工作的公開基準。它用人類驗證過的 GitHub issue、隔離的 Docker 環境、以及單元測試來判定 patch 是否真的修好問題,這比合成式 coding trivia 誠實得多,也更接近產品環境中的真實任務。

另一個辯護也站得住腳:它不容易輕易作弊。最小化 bash-only harness 去掉了客製工具優勢,逼模型展示真實的命令列能力。對實驗室來說,這提供了相對公平的比較;對工程團隊來說,這至少比抽象語言分數更能反映 repo 操作、除錯與修補能力。
但這些優點不足以挽救它在頂端的辨識力流失。基準可以很真實,也可以在最強模型都擠進 3 到 5 個百分點時失去排序功能。SWE-bench Verified 仍然適合當能力門檻和回歸測試,不適合再被當成 frontier 模型的精細排名器。更有用的讀法是:看它能不能穩定處理真實 repo 工作,而不是看誰在榜上多贏了 2 分。
你能做什麼
如果你是工程師、PM 或創辦人,把 SWE-bench Verified 當作門檻,不要當作桂冠。它適合用來淘汰明顯不行的 coding agent、比較同一產品線的版本變化、以及檢查 repo 導航與 patch 品質是否退步;但不要拿 1 到 3 分的差距,直接推論哪個 frontier 模型會徹底改變你的工作流。真正的決策應該放回你的 repo、你的任務集、你的延遲與成本限制,因為那裡才是模型價值的落點。