[RSCH] 7 分鐘閱讀OraCore 編輯部

Neura 指數把 Claude 與 Grok 推上前段班

Neura Market 把 396 個 AI 模型、48 項 benchmark 整成 0 到 100 指數,Claude、Grok、DeepSeek 在不同任務各自領先。

分享 LinkedIn
Neura 指數把 Claude 與 Grok 推上前段班

Neura Market 把 396 個 AI 模型和 48 項 benchmark 整成一個 0 到 100 的指數,方便直接比 Claude、Grok 和 DeepSeek 的任務表現。

Neura Market 這次把一堆零散分數收進同一張表。Neura Intelligence Index 一口氣整理 396 個模型、48 項 benchmark,還切成 8 類任務。更新時間2026 年 8 月 14 日,資料算新。

這種做法很直白。你不用再開 10 個 benchmark 頁面,也不用自己算平均。對開發者來說,先看總分,再看任務類別,決策會快很多。

指標數值意義
模型數396顯示市場已經非常擠
Benchmark 數48涵蓋更多任務型態
指數範圍0-100方便快速比較
最後更新2026/08/14代表榜單夠新

一個分數,背後其實是很多選擇

訂閱 AI 趨勢週報

每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。

不會寄垃圾信,隨時可取消。

Neura 的核心想法很簡單。它把模型表現壓成一個綜合分數,讓人先看全貌,再往下拆。這比單看某個 benchmark 直覺多了,也比較像產品團隊真的會用的方式。

Neura 指數把 Claude 與 Grok 推上前段班

這個指數把 coding、math、reasoning、general knowledge、language、multimodal、安全性、agentic tasks 都算進去。權重也寫得很清楚。coding 和 reasoning 各占 20%,general knowledge 和 math 各占 15%,language 和 multimodal 各占 10%,安全性與 agentic tasks 各占 5%。

這種權重設計很有態度。它等於直接告訴你,寫程式和推理最重要。你如果只在某一項衝高分,其他項掉太多,總分一樣會被拉下來。

  • 綜合分數範圍:0 到 100
  • 任務類別:8 類
  • Benchmark 總數:48 項以上
  • 高覆蓋門檻:70% 以上

Neura 先把每個 benchmark 做 min-max normalization,再平均成類別分數,最後才算總分。這步很重要,因為不同 benchmark 的原始尺度常常不一樣。沒有先標準化,直接比會很亂。

對開發者來說,這種設計有實用價值。它壓低了「單題目刷榜」的戲份,也讓模型的廣泛能力更容易被看見。你要的是能上線的模型,不是只會在一個測驗拿高分的模型。

領先者分散在不同任務

這份榜單沒有一個通吃的冠軍。不同公司在不同區塊各有地盤。DeepSeek 在 general knowledge 站得很前面,DeepSeek-V3.2-Exp 拿到 98.9,DeepSeek-V3.1 也有 98.5。

在 coding 領域,Anthropic 很兇。Claude Fable 5 是 98.1,Claude Mythos Preview 是 97.8。這種差距很小,但在高分區,0.3 到 0.5 的差距常常就代表不同模型的訓練取向。

推理和多模態也各有主角。這代表模型市場已經不像早期那樣,靠一個總榜就能講完故事。現在更像是各家在不同任務上分工。

“Benchmarks are the smoke, not the fire.” — Andrej Karpathy,X,2023 年 11 月

這句話放在這張榜單上很貼切。分數是煙,任務適配才是火。你如果做的是程式助手,coding 和 reasoning 比圖片能力重要得多。你如果做的是多模態助理,那就不能只看文字榜。

榜單裡幾個任務冠軍也很有意思:

  • 數學:GPT-5.6 Sol 98.2,GPT-5.6 Terra 97.4
  • 推理:Claude Opus 5 96.7,Claude Fable 5 96.6
  • 多模態:Claude Mythos Preview 91.3,Claude Opus 4.8 91.0
  • Agentic:xAIGrok 4.6 99.3

這裡的訊號很清楚。xAIOpenAIGoogle,還有 Meta,都在不同任務裡有存在感。中國模型像 DeepSeek、Zhipu AI、Qwen 也沒有缺席。

成本一進來,榜單就變得很現實

Neura 另一個做得不錯的地方,是把價格一起放進來看。它有一個 “Intelligence Tradeoffs” 視圖,直接拿模型表現對比每百萬 token 的輸出成本。這才是團隊真的會看的東西。

Neura 指數把 Claude 與 Grok 推上前段班

如果只看分數,很多模型都很漂亮。可是一旦加上成本,故事就變了。DeepSeek-V4-Flash-0731 在 Best Value 排名拿到 522.6,S Step-3.5-Flash 是 182.3,Gemma 4 31B 是 177.3,DeepSeek-V4-Pro-0813 則是 109.0。

這個差距很大。它提醒你,模型選型不是選最高分而已。你要看價格、延遲、上下文長度,還有你的任務到底吃不吃推理。

  • 最佳價值:DeepSeek-V4-Flash-0731 522.6
  • 次佳價值:S Step-3.5-Flash 182.3
  • 第三名:Gemma 4 31B 177.3
  • 高階但仍有價值:DeepSeek-V4-Pro-0813 109.0

Neura 也把模型按用途拆開。coding 和 engineering 的前段班包括 Claude Fable 5Claude Opus 5Gemini 3.7 FlashZ GLM-5.3DeepSeek-V4-Pro-0813。research 和 analysis 的排序也差不多,Claude Opus 5 仍然很前面。

這種結果對產品團隊很有用。你做後端資料抽取,可能不需要最貴的旗艦模型。你做研究摘要,則要看推理和長文能力。分數高,不代表適合你的成本結構。

覆蓋率比單一高分更值得看

Neura 有提醒一件事,這點很重要。不是每個模型都跑完所有 benchmark。它把覆蓋率分成三段:70% 以上是 high,40% 到 70% 是 medium,低於 40% 是 low。

這代表什麼?代表一個看起來很漂亮的總分,可能只建立在部分測試上。覆蓋率低的模型,等資料補齊後,排名很可能還會動。你如果只截圖總分,很容易被表象騙到。

這也是這份指數比一般榜單更像工具的地方。它不是只想告訴你誰拿第一,而是想告訴你,這個第一到底有多穩。

我覺得這種設計很適合團隊內部討論。PM 看總分,工程師看類別,採購看價格,研究員看覆蓋率。每個人都能找到自己要的那一層。

這份榜單反映的是市場分工

AI 模型市場現在很像分工明確的工廠。Anthropic 在 coding、reasoning 很強。xAI 在 agentic 分數很猛。DeepSeek 在 general knowledge 和性價比上很有存在感。

OpenAIGoogleMeta 也都還在牌桌上,只是強項不一樣。這種分散化,對開發者其實是好事。你有更多選擇,也更容易按場景挑模型。

接下來真正值得追的,不是誰又多了 0.2 分,而是這些模型在不同 benchmark 的覆蓋率會不會補齊。覆蓋率一拉高,總分的可信度才會更穩。

如果你現在要選模型,我會建議先問三個問題:你的任務是什麼、預算多少、可接受的延遲是多少。先回答這三個問題,再回頭看 Neura 的指數,會比直接看總榜更準。

接下來該看什麼

這份指數已經把很多雜訊壓掉了,但它還不是終點。最實用的下一步,是看同一批模型在下次更新時怎麼變動。只要 benchmark 覆蓋率變高,排名就會更接近真實使用情境。

我會持續盯兩件事。第一,Claude 和 Grok 在高分區能不能守住。第二,DeepSeek 這類高性價比模型,會不會繼續把成本優勢放大。這兩條線,會直接影響團隊的選型習慣。

如果你在做 AI 產品,現在就可以把這份榜單當成選型起點。先挑 3 個候選模型,再用你自己的資料跑一次小測試。榜單給方向,真實資料才決定最後答案。