Neura 指數把 Claude 與 Grok 推上前段班
Neura Market 把 396 個 AI 模型、48 項 benchmark 整成 0 到 100 指數,Claude、Grok、DeepSeek 在不同任務各自領先。

Neura Market 把 396 個 AI 模型和 48 項 benchmark 整成一個 0 到 100 的指數,方便直接比 Claude、Grok 和 DeepSeek 的任務表現。
Neura Market 這次把一堆零散分數收進同一張表。Neura Intelligence Index 一口氣整理 396 個模型、48 項 benchmark,還切成 8 類任務。更新時間是 2026 年 8 月 14 日,資料算新。
這種做法很直白。你不用再開 10 個 benchmark 頁面,也不用自己算平均。對開發者來說,先看總分,再看任務類別,決策會快很多。
| 指標 | 數值 | 意義 |
|---|---|---|
| 模型數 | 396 | 顯示市場已經非常擠 |
| Benchmark 數 | 48 | 涵蓋更多任務型態 |
| 指數範圍 | 0-100 | 方便快速比較 |
| 最後更新 | 2026/08/14 | 代表榜單夠新 |
一個分數,背後其實是很多選擇
訂閱 AI 趨勢週報
每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。
不會寄垃圾信,隨時可取消。
Neura 的核心想法很簡單。它把模型表現壓成一個綜合分數,讓人先看全貌,再往下拆。這比單看某個 benchmark 直覺多了,也比較像產品團隊真的會用的方式。

這個指數把 coding、math、reasoning、general knowledge、language、multimodal、安全性、agentic tasks 都算進去。權重也寫得很清楚。coding 和 reasoning 各占 20%,general knowledge 和 math 各占 15%,language 和 multimodal 各占 10%,安全性與 agentic tasks 各占 5%。
這種權重設計很有態度。它等於直接告訴你,寫程式和推理最重要。你如果只在某一項衝高分,其他項掉太多,總分一樣會被拉下來。
- 綜合分數範圍:0 到 100
- 任務類別:8 類
- Benchmark 總數:48 項以上
- 高覆蓋門檻:70% 以上
Neura 先把每個 benchmark 做 min-max normalization,再平均成類別分數,最後才算總分。這步很重要,因為不同 benchmark 的原始尺度常常不一樣。沒有先標準化,直接比會很亂。
對開發者來說,這種設計有實用價值。它壓低了「單題目刷榜」的戲份,也讓模型的廣泛能力更容易被看見。你要的是能上線的模型,不是只會在一個測驗拿高分的模型。
領先者分散在不同任務
這份榜單沒有一個通吃的冠軍。不同公司在不同區塊各有地盤。DeepSeek 在 general knowledge 站得很前面,DeepSeek-V3.2-Exp 拿到 98.9,DeepSeek-V3.1 也有 98.5。
在 coding 領域,Anthropic 很兇。Claude Fable 5 是 98.1,Claude Mythos Preview 是 97.8。這種差距很小,但在高分區,0.3 到 0.5 的差距常常就代表不同模型的訓練取向。
推理和多模態也各有主角。這代表模型市場已經不像早期那樣,靠一個總榜就能講完故事。現在更像是各家在不同任務上分工。
“Benchmarks are the smoke, not the fire.” — Andrej Karpathy,X,2023 年 11 月
這句話放在這張榜單上很貼切。分數是煙,任務適配才是火。你如果做的是程式助手,coding 和 reasoning 比圖片能力重要得多。你如果做的是多模態助理,那就不能只看文字榜。
榜單裡幾個任務冠軍也很有意思:
- 數學:GPT-5.6 Sol 98.2,GPT-5.6 Terra 97.4
- 推理:Claude Opus 5 96.7,Claude Fable 5 96.6
- 多模態:Claude Mythos Preview 91.3,Claude Opus 4.8 91.0
- Agentic:xAI 的 Grok 4.6 99.3
這裡的訊號很清楚。xAI、OpenAI、Google,還有 Meta,都在不同任務裡有存在感。中國模型像 DeepSeek、Zhipu AI、Qwen 也沒有缺席。
成本一進來,榜單就變得很現實
Neura 另一個做得不錯的地方,是把價格一起放進來看。它有一個 “Intelligence Tradeoffs” 視圖,直接拿模型表現對比每百萬 token 的輸出成本。這才是團隊真的會看的東西。

如果只看分數,很多模型都很漂亮。可是一旦加上成本,故事就變了。DeepSeek-V4-Flash-0731 在 Best Value 排名拿到 522.6,S Step-3.5-Flash 是 182.3,Gemma 4 31B 是 177.3,DeepSeek-V4-Pro-0813 則是 109.0。
這個差距很大。它提醒你,模型選型不是選最高分而已。你要看價格、延遲、上下文長度,還有你的任務到底吃不吃推理。
- 最佳價值:DeepSeek-V4-Flash-0731 522.6
- 次佳價值:S Step-3.5-Flash 182.3
- 第三名:Gemma 4 31B 177.3
- 高階但仍有價值:DeepSeek-V4-Pro-0813 109.0
Neura 也把模型按用途拆開。coding 和 engineering 的前段班包括 Claude Fable 5、Claude Opus 5、Gemini 3.7 Flash、Z GLM-5.3、DeepSeek-V4-Pro-0813。research 和 analysis 的排序也差不多,Claude Opus 5 仍然很前面。
這種結果對產品團隊很有用。你做後端資料抽取,可能不需要最貴的旗艦模型。你做研究摘要,則要看推理和長文能力。分數高,不代表適合你的成本結構。
覆蓋率比單一高分更值得看
Neura 有提醒一件事,這點很重要。不是每個模型都跑完所有 benchmark。它把覆蓋率分成三段:70% 以上是 high,40% 到 70% 是 medium,低於 40% 是 low。
這代表什麼?代表一個看起來很漂亮的總分,可能只建立在部分測試上。覆蓋率低的模型,等資料補齊後,排名很可能還會動。你如果只截圖總分,很容易被表象騙到。
這也是這份指數比一般榜單更像工具的地方。它不是只想告訴你誰拿第一,而是想告訴你,這個第一到底有多穩。
我覺得這種設計很適合團隊內部討論。PM 看總分,工程師看類別,採購看價格,研究員看覆蓋率。每個人都能找到自己要的那一層。
這份榜單反映的是市場分工
AI 模型市場現在很像分工明確的工廠。Anthropic 在 coding、reasoning 很強。xAI 在 agentic 分數很猛。DeepSeek 在 general knowledge 和性價比上很有存在感。
OpenAI、Google、Meta 也都還在牌桌上,只是強項不一樣。這種分散化,對開發者其實是好事。你有更多選擇,也更容易按場景挑模型。
接下來真正值得追的,不是誰又多了 0.2 分,而是這些模型在不同 benchmark 的覆蓋率會不會補齊。覆蓋率一拉高,總分的可信度才會更穩。
如果你現在要選模型,我會建議先問三個問題:你的任務是什麼、預算多少、可接受的延遲是多少。先回答這三個問題,再回頭看 Neura 的指數,會比直接看總榜更準。
接下來該看什麼
這份指數已經把很多雜訊壓掉了,但它還不是終點。最實用的下一步,是看同一批模型在下次更新時怎麼變動。只要 benchmark 覆蓋率變高,排名就會更接近真實使用情境。
我會持續盯兩件事。第一,Claude 和 Grok 在高分區能不能守住。第二,DeepSeek 這類高性價比模型,會不會繼續把成本優勢放大。這兩條線,會直接影響團隊的選型習慣。
如果你在做 AI 產品,現在就可以把這份榜單當成選型起點。先挑 3 個候選模型,再用你自己的資料跑一次小測試。榜單給方向,真實資料才決定最後答案。