[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-neura-ai-benchmark-index-claude-grok-zh":3,"article-related-neura-ai-benchmark-index-claude-grok-zh":31,"series-research-f42a268c-f48c-42cb-89a2-7f39a848bf1a":76},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":24,"views":28,"created_at":29,"published_at":30,"topic_cluster_id":11},"f42a268c-f48c-42cb-89a2-7f39a848bf1a","neura-ai-benchmark-index-claude-grok-zh","Neura 指數把 Claude 與 Grok 推上前段班","\u003Cp data-speakable=\"summary\">Neura Market 把 396 個 AI 模型和 48 項 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 整成一個 0 到 100 的指數，方便直接比 \u003Ca href=\"\u002Ftag\u002Fclaude\">Claude\u003C\u002Fa>、Grok 和 DeepSeek 的任務表現。\u003C\u002Fp>\u003Cp>Neura Market 這次把一堆零散分數收進同一張表。\u003Ca href=\"https:\u002F\u002Fneura.market\u002Ftools\u002Fai-benchmarks\" target=\"_blank\" rel=\"noopener\">Neura Intelligence Index\u003C\u002Fa> 一口氣整理 396 個模型、48 項 benchmark，還切成 8 類任務。更新\u003Ca href=\"\u002Fnews\u002F10-ai-github-repos-that-actually-save-time-zh\">時間\u003C\u002Fa>是 \u003Ca href=\"\u002Fnews\u002Fclaude-vs-chatgpt-2026-claude-bi-jiao-qiang-ma-zh\">2026\u003C\u002Fa> 年 8 月 14 日，資料算新。\u003C\u002Fp>\u003Cp>這種做法很直白。你不用再開 10 個 benchmark 頁面，也不用自己算平均。對開發者來說，先看總分，再看任務類別，決策會快很多。\u003C\u002Fp>\u003Ctable>\u003Cthead>\u003Ctr>\u003Cth>指標\u003C\u002Fth>\u003Cth>數值\u003C\u002Fth>\u003Cth>意義\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd>模型數\u003C\u002Ftd>\u003Ctd>396\u003C\u002Ftd>\u003Ctd>顯示市場已經非常擠\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>Benchmark 數\u003C\u002Ftd>\u003Ctd>48\u003C\u002Ftd>\u003Ctd>涵蓋更多任務型態\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>指數範圍\u003C\u002Ftd>\u003Ctd>0-100\u003C\u002Ftd>\u003Ctd>方便快速比較\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>最後更新\u003C\u002Ftd>\u003Ctd>2026\u002F08\u002F14\u003C\u002Ftd>\u003Ctd>代表榜單夠新\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Ch2>一個分數，背後其實是很多選擇\u003C\u002Fh2>\u003Cp>Neura 的核心想法很簡單。它把模型表現壓成一個綜合分數，讓人先看全貌，再往下拆。這比單看某個 benchmark 直覺多了，也比較像產品團隊真的會用的方式。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786730587164-15w7.png\" alt=\"Neura 指數把 Claude 與 Grok 推上前段班\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這個指數把 coding、math、reasoning、general knowledge、language、multimodal、\u003Ca href=\"\u002Fnews\u002Ffable-51-safety-boundary-permission-template-zh\">安全\u003C\u002Fa>性、agentic tasks 都算進去。權重也寫得很清楚。coding 和 reasoning 各占 20%，general knowledge 和 math 各占 15%，language 和 multimodal 各占 10%，安全性與 agentic tasks 各占 5%。\u003C\u002Fp>\u003Cp>這種權重設計很有態度。它等於直接告訴你，寫程式和推理最重要。你如果只在某一項衝高分，其他項掉太多，總分一樣會被拉下來。\u003C\u002Fp>\u003Cul>\u003Cli>綜合分數範圍：0 到 100\u003C\u002Fli>\u003Cli>任務類別：8 類\u003C\u002Fli>\u003Cli>Benchmark 總數：48 項以上\u003C\u002Fli>\u003Cli>高覆蓋門檻：70% 以上\u003C\u002Fli>\u003C\u002Ful>\u003Cp>Neura 先把每個 benchmark 做 min-max normalization，再平均成類別分數，最後才算總分。這步很重要，因為不同 benchmark 的原始尺度常常不一樣。沒有先標準化，直接比會很亂。\u003C\u002Fp>\u003Cp>對開發者來說，這種設計有實用價值。它壓低了「單題目刷榜」的戲份，也讓模型的廣泛能力更容易被看見。你要的是能上線的模型，不是只會在一個測驗拿高分的模型。\u003C\u002Fp>\u003Ch2>領先者分散在不同任務\u003C\u002Fh2>\u003Cp>這份榜單沒有一個通吃的冠軍。不同公司在不同區塊各有地盤。\u003Ca href=\"https:\u002F\u002Fwww.deepseek.com\" target=\"_blank\" rel=\"noopener\">DeepSeek\u003C\u002Fa> 在 general knowledge 站得很前面，\u003Cstrong>DeepSeek-V3.2-Exp\u003C\u002Fstrong> 拿到 98.9，\u003Cstrong>DeepSeek-V3.1\u003C\u002Fstrong> 也有 98.5。\u003C\u002Fp>\u003Cp>在 coding 領域，\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\" target=\"_blank\" rel=\"noopener\">Anthropic\u003C\u002Fa> 很兇。\u003Cstrong>Claude Fable 5\u003C\u002Fstrong> 是 98.1，\u003Cstrong>\u003Ca href=\"\u002Ftag\u002Fclaude-mythos\">Claude Mythos\u003C\u002Fa> Preview\u003C\u002Fstrong> 是 97.8。這種差距很小，但在高分區，0.3 到 0.5 的差距常常就代表不同模型的訓練取向。\u003C\u002Fp>\u003Cp>推理和多模態也各有主角。這代表模型市場已經不像早期那樣，靠一個總榜就能講完故事。現在更像是各家在不同任務上分工。\u003C\u002Fp>\u003Cblockquote>“Benchmarks are the smoke, not the fire.” — Andrej Karpathy，X，2023 年 11 月\u003C\u002Fblockquote>\u003Cp>這句話放在這張榜單上很貼切。分數是煙，任務適配才是火。你如果做的是程式助手，coding 和 reasoning 比圖片能力重要得多。你如果做的是多模態助理，那就不能只看文字榜。\u003C\u002Fp>\u003Cp>榜單裡幾個任務冠軍也很有意思：\u003C\u002Fp>\u003Cul>\u003Cli>數學：\u003Cstrong>GPT-5.6 Sol\u003C\u002Fstrong> 98.2，\u003Cstrong>GPT-5.6 Terra\u003C\u002Fstrong> 97.4\u003C\u002Fli>\u003Cli>推理：\u003Cstrong>Claude Opus 5\u003C\u002Fstrong> 96.7，\u003Cstrong>Claude Fable 5\u003C\u002Fstrong> 96.6\u003C\u002Fli>\u003Cli>多模態：\u003Cstrong>Claude Mythos Preview\u003C\u002Fstrong> 91.3，\u003Cstrong>Claude Opus 4.8\u003C\u002Fstrong> 91.0\u003C\u002Fli>\u003Cli>Agentic：\u003Cstrong>xAI\u003C\u002Fstrong> 的 \u003Cstrong>Grok 4.6\u003C\u002Fstrong> 99.3\u003C\u002Fli>\u003C\u002Ful>\u003Cp>這裡的訊號很清楚。\u003Ca href=\"https:\u002F\u002Fx.ai\" target=\"_blank\" rel=\"noopener\">xAI\u003C\u002Fa>、\u003Ca href=\"https:\u002F\u002Fopenai.com\" target=\"_blank\" rel=\"noopener\">OpenAI\u003C\u002Fa>、\u003Ca href=\"https:\u002F\u002Fwww.google.com\u002Fai\" target=\"_blank\" rel=\"noopener\">Google\u003C\u002Fa>，還有 \u003Ca href=\"https:\u002F\u002Fwww.meta.com\u002Fai\" target=\"_blank\" rel=\"noopener\">Meta\u003C\u002Fa>，都在不同任務裡有存在感。中國模型像 DeepSeek、Zhipu AI、Qwen 也沒有缺席。\u003C\u002Fp>\u003Ch2>成本一進來，榜單就變得很現實\u003C\u002Fh2>\u003Cp>Neura 另一個做得不錯的地方，是把價格一起放進來看。它有一個 “Intelligence Tradeoffs” 視圖，直接拿模型表現對比每百萬 \u003Ca href=\"\u002Ftag\u002Ftoken\">token\u003C\u002Fa> 的輸出成本。這才是團隊真的會看的東西。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786730585043-s15t.png\" alt=\"Neura 指數把 Claude 與 Grok 推上前段班\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>如果只看分數，很多模型都很漂亮。可是一旦加上成本，故事就變了。\u003Cstrong>DeepSeek-V4-Flash-0731\u003C\u002Fstrong> 在 Best Value 排名拿到 522.6，\u003Cstrong>S Step-3.5-Flash\u003C\u002Fstrong> 是 182.3，\u003Cstrong>Gemma 4 31B\u003C\u002Fstrong> 是 177.3，\u003Cstrong>DeepSeek-V4-Pro-0813\u003C\u002Fstrong> 則是 109.0。\u003C\u002Fp>\u003Cp>這個差距很大。它提醒你，模型選型不是選最高分而已。你要看價格、延遲、上下文長度，還有你的任務到底吃不吃推理。\u003C\u002Fp>\u003Cul>\u003Cli>最佳價值：\u003Cstrong>DeepSeek-V4-Flash-0731\u003C\u002Fstrong> 522.6\u003C\u002Fli>\u003Cli>次佳價值：\u003Cstrong>S Step-3.5-Flash\u003C\u002Fstrong> 182.3\u003C\u002Fli>\u003Cli>第三名：\u003Cstrong>Gemma 4 31B\u003C\u002Fstrong> 177.3\u003C\u002Fli>\u003Cli>高階但仍有價值：\u003Cstrong>DeepSeek-V4-Pro-0813\u003C\u002Fstrong> 109.0\u003C\u002Fli>\u003C\u002Ful>\u003Cp>Neura 也把模型按用途拆開。coding 和 engineering 的前段班包括 \u003Cstrong>Claude Fable 5\u003C\u002Fstrong>、\u003Cstrong>Claude Opus 5\u003C\u002Fstrong>、\u003Cstrong>\u003Ca href=\"\u002Ftag\u002Fgemini\">Gemini\u003C\u002Fa> 3.7 Flash\u003C\u002Fstrong>、\u003Cstrong>Z GLM-5.3\u003C\u002Fstrong>、\u003Cstrong>DeepSeek-V4-Pro-0813\u003C\u002Fstrong>。research 和 analysis 的排序也差不多，\u003Cstrong>Claude Opus 5\u003C\u002Fstrong> 仍然很前面。\u003C\u002Fp>\u003Cp>這種結果對產品團隊很有用。你做後端資料抽取，可能不需要最貴的旗艦模型。你做研究摘要，則要看推理和長文能力。分數高，不代表適合你的成本結構。\u003C\u002Fp>\u003Ch2>覆蓋率比單一高分更值得看\u003C\u002Fh2>\u003Cp>Neura 有提醒一件事，這點很重要。不是每個模型都跑完所有 benchmark。它把覆蓋率分成三段：70% 以上是 high，40% 到 70% 是 medium，低於 40% 是 low。\u003C\u002Fp>\u003Cp>這代表什麼？代表一個看起來很漂亮的總分，可能只建立在部分測試上。覆蓋率低的模型，等資料補齊後，排名很可能還會動。你如果只截圖總分，很容易被表象騙到。\u003C\u002Fp>\u003Cp>這也是這份指數比一般榜單更像工具的地方。它不是只想告訴你誰拿第一，而是想告訴你，這個第一到底有多穩。\u003C\u002Fp>\u003Cp>我覺得這種設計很適合團隊內部討論。PM 看總分，工程師看類別，採購看價格，研究員看覆蓋率。每個人都能找到自己要的那一層。\u003C\u002Fp>\u003Ch2>這份榜單反映的是市場分工\u003C\u002Fh2>\u003Cp>AI 模型市場現在很像分工明確的工廠。\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\" target=\"_blank\" rel=\"noopener\">Anthropic\u003C\u002Fa> 在 coding、reasoning 很強。\u003Ca href=\"https:\u002F\u002Fx.ai\" target=\"_blank\" rel=\"noopener\">xAI\u003C\u002Fa> 在 agentic 分數很猛。\u003Ca href=\"https:\u002F\u002Fwww.deepseek.com\" target=\"_blank\" rel=\"noopener\">DeepSeek\u003C\u002Fa> 在 general knowledge 和性價比上很有存在感。\u003C\u002Fp>\u003Cp>\u003Ca href=\"https:\u002F\u002Fopenai.com\" target=\"_blank\" rel=\"noopener\">OpenAI\u003C\u002Fa>、\u003Ca href=\"https:\u002F\u002Fwww.google.com\u002Fai\" target=\"_blank\" rel=\"noopener\">Google\u003C\u002Fa>、\u003Ca href=\"https:\u002F\u002Fwww.meta.com\u002Fai\" target=\"_blank\" rel=\"noopener\">Meta\u003C\u002Fa> 也都還在牌桌上，只是強項不一樣。這種分散化，對開發者其實是好事。你有更多選擇，也更容易按場景挑模型。\u003C\u002Fp>\u003Cp>接下來真正值得追的，不是誰又多了 0.2 分，而是這些模型在不同 benchmark 的覆蓋率會不會補齊。覆蓋率一拉高，總分的可信度才會更穩。\u003C\u002Fp>\u003Cp>如果你現在要選模型，我會建議先問三個問題：你的任務是什麼、預算多少、可接受的延遲是多少。先回答這三個問題，再回頭看 Neura 的指數，會比直接看總榜更準。\u003C\u002Fp>\u003Ch2>接下來該看什麼\u003C\u002Fh2>\u003Cp>這份指數已經把很多雜訊壓掉了，但它還不是終點。最實用的下一步，是看同一批模型在下次更新時怎麼變動。只要 benchmark 覆蓋率變高，排名就會更接近真實使用情境。\u003C\u002Fp>\u003Cp>我會持續盯兩件事。第一，Claude 和 Grok 在高分區能不能守住。第二，DeepSeek 這類高性價比模型，會不會繼續把成本優勢放大。這兩條線，會直接影響團隊的選型習慣。\u003C\u002Fp>\u003Cp>如果你在做 AI 產品，現在就可以把這份榜單當成選型起點。先挑 3 個候選模型，再用你自己的資料跑一次小測試。榜單給方向，真實資料才決定最後答案。\u003C\u002Fp>","Neura Market 把 396 個 AI 模型、48 項 benchmark 整成 0 到 100 指數，Claude、Grok、DeepSeek 在不同任務各自領先。","neura.market","https:\u002F\u002Fneura.market\u002Ftools\u002Fai-benchmarks",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786730587164-15w7.png","research","zh","bdd400ae-6032-488e-9240-2e936ab297d3",[17,18,19,20,21,22,23],"AI benchmark","Claude","Grok","DeepSeek","Neura Intelligence Index","模型評測","LLM 比較",[25,26,27],"Neura 把 396 個模型和 48 項 benchmark 整成 0 到 100 指數。","Claude、Grok、DeepSeek 在不同任務各有強項，沒有單一通吃的冠軍。","把成本和覆蓋率一起看，比只看總分更接近實際選型。",1,"2026-08-14T18:02:37.974144+00:00","2026-08-14T18:02:37.964+00:00",{"tags":32,"relatedLang":11,"relatedPosts":39},[33,35,37],{"name":20,"slug":34},"deepseek",{"name":18,"slug":36},"claude",{"name":17,"slug":38},"ai-benchmark",[40,46,52,58,64,70],{"id":41,"slug":42,"title":43,"cover_image":44,"image_url":44,"created_at":45,"category":13},"70584f73-54b3-4548-944b-7c596e1e3db5","humantracker-human-aligned-motion-tracking-benchmark-zh","HumanTracker補上人形評測盲點","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786690974820-0s3o.png","2026-08-14T07:02:30.412806+00:00",{"id":47,"slug":48,"title":49,"cover_image":50,"image_url":50,"created_at":51,"category":13},"6bbeb865-a249-440c-839f-cf1763be8ab2","omni-scientist-full-stack-ai-science-zh","OmniScientist：AI 科學家先看原始證據","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786689182933-w118.png","2026-08-14T06:32:31.082995+00:00",{"id":53,"slug":54,"title":55,"cover_image":56,"image_url":56,"created_at":57,"category":13},"3a451f17-5483-4c4f-930c-3e58a97760a1","autodesign-meta-harness-optimization-posters-zh","AutoDesign：讓海報生成自己變強","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786687383071-oaq0.png","2026-08-14T06:02:26.50133+00:00",{"id":59,"slug":60,"title":61,"cover_image":62,"image_url":62,"created_at":63,"category":13},"a212bb55-ce9d-4c3e-870d-8d6cd0ff3b76","test-time-harnesses-weak-model-transfer-zh","測試時外掛讓弱模型升級","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786604574332-ails.png","2026-08-13T07:02:25.318901+00:00",{"id":65,"slug":66,"title":67,"cover_image":68,"image_url":68,"created_at":69,"category":13},"363b733e-eb27-4be3-a234-4b3044e0eb3e","dreamfly-aerial-vln-memory-planning-zh","DreamFly 讓空中 VLN 更會記、會算","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786602773313-9vlj.png","2026-08-13T06:32:23.836363+00:00",{"id":71,"slug":72,"title":73,"cover_image":74,"image_url":74,"created_at":75,"category":13},"01d1a149-5977-4846-938a-6199ae59fc70","ava-encoder-agent-native-video-representation-zh","AVA-Encoder 把影片變知識圖譜","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786600969140-3p0h.png","2026-08-13T06:02:21.397513+00:00",[77,82,87,92,97,102,107,112,117,122],{"id":78,"slug":79,"title":80,"created_at":81},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":83,"slug":84,"title":85,"created_at":86},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":88,"slug":89,"title":90,"created_at":91},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":93,"slug":94,"title":95,"created_at":96},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":98,"slug":99,"title":100,"created_at":101},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":103,"slug":104,"title":105,"created_at":106},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":108,"slug":109,"title":110,"created_at":111},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":113,"slug":114,"title":115,"created_at":116},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":118,"slug":119,"title":120,"created_at":121},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":123,"slug":124,"title":125,"created_at":126},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]