[RSCH] 12 分鐘閱讀OraCore 編輯部

Grok 4.6 把前沿智商壓回預算內

我拆 Artificial Analysis 的 Grok 4.6 評測,整理成可直接拿去比模型、算任務成本、做 agent 評估的版本。

分享 LinkedIn
Grok 4.6 把前沿智商壓回預算內

以前我只看模型分數,現在我先看分數加上每個任務的帳單。

我盯模型發布盯久了,最煩的就是那種老套路:分數更高了,帳單也跟著鼓起來。你如果真的在做 agent,就知道這有多煩。模型在 demo 裡很會講,輪到真實工作就開始多嘴、繞路、重試,最後 token 像水龍頭一樣開著不關。我現在只想要一件事:它要能想、能用工具、能把活做完,而且別把成本搞成災難。

所以我卡在 Artificial Analysis 的 Grok 4.6 評測。它給的數字很直白:Artificial Analysis Intelligence Index 61,輸入/輸出價格是 $2/$6 per 1M tokens,任務成本 $0.84。這種組合我會停下來看,因為它不是單純說「更強」,而是說「更強,還沒把成本曲線拉歪」。

我先看分數,但我更在意分數旁邊的帳單

訂閱 AI 趨勢週報

每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。

不會寄垃圾信,隨時可取消。

“Grok 4.6 scores 61 on the Artificial Analysis Intelligence Index, joining the frontier in line with GPT-5.6 Sol (max), behind Claude Opus 5 (max, 63) and Claude Fable 5 (max with fallback, 62).”

白話翻譯就是:Grok 4.6 不是那種卡在中段班、硬說自己很有料的模型了。Artificial Analysis 直接把它放回前沿,跟大家平常會拿來做高階推理的模型站在同一條線上。真正值得看的,是它把前沿智力跟 Grok 4.5 一樣的價格綁在一起。

Grok 4.6 把前沿智商壓回預算內

我以前被「更好」的模型坑過不少次。Demo 很漂亮,真上線才發現每多一輪都在燒錢。這種模型如果只看單次答案,會覺得很香;一旦進到 agent loop,成本就開始像失控的外送費。這篇文章真正想講的,是 Grok 4.6 在 Intelligence Index 從 56 拉到 61,價格卻沒跟著往上跳。這種變化我會寫進採購備忘錄。

實操寫法很簡單:你比模型時,別只看 benchmark 排名。把 intelligence 跟 task cost 放在一起看,別只看每 token 價格。只要你在跑 agent,少幾輪通常比單價便宜更有用。

  • 先用 benchmark score 篩掉明顯不行的。
  • 再用 task cost 決定能不能上線。
  • 最後看 turn count,猜你的帳單會不會爆。

真正有感的是 agentic 工作,不是靜態答題

“Grok 4.6's strongest results are on agentic work rather than static reasoning.”

這句我很認同。很多模型在乾淨 prompt、固定輸出格式裡看起來都很聰明;難的是它能不能扛住多步驟工作、工具呼叫、上下文漂移,還有中途插進來的雜訊。Grok 4.6 被放的位置,就是這種工作。

在 GDPval-AA v2 上,它拿到 1753 Elo,僅次於 Claude Opus 5,跟 Claude Fable 5、Qwen3.8 Max 的信賴區間有重疊。𝜏³-Banking 是 50.7%,Terminal-Bench v2.1 是 88.4%。我會在意這種分布,因為它不是只在一個小題型上耍帥,而是能跨 knowledge work、客服、terminal 任務。

我自己做內部支援 agent 時就遇過這種失敗模式:模型能回一封漂亮的 ticket reply,下一秒要查紀錄、整理摘要、判斷要不要升級處理,就開始亂掉。這不是抽象的「推理不夠好」,而是 agent 的紀律不夠。它得在工作流程變髒的時候,還記得自己在幹嘛。

實操寫法:如果你的工作會碰工具、API 或 terminal,請直接拿真實 trace 測。不要問「它答得好不好」,要問「它能不能用合理的輪數跟合理的 token,把事情做完」。

  • 測多步驟任務,不要只測單輪 prompt。
  • 看完成率,不要只看答案漂亮不漂亮。
  • 記錄它是不是一直問多餘的確認。

價格維持不動,才是最陰的地方

“Holding headline pricing flat across a generation is unusual at the frontier, where intelligence gains have typically been accompanied by price increases.”

這句話很重要,因為它講的是業界常態:前沿模型通常是變強、也變貴。對寫 benchmark 文章的人來說很熱鬧,對付帳單的人來說很痛苦。Grok 4.6 把價格維持在 Grok 4.5 的 $2/$6,同時把 Intelligence Index 從 56 拉到 61。

Grok 4.6 把前沿智商壓回預算內

Artificial Analysis 也提到它的 measured task cost 是 $0.84,跟 Kimi K3 一樣,但 intelligence 稍高。這不是在比感覺,而是在跟 Claude Opus 5 的 $5/$25、GPT-5.6 Sol 的 $5/$30 對照。只要你做的是推理重、輸出長的工作,output token 才是帳單主角。這就是為什麼我會把輸出價格圈起來看。

我看過太多團隊選了「紙面最強」的模型,結果上線後又偷偷限流,因為成本扛不住。這很虧。通常更合理的做法,是挑一個能力差不多、但便宜很多的模型,因為它會被真的用起來,而不是只躺在簡報上。

實操寫法:你可以替每個模型做一張簡單矩陣。

  • Frontier score
  • Cost per task
  • Average turns to completion
  • Output token consumption

如果你講不出更貴那個模型到底值在哪裡,大多數時候你根本不需要它。

長流程任務一跑,token 效率就不再是抽象詞

“Grok 4.6 resolves tasks in ~53 turns and ~0.5B input tokens on average, against ~103 turns and ~2.0B input tokens for Claude Opus 5 (max).”

這段是我最在意的。長流程任務會把模型效率的差異放大到很難忽略。若一個模型要兩倍輪數、四倍輸入 token,單看每 token 價格就已經不夠用了。你其實是在付 context 累積、重試、以及模型自己走偏的代價。

Artificial Analysis 還說 Grok 4.6 在 AA-Briefcase 上首次登場就拿到 1577 Elo,接近 Fable 5 等級,落在 Claude Opus 5 家族之後。這成績不差,但我更在意的是效率輪廓。53 turns 對 103 turns,不是裝飾性的差距。那代表更少 drift、更少工具呼叫、也更少上下文膨脹。

我在研究型 agent 工作流也看過同樣的事。能把內部脈絡維持乾淨的模型,常常會比靜態 benchmark 的第一名更快交出能用的答案。對實務來說,少幾輪通常就是少幾個失敗點,也比較不會忘了你原本要它優化什麼。

實操寫法:如果你的 agent 會跑超過幾輪,請把整條 trace 記下來,再比這四個東西:

  • turn count
  • input tokens consumed
  • tool-call count
  • final answer quality

這比「它有沒有一次答對」有用太多。

500k context 很大,但別把它當萬靈丹

“Context window of 500k tokens (unchanged from Grok 4.5).”

500k context window 當然很猛,能吃進去的材料比很多模型多很多。但我也踩過坑:大 context 不是策略,只是一個工具。你如果 prompt 寫得爛,bucket 只是讓你裝更多垃圾。

這裡有個我會加分的地方:Grok 4.6 的 500k 跟 Grok 4.5 一樣,代表這次進步不是靠 context 作弊,而是靠模型品質跟效率本身。這比只會吹 context 的發表方式實在多了。

我拿長 context 模型做過 codebase 分析跟文件型工作,失敗模式都很像:大家把全部資料丟進去,然後祈禱。那種做法通常死得很快。你真的要用 500k,還是得有 retrieval、chunking,還有清楚的任務結構。

實操寫法:把長 context 拿來當參考,不要拿來當混亂的藉口。

  • 先摘要,再推理。
  • 把來源資料跟指令分開。
  • 工具輸出要短,別讓它自己長成一坨。

我會考慮把它放進 production 的原因很務實

“Few models are simultaneously competitive across knowledge work, customer service and terminal use.”

這句話其實就是整篇的實務結論。對我來說,單一場景超強、其他場景普普的模型沒那麼值得追,因為 production 很少維持純淨。support、research、terminal work 一旦接上真實流程,通常就會混在一起。

Grok 4.6 吸引我的地方,是它同時有三件我在乎的事:前沿智力、像樣的 agentic 行為、以及不太刺眼的成本結構。它沒有宣稱自己每一項都第一,但它在更像真實工作的範圍內,夠完整。

如果是我幫團隊評估,我會先從那些模型費已經開始痛的工作下手。接著把它跟貴的前沿模型、以及便宜的中階模型一起比。問題不是「它是不是最強」,而是「它在我們真的會跑的任務裡,能不能提供更好的每美元產出」。

實操寫法:別搞 winner-takes-all,直接做 shortlist。

  • 一個前沿模型處理最難案例
  • 一個成本效率高的模型處理大量任務
  • 一個適合結構化工具使用的 fallback

這通常比硬要一個模型包山包海老實得多。

可抄的模板

# Frontier model evaluation template for agentic workloads

## Goal
Decide whether a model is good enough for production agent tasks without blowing up cost.

## Model under test
- Name:
- Provider:
- Pricing (input/output per 1M tokens):
- Context window:

## Benchmarks to record
- Intelligence score:
- Agentic knowledge-work score:
- Customer service / tool-use score:
- Terminal / coding score:

## Production-like metrics
- Average turns to completion:
- Average input tokens per task:
- Average output tokens per task:
- Cost per task:
- Success rate:
- Escalation rate:
- Retry rate:

## Evaluation rubric
Rate each task from 1-5:
- Correctness
- Tool discipline
- Analytical quality
- Presentation quality
- Efficiency

## Decision rule
Ship the model if:
- It matches or beats the current model on task success rate
- It reduces cost per task or justifies higher cost with clear quality gains
- It stays within acceptable turn count and token budget
- It handles long-horizon tasks without drifting

## Notes
- Test on real traces, not just synthetic prompts.
- Compare against the models closest in score, not just the cheapest model.
- Treat output token cost as the main budget risk in reasoning-heavy workflows.

這段我真的會直接貼進團隊文件。它逼你看 Artificial Analysis 這篇一直在強調的東西:分數、任務成本、輪數、還有模型能不能撐住真實 agent 工作。

來源是 Artificial Analysis 的 Grok 4.6 benchmarks and analysis。上面那些結論跟模板是我自己整理成適合台灣開發者用的版本,原始數字跟評測框架來自他們,解讀與實作建議是我加上的。也可以順手看 xAIArtificial Analysis,以及 GitHub 上相關 agent 評測專案怎麼做。