[MODEL] 3 分鐘閱讀OraCore 編輯部

Gemini 3.6 Flash 證明 Google 把效率放在 hype 前面

Google 用 Gemini 3.6 Flash 與 3.5 Flash-Lite 表明,接下來先拼成本、速度與可部署性,而不是先追求最大模型聲量。

分享 LinkedIn
Gemini 3.6 Flash 證明 Google 把效率放在 hype 前面

17% 更少輸出 token,代表 Google 正把 Gemini 的重心放在更便宜、更快的實作,而不是先追求更大聲量。

Google 選擇用 Gemini 3.6 Flash 把效率放在舞台中央,這一步是對的。

3.6 Flash 並不是拿來賣「下一個大奇蹟」的。Google 公布它比 3.5 Flash 少用 17% 的輸出 token,輸入價格是每百萬 token 1.50 美元、輸出價格是 7.50 美元,還能在多步驟工作流程中減少推理步驟與工具呼叫。對真正要上線的產品團隊來說,這些數字比口號重要得多,因為它們直接換成更低延遲、更低帳單和更少的流程抖動。

第一個論點

訂閱 AI 趨勢週報

每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。

不會寄垃圾信,隨時可取消。

模型發布最常被拿來比的是 benchmark,但生意上更重要的是單位經濟。若同樣能完成任務,卻少吐出 17% 的 token,省下來的成本會在客服對話、資料擷取、代理循環與批次生成裡持續累積。這就是為什麼 Flash 這一層的價值,不在於炫技,而在於能否成為大量流量的主力模型。

Gemini 3.6 Flash 證明 Google 把效率放在 hype 前面

價格也印證了這個方向。3.6 Flash 的輸出價格降到每百萬 token 7.50 美元,低於先前 3.5 Flash 的 9 美元,同時還宣稱能減少不必要的程式碼修改與執行迴圈。對每天處理大量請求的工程團隊來說,這種組合比單點 benchmark 提升更有意義,因為它同時降低了迭代成本與出錯成本。

第二個論點

Google 端出的提升不是只看起來漂亮,而是直接對準產品工作。以 DeepSWE 為例,3.6 Flash 從 37% 提升到 49%;在 MLE Bench 上,成績從 49.7% 進步到 63.9%。這些差距對寫程式、做機器學習流程、修補工具鏈問題都很實際,因為它們反映的是模型能否真正幫團隊把工作做完,而不是只會在榜單上好看。

類似的改善也出現在一般知識工作與電腦操作。Google 表示 GDPval-AA 從 1349 升到 1421,OSWorld-Verified 從 78.4% 升到 83%。這不是革命,但對內部助理、文件流程、半自動化代理來說已經足夠重要。買單的人要的不是幻覺式智能,而是在混亂環境裡穩定完成任務的能力,而 3.6 Flash 正在往這個方向靠攏。

反方可能怎麼說

最強的反對意見其實很簡單:Google 仍然把真正的旗艦模型藏在後面。公司已說明 3.5 Pro 還在與合作夥伴測試,而下一次更大的躍進會落在 Gemini 4。從這個角度看,3.6 Flash 只是過渡版本,用來維持開發者熱度與產品節奏,真正決定平台高度的仍然是更大的模型。

Gemini 3.6 Flash 證明 Google 把效率放在 hype 前面

這個批評並不空穴來風。旗艦模型確實會定義生態系的上限,Google 也清楚這件事。但對多數實際用量來說,上限不是最先卡住的地方,成本、延遲與穩定性才是。產品團隊今天就需要一個夠便宜、夠快、夠穩的模型,而 3.6 Flash 與 3.5 Flash-Lite 正是在解這個問題。就算 Gemini 4 才是下一個大招,Google 也已經先把通往它的量產路鋪好。

你能做什麼

如果你是工程師,先把 3.6 Flash 放進最怕 token 膨脹、工具呼叫過多、延遲過高的流程裡做 A/B 測試;如果你是 PM 或創辦人,把 Flash-Lite 與 Flash 當成預設的成本控制層,用在搜尋、文件處理、客服與代理任務,再把昂貴模型保留給少數真正需要它的場景。Google 已經把訊號講得很清楚:先用更便宜、更快、更可部署的模型贏下實際使用,再談更大的未來。