Kimi K3 點出測試時擴展的4條路
4 條模型路線對照,幫你看懂測試時計算如何成為大模型擴展的第二核心維度。

看完這 4 條路線,哪一種大模型擴展最值得你追?
這份報告整理了測試時計算成為大模型第二核心擴展維度的 4 個方向。
| 項目 | 擴展位置 | 主要機制 | 適合場景 |
|---|---|---|---|
| 預訓練擴展 | 訓練前 | 更大模型、更多資料、更多算力 | 通用底座、知識覆蓋 |
| OpenAI o 系列 | 測試時 | 強化學習 + 推理時多花計算 | 數學、程式、複雜問答 |
| Anthropic 擴展思考 | 測試時 | 自適應思考預算 + 工具調用 | 動態難度任務、產品系統 |
| DeepSeek-R1 / Kimi K1.5 | 後訓練 | 大規模強化學習激發推理 | 推理增強、能力重塑 |
| Kimi K2.5 Agent Swarm | 測試時 | 多智能體並行協同 | 研究、規劃、長鏈路任務 |
1. 先把底座做大:預訓練擴展
訂閱 AI 趨勢週報
每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。
不會寄垃圾信,隨時可取消。
報告先把最早期、也最熟悉的路線放回檯面:在部署前投入更多算力,靠更大模型與更多資料換能力。這仍是許多系統的起點,因為它決定了模型的知識密度、表示能力與後續可塑性。

但報告的重點不是重複「越大越好」,而是指出單靠預訓練擴展已不足以解釋今天的進展。真正改變研究重心的是,模型開始在推理階段繼續算,把計算預算從訓練前移到使用時。
- 核心變量:參數規模、訓練資料量、訓練算力
- 優勢:知識覆蓋廣,基礎能力穩定
- 限制:推理時無法按任務動態加算力
2. 在回答時多想一點:OpenAI o 系列
OpenAI 的 o 系列被報告當作關鍵例子。它把強化學習和測試時推理往前推,讓模型不只是在訓練時學會模式,也能在回答複雜問題時多花計算。
這條路線的價值在於,模型面對難題時不必一次給答案,而是能在生成過程中做更多內部推演。對多步推理、約束檢查、答案修正這類任務,這通常比單次前向輸出更有效。
- 關注點:強化學習、測試時推理
- 適合任務:數學、程式、複雜問答
- 關鍵變化:推理階段也能「擴展」
3. 把思考當資源:Anthropic 的自適應思考
Anthropic 的擴展思考模型強調另一種能力:模型可以依任務難度分配不同的思考預算。簡單問題少想一點,複雜問題多想一點,讓測試時計算更像可調資源,而不是固定成本。

報告也提到,這一路線把推理和工具調用結合得更緊。模型不只是在內部「想」,還能在需要時呼叫外部工具,把搜尋、計算、檢索納入同一條解題鏈路。
- 核心機制:自適應思考預算
- 能力組合:推理 + 工具調用
- 價值:降低無謂計算,提高複雜任務命中率
4. 後訓練也能改寫能力:DeepSeek-R1 與 Kimi K1.5
DeepSeek 的 R1 和 Kimi K1.5 在報告中被放在同一組,因為它們共同說明了一件事:大規模強化學習可以從強預訓練基座中喚醒複雜推理行為。底座不只是存知識,還能在後訓練階段被塑造成更會思考的系統。
這類結果的重要性在於,它證明推理能力不完全依賴更大的預訓練模型,也能透過後訓練和獎勵設計顯著增強。對研究者和產品團隊來說,這意味著能力提升的路徑更多了,不必只盯著參數規模。
- 共同點:強預訓練基座 + 大規模強化學習
- 目標:激發複雜推理
- 啟示:後訓練能顯著改寫模型行為
5. 從單模型到多智能體:Kimi K2.5 Agent Swarm
Kimi 的 K2.5 Agent Swarm 把測試時擴展推進到更高一層:不再只是單個模型一步步想,而是讓多個智能體並行協作。報告認為,這標誌著測試時 scaling 從串行推理擴展到並行智能體協同。
這種架構更適合開放式、長鏈路、需要分工的任務,比如研究、規劃、複雜檢索和多約束決策。它的價值不只是更快,而是把「思考」拆成多個可並行的子過程,再由系統統一整合。
- 形態變化:單模型串行推理 → 多智能體並行協同
- 適合場景:研究、規劃、長任務鏈
- 系統收益:更強的任務分解與整合能力
怎麼挑
如果你在看模型底座,先看預訓練擴展;如果你在意難題上的答案品質,就看 o 系列和 R1 這類後訓練推理路線;如果你要做產品級系統,Anthropic 式自適應思考預算更貼近工程現實;如果你在做複雜工作流或代理系統,K2.5 這種並行協同更值得參考。
這份報告的結論很直接:今天的大模型競爭,不再只看訓練前誰堆得更多,也要看測試時誰能把計算用得更聰明。