[IND] 4 分鐘閱讀OraCore 編輯部

Kimi K3 點出測試時擴展的4條路

4 條模型路線對照,幫你看懂測試時計算如何成為大模型擴展的第二核心維度。

分享 LinkedIn
Kimi K3 點出測試時擴展的4條路

看完這 4 條路線,哪一種大模型擴展最值得你追?

這份報告整理了測試時計算成為大模型第二核心擴展維度的 4 個方向。

項目擴展位置主要機制適合場景
預訓練擴展訓練前更大模型、更多資料、更多算力通用底座、知識覆蓋
OpenAI o 系列測試時強化學習 + 推理時多花計算數學、程式、複雜問答
Anthropic 擴展思考測試時自適應思考預算 + 工具調用動態難度任務、產品系統
DeepSeek-R1 / Kimi K1.5後訓練大規模強化學習激發推理推理增強、能力重塑
Kimi K2.5 Agent Swarm測試時多智能體並行協同研究、規劃、長鏈路任務

1. 先把底座做大:預訓練擴展

訂閱 AI 趨勢週報

每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。

不會寄垃圾信,隨時可取消。

報告先把最早期、也最熟悉的路線放回檯面:在部署前投入更多算力,靠更大模型與更多資料換能力。這仍是許多系統的起點,因為它決定了模型的知識密度、表示能力與後續可塑性。

Kimi K3 點出測試時擴展的4條路

但報告的重點不是重複「越大越好」,而是指出單靠預訓練擴展已不足以解釋今天的進展。真正改變研究重心的是,模型開始在推理階段繼續算,把計算預算從訓練前移到使用時。

  • 核心變量:參數規模、訓練資料量、訓練算力
  • 優勢:知識覆蓋廣,基礎能力穩定
  • 限制:推理時無法按任務動態加算力

2. 在回答時多想一點:OpenAI o 系列

OpenAI 的 o 系列被報告當作關鍵例子。它把強化學習和測試時推理往前推,讓模型不只是在訓練時學會模式,也能在回答複雜問題時多花計算。

這條路線的價值在於,模型面對難題時不必一次給答案,而是能在生成過程中做更多內部推演。對多步推理、約束檢查、答案修正這類任務,這通常比單次前向輸出更有效。

  • 關注點:強化學習、測試時推理
  • 適合任務:數學、程式、複雜問答
  • 關鍵變化:推理階段也能「擴展」

3. 把思考當資源:Anthropic 的自適應思考

Anthropic 的擴展思考模型強調另一種能力:模型可以依任務難度分配不同的思考預算。簡單問題少想一點,複雜問題多想一點,讓測試時計算更像可調資源,而不是固定成本。

Kimi K3 點出測試時擴展的4條路

報告也提到,這一路線把推理和工具調用結合得更緊。模型不只是在內部「想」,還能在需要時呼叫外部工具,把搜尋、計算、檢索納入同一條解題鏈路。

  • 核心機制:自適應思考預算
  • 能力組合:推理 + 工具調用
  • 價值:降低無謂計算,提高複雜任務命中率

4. 後訓練也能改寫能力:DeepSeek-R1 與 Kimi K1.5

DeepSeek 的 R1 和 Kimi K1.5 在報告中被放在同一組,因為它們共同說明了一件事:大規模強化學習可以從強預訓練基座中喚醒複雜推理行為。底座不只是存知識,還能在後訓練階段被塑造成更會思考的系統。

這類結果的重要性在於,它證明推理能力不完全依賴更大的預訓練模型,也能透過後訓練和獎勵設計顯著增強。對研究者和產品團隊來說,這意味著能力提升的路徑更多了,不必只盯著參數規模。

  • 共同點:強預訓練基座 + 大規模強化學習
  • 目標:激發複雜推理
  • 啟示:後訓練能顯著改寫模型行為

5. 從單模型到多智能體:Kimi K2.5 Agent Swarm

Kimi 的 K2.5 Agent Swarm 把測試時擴展推進到更高一層:不再只是單個模型一步步想,而是讓多個智能體並行協作。報告認為,這標誌著測試時 scaling 從串行推理擴展到並行智能體協同。

這種架構更適合開放式、長鏈路、需要分工的任務,比如研究、規劃、複雜檢索和多約束決策。它的價值不只是更快,而是把「思考」拆成多個可並行的子過程,再由系統統一整合。

  • 形態變化:單模型串行推理 → 多智能體並行協同
  • 適合場景:研究、規劃、長任務鏈
  • 系統收益:更強的任務分解與整合能力

怎麼挑

如果你在看模型底座,先看預訓練擴展;如果你在意難題上的答案品質,就看 o 系列和 R1 這類後訓練推理路線;如果你要做產品級系統,Anthropic 式自適應思考預算更貼近工程現實;如果你在做複雜工作流或代理系統,K2.5 這種並行協同更值得參考。

這份報告的結論很直接:今天的大模型競爭,不再只看訓練前誰堆得更多,也要看測試時誰能把計算用得更聰明。