[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-kimi-k3-report-test-time-scaling-4-directions-zh":3,"article-related-kimi-k3-report-test-time-scaling-4-directions-zh":33,"series-industry-6e506134-abee-4415-b7d7-0b455f9a5dbc":75},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":26,"views":30,"created_at":31,"published_at":32,"topic_cluster_id":11},"6e506134-abee-4415-b7d7-0b455f9a5dbc","kimi-k3-report-test-time-scaling-4-directions-zh","Kimi K3 點出測試時擴展的4條路","\u003Cp>看完這 4 條路線，哪一種大模型擴展最值得你追？\u003C\u002Fp>\u003Cp data-speakable=\"summary\">這份報告整理了測試時計算成為大模型第二核心擴展維度的 4 個方向。\u003C\u002Fp>\u003Ctable>\u003Cthead>\u003Ctr>\u003Cth>項目\u003C\u002Fth>\u003Cth>擴展位置\u003C\u002Fth>\u003Cth>主要機制\u003C\u002Fth>\u003Cth>適合場景\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd>預訓練擴展\u003C\u002Ftd>\u003Ctd>訓練前\u003C\u002Ftd>\u003Ctd>更大模型、更多資料、更多算力\u003C\u002Ftd>\u003Ctd>通用底座、知識覆蓋\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>OpenAI o 系列\u003C\u002Ftd>\u003Ctd>測試時\u003C\u002Ftd>\u003Ctd>強化學習 + 推理時多花計算\u003C\u002Ftd>\u003Ctd>數學、程式、複雜問答\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>Anthropic 擴展思考\u003C\u002Ftd>\u003Ctd>測試時\u003C\u002Ftd>\u003Ctd>自適應思考預算 + 工具調用\u003C\u002Ftd>\u003Ctd>動態難度任務、產品系統\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>DeepSeek-R1 \u002F Kimi K1.5\u003C\u002Ftd>\u003Ctd>後訓練\u003C\u002Ftd>\u003Ctd>大規模強化學習激發推理\u003C\u002Ftd>\u003Ctd>推理增強、能力重塑\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>Kimi K2.5 Agent Swarm\u003C\u002Ftd>\u003Ctd>測試時\u003C\u002Ftd>\u003Ctd>多智能體並行協同\u003C\u002Ftd>\u003Ctd>研究、規劃、長鏈路任務\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Ch2>1. 先把底座做大：預訓練擴展\u003C\u002Fh2>\u003Cp>報告先把最早期、也最熟悉的路線放回檯面：在部署前投入更多算力，靠更大模型與更多資料換能力。這仍是許多系統的起點，因為它決定了模型的知識密度、表示能力與後續可塑性。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785718973968-9lhh.png\" alt=\"Kimi K3 點出測試時擴展的4條路\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>但報告的重點不是重複「越大越好」，而是指出單靠預訓練擴展已不足以解釋今天的進展。真正改變研究重心的是，模型開始在推理階段繼續算，把計算預算從訓練前移到使用時。\u003C\u002Fp>\u003Cul>\u003Cli>核心變量：參數規模、訓練資料量、訓練算力\u003C\u002Fli>\u003Cli>優勢：知識覆蓋廣，基礎能力穩定\u003C\u002Fli>\u003Cli>限制：推理時無法按任務動態加算力\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>2. 在回答時多想一點：OpenAI o 系列\u003C\u002Fh2>\u003Cp>\u003Ca href=\"https:\u002F\u002Fopenai.com\u002F\">OpenAI\u003C\u002Fa> 的 o 系列被報告當作關鍵例子。它把強化學習和測試時推理往前推，讓模型不只是在訓練時學會模式，也能在回答複雜問題時多花計算。\u003C\u002Fp>\u003Cp>這條路線的價值在於，模型面對難題時不必一次給答案，而是能在生成過程中做更多內部推演。對多步推理、約束檢查、答案修正這類任務，這通常比單次前向輸出更有效。\u003C\u002Fp>\u003Cul>\u003Cli>關注點：強化學習、測試時推理\u003C\u002Fli>\u003Cli>適合任務：數學、程式、複雜問答\u003C\u002Fli>\u003Cli>關鍵變化：推理階段也能「擴展」\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>3. 把思考當資源：Anthropic 的自適應思考\u003C\u002Fh2>\u003Cp>\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\u002F\">Anthropic\u003C\u002Fa> 的擴展思考模型強調另一種能力：模型可以依任務難度分配不同的思考預算。簡單問題少想一點，複雜問題多想一點，讓測試時計算更像可調資源，而不是固定成本。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785718968774-axi9.png\" alt=\"Kimi K3 點出測試時擴展的4條路\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>報告也提到，這一路線把推理和工具調用結合得更緊。模型不只是在內部「想」，還能在需要時呼叫外部工具，把搜尋、計算、檢索納入同一條解題鏈路。\u003C\u002Fp>\u003Cul>\u003Cli>核心機制：自適應思考預算\u003C\u002Fli>\u003Cli>能力組合：推理 + 工具調用\u003C\u002Fli>\u003Cli>價值：降低無謂計算，提高複雜任務命中率\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>4. 後訓練也能改寫能力：DeepSeek-R1 與 Kimi K1.5\u003C\u002Fh2>\u003Cp>\u003Ca href=\"https:\u002F\u002Fwww.deepseek.com\u002F\">DeepSeek\u003C\u002Fa> 的 R1 和 Kimi K1.5 在報告中被放在同一組，因為它們共同說明了一件事：大規模強化學習可以從強預訓練基座中喚醒複雜推理行為。底座不只是存知識，還能在後訓練階段被塑造成更會思考的系統。\u003C\u002Fp>\u003Cp>這類結果的重要性在於，它\u003Ca href=\"\u002Fnews\u002Fopenai-hugging-face-breach-agents-hard-limits-zh\">證明\u003C\u002Fa>推理能力不完全依賴更大的預訓練模型，也能透過後訓練和獎勵設計顯著增強。對研究者和\u003Ca href=\"\u002Fnews\u002Fclaude-2026-limit-changes-capacity-story-zh\">產品\u003C\u002Fa>團隊來說，這意味著能力提升的路徑更多了，不必只盯著參數規模。\u003C\u002Fp>\u003Cul>\u003Cli>共同點：強預訓練基座 + 大規模強化學習\u003C\u002Fli>\u003Cli>目標：激發複雜推理\u003C\u002Fli>\u003Cli>啟示：後訓練能顯著改寫模型行為\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>5. 從單模型到多智能體：Kimi K2.5 Agent Swarm\u003C\u002Fh2>\u003Cp>\u003Ca href=\"https:\u002F\u002Fwww.kimi.com\u002F\">Kimi\u003C\u002Fa> 的 K2.5 \u003Ca href=\"\u002Ftag\u002Fagent\">Agent\u003C\u002Fa> Swarm 把測試時擴展推進到更高一層：不再只是單個模型一步步想，而是讓多個智能體並行協作。報告認為，這標誌著測試時 scaling 從串行推理擴展到並行智能體協同。\u003C\u002Fp>\u003Cp>這種架構更適合開放式、長鏈路、需要分工的任務，比如研究、規劃、複雜檢索和多約束決策。它的價值不只是更快，而是把「思考」拆成多個可並行的子過程，再由系統統一整合。\u003C\u002Fp>\u003Cul>\u003Cli>形態變化：單模型串行推理 → 多智能體並行協同\u003C\u002Fli>\u003Cli>適合場景：研究、規劃、長任務鏈\u003C\u002Fli>\u003Cli>系統收益：更強的任務分解與整合能力\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>怎麼挑\u003C\u002Fh2>\u003Cp>如果你在看模型底座，先看預訓練擴展；如果你在意難題上的答案品質，就看 o 系列和 R1 這類後訓練推理路線；如果你要做產品級系統，\u003Ca href=\"\u002Ftag\u002Fanthropic\">Anthropic\u003C\u002Fa> 式自適應思考預算更貼近工程現實；如果你在做複雜工作流或代理系統，K2.5 這種並行協同更值得參考。\u003C\u002Fp>\u003Cp>這份報告的結論很直接：今天的大\u003Ca href=\"\u002Fnews\u002Fnvidia-bets-big-on-ssi-ai-safety-core-zh\">模型競爭\u003C\u002Fa>，不再只看訓練前誰堆得更多，也要看測試時誰能把計算用得更聰明。\u003C\u002Fp>","4 條模型路線對照，幫你看懂測試時計算如何成為大模型擴展的第二核心維度。","zhuanlan.zhihu.com","https:\u002F\u002Fzhuanlan.zhihu.com\u002Fp\u002F2065855401434800906",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785718973968-9lhh.png","industry","zh","e746ff12-ac66-4bc2-9492-a33e2f921677",[17,18,19,20,21,22,23,24,25],"Kimi K3","test-time scaling","LLM 擴展","推理時計算","強化學習","多智能體","OpenAI o 系列","Anthropic","DeepSeek-R1",[27,28,29],"測試時計算已成為大模型擴展的第二核心維度。","推理能力可透過後訓練、思考預算與工具調用被放大。","多智能體協同把 scaling 從單模型推理推進到系統級協作。",0,"2026-08-03T01:02:29.540197+00:00","2026-08-03T01:02:29.516+00:00",{"tags":34,"relatedLang":35,"relatedPosts":39},[],{"id":15,"slug":36,"title":37,"language":38},"kimi-k3-test-time-scaling-rules-en","Kimi K3 maps the new rules of test-time scaling","en",[40,45,51,57,63,69],{"id":41,"slug":42,"title":43,"cover_image":11,"image_url":11,"created_at":44,"category":13},"e90c712a-4532-416a-8e07-05c01b39196b","ai-weekly-2026-w32-zh","AI 週報：2026-07-27 ~ 2026-08-03","2026-08-03T04:00:40.032678+00:00",{"id":46,"slug":47,"title":48,"cover_image":49,"image_url":49,"created_at":50,"category":13},"ae5612fc-67e3-4975-bfd4-a9e6ef1ef578","ai-gain-stock-liquidation-salp-postmortem-zh","SALP強平復盤：AI概念股崩盤鏈條","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785717178112-t1ep.png","2026-08-03T00:32:32.816008+00:00",{"id":52,"slug":53,"title":54,"cover_image":55,"image_url":55,"created_at":56,"category":13},"2dee0573-baea-4962-b170-95f9365a101e","claude-ai-testing-breaker-template-zh","Claude失控后给AI测试加断路器","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785715398005-vhxm.png","2026-08-03T00:02:54.796534+00:00",{"id":58,"slug":59,"title":60,"cover_image":61,"image_url":61,"created_at":62,"category":13},"701700cc-6aae-4aee-9659-c9666f95a758","x-posts-let-execs-shape-the-ai-story-zh","X 讓高層把故事寫進去","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785697388689-i0ne.png","2026-08-02T19:02:40.72518+00:00",{"id":64,"slug":65,"title":66,"cover_image":67,"image_url":67,"created_at":68,"category":13},"12b0dbbf-39d0-4f25-b28d-24afe44ed94e","jensen-huang-agi-definition-lowers-the-bar-zh","黃仁勳把 AGI 門檻說低了","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785695568811-1ssp.png","2026-08-02T18:32:23.82591+00:00",{"id":70,"slug":71,"title":72,"cover_image":73,"image_url":73,"created_at":74,"category":13},"fa174d34-4c90-4090-b688-91f387025abb","claude-2026-limit-changes-capacity-story-zh","Claude 的 2026 限額變動，本質上是容量故事，不是產品故事","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785693769239-einx.png","2026-08-02T18:02:24.874254+00:00",[76,81,86,91,96,101,106,111,116,121],{"id":77,"slug":78,"title":79,"created_at":80},"ee073da7-28b3-4752-a319-5a501459fb87","ai-in-2026-what-actually-matters-now-zh","2026 AI 真正重要的事","2026-03-26T07:09:12.008134+00:00",{"id":82,"slug":83,"title":84,"created_at":85},"83bd1795-8548-44c9-9a7e-de50a0923f71","trump-ai-framework-power-speech-state-preemption-zh","川普 AI 框架瞄準電力、言論與州權","2026-03-26T07:12:18.695466+00:00",{"id":87,"slug":88,"title":89,"created_at":90},"ea6be18b-c903-4e54-97b7-5f7447a612e0","nvidia-gtc-2026-big-ai-announcements-zh","NVIDIA GTC 2026 重點拆解","2026-03-26T07:14:26.62638+00:00",{"id":92,"slug":93,"title":94,"created_at":95},"4bcec76f-4c36-4daa-909f-54cd702f7c93","claude-users-spreading-out-and-getting-better-zh","Claude 用戶更分散，也更會用","2026-03-26T07:22:52.325888+00:00",{"id":97,"slug":98,"title":99,"created_at":100},"bd903b15-2473-4178-9789-b7557816e535","openclaw-raises-hard-question-for-ai-models-zh","OpenClaw 逼問 AI 模型價值","2026-03-26T07:24:54.707486+00:00",{"id":102,"slug":103,"title":104,"created_at":105},"eeac6b9e-ad9d-4831-8eec-8bba3f9bca6a","gap-google-gemini-checkout-fashion-search-zh","Gap 把結帳搬進 Gemini","2026-03-26T07:28:23.937768+00:00",{"id":107,"slug":108,"title":109,"created_at":110},"0740e53f-605d-4d57-8601-c10beb126f3c","google-pushes-gemini-transition-to-march-2026-zh","Google 把 Gemini 轉換延到 2026 年 3…","2026-03-26T07:30:12.825269+00:00",{"id":112,"slug":113,"title":114,"created_at":115},"e660d801-2421-4529-8fa9-86b82b066990","metas-llama-4-benchmark-scandal-gets-worse-zh","Meta Llama 4 分數風波又擴大","2026-03-26T07:34:21.156421+00:00",{"id":117,"slug":118,"title":119,"created_at":120},"183f9e7c-e143-40bb-a6d5-67ba84a3a8bc","accenture-mistral-ai-sovereign-enterprise-deal-zh","Accenture 攜手 Mistral AI 賣主權 AI","2026-03-26T07:38:14.818906+00:00",{"id":122,"slug":123,"title":124,"created_at":125},"191d9b1b-768a-478c-978c-dd7431a38149","mistral-ai-faces-its-hardest-year-yet-zh","Mistral AI 迎來最硬的一年","2026-03-26T07:40:23.716374+00:00"]