[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-claude-kimi-multimodal-benchmark-2026-08-zh":3,"article-related-claude-kimi-multimodal-benchmark-2026-08-zh":32,"series-model-release-d6e0d4ac-1b63-4296-9d7a-8a6552b5f21f":78},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":25,"views":29,"created_at":30,"published_at":31,"topic_cluster_id":11},"d6e0d4ac-1b63-4296-9d7a-8a6552b5f21f","claude-kimi-multimodal-benchmark-2026-08-zh","Claude 文本領先，Kimi 編碼更強","\u003Cp data-speakable=\"summary\">8 月大模型榜單顯示，\u003Ca href=\"\u002Ftag\u002Fclaude\">Claude\u003C\u002Fa> 在文本能力領先，Kimi 在編碼表現更強，多模態模型也在快速整合語音、圖像與文字。\u003C\u002Fp>\u003Cp>這份 2026 年 8 月的大模型觀察，結論很直白：\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\" target=\"_blank\" rel=\"noopener\">Anthropic\u003C\u002Fa> 仍守住文本高位，\u003Ca href=\"https:\u002F\u002Fwww.kimi.com\" target=\"_blank\" rel=\"noopener\">Kimi\u003C\u002Fa> 在編碼賽道更亮眼，而多模態模型正在把圖像、語音、文字放進同一個工作流。頭部排名沒有大洗牌，但分差正在縮小，這比單次名次更有意思。\u003C\u002Fp>\u003Cp>如果把時間拉長看，這代表閉源模型的競爭重心已經變了。現在比的不是誰只贏一項，而是誰能在更多場景裡穩住第一梯隊。對開發者來說，真正重要的是模型能不能連續完成多種任務，而不是只在榜單上好看。\u003C\u002Fp>\u003Ctable>\u003Cthead>\u003Ctr>\u003Cth>維度\u003C\u002Fth>\u003Cth>榜單觀察\u003C\u002Fth>\u003Cth>代表模型\u003C\u002Fth>\u003Cth>時間線\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd>文本\u003C\u002Ftd>\u003Ctd>Anthropic 系輪流領先\u003C\u002Ftd>\u003Ctd>Opus 4.6 \u002F 4.7、Fable 5、Opus 5\u003C\u002Ftd>\u003Ctd>6 月到 7 月\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>文本對手\u003C\u002Ftd>\u003Ctd>穩定貼近頭部\u003C\u002Ftd>\u003Ctd>GPT-5.5 Pro、Gemini 3.1 Pro\u003C\u002Ftd>\u003Ctd>長期在 1500 線附近\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>編碼\u003C\u002Ftd>\u003Ctd>Kimi 位置更強\u003C\u002Ftd>\u003Ctd>Kimi 系模型\u003C\u002Ftd>\u003Ctd>8 月觀察\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>多模態\u003C\u002Ftd>\u003Ctd>進入全模態階段\u003C\u002Ftd>\u003Ctd>圖像、語音、文字整合\u003C\u002Ftd>\u003Ctd>8 月觀察\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Ch2>文本榜第一群，還是那幾家在打\u003C\u002Fh2>\u003Cp>這次觀察最清楚的一點，是文本榜頭部沒有被新玩家徹底改寫。\u003Ca href=\"\u002Ftag\u002Fanthropic\">Anthropic\u003C\u002Fa> 內部模型在 6 月到 7 月之間輪流拿高位，從 Opus 4.6、\u003Ca href=\"\u002Ftag\u002Fopus-47\">Opus 4.7\u003C\u002Fa>，到 Fable 5、Opus 5，都顯示它在文本理解和生成這條線上維持很強的延續性。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786473205481-pcsz.png\" alt=\"Claude 文本領先，Kimi 編碼更強\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這種輪換很關鍵。它代表領先不再只靠某一個模型，而是靠整套訓練、對齊和產品迭代能力。換句話說，使用者感受到的不是一次發表很強，而是這個\u003Ca href=\"\u002Fnews\u002Fanthropic-builds-in-house-chip-team-claude-zh\">團隊\u003C\u002Fa>持續把文本能力往上推。\u003C\u002Fp>\u003Cp>\u003Ca href=\"https:\u002F\u002Fopenai.com\" target=\"_blank\" rel=\"noopener\">OpenAI\u003C\u002Fa> 的 GPT-5.5 Pro 和 \u003Ca href=\"https:\u002F\u002Fdeepmind.google\" target=\"_blank\" rel=\"noopener\">Google DeepMind\u003C\u002Fa> 的 Gemini 3.1 Pro 也沒有掉出第一梯隊太遠，長期貼著 1500 線附近跑。這個位置很擠，也很說明問題：頭部閉源模型之間的差距正在縮小，誰都很難再靠一代模型把對手拉開好幾個身位。\u003C\u002Fp>\u003Cul>\u003Cli>Anthropic 系模型在文本榜上輪流占優\u003C\u002Fli>\u003Cli>OpenAI 和 Google DeepMind 緊跟在頭部附近\u003C\u002Fli>\u003Cli>頭部競爭更像細節優化，而不是代際碾壓\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>Kimi 在編碼賽道更像一把利刀\u003C\u002Fh2>\u003Cp>編碼榜的情況和文本榜不太一樣。Kimi 在程式碼能力上的表現更強，表示它在程式生成、程式理解和除錯輔助這些任務裡，更貼近開發者的真實需求。對工程團隊來說，這種差異比「誰的通用分數高一點」更有意義。\u003C\u002Fp>\u003Cp>因為程式模型最後要落到 IDE、CI、\u003Ca href=\"\u002Fnews\u002Fclaude-code-5-alternatives-2026-08-zh\">code\u003C\u002Fa> review 和自動修 bug 這些場景。只要模型寫錯 API、漏掉邊界條件，或者在複雜倉庫裡迷路，分數再漂亮也沒用。編碼賽道很現實，錯一行就會被測試打臉。\u003C\u002Fp>\u003Cblockquote>“The model is the product.” — Sam Altman, OpenAI DevDay 2023 keynote\u003C\u002Fblockquote>\u003Cp>這句話放到今天還是貼切，但要補一層現實版解釋：對開發者來說，模型不是抽象分數，而是能不能少改幾輪程式、少查幾次文件、少在測試裡踩坑。編碼能力一旦穩定領先，產品黏性通常會比通用聊天更強。\u003C\u002Fp>\u003Cp>如果把編碼和文本放在一起看，分工就很清楚。文本能力決定模型能不能理解複雜意圖，編碼能力決定它能不能把意圖變成可執行的東西。這也是為什麼很多團隊會同時看兩個榜，而不是只盯總分。\u003C\u002Fp>\u003Cul>\u003Cli>文本能力偏理解、摘要和長上下文處理\u003C\u002Fli>\u003Cli>編碼能力偏可執行性和錯誤修正\u003C\u002Fli>\u003Cli>對開發者來說，後者通常更接近日常工作流\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>多模態正在從能看圖，走向全模態\u003C\u002Fh2>\u003Cp>這次最值得記住的詞，是全模態。意思很直接：模型不再只是把圖像、語音、文字當成獨立輸入，而是開始放進同一套推理和互動框架裡處理。對使用者來說，這表示你可以更自然地讓模型聽一句話、看一張圖，再輸出一段可執行建議。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786473193238-shdp.png\" alt=\"Claude 文本領先，Kimi 編碼更強\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這一步看起來像能力擴張，其實更像互動方式的重寫。以前很多多模態產品只是加了圖片輸入，現在更接近「輸入本來就應該是多種形式」。一旦模型能在這些模態之間來回切換，很多原本要拆成多個工具完成的任務，就能壓縮到一次對話裡。\u003C\u002Fp>\u003Cp>從產業角度看，這會直接影響產品設計。做筆記、做客服、做內容審核、做程式碼審查的團隊，都會更在意模型能不能同時處理截圖、語音說明和文字上下文，而不是只看單一模態分數。\u003Ca href=\"\u002Fnews\u002Fmultimodal-ai-trends-2026\" target=\"_blank\" rel=\"noopener\">我們之前整理的多模態趨勢\u003C\u002Fa>也提過，真正的競爭點已經從「支援什麼輸入」轉向「能不能把輸入串起來」。\u003C\u002Fp>\u003Ch2>頭部格局沒變，差距在縮小\u003C\u002Fh2>\u003Cp>這篇觀察裡最穩的一條判斷，是閉源三強的主導地位還在，但彼此之間的縫隙變小了。Anthropic、\u003Ca href=\"\u002Ftag\u002Fopenai\">OpenAI\u003C\u002Fa>、\u003Ca href=\"\u002Ftag\u002Fgoogle-deepmind\">Google DeepMind\u003C\u002Fa> 仍然占據主導位置，只是現在很難說誰能長期把對手甩開。每一家的新模型都在補短板，結果就是榜單更像一條擠得很緊的高分帶。\u003C\u002Fp>\u003Cp>這對企業用戶其實是好事。頭部模型差距越小，採購和切換成本就越容易被功能、價格、延遲和合規要求決定，而不是被某個單點分數決定。對開發者來說，選模型時也要更具體：你要的是最強文本，還是更好的程式，還是能把圖像和語音一起處理的工作流引擎。\u003C\u002Fp>\u003Cul>\u003Cli>文本第一群仍由 Anthropic、OpenAI、Google DeepMind 主導\u003C\u002Fli>\u003Cli>編碼賽道更容易出現單項優勢\u003C\u002Fli>\u003Cli>多模態競爭正在把模型邊界抹平\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>這波競爭背後，其實是產品入口之爭\u003C\u002Fh2>\u003Cp>大模型榜單看起來像分數\u003Ca href=\"\u002Fnews\u002Fdoubao-one-hour-flash-game-collection-zh\">遊戲\u003C\u002Fa>，但真正打的是入口。誰能先進到開發者的 IDE，誰能先進到企業的客服系統，誰能先進到內容生產流程，誰就更容易把模型能力變成日常使用習慣。這也是為什麼編碼和多模態都變得重要，因為它們都更接近工作現場。\u003C\u002Fp>\u003Cp>從歷史脈絡看，LLM 的競爭已經走過「能不能聊天」和「能不能推理」兩個階段。現在進入的是「能不能穩定完成任務」階段。這一階段很無聊，也很殘酷，因為它不吃華麗展示，只吃穩定、延遲、成本和整合能力。\u003C\u002Fp>\u003Cp>如果 2026 年下半年榜單繼續沿著這條線走，接下來最值得盯的不是誰又拿第一，而是誰能把第一做成可用產品。真正決定市場份額的，可能不是一次榜單跳升，而是模型能否在文本、程式和多模態互動裡同時維持穩定表現。\u003C\u002Fp>\u003Ch2>接下來該看什麼\u003C\u002Fh2>\u003Cp>我會先盯兩件事。第一，是 Kimi 的編碼優勢能不能延伸到更長上下文和更複雜倉庫。第二，是 Anthropic 能不能把文本領先轉成更完整的產品體驗，而不只是榜單上的高分。\u003C\u002Fp>\u003Cp>如果你是開發者，下一次選型時可以直接問一個很實際的問題：這模型在你的主任務裡，是能省 10 分鐘，還是能省一整輪返工？這個答案，通常比名次更誠實。\u003C\u002Fp>","8 月大模型榜單顯示，Claude 在文本能力領先，Kimi 在編碼表現更強，多模態模型也在快速整合語音、圖像與文字。","zhuanlan.zhihu.com","https:\u002F\u002Fzhuanlan.zhihu.com\u002Fp\u002F2068902612842328752",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786473205481-pcsz.png","model-release","zh","ba2f9faf-d709-4570-b835-5e4450aa7fce",[17,18,19,20,21,22,23,24],"Claude","Kimi","大模型榜單","編碼模型","多模態模型","Anthropic","OpenAI","Google DeepMind",[26,27,28],"Anthropic 仍在文本能力保持領先，且是多個模型輪流占位。","Kimi 在編碼賽道表現更強，對開發者工作流更有直接價值。","多模態正在走向全模態，模型競爭重心轉向任務完成度。",1,"2026-08-11T18:32:47.271125+00:00","2026-08-11T18:32:47.243+00:00",{"tags":33,"relatedLang":37,"relatedPosts":41},[34,35],{"name":21,"slug":21},{"name":17,"slug":36},"claude",{"id":15,"slug":38,"title":39,"language":40},"august-2026-model-rankings-claude-kimi-en","August 2026 model rankings: Claude leads text, Kimi coding","en",[42,48,54,60,66,72],{"id":43,"slug":44,"title":45,"cover_image":46,"image_url":46,"created_at":47,"category":13},"1299c9a0-be8c-4b31-a0dc-0c9164cf1099","qwen38-max-alibaba-pricing-and-performance-zh","Qwen3.8-Max 把價格壓下來了","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786149189506-m2ez.png","2026-08-08T00:32:52.987339+00:00",{"id":49,"slug":50,"title":51,"cover_image":52,"image_url":52,"created_at":53,"category":13},"8b6f5cee-1836-4999-b4ae-7e30d74c4799","qwen38-max-is-built-for-delivery-not-chat-zh","Qwen3.8-Max不是更会聊天，而是更会交付","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785844982253-8ssv.png","2026-08-04T12:02:31.629566+00:00",{"id":55,"slug":56,"title":57,"cover_image":58,"image_url":58,"created_at":59,"category":13},"eb11e3d7-1b4a-4458-af9e-ea2e31ddc854","google-earth-image-generation-wrong-bet-zh","谷歌不该把图像生成塞进地球浏览器","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785805370695-9jtp.png","2026-08-04T01:02:29.602167+00:00",{"id":61,"slug":62,"title":63,"cover_image":64,"image_url":64,"created_at":65,"category":13},"fb1f9ca1-8802-4901-935b-1a1d5ae41f59","try-claude-opus-4-7-benchmarks-safety-zh","Claude Opus 4.7 基準與安全檢查清單","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785720758596-foj1.png","2026-08-03T01:32:20.536712+00:00",{"id":67,"slug":68,"title":69,"cover_image":70,"image_url":70,"created_at":71,"category":13},"af7c62ff-db44-4ed0-a37d-06c1075be3da","opus-5-cut-cost-without-losing-quality-zh","Opus 5 讓你降成本不降品質","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785607383846-0d63.png","2026-08-01T18:02:40.319298+00:00",{"id":73,"slug":74,"title":75,"cover_image":76,"image_url":76,"created_at":77,"category":13},"39170c12-7e99-4fb8-aebc-d4f155953b6f","openai-cuts-gpt-56-prices-ai-bills-zh","OpenAI 降價 GPT-5.6，AI 成本戰升溫","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785542570368-7qsi.png","2026-08-01T00:02:27.913994+00:00",[79,84,89,94,99,104,109,114,119,124],{"id":80,"slug":81,"title":82,"created_at":83},"58b64033-7eb6-49b9-9aab-01cf8ae1b2f2","nvidia-rubin-six-chips-one-ai-supercomputer-zh","NVIDIA Rubin 把六顆晶片塞進 AI 機櫃","2026-03-26T07:18:45.861277+00:00",{"id":85,"slug":86,"title":87,"created_at":88},"0dcc2c61-c2a6-480d-adb8-dd225fc68914","march-2026-ai-model-news-what-mattered-zh","2026 年 3 月 AI 模型新聞重點","2026-03-26T07:32:08.386348+00:00",{"id":90,"slug":91,"title":92,"created_at":93},"214ab08b-5ce5-4b5c-8b72-47619d8675dd","why-small-models-are-winning-on-device-ai-zh","小模型為何吃下裝置端 AI","2026-03-26T07:36:30.488966+00:00",{"id":95,"slug":96,"title":97,"created_at":98},"785624b2-0355-4b82-adc3-de5e45eecd88","midjourney-v8-faster-images-higher-costs-zh","Midjourney V8 變快了，也變貴了","2026-03-26T07:52:03.562971+00:00",{"id":100,"slug":101,"title":102,"created_at":103},"9e1044b4-946d-47fe-9e2a-c2ee032e1164","xiaomi-mimo-v2-pro-1t-moe-agents-zh","小米 MiMo-V2-Pro 登場：1T MoE 模型","2026-03-28T03:06:19.002353+00:00",{"id":105,"slug":106,"title":107,"created_at":108},"c4b6186f-bd84-4598-997e-c6e31d543c0d","cursor-composer-2-agentic-coding-model-zh","Cursor Composer 2 走向代理式寫碼","2026-03-28T03:13:06.422716+00:00",{"id":110,"slug":111,"title":112,"created_at":113},"e112e76f-ec3b-408f-810e-e93ae21a888a","apple-siri-gemini-distilled-models-zh","Apple Siri 牽手 Gemini 的真相","2026-03-29T04:52:57.886544+00:00",{"id":115,"slug":116,"title":117,"created_at":118},"c679b51f-194a-463b-87fc-7695256ff752","mimo-v2-pro-vs-omni-vs-flash-2026-zh","MiMo V2 Pro、Omni、Flash 怎麼選","2026-04-02T01:18:43.576128+00:00",{"id":120,"slug":121,"title":122,"created_at":123},"3b988fd7-6749-4f01-ba25-c0ad7486dc31","z-ai-glm-5v-turbo-design2code-claude-zh","GLM-5V-Turbo 在 Design2Code 贏了…","2026-04-02T04:03:36.31741+00:00",{"id":125,"slug":126,"title":127,"created_at":128},"975a7aef-030e-41a6-9401-1c6a342be68e","april-2026-ai-model-releases-zh","2026年4月 AI 模型更新追蹤","2026-04-02T08:45:33.308563+00:00"]