[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-qwen38-max-is-built-for-delivery-not-chat-zh":3,"article-related-qwen38-max-is-built-for-delivery-not-chat-zh":30,"series-model-release-8b6f5cee-1836-4999-b4ae-7e30d74c4799":73},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":23,"views":27,"created_at":28,"published_at":29,"topic_cluster_id":11},"8b6f5cee-1836-4999-b4ae-7e30d74c4799","qwen38-max-is-built-for-delivery-not-chat-zh","Qwen3.8-Max不是更会聊天，而是更会交付","\u003Cp data-speakable=\"summary\">2.4万亿参数的Qwen3.8-Max把重点放在\u003Ca href=\"\u002Fnews\u002Fai-jiedan-zuo-tushengtu-fuye-shizhan-liucheng-zh\">交付\u003C\u002Fa>，而不是聊天。\u003C\u002Fp>\u003Cp>Qwen3.8-Max最值得重视的，不是它又一次刷新\u003Ca href=\"\u002Fnews\u002Fonepot-bench-0-lab-aware-chemistry-benchmarks-zh\">模型\u003C\u002Fa>规模，而是它把“模型能不能真正把事做完”推到了前台：从代码项目、论文复现，到办公流、量化研究、芯片设计和电商经营，它都强调端到端完成，而不是停留在答题和补全。\u003C\u002Fp>\u003Ch2>第一，真正的竞争已经从“会不会”转向“能不能做完”\u003C\u002Fh2>\u003Cp>在编程场景里，这个变化最明显。官方给出的案例不是简单代码题，而是从空文件夹起步，独立搭建一个自进化 harness 项目，连续运行约16天，留下265次 commits、127个 PR 和151个 issues。重点不在热闹，而在它说明\u003Ca href=\"\u002Fnews\u002Fkimi-k3-jiu-kai-shi-gei-zi-ji-da-gong-liao-zh\">模型\u003C\u002Fa>已经能在真实软件工程节奏里持续推进，而不是一次性生成一段看起来正确的代码。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785844982253-8ssv.png\" alt=\"Qwen3.8-Max不是更会聊天，而是更会交付\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>论文复现的案例更能说明问题。Qwen3.8-Max在约125小时里，从零写出训练和评测流水线，复现《Unified Data Selection for \u003Ca href=\"\u002Ftag\u002Fllm\">LLM\u003C\u002Fa> Reasoning》的六项主要结论，并在后续88小时里继续做假设、写代码、跑\u003Ca href=\"\u002Ftag\u002Fgpu\">GPU\u003C\u002Fa>、分析结果，最终在AIME24上再提升2.7分。真正重要的不是“跑得久”，而是它能把研究工作拆成连续闭环，并在闭环里找到更好的方案。\u003C\u002Fp>\u003Ch2>第二，办公与Agent能力的关键，不是单点聪明，而是稳定的系统性\u003C\u002Fh2>\u003Cp>Qwen3.8-Max之所以在办公任务上被强调，是因为它面对的不是单一文本，而是混合了文档、截图、页面、日志和工具调用的复杂工作流。官方把环境拆成任务、工作空间、工具链三个维度，再配合统一奖励系统和在线数据均衡器，本质上是在解决一个老问题：模型不是缺一次灵感，而是缺在多样环境里持续拿到一致反馈的能力。\u003C\u002Fp>\u003Cp>这套思路的价值也体现在它覆盖的主流 harness 上。QwenWork、\u003Ca href=\"\u002Ftag\u002Fclaude-code\">Claude Code\u003C\u002Fa>、\u003Ca href=\"\u002Ftag\u002Fcodex\">Codex\u003C\u002Fa>、\u003Ca href=\"\u002Ftag\u002Fopenclaw\">OpenClaw\u003C\u002Fa>、Hermes 等工具链并不只是展示名单，它们代表的是不同工作流、不同约束和不同验收方式。Qwen3.8-Max在这些环境里被描述为“干得广，也干得好”，说明它不只是会某一种接口，而是把任务理解、执行、验证和修正连成了稳定链路。\u003C\u002Fp>\u003Ch2>第三，长程任务才是分水岭，短回答没有资格定义前沿模型\u003C\u002Fh2>\u003Cp>如果说编程和办公体现的是广度，那么长程任务体现的就是模型是否真的具备系统级自主规划能力。芯片设计案例里，Qwen3.8-Max在没有参考设计和人工干预的条件下，经过约500轮交互、71次评估、13个关键里程碑，把一个GCD\u002FRSA加速器从8,298门优化到678门。这个跨度说明它不只是“生成设计”，而是在持续重构设计。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785844979018-mqga.png\" alt=\"Qwen3.8-Max不是更会聊天，而是更会交付\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>电商经营基准则进一步证明它不是只会在静态题目里表现好。模型在365天经营模拟中拿着¥100,000启动资金，独立完成选品、议价、库存、定价和退货处理，最终总现金达到¥416,252，较第二名高出38%。这类结果的意义很直接：模型已经开始在动态环境里学习，并把早期反馈转化为后续收益。\u003C\u002Fp>\u003Ch2>反方可能怎么说\u003C\u002Fh2>\u003Cp>最强的反对意见很简单：这些案例都来自厂商自述，天然带有筛选和展示偏差。再强的模型，也可能只是在特定基准、特定工具链和特定提示词下表现出色，一旦换成真实企业环境，权限、脏数据、异常流程和跨团队协作就会把它拉回原形。更现实一点说，很多“自主完成”其实仍然依赖预先搭好的沙箱、评测器和奖励函数。\u003C\u002Fp>\u003Cp>这个质疑成立，但它并不能推翻Qwen3.8-Max的核心进步。今天最重要的不是某一次演示是否完美，而是模型是否已经从“回答问题”进入“持续交付”的能力区间。哪怕沙箱和基准是受控的，只要它能在长链路任务里稳定完成计划、执行、验证和修正，就说明能力边界已经从单轮生成推进到可用的代理式工作流。\u003C\u002Fp>\u003Cp>换句话说，批评者抓住的是“外推要谨慎”，而Qwen3.8-Max展示的是“内功已经成型”。厂商叙事当然不能直接等于生产力，但当它同时覆盖编程、办公、科研、视觉和长程经营，并且在多个公开或半公开 harness 中给出一致提升时，结论就不该是怀疑一切，而是承认这类模型已经具备进入真实工作流的资格。\u003C\u002Fp>\u003Ch2>你能做什么\u003C\u002Fh2>\u003Cp>如果你是工程师，不要把这类模型当成聊天机器人，而要把它当成会写、会跑、会修的初级协作者：把任务切成可验证的小闭环，强制它输出代码、测试、日志和复盘；如果你是PM，就该优先设计能被工具执行和自动验收的工作流，而不是只追求“看起来聪明”的演示；如果你是创始人，应该把预算投向那些能让模型在真实环境里持续反馈、持续改进的系统，因为下一轮竞争比的不是单次生成质量，而是谁先把AI变成真正的交付机器。\u003C\u002Fp>","Qwen3.8-Max的价值不在对话感，而在更少人工介入下完成编程、办公与长程交付。","zhuanlan.zhihu.com","https:\u002F\u002Fzhuanlan.zhihu.com\u002Fp\u002F2067570518102905363",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785844982253-8ssv.png","model-release","zh","ff8312eb-e6ac-4bbc-85d5-38844a1c1964",[17,18,19,20,21,22],"Qwen3.8-Max","代理式工作流","长程任务","软件工程","办公自动化","交付能力",[24,25,26],"模型竞争焦点正在从会答题转向能否把任务真正做完。","Qwen3.8-Max的优势在长链路执行、验证与修正，而非聊天感。","工程、PM、创办人都应把AI系统设计成可验证、可交付的工作流。",1,"2026-08-04T12:02:31.629566+00:00","2026-08-04T12:02:31.606+00:00",{"tags":31,"relatedLang":32,"relatedPosts":36},[],{"id":15,"slug":33,"title":34,"language":35},"qwen38-max-agentic-work-real-frontier-en","Qwen3.8-Max proves that agentic work is the real frontier","en",[37,43,49,55,61,67],{"id":38,"slug":39,"title":40,"cover_image":41,"image_url":41,"created_at":42,"category":13},"eb11e3d7-1b4a-4458-af9e-ea2e31ddc854","google-earth-image-generation-wrong-bet-zh","谷歌不该把图像生成塞进地球浏览器","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785805370695-9jtp.png","2026-08-04T01:02:29.602167+00:00",{"id":44,"slug":45,"title":46,"cover_image":47,"image_url":47,"created_at":48,"category":13},"fb1f9ca1-8802-4901-935b-1a1d5ae41f59","try-claude-opus-4-7-benchmarks-safety-zh","Claude Opus 4.7 基準與安全檢查清單","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785720758596-foj1.png","2026-08-03T01:32:20.536712+00:00",{"id":50,"slug":51,"title":52,"cover_image":53,"image_url":53,"created_at":54,"category":13},"af7c62ff-db44-4ed0-a37d-06c1075be3da","opus-5-cut-cost-without-losing-quality-zh","Opus 5 讓你降成本不降品質","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785607383846-0d63.png","2026-08-01T18:02:40.319298+00:00",{"id":56,"slug":57,"title":58,"cover_image":59,"image_url":59,"created_at":60,"category":13},"39170c12-7e99-4fb8-aebc-d4f155953b6f","openai-cuts-gpt-56-prices-ai-bills-zh","OpenAI 降價 GPT-5.6，AI 成本戰升溫","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785542570368-7qsi.png","2026-08-01T00:02:27.913994+00:00",{"id":62,"slug":63,"title":64,"cover_image":65,"image_url":65,"created_at":66,"category":13},"5c2585a3-075b-460e-a94c-8074cef9fd5c","opus-5-anthropic-pricing-declaration-zh","Opus 5 不是便宜替代品，而是 Anthropic 的定价宣言","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785499377637-rvq1.png","2026-07-31T12:02:29.120933+00:00",{"id":68,"slug":69,"title":70,"cover_image":71,"image_url":71,"created_at":72,"category":13},"7f3ab4f9-0379-43be-bec5-cfcecadb2c16","openai-free-gpt56-access-scientists-zh","OpenAI免費開放GPT-5.6給科學家","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785434587853-kd60.png","2026-07-30T18:02:38.330087+00:00",[74,79,84,89,94,99,104,109,114,119],{"id":75,"slug":76,"title":77,"created_at":78},"58b64033-7eb6-49b9-9aab-01cf8ae1b2f2","nvidia-rubin-six-chips-one-ai-supercomputer-zh","NVIDIA Rubin 把六顆晶片塞進 AI 機櫃","2026-03-26T07:18:45.861277+00:00",{"id":80,"slug":81,"title":82,"created_at":83},"0dcc2c61-c2a6-480d-adb8-dd225fc68914","march-2026-ai-model-news-what-mattered-zh","2026 年 3 月 AI 模型新聞重點","2026-03-26T07:32:08.386348+00:00",{"id":85,"slug":86,"title":87,"created_at":88},"214ab08b-5ce5-4b5c-8b72-47619d8675dd","why-small-models-are-winning-on-device-ai-zh","小模型為何吃下裝置端 AI","2026-03-26T07:36:30.488966+00:00",{"id":90,"slug":91,"title":92,"created_at":93},"785624b2-0355-4b82-adc3-de5e45eecd88","midjourney-v8-faster-images-higher-costs-zh","Midjourney V8 變快了，也變貴了","2026-03-26T07:52:03.562971+00:00",{"id":95,"slug":96,"title":97,"created_at":98},"9e1044b4-946d-47fe-9e2a-c2ee032e1164","xiaomi-mimo-v2-pro-1t-moe-agents-zh","小米 MiMo-V2-Pro 登場：1T MoE 模型","2026-03-28T03:06:19.002353+00:00",{"id":100,"slug":101,"title":102,"created_at":103},"c4b6186f-bd84-4598-997e-c6e31d543c0d","cursor-composer-2-agentic-coding-model-zh","Cursor Composer 2 走向代理式寫碼","2026-03-28T03:13:06.422716+00:00",{"id":105,"slug":106,"title":107,"created_at":108},"e112e76f-ec3b-408f-810e-e93ae21a888a","apple-siri-gemini-distilled-models-zh","Apple Siri 牽手 Gemini 的真相","2026-03-29T04:52:57.886544+00:00",{"id":110,"slug":111,"title":112,"created_at":113},"c679b51f-194a-463b-87fc-7695256ff752","mimo-v2-pro-vs-omni-vs-flash-2026-zh","MiMo V2 Pro、Omni、Flash 怎麼選","2026-04-02T01:18:43.576128+00:00",{"id":115,"slug":116,"title":117,"created_at":118},"3b988fd7-6749-4f01-ba25-c0ad7486dc31","z-ai-glm-5v-turbo-design2code-claude-zh","GLM-5V-Turbo 在 Design2Code 贏了…","2026-04-02T04:03:36.31741+00:00",{"id":120,"slug":121,"title":122,"created_at":123},"975a7aef-030e-41a6-9401-1c6a342be68e","april-2026-ai-model-releases-zh","2026年4月 AI 模型更新追蹤","2026-04-02T08:45:33.308563+00:00"]