[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-claude-opus-5-behavior-audit-lowest-score-zh":3,"article-related-claude-opus-5-behavior-audit-lowest-score-zh":31,"series-industry-29f74ed1-6812-470d-b4fb-88c0383fae6c":78},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":24,"views":28,"created_at":29,"published_at":30,"topic_cluster_id":11},"29f74ed1-6812-470d-b4fb-88c0383fae6c","claude-opus-5-behavior-audit-lowest-score-zh","Claude Opus 5 在行为审计里垫底？先看 4 款模型分数","\u003Cp>\u003Ca href=\"\u002Ftag\u002Fclaude\">Claude\u003C\u002Fa> Opus 5 的自动化行为审计分数为什么这么低？\u003C\u002Fp>\u003Cp data-speakable=\"summary\">Claude Opus 5 在 \u003Ca href=\"\u002Ftag\u002Fanthropic\">Anthropic\u003C\u002Fa> 的行为审计里拿到 2.30 分，低于同组其他近期\u003Ca href=\"\u002Fnews\u002Fmistral-ai-models-2026-builders-guide-zh\">模型\u003C\u002Fa>。\u003C\u002Fp>\u003Ctable>\u003Cthead>\u003Ctr>\u003Cth>模型\u003C\u002Fth>\u003Cth>行为审计分数\u003C\u002Fth>\u003Cth>排名方向\u003C\u002Fth>\u003C\u002Ftr>\u003C\u002Fthead>\u003Ctbody>\u003Ctr>\u003Ctd>Claude Opus 5\u003C\u002Ftd>\u003Ctd>2.30\u003C\u002Ftd>\u003Ctd>越低越好\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>Claude Opus 4.8\u003C\u002Ftd>\u003Ctd>2.85\u003C\u002Ftd>\u003Ctd>越低越好\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>Claude Mythos 5\u003C\u002Ftd>\u003Ctd>2.81\u003C\u002Ftd>\u003Ctd>越低越好\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd>Claude Sonnet 5\u003C\u002Ftd>\u003Ctd>3.35\u003C\u002Ftd>\u003Ctd>越低越好\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Ch2>1. Claude Opus 5：这次拿到最低分\u003C\u002Fh2>\u003Cp>在这份自动化行为审计里，\u003Ca href=\"https:\u002F\u002Fwww.anthropic.com\u002F\">Anthropic\u003C\u002Fa> 的 Claude Opus 5 拿到 2.30 分，四个近期模型中最低。审计关注的不是回答好不好看，而是模型会不会欺骗用户、乱来，或被坏\u003Ca href=\"\u002Fnews\u002F15-perplexity-prompts-better-research-decisions-zh\">提示\u003C\u002Fa>带偏。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785283371428-rlht.png\" alt=\"Claude Opus 5 在行为审计里垫底？先看 4 款模型分数\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>因为这项指标是“越低越好”，所以 2.30 的含义很直接：它在这组测试中最稳。若你只想先抓一个结论，这份材料给出的信号就是 Opus 5 在行为风险上最占优。\u003C\u002Fp>\u003Cul>\u003Cli>分数：2.30\u003C\u002Fli>\u003Cli>同组对比：Opus 4.8、Mythos 5、Sonnet 5\u003C\u002Fli>\u003Cli>指标方向：越低越好\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>2. Claude Opus 4.8：中上，但不是第一\u003C\u002Fh2>\u003Cp>Claude Opus 4.8 的分数是 2.85，落在 Opus 5 后面，但仍明显优于 Sonnet 5。放在同一套审计里，它属于中上区间，说明风险控制不差，只是没有拿到组内最佳。\u003C\u002Fp>\u003Cp>如果你在意的是“别出大错”的稳定性，Opus 4.8 仍然是可读的参考对象；只是和 Opus 5 相比，它在这项测试里少了一点优势。\u003C\u002Fp>\u003Cul>\u003Cli>分数：2.85\u003C\u002Fli>\u003Cli>与 Opus 5 差距：0.55 分\u003C\u002Fli>\u003Cli>位置：第二梯队偏前\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>3. Claude Mythos 5：和 Opus 4.8 很接近\u003C\u002Fh2>\u003Cp>\u003Ca href=\"\u002Ftag\u002Fclaude-mythos\">Claude Mythos\u003C\u002Fa> 5 的分数是 2.81，和 Opus 4.8 非常接近，只比后者略好一点。这样的结果说明，这组模型在行为审计上的差距并不夸张，更多像是横向筛选信号，而不是绝对分水岭。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785283370363-4cvp.png\" alt=\"Claude Opus 5 在行为审计里垫底？先看 4 款模型分数\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>换句话说，Mythos 5 不是“明显更强”，而是“略占便宜”。如果你要比较近期模型在风险控制上的细微差异，这个分数可以作为辅助依据。\u003C\u002Fp>\u003Ccode>Claude Mythos 5: 2.81\u003C\u002Fcode>\u003Ch2>4. Claude Sonnet 5：组内最高分\u003C\u002Fh2>\u003Cp>Claude Sonnet 5 的分数是 3.35，在四个近期模型里最高。既然这项审计是越低越好，Sonnet 5 就代表在这份测试中，行为风险控制相对最弱。\u003C\u002Fp>\u003Cp>这不等于它整体能力差，只能说明在这项自动化审计里，它没有拿到最好结果。对需要把模型放进真实流程的人来说，这种信号值得留意。\u003C\u002Fp>\u003Cul>\u003Cli>分数：3.35\u003C\u002Fli>\u003Cli>组内位置：最高分\u003C\u002Fli>\u003Cli>解读：风险控制相对较弱\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>5. 这套行为审计在测什么\u003C\u002Fh2>\u003Cp>这类审计的重点，是把“会说话”与“会不会越界”分开看。Anthropic 的自动化行为审计会观察模型是否会欺骗用户、做出不当行为，或者被恶意提示诱导去做坏事。\u003C\u002Fp>\u003Cp>对产品团队来说，这种指标很实用，因为它直接对应上线后的风险。它不能替代完整评测，但能先帮你筛出谁更不容易在压力场景里失控。\u003C\u002Fp>\u003Cul>\u003Cli>是否欺骗用户\u003C\u002Fli>\u003Cli>是否会乱来\u003C\u002Fli>\u003Cli>是否会被坏提示带偏\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>哪种适合你\u003C\u002Fh2>\u003Cp>如果你最在意行为可靠性，这份数据优\u003Ca href=\"\u002Fnews\u002Fgrok-imagine-odyssey-film-bet-zh\">先看\u003C\u002Fa> Claude Opus 5，因为它在这组近期模型里拿到最低分。若你想看次一级对照，Claude Opus 4.8 和 Claude Mythos 5 都属于中间区间；Claude Sonnet 5 则是这组里最需要留意的对象。\u003C\u002Fp>\u003Cp>更稳妥的读法，是把这项审计当成风险筛选，而不是最终裁判。它能告诉你谁在“别乱来”这件事上更占优，但不能单独决定模型是否适合你的场景。\u003C\u002Fp>","4 款近期模型对比显示，Claude Opus 5 在自动化行为审计拿到 2.30 分，组内最低；这份清单帮你快速判断谁更稳、谁更弱。","zhuanlan.zhihu.com","https:\u002F\u002Fzhuanlan.zhihu.com\u002Fp\u002F2064290264823379497",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785283371428-rlht.png","industry","zh","b76b6998-3bc6-4c39-abc4-eb2e8fd750a9",[17,18,19,20,21,22,23],"Claude Opus 5","Anthropic","行为审计","模型对比","AI 安全","Claude Sonnet 5","Claude Mythos 5",[25,26,27],"Claude Opus 5 在这份行为审计里拿到 2.30 分，是四个近期模型中最低。","Claude Opus 4.8 与 Claude Mythos 5 分数接近，属于中间区间。","Claude Sonnet 5 在这组里分数最高，表示这项审计中的风险控制相对较弱。",0,"2026-07-29T00:02:26.546468+00:00","2026-07-29T00:02:26.535+00:00",{"tags":32,"relatedLang":37,"relatedPosts":41},[33,35],{"name":18,"slug":34},"anthropic",{"name":21,"slug":36},"ai-安全",{"id":15,"slug":38,"title":39,"language":40},"claude-opus-5-lowest-safety-audit-score-en","Claude Opus 5 posts the lowest safety audit score","en",[42,48,54,60,66,72],{"id":43,"slug":44,"title":45,"cover_image":46,"image_url":46,"created_at":47,"category":13},"df697047-7a62-4e21-88db-1fdda708b31b","risc-v-is-a-real-platform-now-zh","RISC-V 已經不是玩具，而是該被正視的平台","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785294170857-f9z3.png","2026-07-29T03:02:23.203866+00:00",{"id":49,"slug":50,"title":51,"cover_image":52,"image_url":52,"created_at":53,"category":13},"c2bc78da-4c1e-4fa4-964d-1b5de331d0ff","nvidia-openai-250b-ai-backstop-talks-zh","Nvidia 與 OpenAI 的2500億美元賭局","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785286971622-hngm.png","2026-07-29T01:02:30.187766+00:00",{"id":55,"slug":56,"title":57,"cover_image":58,"image_url":58,"created_at":59,"category":13},"94f09858-0eaa-47b7-b539-80c0a31396d3","zhihu-fields-awards-roundtable-zh","知乎把菲尔兹奖熱度做成圓桌","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785241997935-nm5y.png","2026-07-28T12:32:51.926011+00:00",{"id":61,"slug":62,"title":63,"cover_image":64,"image_url":64,"created_at":65,"category":13},"5330b8e9-f7cc-407d-bfa0-daed93de78d4","anthropic-cognizant-claude-enterprise-expansion-zh","Anthropic 與 Cognizant 擴大 Claude 企業合作","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785240184603-cgqd.png","2026-07-28T12:02:32.95144+00:00",{"id":67,"slug":68,"title":69,"cover_image":70,"image_url":70,"created_at":71,"category":13},"831a3d74-121a-416b-bac3-386a3396e6fe","windsurf-cascade-agentic-ide-workflow-zh","Windsurf 讓 IDE 編輯變代理工作","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785225821727-odx3.png","2026-07-28T08:03:09.430675+00:00",{"id":73,"slug":74,"title":75,"cover_image":76,"image_url":76,"created_at":77,"category":13},"a777754e-65d8-4004-b5e7-b0e6c7388a6c","fuerteventura-2026-freestyle-crowned-two-winners-zh","Fuerteventura 2026 自由式決賽的 5 個重點","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1785223968165-g412.png","2026-07-28T07:32:19.836261+00:00",[79,84,89,94,99,104,109,114,119,124],{"id":80,"slug":81,"title":82,"created_at":83},"ee073da7-28b3-4752-a319-5a501459fb87","ai-in-2026-what-actually-matters-now-zh","2026 AI 真正重要的事","2026-03-26T07:09:12.008134+00:00",{"id":85,"slug":86,"title":87,"created_at":88},"83bd1795-8548-44c9-9a7e-de50a0923f71","trump-ai-framework-power-speech-state-preemption-zh","川普 AI 框架瞄準電力、言論與州權","2026-03-26T07:12:18.695466+00:00",{"id":90,"slug":91,"title":92,"created_at":93},"ea6be18b-c903-4e54-97b7-5f7447a612e0","nvidia-gtc-2026-big-ai-announcements-zh","NVIDIA GTC 2026 重點拆解","2026-03-26T07:14:26.62638+00:00",{"id":95,"slug":96,"title":97,"created_at":98},"4bcec76f-4c36-4daa-909f-54cd702f7c93","claude-users-spreading-out-and-getting-better-zh","Claude 用戶更分散，也更會用","2026-03-26T07:22:52.325888+00:00",{"id":100,"slug":101,"title":102,"created_at":103},"bd903b15-2473-4178-9789-b7557816e535","openclaw-raises-hard-question-for-ai-models-zh","OpenClaw 逼問 AI 模型價值","2026-03-26T07:24:54.707486+00:00",{"id":105,"slug":106,"title":107,"created_at":108},"eeac6b9e-ad9d-4831-8eec-8bba3f9bca6a","gap-google-gemini-checkout-fashion-search-zh","Gap 把結帳搬進 Gemini","2026-03-26T07:28:23.937768+00:00",{"id":110,"slug":111,"title":112,"created_at":113},"0740e53f-605d-4d57-8601-c10beb126f3c","google-pushes-gemini-transition-to-march-2026-zh","Google 把 Gemini 轉換延到 2026 年 3…","2026-03-26T07:30:12.825269+00:00",{"id":115,"slug":116,"title":117,"created_at":118},"e660d801-2421-4529-8fa9-86b82b066990","metas-llama-4-benchmark-scandal-gets-worse-zh","Meta Llama 4 分數風波又擴大","2026-03-26T07:34:21.156421+00:00",{"id":120,"slug":121,"title":122,"created_at":123},"183f9e7c-e143-40bb-a6d5-67ba84a3a8bc","accenture-mistral-ai-sovereign-enterprise-deal-zh","Accenture 攜手 Mistral AI 賣主權 AI","2026-03-26T07:38:14.818906+00:00",{"id":125,"slug":126,"title":127,"created_at":128},"191d9b1b-768a-478c-978c-dd7431a38149","mistral-ai-faces-its-hardest-year-yet-zh","Mistral AI 迎來最硬的一年","2026-03-26T07:40:23.716374+00:00"]