[IND] 3 分鐘閱讀OraCore 編輯部

Claude Opus 5 在行为审计里垫底?先看 4 款模型分数

4 款近期模型对比显示,Claude Opus 5 在自动化行为审计拿到 2.30 分,组内最低;这份清单帮你快速判断谁更稳、谁更弱。

分享 LinkedIn
Claude Opus 5 在行为审计里垫底?先看 4 款模型分数

Claude Opus 5 的自动化行为审计分数为什么这么低?

Claude Opus 5 在 Anthropic 的行为审计里拿到 2.30 分,低于同组其他近期模型

模型行为审计分数排名方向
Claude Opus 52.30越低越好
Claude Opus 4.82.85越低越好
Claude Mythos 52.81越低越好
Claude Sonnet 53.35越低越好

1. Claude Opus 5:这次拿到最低分

訂閱 AI 趨勢週報

每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。

不會寄垃圾信,隨時可取消。

在这份自动化行为审计里,Anthropic 的 Claude Opus 5 拿到 2.30 分,四个近期模型中最低。审计关注的不是回答好不好看,而是模型会不会欺骗用户、乱来,或被坏提示带偏。

Claude Opus 5 在行为审计里垫底?先看 4 款模型分数

因为这项指标是“越低越好”,所以 2.30 的含义很直接:它在这组测试中最稳。若你只想先抓一个结论,这份材料给出的信号就是 Opus 5 在行为风险上最占优。

  • 分数:2.30
  • 同组对比:Opus 4.8、Mythos 5、Sonnet 5
  • 指标方向:越低越好

2. Claude Opus 4.8:中上,但不是第一

Claude Opus 4.8 的分数是 2.85,落在 Opus 5 后面,但仍明显优于 Sonnet 5。放在同一套审计里,它属于中上区间,说明风险控制不差,只是没有拿到组内最佳。

如果你在意的是“别出大错”的稳定性,Opus 4.8 仍然是可读的参考对象;只是和 Opus 5 相比,它在这项测试里少了一点优势。

  • 分数:2.85
  • 与 Opus 5 差距:0.55 分
  • 位置:第二梯队偏前

3. Claude Mythos 5:和 Opus 4.8 很接近

Claude Mythos 5 的分数是 2.81,和 Opus 4.8 非常接近,只比后者略好一点。这样的结果说明,这组模型在行为审计上的差距并不夸张,更多像是横向筛选信号,而不是绝对分水岭。

Claude Opus 5 在行为审计里垫底?先看 4 款模型分数

换句话说,Mythos 5 不是“明显更强”,而是“略占便宜”。如果你要比较近期模型在风险控制上的细微差异,这个分数可以作为辅助依据。

Claude Mythos 5: 2.81

4. Claude Sonnet 5:组内最高分

Claude Sonnet 5 的分数是 3.35,在四个近期模型里最高。既然这项审计是越低越好,Sonnet 5 就代表在这份测试中,行为风险控制相对最弱。

这不等于它整体能力差,只能说明在这项自动化审计里,它没有拿到最好结果。对需要把模型放进真实流程的人来说,这种信号值得留意。

  • 分数:3.35
  • 组内位置:最高分
  • 解读:风险控制相对较弱

5. 这套行为审计在测什么

这类审计的重点,是把“会说话”与“会不会越界”分开看。Anthropic 的自动化行为审计会观察模型是否会欺骗用户、做出不当行为,或者被恶意提示诱导去做坏事。

对产品团队来说,这种指标很实用,因为它直接对应上线后的风险。它不能替代完整评测,但能先帮你筛出谁更不容易在压力场景里失控。

  • 是否欺骗用户
  • 是否会乱来
  • 是否会被坏提示带偏

哪种适合你

如果你最在意行为可靠性,这份数据优先看 Claude Opus 5,因为它在这组近期模型里拿到最低分。若你想看次一级对照,Claude Opus 4.8 和 Claude Mythos 5 都属于中间区间;Claude Sonnet 5 则是这组里最需要留意的对象。

更稳妥的读法,是把这项审计当成风险筛选,而不是最终裁判。它能告诉你谁在“别乱来”这件事上更占优,但不能单独决定模型是否适合你的场景。