Simon Willison·· 4 天前AI 评分62
Anthropic 红队:GLM-5.3 与 Claude Mythos Preview 在二进制漏洞利用基准上的表现
Quoting Anthropic Frontier Red Team
AI 导读
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准中随机抽取 100 个任务评测多个模型,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。报告指出,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,说明某个有意义的门槛已被跨过。
来源:Simon Willison · simonwillison.net