Anthropic Frontier Red Team 测评 GLM-5.3 与 Claude Mythos Preview 的二进制漏洞利用能力
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准随机抽取的 100 个任务上测评多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。报告称这一水平已跨过明显门槛,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务上均未成功。