跳到正文
今天10月5日周一1 条
10月4日周日
9月30日周三
  1. Simon Willison65

    Anthropic Frontier Red Team 测评 GLM-5.3 与 Claude Mythos Preview 的二进制漏洞利用能力

    Anthropic Frontier Red Team 在内部 Binary Exploitation 基准随机抽取的 100 个任务上测评多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。报告称这一水平已跨过明显门槛,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务上均未成功。

9月29日周二
9月17日周四
8月27日周四
6月16日周二
  1. Google DeepMind63

    Google DeepMind 发布 AI Control Roadmap 智能体安全框架

    Google DeepMind 发布 AI Control Roadmap 框架,用纵深防御方式管理内部部署的先进 AI 智能体,并同步发布面向政策制定者的技术框架 Three Layers of Agent Security。

    推荐理由:原文给出把不可信智能体视作内部威胁的整套做法,以及按模型能力分级的检测与响应指标,对建设智能体安全体系有直接参考价值。