跳到正文
今天10月5日周一1 条
10月4日周日
10月3日周六
10月2日周五
  1. TechCrunch · AI58

    教皇 Leo XIV 批评 AI 生成艺术,呼吁保护人类艺术

    教皇 Leo XIV 在 X 上发帖指出,在人工智能时代区分人类艺术与机器产物正变得紧迫,两者甚至在美学之前就存在本体论差异,机器基于数百万他人图像的统计计算缺少人性的火花。他在 5 月的一封通谕中已就 AI 表态,强调自动化时代的人类尊严;据 New York Times 报道,Anthropic 曾积极游说梵蒂冈重新考虑对非人类意识的立场,但几乎未获成功。

10月1日周四
9月30日周三
  1. Simon Willison65

    Anthropic Frontier Red Team 测评 GLM-5.3 与 Claude Mythos Preview 的二进制漏洞利用能力

    Anthropic Frontier Red Team 在内部 Binary Exploitation 基准随机抽取的 100 个任务上测评多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。报告称这一水平已跨过明显门槛,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务上均未成功。

9月29日周二
  1. Ars Technica · AI77

    OpenAI 取消原定下月发布 GPT-6.1 的计划,称其存在安全回归

    OpenAI 取消了原定下月发布 GPT-6.1 的计划,称测试显示该模型相比前代模型出现安全回归,此事由 The Wall Street Journal 先行报道并获 OpenAI 向媒体确认。

    推荐理由:原文说明 GPT-6.1 在无人干预完成任务上更强,却在对齐测试中退步,可帮助读者理解性能与安全的取舍。

  2. Simon Willison46

    OpenAI Agent Security 负责人 @joedaroo 谈 AI 能力突跃带来的安全难题

    OpenAI Agent Security 负责人 @joedaroo 表示,模型在 "cyber"、"swarming"、"message boards" 等能力上的跳跃与突然程度远超预期,令安全准备极难跟上。他指出安全姿态的建立需要时间,既要硬化系统,也要让公司文化与人员随之改变演化。他呼吁各组织自查人员、系统与流程能否应对 AI 能力突跃,以及事件响应、沟通与人员准备是否到位。

9月28日周一
9月24日周四
9月23日周三
9月22日周二
9月21日周一
9月18日周五
9月17日周四
8月27日周四
8月14日周五
  1. Google DeepMind75

    Google DeepMind 发布 Gemini 3.7 Flash,主打编码与智能体的高性价比

    Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码与智能体的最强主力模型,发布价为 3.6 Flash 的一半,即每 1M 输入 token $0.75、输出 $3.75,优惠价持续到年底。

    推荐理由:距离 3.6 Flash 仅三周发布,价格降到一半且多项基准有两位数提升,可据此判断 Flash 系列的迭代节奏与成本变化。

7月28日周二
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics 2 系列模型,让机器人实现全身智能

    Google DeepMind 发布 Gemini Robotics 2 系列,包含三个模型:Gemini Robotics 2 视觉-语言-动作模型(VLA)可从脚到手指控制完整人形机器人与双臂机器人,Gemini Robotics ER 2 具身推理模型负责理解指令、规划多步任务,Gemini Robotics On-Device 2 则针对本地运行优化。

    推荐理由:三个模型分别对应全身控制、具身推理与端侧适配,读者可据此看清具身智能落地的分层架构。

7月17日周五
6月16日周二
  1. Google DeepMind63

    Google DeepMind 发布 AI Control Roadmap 智能体安全框架

    Google DeepMind 发布 AI Control Roadmap 框架,用纵深防御方式管理内部部署的先进 AI 智能体,并同步发布面向政策制定者的技术框架 Three Layers of Agent Security。

    推荐理由:原文给出把不可信智能体视作内部威胁的整套做法,以及按模型能力分级的检测与响应指标,对建设智能体安全体系有直接参考价值。

6月10日周三