OpenAI 瓦解一场协同式模型蒸馏行动
OpenAI 打击了一场旨在提取其受保护模型推理过程的协同式蒸馏行动,并正在加强对抗性蒸馏的防御。
OpenAI 打击了一场旨在提取其受保护模型推理过程的协同式蒸馏行动,并正在加强对抗性蒸馏的防御。
OpenAI 给出前沿 AI 训练 safety case 的初期指南,覆盖技术防护措施、运营实践,以及对齐失效(misalignment)事件的调查三方面内容。
Google DeepMind 宣布为 Private AI Compute 平台加入安全的服务端持久记忆层,让助手具备跨设备的长期连续性,同时保持设备端级别的隐私标准。
OpenAI 宣布将 Daybreak 计划的访问权限扩展给乌克兰政府,以支持民用基础设施的网络防御。材料为官方摘要,未提供更多细节。
OpenAI 提出对前沿模型及其安全防护措施进行第三方 AI 安全评估的优先事项与原则,强调评估应严谨、安全且独立。
NVIDIA 称 Physical AI 规模化部署需在硬件、软件、AI、运行环境与部署全生命周期每一层持续保障安全,而非部署前的一次性检查。ABI Research 预计 2035 年 L3-L5 自动驾驶汽车保有量达 49 million,Omdia 估计 2026-2035 年部署约 60 million 台工业机器人。
NVIDIA 博文提出 AI 安全是工程问题,主张在 Agent 栈的模型、harness 与运行时各层都落实可执行边界和可验证的防护证据。
OpenAI 推出澳大利亚青少年安全蓝图(Australian Youth Safety Blueprint),面向更安全的 AI 体验给出一份六支柱路线图,旨在保护并赋能年轻人。
OpenAI 公开了一套用于追踪、调查和披露模型对齐问题的框架,同时发布了六份关于模型意外或令人担忧行为的报告。材料为官方摘要,未提供框架的具体流程与报告细节。
Google DeepMind 宣布试点全球首个针对专有前沿模型的双盲评测,与 Singapore AI Safety Institute、OpenMined、AVERI、MLCommons 合作,在隐私保护环境中用保密基准测试 Gemini Flash Lite 模型。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码与智能体的最强主力模型,发布价为 3.6 Flash 的一半,即每 1M 输入 token $0.75、输出 $3.75,优惠价持续到年底。
推荐理由:距离 3.6 Flash 仅三周发布,价格降到一半且多项基准有两位数提升,可据此判断 Flash 系列的迭代节奏与成本变化。
Google DeepMind 发布 Gemini Robotics 2 系列,包含三个模型:Gemini Robotics 2 视觉-语言-动作模型(VLA)可从脚到手指控制完整人形机器人与双臂机器人,Gemini Robotics ER 2 具身推理模型负责理解指令、规划多步任务,Gemini Robotics On-Device 2 则针对本地运行优化。
推荐理由:三个模型分别对应全身控制、具身推理与端侧适配,读者可据此看清具身智能落地的分层架构。
Google DeepMind 发布轻量网络安全模型 Gemini 3.5 Flash Cyber,基于 Gemini 3.5 Flash 微调,用于快速发现、验证并修补漏洞。
Google DeepMind 发布 AI Control Roadmap 框架,用纵深防御方式管理内部部署的先进 AI 智能体,并同步发布面向政策制定者的技术框架 Three Layers of Agent Security。
推荐理由:原文给出把不可信智能体视作内部威胁的整套做法,以及按模型能力分级的检测与响应指标,对建设智能体安全体系有直接参考价值。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 与 Google.org 启动最高 $10M 的技术研究资助,面向全球研究人员征集大规模多智能体 AI 系统安全研究提案。