DeepMind 研究者提出人工共生智能以取代奇点论
DeepMind 研究者提出以人工共生智能取代奇点论,主张智能是社会现象,AI 研究应转向协调人、智能体与连接系统构成的网络。
DeepMind 研究者提出以人工共生智能取代奇点论,主张智能是社会现象,AI 研究应转向协调人、智能体与连接系统构成的网络。
Google 研究者在新论文中提出 RRSI(智能体 harness 的正则化递归自我优化),通过收缩编辑预算和严格的批评器,防止让语言模型反复改写 harness 的自我优化过拟合测试任务。
NASA 与 IBM Research 联合多所高校发布开源的 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
Aleph Alpha 测试 967 个敏感话题发现,Qwen、DeepSeek、Kimi 等中国模型仅 17%–41% 的回答被评为平衡,其余照搬官方立场或拒绝回答;DeepSeek V4 Pro 拒答三分之二的问题。
AINews 10/1-10/2 日报的头条是 OpenAI 推出 GPT-6.1 Sol,定价 $2/$10 每百万输入/输出 token,低于 Astra 的 $10/$50。
Carnegie Mellon、MIT、纽约大学与斯坦福团队研发的 AI Ataraxos 以15胜1负4和击败被认为是 Stratego 史上最强的棋手 Pim Niemeijer,训练只用了16块GPU和几千美元。
Microsoft Research 的机器学习管线可为美国本土 66,935 座变电站在潜在影响前 30-60 分钟生成位置级太空天气风险估计,评估期检测到近 80% 的重大太空天气事件。
Google 找到为 AI 设计的蛋白质加水印的方法,旨在服务生物安全,且可与一款热门 AI 蛋白质设计工具配合使用。原文未透露该水印方案的具体技术细节与所对接工具的名称。
Google DeepMind 发布 SynthID Bio,把水印技术带入合成生物学,可在氨基酸序列和预测 3D 结构坐标中嵌入不可感知的签名,并在实验室测试中保持蛋白质的生物学功能。
推荐理由:原文给出了湿实验验证数据与 DNA 合成筛查场景,读者可据此理解水印如何在不损害蛋白功能的前提下进入生物安全防线。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准随机抽取的 100 个任务上测评多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。报告称这一水平已跨过明显门槛,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务上均未成功。
Opus 5.5 本周发布后社区口碑正面,并因大量用纯代码生成解释类视频而刷屏时间线。本期日报覆盖 12 个 subreddit、544 个 Twitter 账号。
OpenAI 给出前沿 AI 训练 safety case 的初期指南,覆盖技术防护措施、运营实践,以及对齐失效(misalignment)事件的调查三方面内容。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构开放 2800 余种病毒蛋白复合体的预测 3D 结构,通过 AlphaFold Database 供全球科学家免费使用。
推荐理由:文中说明了病毒蛋白复合体数据的开放规模和可复用的结构预测流程,便于研究者判断如何接入自己的课题。
Microsoft Research 宣布为 Physical AI Toolchain 新增机器人推理卸载能力,可用 Kubernetes 工具把机器人 AI 工作负载容器化并分发到板载计算、边缘 GPU 与云端,集成 ROS2、LeRobot 与机器人仿真器,本次发布含 SO-101 和 UR10e 的卸载示例项目。
MentalHealthBench 是一个由专家参与设计的 benchmark,用于评估 AI 在真实心理健康对话中的回答是否既有帮助又安全。OpenAI 以“Introducing MentalHealthBench”的形式公布了这一评测基准,聚焦心理健康对话场景下的模型表现。
Microsoft Research 在 Nature 发表逆合成预测模型 RetroChimera,并开源其实现与权重。
OpenAI 公开了一套用于追踪、调查和披露模型对齐问题的框架,同时发布了六份关于模型意外或令人担忧行为的报告。材料为官方摘要,未提供框架的具体流程与报告细节。
OpenAI Economic Research 显示,劳动者正把 AI 用于传统岗位职责之外的场景,并弄清哪些新活动会成为其工作的常规部分。
Google DeepMind 宣布试点全球首个针对专有前沿模型的双盲评测,与 Singapore AI Safety Institute、OpenMined、AVERI、MLCommons 合作,在隐私保护环境中用保密基准测试 Gemini Flash Lite 模型。
MindTopo 是 Microsoft Research 提出的新 benchmark,用连续性、分离、顺序、包围、打结五类任务评测多模态大语言模型的拓扑空间推理能力。测试显示各模型静态识别明显优于交互规划,且两者都远低于人类水平;规划失误多发生在场景已被理解之后,模型会丢失结构关系或提出违反环境动力学的动作。
Berkeley 研究团队为 K-Search 增加 MLX 后端与结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核适配 Apple Silicon,在 Apple Silicon 上达到接近专家级性能。
Berkeley AI Research 提出 ABBEL 框架,用自然语言信念状态取代完整交互历史作为智能体工作上下文,并通过信念评分监督摘要内容。
Google DeepMind 与 A24 宣布一项以研究为核心的首创性合作,帮助创作者开发新的工作流与技术,让未来工具由使用它们的人来塑造。双方将围绕多个项目展开长期研发协作,A24 及其电影创作者可直接参与技术塑造,Google DeepMind 则获得来自一线艺术家的反馈与指导。
Google DeepMind 发布 AI Control Roadmap 框架,用纵深防御方式管理内部部署的先进 AI 智能体,并同步发布面向政策制定者的技术框架 Three Layers of Agent Security。
推荐理由:原文给出把不可信智能体视作内部威胁的整套做法,以及按模型能力分级的检测与响应指标,对建设智能体安全体系有直接参考价值。
Google DeepMind 公布了在塞拉利昂开展的 Guided Learning 预注册试验结果,使用该工具的学生数学成绩比对照组提高 0.258 个标准差,八周内约合 1.2 到 1.7 年的常规学习进展。
推荐理由:一次预注册试验给出了 AI 辅导的效应量与真实使用率数据,可作为评估教学效果的量化参照。
斯坦福大学医学院遗传学家 Gary Peltz 团队借助 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选可重定位用于肝纤维化的药物,研究发表于 Advanced Science。
Berkeley AI Research 发布长文综述自适应并行推理(APR),分析让模型自行决定何时分解子任务、开多少并发线程、如何协调线程的研究进展。
GRASP 是一种新的基于梯度的规划器,让基于学习动力学的世界模型的长时域规划变得可行。它通过把轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中加入随机性用于探索、并重塑梯度让动作获得干净信号而避开高维视觉模型中脆弱的 state-input 梯度。该方法针对的痛点是长时域 rollout 中 Jacobian 条件数随时间 T 指数恶化导致的梯度爆炸/消失,以及非贪心结构造成的坏局部极小值。
Berkeley AI Research 在 NeurIPS 2025 论文中提出一个按信息含量直接评估和优化成像系统的框架。该信息指标在彩色摄影、射电天文、无透镜成像和显微四个领域都能预测解码器性能,优化它得到的设计匹配端到端方法,同时更省内存和算力、无需任务特定解码器设计。互信息仅从含噪测量与噪声模型直接估计,且是真实信息量的上界。
Berkeley AI Research 介绍一种以分治(divide and conquer)取代 TD learning 的 off-policy 强化学习价值学习方法:把轨迹切成等长两段组合价值,Bellman 递归次数可从线性降为对数级。作者与 Aditya 共同主导的近期工作已把该方法扩展到 goal-conditioned RL 等复杂任务。