跳到正文
8月4日周二
  1. Microsoft Research71

    Microsoft Research 开源智能体训练框架 Orchard,小参数模型在 SWE-bench Verified 达 69.7%

    Microsoft Research 开源智能体训练框架 Orchard,核心是基于 Kubernetes 的可复用环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中直接训练智能体,并同步发布训练数据与评测方法。

    推荐理由:环境层与三套训练配方一并开源,读者可以据此判断小参数模型在真实 harness 中训练能达到什么水平。

7月30日周四
  1. Google DeepMind61

    Google DeepMind 发布 Gemini Robotics ER 2,支持视频理解、任务编排与多机器人协同

    Google DeepMind 发布 Gemini Robotics ER 2,这是它最强的机器人具身推理模型,作为机器人的高层大脑与人对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,且能原生调用 Google Search 等工具。

    推荐理由:原文给出了相对 ER 1.6 的评测数字与开放入口,读者可据此判断它在真实机器人工作流中的可用程度。

  2. Google DeepMind53

    Google DeepMind 在 Google Flow Music 上线音乐生成模型 Lyria 3.5

    Google DeepMind 的新一代音乐生成模型 Lyria 3.5 今日在 Google Flow Music 上线,在音乐性、歌词、人声和创作控制四方面升级。它能生成更复杂自然的旋律结构,产出提示词遵循和结构意识更好的歌词,人声更真实且情绪更细腻、发音有所改进,同时支持更方便地控制输出的节奏与时长。

7月29日周三
7月28日周二
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics 2 系列模型,让机器人实现全身智能

    Google DeepMind 发布 Gemini Robotics 2 系列,包含三个模型:Gemini Robotics 2 视觉-语言-动作模型(VLA)可从脚到手指控制完整人形机器人与双臂机器人,Gemini Robotics ER 2 具身推理模型负责理解指令、规划多步任务,Gemini Robotics On-Device 2 则针对本地运行优化。

    推荐理由:三个模型分别对应全身控制、具身推理与端侧适配,读者可据此看清具身智能落地的分层架构。

7月26日周日
7月22日周三
7月21日周二
7月17日周五
7月16日周四
7月13日周一
7月7日周二
7月3日周五
7月1日周三
  1. Berkeley AI Research43

    2026 BAIR 博士毕业生展示

    BAIR 庆祝 2026 届博士毕业生,研究覆盖机器人与具身智能、大语言模型与推理、计算机视觉、生成模型与 AI 安全等领域。毕业生将走向教职与博士后岗位、业界研究实验室和自创的初创公司,其中 Hanlin Zhu 将加入 OpenAI,Charlie Snell 将加入 Physical Intelligence。

  2. Google DeepMind73

    Google DeepMind 发布 Nano Banana 2 Lite 图像模型并开放 Gemini Omni Flash 给开发者

    Google DeepMind 发布图像模型 Nano Banana 2 Lite,并首次把视频生成与对话式编辑模型 Gemini Omni Flash 经 Gemini API 和 Google AI Studio 开放给开发者。

    推荐理由:文中给出两款模型的定位分工、单价和开放入口,读者可据此判断是否把现有图像与视频工作流迁移过去。

6月25日周四
6月17日周三
6月16日周二
  1. Google DeepMind63

    Google DeepMind 发布 AI Control Roadmap 智能体安全框架

    Google DeepMind 发布 AI Control Roadmap 框架,用纵深防御方式管理内部部署的先进 AI 智能体,并同步发布面向政策制定者的技术框架 Three Layers of Agent Security。

    推荐理由:原文给出把不可信智能体视作内部威胁的整套做法,以及按模型能力分级的检测与响应指标,对建设智能体安全体系有直接参考价值。

6月11日周四
6月10日周三
6月9日周二
  1. Google DeepMind70

    Google DeepMind 发布 Gemma 4 12B:无编码器统一多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的无编码器统一多模态模型,16GB 内存或统一显存即可运行。其基准表现接近 26B MoE 模型但内存占用不足一半,视觉与音频输入直接进入 LLM 主干,并配备 Multi-Token Prediction(MTP)drafter 降低延迟,采用 Apache 2.0 许可。

    推荐理由:讲清了去掉多模态编码器如何降低延迟与内存占用,读者可据此判断本地跑智能体的可行性。

6月8日周一
  1. Google DeepMind65

    Google DeepMind 公布塞拉利昂 AI 数学教学预注册试验结果

    Google DeepMind 公布了在塞拉利昂开展的 Guided Learning 预注册试验结果,使用该工具的学生数学成绩比对照组提高 0.258 个标准差,八周内约合 1.2 到 1.7 年的常规学习进展。

    推荐理由:一次预注册试验给出了 AI 辅导的效应量与真实使用率数据,可作为评估教学效果的量化参照。

5月22日周五
5月19日周二
  1. Google DeepMind51

    Co-Scientist 加速寻找逆转细胞衰老的基因线索

    Google DeepMind 介绍其 Co-Scientist 帮助生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室加速细胞衰老研究:它扫描数万篇论文后提出 20 多个新颖的候选基因因子,实验室测试验证了其中数个假设,其推荐的因子成功让细胞进入更年轻、整体功能改善的状态。同时它把大型基因筛选数据结合多年分散文献的分析工作从最长六个月缩短到几天。

5月18日周一
  1. Google DeepMind74

    Google DeepMind 发布 Gemini Omni Flash 视频生成模型

    Google DeepMind 发布 Omni 系列首个模型 Gemini Omni Flash,可将图像、音频、视频和文本任意组合作为输入来生成视频,并支持用自然语言多轮编辑且保持角色与场景连贯。

    推荐理由:原文写清了输入组合、对话式多轮编辑与分阶段开放节奏,便于判断它会怎样进入现有视频创作流程。

5月17日周日
  1. Google DeepMind70

    Google DeepMind 扩展 SynthID 与内容验证工具,覆盖 Search、Gemini、Chrome、Pixel 和 Cloud

    Google DeepMind 宣布在 Search、Gemini、Chrome、Pixel 和 Cloud 扩展内容透明与验证工具,SynthID 已为超过 1000 亿张图片和视频、60,000 年音频加水印。

    推荐理由:原文列出 SynthID 的水印覆盖规模与各产品的验证入口,读者可据此判断内容溯源已落地到哪些日常场景。

5月16日周六
5月8日周五
4月20日周一
  1. Berkeley AI Research38

    GRASP:长时域世界模型的基于梯度规划

    GRASP 是一种新的基于梯度的规划器,让基于学习动力学的世界模型的长时域规划变得可行。它通过把轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中加入随机性用于探索、并重塑梯度让动作获得干净信号而避开高维视觉模型中脆弱的 state-input 梯度。该方法针对的痛点是长时域 rollout 中 Jacobian 条件数随时间 T 指数恶化导致的梯度爆炸/消失,以及非贪心结构造成的坏局部极小值。

1月10日周六
  1. Berkeley AI Research47

    成像系统的信息驱动设计

    Berkeley AI Research 在 NeurIPS 2025 论文中提出一个按信息含量直接评估和优化成像系统的框架。该信息指标在彩色摄影、射电天文、无透镜成像和显微四个领域都能预测解码器性能,优化它得到的设计匹配端到端方法,同时更省内存和算力、无需任务特定解码器设计。互信息仅从含噪测量与噪声模型直接估计,且是真实信息量的上界。

11月1日周六
  1. Berkeley AI Research48

    不依赖 TD learning 的强化学习

    Berkeley AI Research 介绍一种以分治(divide and conquer)取代 TD learning 的 off-policy 强化学习价值学习方法:把轨迹切成等长两段组合价值,Bellman 递归次数可从线性降为对数级。作者与 Aditya 共同主导的近期工作已把该方法扩展到 goal-conditioned RL 等复杂任务。