跳到正文
7月16日周四
7月13日周一
7月7日周二
7月3日周五
7月1日周三
  1. Berkeley AI Research43

    2026 BAIR 博士毕业生展示

    BAIR 庆祝 2026 届博士毕业生,研究覆盖机器人与具身智能、大语言模型与推理、计算机视觉、生成模型与 AI 安全等领域。毕业生将走向教职与博士后岗位、业界研究实验室和自创的初创公司,其中 Hanlin Zhu 将加入 OpenAI,Charlie Snell 将加入 Physical Intelligence。

  2. Google DeepMind73

    Google DeepMind 发布 Nano Banana 2 Lite 图像模型并开放 Gemini Omni Flash 给开发者

    Google DeepMind 发布图像模型 Nano Banana 2 Lite,并首次把视频生成与对话式编辑模型 Gemini Omni Flash 经 Gemini API 和 Google AI Studio 开放给开发者。

    推荐理由:文中给出两款模型的定位分工、单价和开放入口,读者可据此判断是否把现有图像与视频工作流迁移过去。

6月25日周四
6月17日周三
6月16日周二
  1. Google DeepMind63

    Google DeepMind 发布 AI Control Roadmap 智能体安全框架

    Google DeepMind 发布 AI Control Roadmap 框架,用纵深防御方式管理内部部署的先进 AI 智能体,并同步发布面向政策制定者的技术框架 Three Layers of Agent Security。

    推荐理由:原文给出把不可信智能体视作内部威胁的整套做法,以及按模型能力分级的检测与响应指标,对建设智能体安全体系有直接参考价值。

6月11日周四
6月10日周三
6月9日周二
  1. Google DeepMind70

    Google DeepMind 发布 Gemma 4 12B:无编码器统一多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的无编码器统一多模态模型,16GB 内存或统一显存即可运行。其基准表现接近 26B MoE 模型但内存占用不足一半,视觉与音频输入直接进入 LLM 主干,并配备 Multi-Token Prediction(MTP)drafter 降低延迟,采用 Apache 2.0 许可。

    推荐理由:讲清了去掉多模态编码器如何降低延迟与内存占用,读者可据此判断本地跑智能体的可行性。

6月8日周一
  1. Google DeepMind65

    Google DeepMind 公布塞拉利昂 AI 数学教学预注册试验结果

    Google DeepMind 公布了在塞拉利昂开展的 Guided Learning 预注册试验结果,使用该工具的学生数学成绩比对照组提高 0.258 个标准差,八周内约合 1.2 到 1.7 年的常规学习进展。

    推荐理由:一次预注册试验给出了 AI 辅导的效应量与真实使用率数据,可作为评估教学效果的量化参照。

5月22日周五
5月19日周二
  1. Google DeepMind51

    Co-Scientist 加速寻找逆转细胞衰老的基因线索

    Google DeepMind 介绍其 Co-Scientist 帮助生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室加速细胞衰老研究:它扫描数万篇论文后提出 20 多个新颖的候选基因因子,实验室测试验证了其中数个假设,其推荐的因子成功让细胞进入更年轻、整体功能改善的状态。同时它把大型基因筛选数据结合多年分散文献的分析工作从最长六个月缩短到几天。

5月18日周一
  1. Google DeepMind74

    Google DeepMind 发布 Gemini Omni Flash 视频生成模型

    Google DeepMind 发布 Omni 系列首个模型 Gemini Omni Flash,可将图像、音频、视频和文本任意组合作为输入来生成视频,并支持用自然语言多轮编辑且保持角色与场景连贯。

    推荐理由:原文写清了输入组合、对话式多轮编辑与分阶段开放节奏,便于判断它会怎样进入现有视频创作流程。

5月17日周日
  1. Google DeepMind70

    Google DeepMind 扩展 SynthID 与内容验证工具,覆盖 Search、Gemini、Chrome、Pixel 和 Cloud

    Google DeepMind 宣布在 Search、Gemini、Chrome、Pixel 和 Cloud 扩展内容透明与验证工具,SynthID 已为超过 1000 亿张图片和视频、60,000 年音频加水印。

    推荐理由:原文列出 SynthID 的水印覆盖规模与各产品的验证入口,读者可据此判断内容溯源已落地到哪些日常场景。

5月16日周六
5月8日周五
4月20日周一
  1. Berkeley AI Research38

    GRASP:长时域世界模型的基于梯度规划

    GRASP 是一种新的基于梯度的规划器,让基于学习动力学的世界模型的长时域规划变得可行。它通过把轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中加入随机性用于探索、并重塑梯度让动作获得干净信号而避开高维视觉模型中脆弱的 state-input 梯度。该方法针对的痛点是长时域 rollout 中 Jacobian 条件数随时间 T 指数恶化导致的梯度爆炸/消失,以及非贪心结构造成的坏局部极小值。

1月10日周六
  1. Berkeley AI Research47

    成像系统的信息驱动设计

    Berkeley AI Research 在 NeurIPS 2025 论文中提出一个按信息含量直接评估和优化成像系统的框架。该信息指标在彩色摄影、射电天文、无透镜成像和显微四个领域都能预测解码器性能,优化它得到的设计匹配端到端方法,同时更省内存和算力、无需任务特定解码器设计。互信息仅从含噪测量与噪声模型直接估计,且是真实信息量的上界。

11月1日周六
  1. Berkeley AI Research48

    不依赖 TD learning 的强化学习

    Berkeley AI Research 介绍一种以分治(divide and conquer)取代 TD learning 的 off-policy 强化学习价值学习方法:把轨迹切成等长两段组合价值,Bellman 递归次数可从线性降为对数级。作者与 Aditya 共同主导的近期工作已把该方法扩展到 goal-conditioned RL 等复杂任务。