AMD 以 82 亿美元收购 World Labs,其 Atlas 模型解决稀疏重建问题
AMD 完成对 World Labs 的收购,因 AMD 是上市公司,交易价格 82 亿美元得以公开,李飞飞发文说明收购背景与空间智能布局。World Labs 近日发布的 Atlas 是首创的 omni 模型架构,能从输入的 2D 图像预测下一个视角,并结合生成模型与多视角几何解决了计算机视觉领域长期存在的稀疏重建问题。
AMD 完成对 World Labs 的收购,因 AMD 是上市公司,交易价格 82 亿美元得以公开,李飞飞发文说明收购背景与空间智能布局。World Labs 近日发布的 Atlas 是首创的 omni 模型架构,能从输入的 2D 图像预测下一个视角,并结合生成模型与多视角几何解决了计算机视觉领域长期存在的稀疏重建问题。
Microsoft Research Asia – Singapore 成立一年来围绕四大支柱推进前沿 AI 研究:新一代 AI 模型与 agentic 系统、领域专用 AI、AI 原生研究实践、生态与人才。
Microsoft Research 宣布为 Physical AI Toolchain 新增机器人推理卸载能力,可用 Kubernetes 工具把机器人 AI 工作负载容器化并分发到板载计算、边缘 GPU 与云端,集成 ROS2、LeRobot 与机器人仿真器,本次发布含 SO-101 和 UR10e 的卸载示例项目。
NVIDIA 在加拿大多伦多 ROSCon 发布开源免费的 Isaac ROS 5.0,为机器人开发引入智能体工作流与新平台支持。
推荐理由:原文列出智能体技能与生态伙伴的接入方式,读者可看到 AI 智能体嵌入机器人开发的具体路径。
NVIDIA 称 Physical AI 规模化部署需在硬件、软件、AI、运行环境与部署全生命周期每一层持续保障安全,而非部署前的一次性检查。ABI Research 预计 2035 年 L3-L5 自动驾驶汽车保有量达 49 million,Omdia 估计 2026-2035 年部署约 60 million 台工业机器人。
MindTopo 是 Microsoft Research 提出的新 benchmark,用连续性、分离、顺序、包围、打结五类任务评测多模态大语言模型的拓扑空间推理能力。测试显示各模型静态识别明显优于交互规划,且两者都远低于人类水平;规划失误多发生在场景已被理解之后,模型会丢失结构关系或提出违反环境动力学的动作。
Google DeepMind 发布 Gemini Robotics ER 2,这是它最强的机器人具身推理模型,作为机器人的高层大脑与人对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,且能原生调用 Google Search 等工具。
推荐理由:原文给出了相对 ER 1.6 的评测数字与开放入口,读者可据此判断它在真实机器人工作流中的可用程度。
Google DeepMind 发布 Gemini Robotics 2 系列,包含三个模型:Gemini Robotics 2 视觉-语言-动作模型(VLA)可从脚到手指控制完整人形机器人与双臂机器人,Gemini Robotics ER 2 具身推理模型负责理解指令、规划多步任务,Gemini Robotics On-Device 2 则针对本地运行优化。
推荐理由:三个模型分别对应全身控制、具身推理与端侧适配,读者可据此看清具身智能落地的分层架构。
Google DeepMind 启动为期 3 个月的 Google DeepMind Accelerator: Robotics 项目,从欧洲选拔出 15 家早期机器人初创公司加入。
GRASP 是一种新的基于梯度的规划器,让基于学习动力学的世界模型的长时域规划变得可行。它通过把轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中加入随机性用于探索、并重塑梯度让动作获得干净信号而避开高维视觉模型中脆弱的 state-input 梯度。该方法针对的痛点是长时域 rollout 中 Jacobian 条件数随时间 T 指数恶化导致的梯度爆炸/消失,以及非贪心结构造成的坏局部极小值。