跳到正文
  1. Google DeepMind80

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 发布前沿模型 Gemini 4 Argon,输出 token 上限从 64K 提升至 1M,介绍价为每百万输入 token 2 美元、输出 10 美元,缓存输入按输入价 95% 折扣。

    推荐理由:文章给出 1M 输出 token 与分阶段放量的思路,读者可据此判断长程任务能力如何与安全节奏配套。

  1. Google DeepMind64

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,口型同步覆盖 97 种语言

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为原生实时对话模型加入近实时视频生成的可视化形象,同步起在 Gemini Enterprise 中开放。

    推荐理由:文中说明了异步工具调用与语音对话并行的实现方式,对做企业级语音智能体的读者有直接参考价值。

  1. Google DeepMind71

    Gemini 推出 agentic video understanding,token 消耗最多降 88%

    Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上线 agentic video understanding 视频分析功能,token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。

    推荐理由:官方给出了 token、成本与准确率的具体变化和 API 启用方式,便于判断它会怎样改变长视频分析的成本结构。

  1. Google DeepMind65

    Gemini Omni 1.1 Flash 发布,新增场景延长与首尾帧插值等视频控制能力

    Gemini Omni 1.1 Flash 发布,新增场景延长、首尾帧插值、360p 快速草稿、4K 上采样和视频参考五项创意控制,已通过 Gemini API 在 Google AI Studio 与 Agent Platform API 开放。

    推荐理由:逐项给出五项新控制能力与对应 API 用法,方便开发者判断是否把生成视频流程迁到 Omni 1.1。

  1. Google DeepMind69

    Google DeepMind 发布手语翻译模型 SL2T,落地 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语到文本翻译模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 与 Live Transcribe 上提供 ASL 到英语的手语转文字听写,可用于搜索、撰写消息并向 Gemini 提问,后续将支持更多设备与语言。

    推荐理由:文中说明了手语翻译区别于语音转写的两大难点,以及用姿势坐标替代 gloss 的设计,便于理解方案取舍

  1. Google DeepMind61

    Google DeepMind 发布 Gemini Robotics ER 2,支持视频理解、任务编排与多机器人协同

    Google DeepMind 发布 Gemini Robotics ER 2,这是它最强的机器人具身推理模型,作为机器人的高层大脑与人对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,且能原生调用 Google Search 等工具。

    推荐理由:原文给出了相对 ER 1.6 的评测数字与开放入口,读者可据此判断它在真实机器人工作流中的可用程度。

  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics 2 系列模型,让机器人实现全身智能

    Google DeepMind 发布 Gemini Robotics 2 系列,包含三个模型:Gemini Robotics 2 视觉-语言-动作模型(VLA)可从脚到手指控制完整人形机器人与双臂机器人,Gemini Robotics ER 2 具身推理模型负责理解指令、规划多步任务,Gemini Robotics On-Device 2 则针对本地运行优化。

    推荐理由:三个模型分别对应全身控制、具身推理与端侧适配,读者可据此看清具身智能落地的分层架构。

  1. Google DeepMind73

    Google DeepMind 发布 Nano Banana 2 Lite 图像模型并开放 Gemini Omni Flash 给开发者

    Google DeepMind 发布图像模型 Nano Banana 2 Lite,并首次把视频生成与对话式编辑模型 Gemini Omni Flash 经 Gemini API 和 Google AI Studio 开放给开发者。

    推荐理由:文中给出两款模型的定位分工、单价和开放入口,读者可据此判断是否把现有图像与视频工作流迁移过去。

  1. Google DeepMind70

    Google DeepMind 发布 Gemma 4 12B:无编码器统一多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的无编码器统一多模态模型,16GB 内存或统一显存即可运行。其基准表现接近 26B MoE 模型但内存占用不足一半,视觉与音频输入直接进入 LLM 主干,并配备 Multi-Token Prediction(MTP)drafter 降低延迟,采用 Apache 2.0 许可。

    推荐理由:讲清了去掉多模态编码器如何降低延迟与内存占用,读者可据此判断本地跑智能体的可行性。

  1. Google DeepMind74

    Google DeepMind 发布 Gemini Omni Flash 视频生成模型

    Google DeepMind 发布 Omni 系列首个模型 Gemini Omni Flash,可将图像、音频、视频和文本任意组合作为输入来生成视频,并支持用自然语言多轮编辑且保持角色与场景连贯。

    推荐理由:原文写清了输入组合、对话式多轮编辑与分阶段开放节奏,便于判断它会怎样进入现有视频创作流程。

已经到底了