Google DeepMind 发布前沿模型 Gemini 4 Argon
Google DeepMind 发布前沿模型 Gemini 4 Argon,输出 token 上限从 64K 提升至 1M,介绍价为每百万输入 token 2 美元、输出 10 美元,缓存输入按输入价 95% 折扣。
推荐理由:文章给出 1M 输出 token 与分阶段放量的思路,读者可据此判断长程任务能力如何与安全节奏配套。
Google DeepMind 发布前沿模型 Gemini 4 Argon,输出 token 上限从 64K 提升至 1M,介绍价为每百万输入 token 2 美元、输出 10 美元,缓存输入按输入价 95% 折扣。
推荐理由:文章给出 1M 输出 token 与分阶段放量的思路,读者可据此判断长程任务能力如何与安全节奏配套。
Google DeepMind 发布 SynthID Bio,把水印技术带入合成生物学,可在氨基酸序列和预测 3D 结构坐标中嵌入不可感知的签名,并在实验室测试中保持蛋白质的生物学功能。
推荐理由:原文给出了湿实验验证数据与 DNA 合成筛查场景,读者可据此理解水印如何在不损害蛋白功能的前提下进入生物安全防线。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为原生实时对话模型加入近实时视频生成的可视化形象,同步起在 Gemini Enterprise 中开放。
推荐理由:文中说明了异步工具调用与语音对话并行的实现方式,对做企业级语音智能体的读者有直接参考价值。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构开放 2800 余种病毒蛋白复合体的预测 3D 结构,通过 AlphaFold Database 供全球科学家免费使用。
推荐理由:文中说明了病毒蛋白复合体数据的开放规模和可复用的结构预测流程,便于研究者判断如何接入自己的课题。
Google DeepMind 宣布为 Private AI Compute 平台加入安全的服务端持久记忆层,让助手具备跨设备的长期连续性,同时保持设备端级别的隐私标准。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零生成角色声音,并逐行控制表演提示、节奏、口音变化与接话插话。
推荐理由:文中给出 Hume AI 与 Voice Arena 的具体名次和分数,读者可据此判断这两款 TTS 相对现有方案的水平。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,面向语音智能体带来近实时推理升级。
推荐理由:两个版本的分工和基准分数写得很清楚,读者可以直接据此判断自己的语音场景该选哪一档。
Google DeepMind 推出 AlphaGenome Atlas 平台,预先计算并开放人类基因组约 9 billion 个单核苷酸变异的效应预测,含配套论文、免费网站门户和 AlphaGenome API。
推荐理由:原文把数据规模与 AlphaFold 数据库对比,读者可据此理解这次开放的资源在生命科学研究中的定位。
Google DeepMind 与 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测是迄今最先进准确的全球天气 AI 模型,每小时基于实时卫星数据生成一次预报。
推荐理由:模型改为直接学习实时卫星与站点观测,读者可据此看清它与依赖 NWP 数据的前代模型在训练来源上的差异。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个新模型,均基于同一核心智能,定价与 3.7 Flash 相同,为 $0.75 per million input tokens 和 $3.75 per million output tokens。
推荐理由:文中列出的多项基准成绩与每百万 token 定价,便于读者横向比较新模型的能力与成本。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上线 agentic video understanding 视频分析功能,token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出了 token、成本与准确率的具体变化和 API 启用方式,便于判断它会怎样改变长视频分析的成本结构。
Gemini Omni 1.1 Flash 发布,新增场景延长、首尾帧插值、360p 快速草稿、4K 上采样和视频参考五项创意控制,已通过 Gemini API 在 Google AI Studio 与 Agent Platform API 开放。
推荐理由:逐项给出五项新控制能力与对应 API 用法,方便开发者判断是否把生成视频流程迁到 Omni 1.1。
Google DeepMind 宣布试点全球首个针对专有前沿模型的双盲评测,与 Singapore AI Safety Institute、OpenMined、AVERI、MLCommons 合作,在隐私保护环境中用保密基准测试 Gemini Flash Lite 模型。
Google DeepMind 发布语音转写模型 Gemini 3.5 Transcribe,据 Artificial Analysis 测量其流式场景平均 WER 为 4.0%,非流式为 2.6%,最终转写耗时相比 Chirp 3 改善 70%,FLEURS 基准上流式与非流式 WER 分别为 5.50% 和 5.04%。
推荐理由:原文给出流式与非流式的 WER 数据和相比 Chirp 3 的延迟改进,读者可据此评估它能否替代现有语音转写方案。
Google DeepMind 宣布与 EVE Universe 背后的独立工作室 Fenris Creations 开展新研究合作,共同原型验证 AI 带来的全新玩法。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码与智能体的最强主力模型,发布价为 3.6 Flash 的一半,即每 1M 输入 token $0.75、输出 $3.75,优惠价持续到年底。
推荐理由:距离 3.6 Flash 仅三周发布,价格降到一半且多项基准有两位数提升,可据此判断 Flash 系列的迭代节奏与成本变化。
Google DeepMind 发布多语言手语到文本翻译模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 与 Live Transcribe 上提供 ASL 到英语的手语转文字听写,可用于搜索、撰写消息并向 Gemini 提问,后续将支持更多设备与语言。
推荐理由:文中说明了手语翻译区别于语音转写的两大难点,以及用姿势坐标替代 gloss 的设计,便于理解方案取舍
Google DeepMind 在 Nature 发表论文并开源 WeatherNext Cyclones、WeatherNext 2 和 WeatherNext 2-mini 三个模型,单一模型在气旋路径、强度与风场结构预报上达到 SOTA 精度,平均比以往模型多出超过 24 小时的提前量,三天预报精度相当于旧模型的两天。
推荐理由:文中说明了单一模型同时处理路径与强度的做法,并给出比以往多出一天以上预警时间的量化口径,便于判断其应用价值。
Google DeepMind 发布 Gemini Robotics ER 2,这是它最强的机器人具身推理模型,作为机器人的高层大脑与人对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,且能原生调用 Google Search 等工具。
推荐理由:原文给出了相对 ER 1.6 的评测数字与开放入口,读者可据此判断它在真实机器人工作流中的可用程度。
Google DeepMind 的新一代音乐生成模型 Lyria 3.5 今日在 Google Flow Music 上线,在音乐性、歌词、人声和创作控制四方面升级。它能生成更复杂自然的旋律结构,产出提示词遵循和结构意识更好的歌词,人声更真实且情绪更细腻、发音有所改进,同时支持更方便地控制输出的节奏与时长。
Google DeepMind 发布 Gemini Robotics 2 系列,包含三个模型:Gemini Robotics 2 视觉-语言-动作模型(VLA)可从脚到手指控制完整人形机器人与双臂机器人,Gemini Robotics ER 2 具身推理模型负责理解指令、规划多步任务,Gemini Robotics On-Device 2 则针对本地运行优化。
推荐理由:三个模型分别对应全身控制、具身推理与端侧适配,读者可据此看清具身智能落地的分层架构。
Google 承诺为 Genesis Mission 提供价值 $40M 的 AI token 与额度,用于加速科学发现的前沿探索。该投入以模型 token 和产品额度的形式给出,是官方渠道发布的一则简短公告。
Google DeepMind 发布三款 Gemini Flash 系列新模型,主打规模化构建 AI 智能体所需的效率与低延迟。
推荐理由:同一 Flash 家族三款模型一次发布,含定价与逐项基准对照,便于直接评估迁移成本。
Google DeepMind 发布轻量网络安全模型 Gemini 3.5 Flash Cyber,基于 Gemini 3.5 Flash 微调,用于快速发现、验证并修补漏洞。
Google DeepMind 与 Isomorphic Labs 公开联合生物韧性方案,过去 12 个月推进超过 15 项与政府机构、生物安全组织和研究团体的合作,并向受信伙伴开放 AI 模型与智能体,覆盖预防、检测、响应三方面。
Google DeepMind 推出由 Gemini 驱动的 Web 应用 ATL Saathi 实时试点,为印度 Atal Tinkering Labs 教师提供 24/7 备课与培训助手,首批覆盖 100 所试点学校。
Google DeepMind 与 A24 宣布一项以研究为核心的首创性合作,帮助创作者开发新的工作流与技术,让未来工具由使用它们的人来塑造。双方将围绕多个项目展开长期研发协作,A24 及其电影创作者可直接参与技术塑造,Google DeepMind 则获得来自一线艺术家的反馈与指导。
Google DeepMind 发布图像模型 Nano Banana 2 Lite,并首次把视频生成与对话式编辑模型 Gemini Omni Flash 经 Gemini API 和 Google AI Studio 开放给开发者。
推荐理由:文中给出两款模型的定位分工、单价和开放入口,读者可据此判断是否把现有图像与视频工作流迁移过去。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前它只作为独立的 Gemini 2.5 computer use 模型提供,现在已原生集成进主打的 Gemini Flash 模型。
推荐理由:原文说明了功能从独立模型到内置的路径和两项可选企业防护,读者可据此评估接入与安全权衡。
Google DeepMind 与英国政府、Google Cloud 等合作,基于 Gemini 开发 AI 规划审批原型,目标把房主规划申请的决策时间缩短 50%。
Google DeepMind 发布 AI Control Roadmap 框架,用纵深防御方式管理内部部署的先进 AI 智能体,并同步发布面向政策制定者的技术框架 Three Layers of Agent Security。
推荐理由:原文给出把不可信智能体视作内部威胁的整套做法,以及按模型能力分级的检测与响应指标,对建设智能体安全体系有直接参考价值。
Google DeepMind 发布实验性开源模型 DiffusionGemma,用文本扩散方式一次并行生成整段文本,在专用 GPU 上文本生成速度最高提升 4 倍。
推荐理由:把扩散式并行解码用到 26B MoE 文本模型上,讲清了本地低并发场景下速度与质量的取舍边界。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 与 Google.org 启动最高 $10M 的技术研究资助,面向全球研究人员征集大规模多智能体 AI 系统安全研究提案。
Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,可自动检测 70+ 语言并连续生成流畅自然的译音,保留说话人的语调、节奏和音高,全程只落后说话人几秒。
推荐理由:解释了连续生成与等待上下文之间的取舍,读者可据此理解近实时同传的延迟表现。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的无编码器统一多模态模型,16GB 内存或统一显存即可运行。其基准表现接近 26B MoE 模型但内存占用不足一半,视觉与音频输入直接进入 LLM 主干,并配备 Multi-Token Prediction(MTP)drafter 降低延迟,采用 Apache 2.0 许可。
推荐理由:讲清了去掉多模态编码器如何降低延迟与内存占用,读者可据此判断本地跑智能体的可行性。
Google DeepMind 启动为期 3 个月的 Google DeepMind Accelerator: Robotics 项目,从欧洲选拔出 15 家早期机器人初创公司加入。
Google DeepMind 公布了在塞拉利昂开展的 Guided Learning 预注册试验结果,使用该工具的学生数学成绩比对照组提高 0.258 个标准差,八周内约合 1.2 到 1.7 年的常规学习进展。
推荐理由:一次预注册试验给出了 AI 辅导的效应量与真实使用率数据,可作为评估教学效果的量化参照。
Google DeepMind 启动首届亚太 Accelerator 项目,聚焦「AI for the Planet」,面向该地区的初创公司、研究团队和非营利组织,用前沿 AI 解决自然、气候、农业、能源等领域的问题。
Google DeepMind 介绍其 Co-Scientist 帮助生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室加速细胞衰老研究:它扫描数万篇论文后提出 20 多个新颖的候选基因因子,实验室测试验证了其中数个假设,其推荐的因子成功让细胞进入更年轻、整体功能改善的状态。同时它把大型基因筛选数据结合多年分散文献的分析工作从最长六个月缩短到几天。
Google DeepMind 为 Project Genie 新增 Street View 影像锚定能力,并将其逐步开放给全球符合条件的 Google AI Ultra $200 订阅者(18+)。