跳到正文
今天10月5日周一2 条
10月4日周日
10月2日周五
  1. MIT Technology Review · AI57

    别被误导,大语言模型不会推理

    AlphaGo团队核心成员、伦敦大学学院机器学习讲席教授Thore Graepel认为当前LLM并不具备科学家意义上的真正推理能力。他指出AlphaGo第37手来自搜索机制对未来的权衡而非直觉,而CoT仍是同一套next-token预测的延长,存在缺乏可检视的认识状态、知识与推理纠缠在权重中、思维链常是事后编造这三条缺陷。

  2. Ars Technica · AI67

    联邦法官驳回 Chegg 和 Penske 针对 Google AI 搜索的反垄断诉讼

    美国联邦法官 Amit Mehta 驳回了 Chegg 和 Penske Media 对 Google 提起的反垄断诉讼,认定其行为不构成违法。两家公司指控 Google 在 AI Overviews 等产品中违规抓取内容导致流量下滑,诉讼于 2025 年提起。Mehta 认为网站对 Google 导流的期待并不构成协议,这只是通用搜索引擎的运作方式。

10月1日周四
  1. Google DeepMind80

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 发布前沿模型 Gemini 4 Argon,输出 token 上限从 64K 提升至 1M,介绍价为每百万输入 token 2 美元、输出 10 美元,缓存输入按输入价 95% 折扣。

    推荐理由:文章给出 1M 输出 token 与分阶段放量的思路,读者可据此判断长程任务能力如何与安全节奏配套。

  2. Ars Technica · AI60

    Google 向约100家网站支付 AI 答案分成,金额极少进展不顺

    Google 已让约100家出版商进入 AI 贡献试点,当其内容对 AI Overview 等 Gemini 搜索结果有实质贡献时可获得付费。据 The Information,试点中的中小出版商称这笔收入仅约相当于其广告收入的千分之一,多家较大的出版商已拒绝参与,希望借此促使 Google 提出更优厚的条件。Google 此前一直以流量回报为由拒绝直接向出版商付费。

9月30日周三
  1. Google DeepMind63

    Google DeepMind 发布 SynthID Bio,为 AI 生成蛋白质添加水印

    Google DeepMind 发布 SynthID Bio,把水印技术带入合成生物学,可在氨基酸序列和预测 3D 结构坐标中嵌入不可感知的签名,并在实验室测试中保持蛋白质的生物学功能。

    推荐理由:原文给出了湿实验验证数据与 DNA 合成筛查场景,读者可据此理解水印如何在不损害蛋白功能的前提下进入生物安全防线。

9月29日周二
9月28日周一
9月25日周五
  1. Latent Space35

    Latent Space 的未来:AINews v3 计划

    Latent Space 宣布 AINews v3 计划,将把已超过 200K 订阅者的 AINews 与拥有数万成员却日益冷清的 Discord 合并职能,并计划迁移到 Beehiiv、启用新主页。公司新聘 Business/Ops Manager 与 Head of Editorial,重新开放赞助与 PR/tips 合作。

9月24日周四
  1. NVIDIA Blog60

    NVIDIA 与 Google DeepMind 如何用开放病毒蛋白结构数据帮研究者准备下一次大流行

    NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构开放 2800 余种病毒蛋白复合体的预测 3D 结构,通过 AlphaFold Database 供全球科学家免费使用。

    推荐理由:文中说明了病毒蛋白复合体数据的开放规模和可复用的结构预测流程,便于研究者判断如何接入自己的课题。

9月23日周三
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音生成模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零生成角色声音,并逐行控制表演提示、节奏、口音变化与接话插话。

    推荐理由:文中给出 Hume AI 与 Voice Arena 的具体名次和分数,读者可据此判断这两款 TTS 相对现有方案的水平。

9月16日周三
9月8日周二
  1. Google DeepMind68

    Google DeepMind 发布 AlphaGenome Atlas:人类基因组 90 亿种单碱基变异的预测图谱

    Google DeepMind 推出 AlphaGenome Atlas 平台,预先计算并开放人类基因组约 9 billion 个单核苷酸变异的效应预测,含配套论文、免费网站门户和 AlphaGenome API。

    推荐理由:原文把数据规模与 AlphaFold 数据库对比,读者可据此理解这次开放的资源在生命科学研究中的定位。

9月3日周四
  1. Google DeepMind73

    Google DeepMind 发布 WeatherNext 3,天气预报分辨率提升至 5 公里

    Google DeepMind 与 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测是迄今最先进准确的全球天气 AI 模型,每小时基于实时卫星数据生成一次预报。

    推荐理由:模型改为直接学习实时卫星与站点观测,读者可据此看清它与依赖 NWP 数据的前代模型在训练来源上的差异。

  2. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个新模型,均基于同一核心智能,定价与 3.7 Flash 相同,为 $0.75 per million input tokens 和 $3.75 per million output tokens。

    推荐理由:文中列出的多项基准成绩与每百万 token 定价,便于读者横向比较新模型的能力与成本。

9月2日周三
  1. Google DeepMind71

    Gemini 推出 agentic video understanding,token 消耗最多降 88%

    Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上线 agentic video understanding 视频分析功能,token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。

    推荐理由:官方给出了 token、成本与准确率的具体变化和 API 启用方式,便于判断它会怎样改变长视频分析的成本结构。

8月28日周五
  1. Google DeepMind65

    Gemini Omni 1.1 Flash 发布,新增场景延长与首尾帧插值等视频控制能力

    Gemini Omni 1.1 Flash 发布,新增场景延长、首尾帧插值、360p 快速草稿、4K 上采样和视频参考五项创意控制,已通过 Gemini API 在 Google AI Studio 与 Agent Platform API 开放。

    推荐理由:逐项给出五项新控制能力与对应 API 用法,方便开发者判断是否把生成视频流程迁到 Omni 1.1。

8月27日周四
  1. Google DeepMind69

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转写模型

    Google DeepMind 发布语音转写模型 Gemini 3.5 Transcribe,据 Artificial Analysis 测量其流式场景平均 WER 为 4.0%,非流式为 2.6%,最终转写耗时相比 Chirp 3 改善 70%,FLEURS 基准上流式与非流式 WER 分别为 5.50% 和 5.04%。

    推荐理由:原文给出流式与非流式的 WER 数据和相比 Chirp 3 的延迟改进,读者可据此评估它能否替代现有语音转写方案。

8月21日周五
8月14日周五
  1. Google DeepMind75

    Google DeepMind 发布 Gemini 3.7 Flash,主打编码与智能体的高性价比

    Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码与智能体的最强主力模型,发布价为 3.6 Flash 的一半,即每 1M 输入 token $0.75、输出 $3.75,优惠价持续到年底。

    推荐理由:距离 3.6 Flash 仅三周发布,价格降到一半且多项基准有两位数提升,可据此判断 Flash 系列的迭代节奏与成本变化。

8月12日周三
  1. Google DeepMind69

    Google DeepMind 发布手语翻译模型 SL2T,落地 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语到文本翻译模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 与 Live Transcribe 上提供 ASL 到英语的手语转文字听写,可用于搜索、撰写消息并向 Gemini 提问,后续将支持更多设备与语言。

    推荐理由:文中说明了手语翻译区别于语音转写的两大难点,以及用姿势坐标替代 gloss 的设计,便于理解方案取舍

8月6日周四
  1. Google DeepMind72

    Google DeepMind 开源 WeatherNext 气旋预报模型,三天预报精度相当于以往两天

    Google DeepMind 在 Nature 发表论文并开源 WeatherNext Cyclones、WeatherNext 2 和 WeatherNext 2-mini 三个模型,单一模型在气旋路径、强度与风场结构预报上达到 SOTA 精度,平均比以往模型多出超过 24 小时的提前量,三天预报精度相当于旧模型的两天。

    推荐理由:文中说明了单一模型同时处理路径与强度的做法,并给出比以往多出一天以上预警时间的量化口径,便于判断其应用价值。

7月30日周四
  1. Google DeepMind61

    Google DeepMind 发布 Gemini Robotics ER 2,支持视频理解、任务编排与多机器人协同

    Google DeepMind 发布 Gemini Robotics ER 2,这是它最强的机器人具身推理模型,作为机器人的高层大脑与人对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,且能原生调用 Google Search 等工具。

    推荐理由:原文给出了相对 ER 1.6 的评测数字与开放入口,读者可据此判断它在真实机器人工作流中的可用程度。

  2. Google DeepMind53

    Google DeepMind 在 Google Flow Music 上线音乐生成模型 Lyria 3.5

    Google DeepMind 的新一代音乐生成模型 Lyria 3.5 今日在 Google Flow Music 上线,在音乐性、歌词、人声和创作控制四方面升级。它能生成更复杂自然的旋律结构,产出提示词遵循和结构意识更好的歌词,人声更真实且情绪更细腻、发音有所改进,同时支持更方便地控制输出的节奏与时长。

7月28日周二
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics 2 系列模型,让机器人实现全身智能

    Google DeepMind 发布 Gemini Robotics 2 系列,包含三个模型:Gemini Robotics 2 视觉-语言-动作模型(VLA)可从脚到手指控制完整人形机器人与双臂机器人,Gemini Robotics ER 2 具身推理模型负责理解指令、规划多步任务,Gemini Robotics On-Device 2 则针对本地运行优化。

    推荐理由:三个模型分别对应全身控制、具身推理与端侧适配,读者可据此看清具身智能落地的分层架构。

7月22日周三
7月21日周二