跳到正文
10月4日周日
10月3日周六
10月2日周五
  1. NVIDIA Blog64

    GPT-6 Astra Ultrafast 基于 NVIDIA Blackwell GPU 上线 OpenAI API,token 生成提速最高 8x

    GPT-6 Astra Ultrafast 运行在 NVIDIA Blackwell GPU 上,现已在 OpenAI API 开放,并面向符合条件的 ChatGPT Work 和 Codex 用户,token 生成速度比 Astra Standard 模式最高快 8x。

    推荐理由:原文对比了 Ultrafast 与 Standard 模式的速度差距,并说明更快的 token 生成如何嵌入智能体的编码循环。

10月1日周四
  1. Google DeepMind80

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 发布前沿模型 Gemini 4 Argon,输出 token 上限从 64K 提升至 1M,介绍价为每百万输入 token 2 美元、输出 10 美元,缓存输入按输入价 95% 折扣。

    推荐理由:文章给出 1M 输出 token 与分阶段放量的思路,读者可据此判断长程任务能力如何与安全节奏配套。

9月30日周三
  1. AWS Machine Learning Blog73

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,为 agentic 编码、计算机使用和专业工作负载带来更强推理能力。

    推荐理由:文章给出 GPT-6.1 Sol 相对 GPT-6 Sol 的成本与成绩对比,以及 Bedrock 上的部署与数据控制项,便于评估引入代价。

9月29日周二
  1. Ars Technica · AI77

    OpenAI 取消原定下月发布 GPT-6.1 的计划,称其存在安全回归

    OpenAI 取消了原定下月发布 GPT-6.1 的计划,称测试显示该模型相比前代模型出现安全回归,此事由 The Wall Street Journal 先行报道并获 OpenAI 向媒体确认。

    推荐理由:原文说明 GPT-6.1 在无人干预完成任务上更强,却在对齐测试中退步,可帮助读者理解性能与安全的取舍。

  2. OpenAI News70

    OpenAI 发布 GPT-6.1 Sol,价格为 Astra 的五分之一

    OpenAI 发布 GPT-6.1 Sol,定位是接近 Astra 智能水平的模型,面向编码、计算机使用和专业工作。其 API 输入和输出 token 价格为 Astra 标准价格的五分之一。

    推荐理由:原文点明它在编码与专业工作上接近 Astra 的能力,而 API 输入输出价格仅为其五分之一,读者可用这条价性比信息评估接入成本。

  3. Latent Space73

    AMD 以 82 亿美元收购 World Labs,其 Atlas 模型解决稀疏重建问题

    AMD 完成对 World Labs 的收购,因 AMD 是上市公司,交易价格 82 亿美元得以公开,李飞飞发文说明收购背景与空间智能布局。World Labs 近日发布的 Atlas 是首创的 omni 模型架构,能从输入的 2D 图像预测下一个视角,并结合生成模型与多视角几何解决了计算机视觉领域长期存在的稀疏重建问题。

9月23日周三
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音生成模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零生成角色声音,并逐行控制表演提示、节奏、口音变化与接话插话。

    推荐理由:文中给出 Hume AI 与 Voice Arena 的具体名次和分数,读者可据此判断这两款 TTS 相对现有方案的水平。

  2. Latent Space85

    Claude Opus 5.5 发布并成为 AINews 默认模型,OpenAI 同日推出降价约 50% 的 GPT-6 Sol 与 Luna

    Anthropic 发布 Claude Opus 5.5,称其多数任务达到 Claude Fable 5.1 水平、运行成本比 Opus 5 低 40%,约快 30%,并成为 Claude Code 与 Claude app(含 Cowork)的默认模型,Latent Space 宣布 AINews 今后默认用它生成。

    推荐理由:把 Opus 5.5 的基准表现、定价与成本拆解放在一起,读者能看出 40% 降价在不同 effort 设置下并不都成立。

  3. OpenAI News67

    OpenAI 发布 GPT-6 Sol 和 Luna 两个模型

    OpenAI 发布 GPT-6 Sol 和 Luna 两个模型,把前沿智能带入日常工作的不同场景。两者在能力与成本之间采取不同平衡,供用户按需选择。

    推荐理由:原文点出两个模型按能力与成本做不同取舍的定位,可帮助读者理解 GPT-6 系列的产品分层思路。

9月22日周二
  1. Latent Space76

    Xiaomi MiMo-V2.6-Pro 1T-A42B 发布,成为新的顶级开放权重模型

    Xiaomi 发布 MiMo-V2.6 系列原生全模态模型,MiMo-V2.6-Pro 以 1.02T 总参数 / 42B 激活参数成为新的顶级开放权重模型,另有 MiMo-V2.6-Flash 与最高 20x 输出提速的 MiMo-V2.6-Pro-UltraSpeed。

    推荐理由:文中给出 RL 训练的批量、上下文与 token 步长细节以及开源范围,便于判断开放 RL 环境的价值。

9月21日周一
9月16日周三
9月3日周四
  1. Google DeepMind73

    Google DeepMind 发布 WeatherNext 3,天气预报分辨率提升至 5 公里

    Google DeepMind 与 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测是迄今最先进准确的全球天气 AI 模型,每小时基于实时卫星数据生成一次预报。

    推荐理由:模型改为直接学习实时卫星与站点观测,读者可据此看清它与依赖 NWP 数据的前代模型在训练来源上的差异。

  2. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个新模型,均基于同一核心智能,定价与 3.7 Flash 相同,为 $0.75 per million input tokens 和 $3.75 per million output tokens。

    推荐理由:文中列出的多项基准成绩与每百万 token 定价,便于读者横向比较新模型的能力与成本。

9月1日周二
8月27日周四
  1. Google DeepMind69

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转写模型

    Google DeepMind 发布语音转写模型 Gemini 3.5 Transcribe,据 Artificial Analysis 测量其流式场景平均 WER 为 4.0%,非流式为 2.6%,最终转写耗时相比 Chirp 3 改善 70%,FLEURS 基准上流式与非流式 WER 分别为 5.50% 和 5.04%。

    推荐理由:原文给出流式与非流式的 WER 数据和相比 Chirp 3 的延迟改进,读者可据此评估它能否替代现有语音转写方案。

8月21日周五
8月14日周五
  1. Google DeepMind75

    Google DeepMind 发布 Gemini 3.7 Flash,主打编码与智能体的高性价比

    Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码与智能体的最强主力模型,发布价为 3.6 Flash 的一半,即每 1M 输入 token $0.75、输出 $3.75,优惠价持续到年底。

    推荐理由:距离 3.6 Flash 仅三周发布,价格降到一半且多项基准有两位数提升,可据此判断 Flash 系列的迭代节奏与成本变化。

8月12日周三
  1. Google DeepMind69

    Google DeepMind 发布手语翻译模型 SL2T,落地 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语到文本翻译模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 与 Live Transcribe 上提供 ASL 到英语的手语转文字听写,可用于搜索、撰写消息并向 Gemini 提问,后续将支持更多设备与语言。

    推荐理由:文中说明了手语翻译区别于语音转写的两大难点,以及用姿势坐标替代 gloss 的设计,便于理解方案取舍

7月30日周四
  1. Google DeepMind61

    Google DeepMind 发布 Gemini Robotics ER 2,支持视频理解、任务编排与多机器人协同

    Google DeepMind 发布 Gemini Robotics ER 2,这是它最强的机器人具身推理模型,作为机器人的高层大脑与人对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,且能原生调用 Google Search 等工具。

    推荐理由:原文给出了相对 ER 1.6 的评测数字与开放入口,读者可据此判断它在真实机器人工作流中的可用程度。

  2. Google DeepMind53

    Google DeepMind 在 Google Flow Music 上线音乐生成模型 Lyria 3.5

    Google DeepMind 的新一代音乐生成模型 Lyria 3.5 今日在 Google Flow Music 上线,在音乐性、歌词、人声和创作控制四方面升级。它能生成更复杂自然的旋律结构,产出提示词遵循和结构意识更好的歌词,人声更真实且情绪更细腻、发音有所改进,同时支持更方便地控制输出的节奏与时长。

7月28日周二
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics 2 系列模型,让机器人实现全身智能

    Google DeepMind 发布 Gemini Robotics 2 系列,包含三个模型:Gemini Robotics 2 视觉-语言-动作模型(VLA)可从脚到手指控制完整人形机器人与双臂机器人,Gemini Robotics ER 2 具身推理模型负责理解指令、规划多步任务,Gemini Robotics On-Device 2 则针对本地运行优化。

    推荐理由:三个模型分别对应全身控制、具身推理与端侧适配,读者可据此看清具身智能落地的分层架构。

7月21日周二
7月17日周五
7月1日周三
  1. Google DeepMind73

    Google DeepMind 发布 Nano Banana 2 Lite 图像模型并开放 Gemini Omni Flash 给开发者

    Google DeepMind 发布图像模型 Nano Banana 2 Lite,并首次把视频生成与对话式编辑模型 Gemini Omni Flash 经 Gemini API 和 Google AI Studio 开放给开发者。

    推荐理由:文中给出两款模型的定位分工、单价和开放入口,读者可据此判断是否把现有图像与视频工作流迁移过去。

6月11日周四
6月9日周二
  1. Google DeepMind70

    Google DeepMind 发布 Gemma 4 12B:无编码器统一多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的无编码器统一多模态模型,16GB 内存或统一显存即可运行。其基准表现接近 26B MoE 模型但内存占用不足一半,视觉与音频输入直接进入 LLM 主干,并配备 Multi-Token Prediction(MTP)drafter 降低延迟,采用 Apache 2.0 许可。

    推荐理由:讲清了去掉多模态编码器如何降低延迟与内存占用,读者可据此判断本地跑智能体的可行性。

5月18日周一
  1. Google DeepMind74

    Google DeepMind 发布 Gemini Omni Flash 视频生成模型

    Google DeepMind 发布 Omni 系列首个模型 Gemini Omni Flash,可将图像、音频、视频和文本任意组合作为输入来生成视频,并支持用自然语言多轮编辑且保持角色与场景连贯。

    推荐理由:原文写清了输入组合、对话式多轮编辑与分阶段开放节奏,便于判断它会怎样进入现有视频创作流程。