NASA 与 IBM 开源月球基础模型,用 17 年轨道器数据支撑月球科学研究
NASA 与 IBM Research 联合多所高校发布开源的 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
NASA 与 IBM Research 联合多所高校发布开源的 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
AINews 10/1-10/2 日报的头条是 OpenAI 推出 GPT-6.1 Sol,定价 $2/$10 每百万输入/输出 token,低于 Astra 的 $10/$50。
GPT-6 Astra Ultrafast 运行在 NVIDIA Blackwell GPU 上,现已在 OpenAI API 开放,并面向符合条件的 ChatGPT Work 和 Codex 用户,token 生成速度比 Astra Standard 模式最高快 8x。
推荐理由:原文对比了 Ultrafast 与 Standard 模式的速度差距,并说明更快的 token 生成如何嵌入智能体的编码循环。
Google DeepMind 发布 Gemini 4 Argon,面向编程、企业知识工作与网络防御,借助新 API 功能 Long Decode Continuation 把输出上限提到 1M tokens,初期仅通过 Fairwind 项目向政府用户和可信网络防御者开放。
Google 宣布了 Gemini 4 Argon AI 模型,但用户暂时还无法使用。文章正文只有一句 “So much for Gemini 3.5 Pro.”,即此前被期待的 Gemini 3.5 Pro 并未出现。
Google DeepMind 发布前沿模型 Gemini 4 Argon,输出 token 上限从 64K 提升至 1M,介绍价为每百万输入 token 2 美元、输出 10 美元,缓存输入按输入价 95% 折扣。
推荐理由:文章给出 1M 输出 token 与分阶段放量的思路,读者可据此判断长程任务能力如何与安全节奏配套。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,为 agentic 编码、计算机使用和专业工作负载带来更强推理能力。
推荐理由:文章给出 GPT-6.1 Sol 相对 GPT-6 Sol 的成本与成绩对比,以及 Bedrock 上的部署与数据控制项,便于评估引入代价。
OpenAI 取消了原定下月发布 GPT-6.1 的计划,称测试显示该模型相比前代模型出现安全回归,此事由 The Wall Street Journal 先行报道并获 OpenAI 向媒体确认。
推荐理由:原文说明 GPT-6.1 在无人干预完成任务上更强,却在对齐测试中退步,可帮助读者理解性能与安全的取舍。
OpenAI 发布 GPT-6.1 Sol,定位是接近 Astra 智能水平的模型,面向编码、计算机使用和专业工作。其 API 输入和输出 token 价格为 Astra 标准价格的五分之一。
推荐理由:原文点明它在编码与专业工作上接近 Astra 的能力,而 API 输入输出价格仅为其五分之一,读者可用这条价性比信息评估接入成本。
AMD 完成对 World Labs 的收购,因 AMD 是上市公司,交易价格 82 亿美元得以公开,李飞飞发文说明收购背景与空间智能布局。World Labs 近日发布的 Atlas 是首创的 omni 模型架构,能从输入的 2D 图像预测下一个视角,并结合生成模型与多视角几何解决了计算机视觉领域长期存在的稀疏重建问题。
Opus 5.5 本周发布后社区口碑正面,并因大量用纯代码生成解释类视频而刷屏时间线。本期日报覆盖 12 个 subreddit、544 个 Twitter 账号。
Anthropic 发布 Claude Sonnet 5.5,官方称其速度快 30% 以上、多数任务成本最多降低 30%,定价与 Sonnet 5 相同,且在各项基准上都超过 Sonnet 5。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零生成角色声音,并逐行控制表演提示、节奏、口音变化与接话插话。
推荐理由:文中给出 Hume AI 与 Voice Arena 的具体名次和分数,读者可据此判断这两款 TTS 相对现有方案的水平。
Anthropic 发布 Claude Opus 5.5,称其多数任务达到 Claude Fable 5.1 水平、运行成本比 Opus 5 低 40%,约快 30%,并成为 Claude Code 与 Claude app(含 Cowork)的默认模型,Latent Space 宣布 AINews 今后默认用它生成。
推荐理由:把 Opus 5.5 的基准表现、定价与成本拆解放在一起,读者能看出 40% 降价在不同 effort 设置下并不都成立。
Anthropic 发布 Claude Opus 5.5,OpenAI 约一小时后发布 GPT-6 Sol 和 GPT-6 Luna,多家模型定价普遍下调。
推荐理由:作者用一张横向定价表和自己跑的实测,呈现了三款新模型的价格变化与 max 档的实际表现。
OpenAI 发布 GPT-6 Sol 和 Luna 两个模型,把前沿智能带入日常工作的不同场景。两者在能力与成本之间采取不同平衡,供用户按需选择。
推荐理由:原文点出两个模型按能力与成本做不同取舍的定位,可帮助读者理解 GPT-6 系列的产品分层思路。
Xiaomi 发布 MiMo-V2.6 系列原生全模态模型,MiMo-V2.6-Pro 以 1.02T 总参数 / 42B 激活参数成为新的顶级开放权重模型,另有 MiMo-V2.6-Flash 与最高 20x 输出提速的 MiMo-V2.6-Pro-UltraSpeed。
推荐理由:文中给出 RL 训练的批量、上下文与 token 步长细节以及开源范围,便于判断开放 RL 环境的价值。
Microsoft Research 在 Nature 发表逆合成预测模型 RetroChimera,并开源其实现与权重。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,面向语音智能体带来近实时推理升级。
推荐理由:两个版本的分工和基准分数写得很清楚,读者可以直接据此判断自己的语音场景该选哪一档。
Google DeepMind 与 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测是迄今最先进准确的全球天气 AI 模型,每小时基于实时卫星数据生成一次预报。
推荐理由:模型改为直接学习实时卫星与站点观测,读者可据此看清它与依赖 NWP 数据的前代模型在训练来源上的差异。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个新模型,均基于同一核心智能,定价与 3.7 Flash 相同,为 $0.75 per million input tokens 和 $3.75 per million output tokens。
推荐理由:文中列出的多项基准成绩与每百万 token 定价,便于读者横向比较新模型的能力与成本。
Microsoft Research 开源 GigaPath-Flash 与 GigaTIME-Flash,在 PANDA、EBRAINS 全切片基准上以约 50 倍更少算力取得与原 GigaPath 相差 3% 以内的性能。
Google DeepMind 发布语音转写模型 Gemini 3.5 Transcribe,据 Artificial Analysis 测量其流式场景平均 WER 为 4.0%,非流式为 2.6%,最终转写耗时相比 Chirp 3 改善 70%,FLEURS 基准上流式与非流式 WER 分别为 5.50% 和 5.04%。
推荐理由:原文给出流式与非流式的 WER 数据和相比 Chirp 3 的延迟改进,读者可据此评估它能否替代现有语音转写方案。
Microsoft Research 发布深度学习交换关联泛函 Skala 1.1,训练数据量为首个公开版本的 2.5 倍,并宣布 Skala 已在 CP2K 中可用,正在接入 Psi4、FHI-aims、ORCA 和 VASP。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码与智能体的最强主力模型,发布价为 3.6 Flash 的一半,即每 1M 输入 token $0.75、输出 $3.75,优惠价持续到年底。
推荐理由:距离 3.6 Flash 仅三周发布,价格降到一半且多项基准有两位数提升,可据此判断 Flash 系列的迭代节奏与成本变化。
Google DeepMind 发布多语言手语到文本翻译模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 与 Live Transcribe 上提供 ASL 到英语的手语转文字听写,可用于搜索、撰写消息并向 Gemini 提问,后续将支持更多设备与语言。
推荐理由:文中说明了手语翻译区别于语音转写的两大难点,以及用姿势坐标替代 gloss 的设计,便于理解方案取舍
微软研究院介绍研究模型 CARE-X,一个把胸部 X 光报告生成与带置信度的结构化诊断预测放进同一模型的视觉语言模型,未获任何监管机构批准、不用于临床诊断。
Google DeepMind 发布 Gemini Robotics ER 2,这是它最强的机器人具身推理模型,作为机器人的高层大脑与人对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,且能原生调用 Google Search 等工具。
推荐理由:原文给出了相对 ER 1.6 的评测数字与开放入口,读者可据此判断它在真实机器人工作流中的可用程度。
Google DeepMind 的新一代音乐生成模型 Lyria 3.5 今日在 Google Flow Music 上线,在音乐性、歌词、人声和创作控制四方面升级。它能生成更复杂自然的旋律结构,产出提示词遵循和结构意识更好的歌词,人声更真实且情绪更细腻、发音有所改进,同时支持更方便地控制输出的节奏与时长。
Google DeepMind 发布 Gemini Robotics 2 系列,包含三个模型:Gemini Robotics 2 视觉-语言-动作模型(VLA)可从脚到手指控制完整人形机器人与双臂机器人,Gemini Robotics ER 2 具身推理模型负责理解指令、规划多步任务,Gemini Robotics On-Device 2 则针对本地运行优化。
推荐理由:三个模型分别对应全身控制、具身推理与端侧适配,读者可据此看清具身智能落地的分层架构。
Google DeepMind 发布三款 Gemini Flash 系列新模型,主打规模化构建 AI 智能体所需的效率与低延迟。
推荐理由:同一 Flash 家族三款模型一次发布,含定价与逐项基准对照,便于直接评估迁移成本。
Google DeepMind 发布轻量网络安全模型 Gemini 3.5 Flash Cyber,基于 Gemini 3.5 Flash 微调,用于快速发现、验证并修补漏洞。
Google DeepMind 发布图像模型 Nano Banana 2 Lite,并首次把视频生成与对话式编辑模型 Gemini Omni Flash 经 Gemini API 和 Google AI Studio 开放给开发者。
推荐理由:文中给出两款模型的定位分工、单价和开放入口,读者可据此判断是否把现有图像与视频工作流迁移过去。
Google DeepMind 发布实验性开源模型 DiffusionGemma,用文本扩散方式一次并行生成整段文本,在专用 GPU 上文本生成速度最高提升 4 倍。
推荐理由:把扩散式并行解码用到 26B MoE 文本模型上,讲清了本地低并发场景下速度与质量的取舍边界。
Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,可自动检测 70+ 语言并连续生成流畅自然的译音,保留说话人的语调、节奏和音高,全程只落后说话人几秒。
推荐理由:解释了连续生成与等待上下文之间的取舍,读者可据此理解近实时同传的延迟表现。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的无编码器统一多模态模型,16GB 内存或统一显存即可运行。其基准表现接近 26B MoE 模型但内存占用不足一半,视觉与音频输入直接进入 LLM 主干,并配备 Multi-Token Prediction(MTP)drafter 降低延迟,采用 Apache 2.0 许可。
推荐理由:讲清了去掉多模态编码器如何降低延迟与内存占用,读者可据此判断本地跑智能体的可行性。
Google DeepMind 发布 Omni 系列首个模型 Gemini Omni Flash,可将图像、音频、视频和文本任意组合作为输入来生成视频,并支持用自然语言多轮编辑且保持角色与场景连贯。
推荐理由:原文写清了输入组合、对话式多轮编辑与分阶段开放节奏,便于判断它会怎样进入现有视频创作流程。