开源 BootLoops 工具帮助 AI 模型完成精确科学计算
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源工具 BootLoops,让 Claude 完成精确科学计算,三个月内团队在18个学科、与19位合著者共同产出36篇手稿。
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源工具 BootLoops,让 Claude 完成精确科学计算,三个月内团队在18个学科、与19位合著者共同产出36篇手稿。
GPT-6 系列模型指南讲解创业者如何选择合适的 GPT-6 模型、调节 reasoning effort,并改进提示词与技能(skills)。此外还覆盖工具协调,以及为生产环境准备工作流的方法。
AlphaGo团队核心成员、伦敦大学学院机器学习讲席教授Thore Graepel认为当前LLM并不具备科学家意义上的真正推理能力。他指出AlphaGo第37手来自搜索机制对未来的权衡而非直觉,而CoT仍是同一套next-token预测的延长,存在缺乏可检视的认识状态、知识与推理纠缠在权重中、思维链常是事后编造这三条缺陷。
Latent Space 播客专访 MIT 的 Alex Zhang,围绕 GPU kernel、KernelBench、Recursive Language Models(RLM)与多智能体 swarm 展开。
GPT-6 Astra Ultrafast 运行在 NVIDIA Blackwell GPU 上,现已在 OpenAI API 开放,并面向符合条件的 ChatGPT Work 和 Codex 用户,token 生成速度比 Astra Standard 模式最高快 8x。
推荐理由:原文对比了 Ultrafast 与 Standard 模式的速度差距,并说明更快的 token 生成如何嵌入智能体的编码循环。
Carnegie Mellon、MIT、纽约大学与斯坦福团队研发的 AI Ataraxos 以15胜1负4和击败被认为是 Stratego 史上最强的棋手 Pim Niemeijer,训练只用了16块GPU和几千美元。
Google DeepMind 发布前沿模型 Gemini 4 Argon,输出 token 上限从 64K 提升至 1M,介绍价为每百万输入 token 2 美元、输出 10 美元,缓存输入按输入价 95% 折扣。
推荐理由:文章给出 1M 输出 token 与分阶段放量的思路,读者可据此判断长程任务能力如何与安全节奏配套。
Microsoft Research 的机器学习管线可为美国本土 66,935 座变电站在潜在影响前 30-60 分钟生成位置级太空天气风险估计,评估期检测到近 80% 的重大太空天气事件。
CoreWeave 在 CoreWeave Fully Connected 大会上宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T Ethernet 网络,并推出连接训练、评估与改进环节的 CoreWeave Forge。
Amazon Bedrock 在印度提供 Anthropic Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5 的境内推理。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,为 agentic 编码、计算机使用和专业工作负载带来更强推理能力。
推荐理由:文章给出 GPT-6.1 Sol 相对 GPT-6 Sol 的成本与成绩对比,以及 Bedrock 上的部署与数据控制项,便于评估引入代价。
Latent Space 宣布 AINews v3 计划,将把已超过 200K 订阅者的 AINews 与拥有数万成员却日益冷清的 Discord 合并职能,并计划迁移到 Beehiiv、启用新主页。公司新聘 Business/Ops Manager 与 Head of Editorial,重新开放赞助与 PR/tips 合作。
Xiaomi 发布 MiMo-V2.6 系列原生全模态模型,MiMo-V2.6-Pro 以 1.02T 总参数 / 42B 激活参数成为新的顶级开放权重模型,另有 MiMo-V2.6-Flash 与最高 20x 输出提速的 MiMo-V2.6-Pro-UltraSpeed。
推荐理由:文中给出 RL 训练的批量、上下文与 token 步长细节以及开源范围,便于判断开放 RL 环境的价值。
TypeSafe AI CEO Diogo Almeida 在 Latent Space 访谈中详解新模型 Jev 的定位:面向软件的 System One 模型,以及自研的 RLCD 训练路线。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中亮相,在 Qwen3-VL 上吞吐最高为 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高为 2.5 倍。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,面向语音智能体带来近实时推理升级。
推荐理由:两个版本的分工和基准分数写得很清楚,读者可以直接据此判断自己的语音场景该选哪一档。
GitHub Copilot 在 CLI 中以 /experimental 开启 Project HydraFusion 研究预览,全计划可用,它在运行时从多家供应商的模型里生成执行计划,按质量、成本和延迟自动选择 Single、Cascade、Critique 三种执行模式之一。
推荐理由:三个基准的成本与质量对照数据齐全,读者可据此判断多模型编排在什么任务上划算、在什么任务上有损失。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个新模型,均基于同一核心智能,定价与 3.7 Flash 相同,为 $0.75 per million input tokens 和 $3.75 per million output tokens。
推荐理由:文中列出的多项基准成绩与每百万 token 定价,便于读者横向比较新模型的能力与成本。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码与智能体的最强主力模型,发布价为 3.6 Flash 的一半,即每 1M 输入 token $0.75、输出 $3.75,优惠价持续到年底。
推荐理由:距离 3.6 Flash 仅三周发布,价格降到一半且多项基准有两位数提升,可据此判断 Flash 系列的迭代节奏与成本变化。
MindTopo 是 Microsoft Research 提出的新 benchmark,用连续性、分离、顺序、包围、打结五类任务评测多模态大语言模型的拓扑空间推理能力。测试显示各模型静态识别明显优于交互规划,且两者都远低于人类水平;规划失误多发生在场景已被理解之后,模型会丢失结构关系或提出违反环境动力学的动作。
微软研究院介绍研究模型 CARE-X,一个把胸部 X 光报告生成与带置信度的结构化诊断预测放进同一模型的视觉语言模型,未获任何监管机构批准、不用于临床诊断。
Google DeepMind 发布 Gemini Robotics ER 2,这是它最强的机器人具身推理模型,作为机器人的高层大脑与人对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,且能原生调用 Google Search 等工具。
推荐理由:原文给出了相对 ER 1.6 的评测数字与开放入口,读者可据此判断它在真实机器人工作流中的可用程度。
Berkeley AI Research 提出 ABBEL 框架,用自然语言信念状态取代完整交互历史作为智能体工作上下文,并通过信念评分监督摘要内容。
Google DeepMind 发布实验性开源模型 DiffusionGemma,用文本扩散方式一次并行生成整段文本,在专用 GPU 上文本生成速度最高提升 4 倍。
推荐理由:把扩散式并行解码用到 26B MoE 文本模型上,讲清了本地低并发场景下速度与质量的取舍边界。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 使用 Co-Scientist 连接衰老生物学中分散的发现并生成可检验的假设,已就 integrated stress response(ISR)如何受代谢调控产出新发现,团队计划发表结果。
Berkeley AI Research 发布长文综述自适应并行推理(APR),分析让模型自行决定何时分解子任务、开多少并发线程、如何协调线程的研究进展。