跳到正文
  1. Latent Space79

    OpenAI DevDay 2026 发布 Dots、GPT-6.1 Sol 与 Decisions API 等更新

    OpenAI 在 DevDay 2026 发布常驻智能体 Dots、模型 GPT-6.1 Sol,以及 Decisions API、ChatGPT Spaces、Marketplace 等平台更新。

    推荐理由:文章汇总了 DevDay 的全部发布并附上多方独立评测数据,可据此对比 GPT-6.1 Sol 与 Astra、Opus 5.5 的价格和能力差距。

  2. AWS Machine Learning Blog73

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,为 agentic 编码、计算机使用和专业工作负载带来更强推理能力。

    推荐理由:文章给出 GPT-6.1 Sol 相对 GPT-6 Sol 的成本与成绩对比,以及 Bedrock 上的部署与数据控制项,便于评估引入代价。

  1. Simon Willison80

    OpenAI DevDay 2026 现场直播:发布 Dots 智能体与 GPT-6.1 Sol

    Simon Willison 在 OpenAI DevDay 2026 现场逐条直播主旨演讲,OpenAI 发布了个人智能体 Dots 和新模型 GPT-6.1 Sol。

    推荐理由:现场时间线覆盖发布会全部关键节点,作者的即时点评点出哪些功能在对标竞品,便于读者判断与自己相关的变化。

  1. GitHub Blog · AI & ML65

    GitHub Copilot app 新手指南:用 canvases 构建自定义工作流

    GitHub Copilot app 让用户用自然语言描述即可生成可与 agent 共享的双向画布界面,无需写代码或手动设计。创建时在 agent 会话中输入 /create-canvas 技能,说明画布支持的工作流、用户可做的操作和 agent 可做的操作,agent 便会在右侧面板构建界面。

    推荐理由:以 /create-canvas 为例讲清双向共享界面的搭建步骤,读者可照此把自己的工作流做成画布。

  1. GitHub Blog · AI & ML62

    GitHub Copilot 撰文讨论聊天框何时是错误的界面

    GitHub Copilot 官方博客提出聊天往往是错误的 UI,主张让用户按任务现场生成自定义 canvas。

    推荐理由:作者解释了聊天成为默认界面的原因,并结合 Winget 和 SQLite 等 canvas 实例,给出何时该改用自定义界面的判断。

  1. NVIDIA Blog63

    NVIDIA 发布 Isaac ROS 5.0,为机器人开发加入智能体工作流

    NVIDIA 在加拿大多伦多 ROSCon 发布开源免费的 Isaac ROS 5.0,为机器人开发引入智能体工作流与新平台支持。

    推荐理由:原文列出智能体技能与生态伙伴的接入方式,读者可看到 AI 智能体嵌入机器人开发的具体路径。

  1. GitHub Blog · AI & ML68

    GitHub 营销负责人用 Copilot 把活动全流程自动化,从建 Issue 到会后报告

    GitHub 日韩市场营销负责人 Tomoko Tanaka 用 GitHub Copilot 把活动从筹备到会后跟进的流程自动化,原本手工拼几天的搭建如今由一个 GitHub Issue 触发完成。

    推荐理由:文章给出把日常流程写成 runbook 交给 Copilot 执行的完整路径,其中用一个 DRY_RUN 开关先演练再上线的做法可迁移到其他自动化。

  1. GitHub Blog · AI & ML62

    GitHub Copilot 推出 Project HydraFusion 研究预览:多模型编排带来接近 Claude Opus 5 的质量与更低成本

    GitHub Copilot 在 CLI 中以 /experimental 开启 Project HydraFusion 研究预览,全计划可用,它在运行时从多家供应商的模型里生成执行计划,按质量、成本和延迟自动选择 Single、Cascade、Critique 三种执行模式之一。

    推荐理由:三个基准的成本与质量对照数据齐全,读者可据此判断多模型编排在什么任务上划算、在什么任务上有损失。

  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个新模型,均基于同一核心智能,定价与 3.7 Flash 相同,为 $0.75 per million input tokens 和 $3.75 per million output tokens。

    推荐理由:文中列出的多项基准成绩与每百万 token 定价,便于读者横向比较新模型的能力与成本。

  1. Google DeepMind71

    Gemini 推出 agentic video understanding,token 消耗最多降 88%

    Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上线 agentic video understanding 视频分析功能,token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。

    推荐理由:官方给出了 token、成本与准确率的具体变化和 API 启用方式,便于判断它会怎样改变长视频分析的成本结构。

  1. Google DeepMind75

    Google DeepMind 发布 Gemini 3.7 Flash,主打编码与智能体的高性价比

    Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码与智能体的最强主力模型,发布价为 3.6 Flash 的一半,即每 1M 输入 token $0.75、输出 $3.75,优惠价持续到年底。

    推荐理由:距离 3.6 Flash 仅三周发布,价格降到一半且多项基准有两位数提升,可据此判断 Flash 系列的迭代节奏与成本变化。

  1. Microsoft Research71

    Microsoft Research 开源智能体训练框架 Orchard,小参数模型在 SWE-bench Verified 达 69.7%

    Microsoft Research 开源智能体训练框架 Orchard,核心是基于 Kubernetes 的可复用环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中直接训练智能体,并同步发布训练数据与评测方法。

    推荐理由:环境层与三套训练配方一并开源,读者可以据此判断小参数模型在真实 harness 中训练能达到什么水平。

  1. Google DeepMind68

    Gemini 3.5 Flash 内置 computer use 智能体操作能力

    Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前它只作为独立的 Gemini 2.5 computer use 模型提供,现在已原生集成进主打的 Gemini Flash 模型。

    推荐理由:原文说明了功能从独立模型到内置的路径和两项可选企业防护,读者可据此评估接入与安全权衡。

  1. Google DeepMind63

    Google DeepMind 发布 AI Control Roadmap 智能体安全框架

    Google DeepMind 发布 AI Control Roadmap 框架,用纵深防御方式管理内部部署的先进 AI 智能体,并同步发布面向政策制定者的技术框架 Three Layers of Agent Security。

    推荐理由:原文给出把不可信智能体视作内部威胁的整套做法,以及按模型能力分级的检测与响应指标,对建设智能体安全体系有直接参考价值。

已经到底了