OpenAI DevDay 2026 发布 Dots、GPT-6.1 Sol 与 Decisions API 等更新
OpenAI 在 DevDay 2026 发布常驻智能体 Dots、模型 GPT-6.1 Sol,以及 Decisions API、ChatGPT Spaces、Marketplace 等平台更新。
推荐理由:文章汇总了 DevDay 的全部发布并附上多方独立评测数据,可据此对比 GPT-6.1 Sol 与 Astra、Opus 5.5 的价格和能力差距。
技术方向
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
15 条精选近 30 天 7 条共收录 60 条
OpenAI 在 DevDay 2026 发布常驻智能体 Dots、模型 GPT-6.1 Sol,以及 Decisions API、ChatGPT Spaces、Marketplace 等平台更新。
推荐理由:文章汇总了 DevDay 的全部发布并附上多方独立评测数据,可据此对比 GPT-6.1 Sol 与 Astra、Opus 5.5 的价格和能力差距。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,为 agentic 编码、计算机使用和专业工作负载带来更强推理能力。
推荐理由:文章给出 GPT-6.1 Sol 相对 GPT-6 Sol 的成本与成绩对比,以及 Bedrock 上的部署与数据控制项,便于评估引入代价。
Simon Willison 在 OpenAI DevDay 2026 现场逐条直播主旨演讲,OpenAI 发布了个人智能体 Dots 和新模型 GPT-6.1 Sol。
推荐理由:现场时间线覆盖发布会全部关键节点,作者的即时点评点出哪些功能在对标竞品,便于读者判断与自己相关的变化。
GitHub Copilot app 让用户用自然语言描述即可生成可与 agent 共享的双向画布界面,无需写代码或手动设计。创建时在 agent 会话中输入 /create-canvas 技能,说明画布支持的工作流、用户可做的操作和 agent 可做的操作,agent 便会在右侧面板构建界面。
推荐理由:以 /create-canvas 为例讲清双向共享界面的搭建步骤,读者可照此把自己的工作流做成画布。
GitHub Copilot 官方博客提出聊天往往是错误的 UI,主张让用户按任务现场生成自定义 canvas。
推荐理由:作者解释了聊天成为默认界面的原因,并结合 Winget 和 SQLite 等 canvas 实例,给出何时该改用自定义界面的判断。
NVIDIA 在加拿大多伦多 ROSCon 发布开源免费的 Isaac ROS 5.0,为机器人开发引入智能体工作流与新平台支持。
推荐理由:原文列出智能体技能与生态伙伴的接入方式,读者可看到 AI 智能体嵌入机器人开发的具体路径。
GitHub 日韩市场营销负责人 Tomoko Tanaka 用 GitHub Copilot 把活动从筹备到会后跟进的流程自动化,原本手工拼几天的搭建如今由一个 GitHub Issue 触发完成。
推荐理由:文章给出把日常流程写成 runbook 交给 Copilot 执行的完整路径,其中用一个 DRY_RUN 开关先演练再上线的做法可迁移到其他自动化。
GitHub Copilot 在 CLI 中以 /experimental 开启 Project HydraFusion 研究预览,全计划可用,它在运行时从多家供应商的模型里生成执行计划,按质量、成本和延迟自动选择 Single、Cascade、Critique 三种执行模式之一。
推荐理由:三个基准的成本与质量对照数据齐全,读者可据此判断多模型编排在什么任务上划算、在什么任务上有损失。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个新模型,均基于同一核心智能,定价与 3.7 Flash 相同,为 $0.75 per million input tokens 和 $3.75 per million output tokens。
推荐理由:文中列出的多项基准成绩与每百万 token 定价,便于读者横向比较新模型的能力与成本。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上线 agentic video understanding 视频分析功能,token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出了 token、成本与准确率的具体变化和 API 启用方式,便于判断它会怎样改变长视频分析的成本结构。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码与智能体的最强主力模型,发布价为 3.6 Flash 的一半,即每 1M 输入 token $0.75、输出 $3.75,优惠价持续到年底。
推荐理由:距离 3.6 Flash 仅三周发布,价格降到一半且多项基准有两位数提升,可据此判断 Flash 系列的迭代节奏与成本变化。
Microsoft Research 开源智能体训练框架 Orchard,核心是基于 Kubernetes 的可复用环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中直接训练智能体,并同步发布训练数据与评测方法。
推荐理由:环境层与三套训练配方一并开源,读者可以据此判断小参数模型在真实 harness 中训练能达到什么水平。
Google DeepMind 发布三款 Gemini Flash 系列新模型,主打规模化构建 AI 智能体所需的效率与低延迟。
推荐理由:同一 Flash 家族三款模型一次发布,含定价与逐项基准对照,便于直接评估迁移成本。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前它只作为独立的 Gemini 2.5 computer use 模型提供,现在已原生集成进主打的 Gemini Flash 模型。
推荐理由:原文说明了功能从独立模型到内置的路径和两项可选企业防护,读者可据此评估接入与安全权衡。
Google DeepMind 发布 AI Control Roadmap 框架,用纵深防御方式管理内部部署的先进 AI 智能体,并同步发布面向政策制定者的技术框架 Three Layers of Agent Security。
推荐理由:原文给出把不可信智能体视作内部威胁的整套做法,以及按模型能力分级的检测与响应指标,对建设智能体安全体系有直接参考价值。