GPT-6 系列模型指南
GPT-6 系列模型指南讲解创业者如何选择合适的 GPT-6 模型、调节 reasoning effort,并改进提示词与技能(skills)。此外还覆盖工具协调,以及为生产环境准备工作流的方法。
GPT-6 系列模型指南讲解创业者如何选择合适的 GPT-6 模型、调节 reasoning effort,并改进提示词与技能(skills)。此外还覆盖工具协调,以及为生产环境准备工作流的方法。
Amazon SageMaker AI 的多轮强化学习(MTRL)被用于微调 Qwen3.6-27B,构建可自主调用 BM25 词法搜索与向量搜索两个工具的企业 search agent。
GitHub Blog 指出 AI 正在改变开发者的工作方式,需加强三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首个答案、把 AI 省下的实现时间用于解决更大问题。
NVIDIA 宣布本月推出 DGX Spark 64GB 统一内存配置,由 Acer、ASUS、Dell、Gigabyte、HP、MSI 等厂商供应,10 月 23 日开售,起价 $4,999,出厂即搭载 DGX OS 与 NVIDIA AI 软件栈。
一个覆盖 300+ 应用的企业迁移项目在 Amazon Bedrock AgentCore 上采用四智能体模式,把每个应用的 IaC 开发时间从 3 到 4 周缩短到几分钟。
AWS 官方教程演示把 Amazon S3 Vectors 实现为 NVIDIA NeMo Agent Toolkit(NAT)的自定义记忆提供者,并部署到 Amazon EKS。
AWS 官方教程展示如何用 Amazon Bedrock AgentCore 构建环境智能体,让 S3 上传等事件自动触发智能体任务,并在需要时通过 ask_human 暂停等待人工答复后从断点恢复。
教程演示如何在 Amazon Bedrock AgentCore Runtime Instances 上用作曲、交付、合规三个智能体协作,产出一个可播放的 .wav 音频。
CoreWeave 在 CoreWeave Fully Connected 大会上宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T Ethernet 网络,并推出连接训练、评估与改进环节的 CoreWeave Forge。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,为 agentic 编码、计算机使用和专业工作负载带来更强推理能力。
推荐理由:文章给出 GPT-6.1 Sol 相对 GPT-6 Sol 的成本与成绩对比,以及 Bedrock 上的部署与数据控制项,便于评估引入代价。
Amazon Quick 各组件对提示词的解读方式不同,需按组件分别定制:Quick Research 要写明目标、受众与焦点,并可从 Quick Index 与 200+ 新闻源中筛选数据源。Quick Flows 要写清触发时间、数据源、计算与输出格式,复杂流程用编号步骤组织,建成后可通过对话迭代调整。Quick Sight 查询需包含业务问题、指标、维度与可视化偏好。
在 AWS 上搭建合同智能平台:用 AI 智能体把合同 PDF 的关键字段结构化入库,解决 RAG 语义搜索无法跨数百份合同做聚合查询的问题。
OpenAI 推出 dots,一款可主动推进工作的助手,能持续处理复杂项目与日常任务。在工作自动向前推进的同时,用户仍保持对过程的掌控。
GitHub Copilot app 让用户用自然语言描述即可生成可与 agent 共享的双向画布界面,无需写代码或手动设计。创建时在 agent 会话中输入 /create-canvas 技能,说明画布支持的工作流、用户可做的操作和 agent 可做的操作,agent 便会在右侧面板构建界面。
推荐理由:以 /create-canvas 为例讲清双向共享界面的搭建步骤,读者可照此把自己的工作流做成画布。
GitHub Copilot 官方博客提出聊天往往是错误的 UI,主张让用户按任务现场生成自定义 canvas。
推荐理由:作者解释了聊天成为默认界面的原因,并结合 Winget 和 SQLite 等 canvas 实例,给出何时该改用自定义界面的判断。
GitHub Security Lab 推出 Fuzzing Taskflow,指向一个 GitHub 仓库即可自动完成 C/C++ 项目的 fuzzing、覆盖率迭代与崩溃分诊。
NVIDIA 在加拿大多伦多 ROSCon 发布开源免费的 Isaac ROS 5.0,为机器人开发引入智能体工作流与新平台支持。
推荐理由:原文列出智能体技能与生态伙伴的接入方式,读者可看到 AI 智能体嵌入机器人开发的具体路径。
NVIDIA 博文提出 AI 安全是工程问题,主张在 Agent 栈的模型、harness 与运行时各层都落实可执行边界和可验证的防护证据。
V7 借助 GPT-5.6 Luna 将成本降低 78%,同时提升准确率。V7 用 GPT-5.6 把零散的公司文件转化为智能体可直接使用的上下文,用于完成复杂且带来源引用的工作。
GitHub 日韩市场营销负责人 Tomoko Tanaka 用 GitHub Copilot 把活动从筹备到会后跟进的流程自动化,原本手工拼几天的搭建如今由一个 GitHub Issue 触发完成。
推荐理由:文章给出把日常流程写成 runbook 交给 Copilot 执行的完整路径,其中用一个 DRY_RUN 开关先演练再上线的做法可迁移到其他自动化。
GitHub Copilot app 内置 diff、terminal、browser 三个面板,审查、运行、预览 agent 改动无需离开 app。diff 面板以绿色高亮新增、红色高亮删除,可接受改动或让 Copilot 再改;terminal 面板可运行项目命令与 Run 脚本,支持同时开多个窗口。
OpenAI 在 ChatGPT Work 中推出 Data agent,可连接公司数据、发现洞察,并用自然语言通过 AI 构建交互式仪表盘。
GitHub Copilot 在 CLI 中以 /experimental 开启 Project HydraFusion 研究预览,全计划可用,它在运行时从多家供应商的模型里生成执行计划,按质量、成本和延迟自动选择 Single、Cascade、Critique 三种执行模式之一。
推荐理由:三个基准的成本与质量对照数据齐全,读者可据此判断多模型编排在什么任务上划算、在什么任务上有损失。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个新模型,均基于同一核心智能,定价与 3.7 Flash 相同,为 $0.75 per million input tokens 和 $3.75 per million output tokens。
推荐理由:文中列出的多项基准成绩与每百万 token 定价,便于读者横向比较新模型的能力与成本。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上线 agentic video understanding 视频分析功能,token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出了 token、成本与准确率的具体变化和 API 启用方式,便于判断它会怎样改变长视频分析的成本结构。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码与智能体的最强主力模型,发布价为 3.6 Flash 的一半,即每 1M 输入 token $0.75、输出 $3.75,优惠价持续到年底。
推荐理由:距离 3.6 Flash 仅三周发布,价格降到一半且多项基准有两位数提升,可据此判断 Flash 系列的迭代节奏与成本变化。
Microsoft Research 开源智能体训练框架 Orchard,核心是基于 Kubernetes 的可复用环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中直接训练智能体,并同步发布训练数据与评测方法。
推荐理由:环境层与三套训练配方一并开源,读者可以据此判断小参数模型在真实 harness 中训练能达到什么水平。
Berkeley AI Research 提出 ABBEL 框架,用自然语言信念状态取代完整交互历史作为智能体工作上下文,并通过信念评分监督摘要内容。
Google DeepMind 发布三款 Gemini Flash 系列新模型,主打规模化构建 AI 智能体所需的效率与低延迟。
推荐理由:同一 Flash 家族三款模型一次发布,含定价与逐项基准对照,便于直接评估迁移成本。
Berkeley AI Research:近零推理成本将为数据系统带来三类挑战——面向 Agent、由 Agent 管理、由 Agent 合成。GPT-4 级能力每百万 token 成本从约 $30 降到不足 $1,推理价格每年下降 9x 到 900x。80-90% 子查询为重复工作,但更多 agent 尝试可显著提升任务成功率。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前它只作为独立的 Gemini 2.5 computer use 模型提供,现在已原生集成进主打的 Gemini Flash 模型。
推荐理由:原文说明了功能从独立模型到内置的路径和两项可选企业防护,读者可据此评估接入与安全权衡。
Google DeepMind 发布 AI Control Roadmap 框架,用纵深防御方式管理内部部署的先进 AI 智能体,并同步发布面向政策制定者的技术框架 Three Layers of Agent Security。
推荐理由:原文给出把不可信智能体视作内部威胁的整套做法,以及按模型能力分级的检测与响应指标,对建设智能体安全体系有直接参考价值。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 与 Google.org 启动最高 $10M 的技术研究资助,面向全球研究人员征集大规模多智能体 AI 系统安全研究提案。
Google DeepMind 发布 Gemini for Science,在 Google Labs 上线三款实验工具并开始逐步开放注册:Hypothesis Generation 基于 Co-Scientist 用多智能体“想法锦标赛”生成并互相评审假说。
剑桥大学教授 Clare Bryant 使用 Google DeepMind 的 Co-Scientist 生成并排序研究假说,锁定了一个此前不在她视野中的蛋白及与其关联的多条信号通路,其团队正在构建含该氨基酸突变的细胞系来验证这些细化后的假说。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 使用 Co-Scientist 连接衰老生物学中分散的发现并生成可检验的假设,已就 integrated stress response(ISR)如何受代谢调控产出新发现,团队计划发表结果。
Google DeepMind 的 Co-Scientist 帮助 MIT 的 Ritu Raman 快速梳理 ALS 领域庞杂且相互矛盾的文献,把原本需数月的工作压缩,并将想法转为可检验假设、按可行性和风险回报排序研究方向。