Google 研究者提出 RRSI,防止自我优化的智能体 harness 记住测试任务
Google 研究者在新论文中提出 RRSI(智能体 harness 的正则化递归自我优化),通过收缩编辑预算和严格的批评器,防止让语言模型反复改写 harness 的自我优化过拟合测试任务。
Google 研究者在新论文中提出 RRSI(智能体 harness 的正则化递归自我优化),通过收缩编辑预算和严格的批评器,防止让语言模型反复改写 harness 的自我优化过拟合测试任务。
Simon Willison 主张按用量计费的服务和 API 应把硬性预算上限设为默认,超过 $X/月 就直接报错,而发警告邮件的软上限不够用。他提到 AWS 在 9 月 16 日的公告中加入了月度支出上限,用量达到上限后项目当月暂停,Google Cloud 也在 7 月推出了可对项目内特定服务设置月度金额上限的 Spend Caps。
Meta 发布开源项目 Muse Gadgets,开发者可自建接入个人 AI 智能体 Muse 的硬件设备。Meta 提供开源固件和 Linux SDK 及若干项目点子,例如为 Muse 加装彩色 e-ink 屏或做成插电视 HDMI 的棒状设备,可基于 Raspberry Pi 或 ESP32 板连接显示器、按钮、传感器、执行器等,并设有 Discord 支持频道。
AWS 介绍 Adjudicated Query 模式,业务用户在 Amazon Quick 聊天界面提出合规问题,通过与违规的判定全部由确定性规则引擎完成,配套参考架构和 GitHub 样例可端到端部署。
教程演示如何通过 Amazon Bedrock AgentCore Gateway 为 Claude Desktop 接入全托管 Web Search,补齐模型实时信息缺口。
Airbnb CTO Ahmad Al-Dahle 表示公司正以从内部到外部的方式推进 AI 原生转型,目前 60% 的代码由 AI 撰写,功能与改进的发布量同比增加近 80%,人均工程师 pull request 吞吐量提升约 1.6x。
Chatham Financial 使用 OpenAI 的 Codex 和 GPT-5.6 构建技术并重塑工作流,将交易验证时间从 30 分钟缩短至不足 4 分钟。
一个覆盖 300+ 应用的企业迁移项目在 Amazon Bedrock AgentCore 上采用四智能体模式,把每个应用的 IaC 开发时间从 3 到 4 周缩短到几分钟。
Amazon Quick 推出 Live Data in Apps,让 AI 智能体构建的 Quick Apps 实时查询受治理的 Quick Sight 数据集,取代发布时冻结的静态快照。
Google 通过 SpaceX 火箭从加州发射了首颗轨道计算卫星原型,由 Planet Labs 建造,用于验证 Google TPU 能否在太空运行,入轨后将以 15 分钟为单位点火跑模型;双方还计划明年试飞两颗更专为计算设计、可通过激光链路协作的卫星。
AWS 官方教程演示把 Amazon S3 Vectors 实现为 NVIDIA NeMo Agent Toolkit(NAT)的自定义记忆提供者,并部署到 Amazon EKS。
AWS 官方教程展示如何用 Amazon Bedrock AgentCore 构建环境智能体,让 S3 上传等事件自动触发智能体任务,并在需要时通过 ask_human 暂停等待人工答复后从断点恢复。
AWS 官方教程演示如何让生产负载、开发者笔记本和外部 CI/CD 三类环境共用一个 Claude Platform on AWS(CPonAWS)订阅,并按 workspace 隔离生产与开发流量。
uniopen 通过在 Amazon SageMaker AI 中对 Amazon Nova 2 Lite 做监督微调并追加提示词级输出优化,使其适配自身的九类行为×三类对象审核分类。
NVIDIA 提出 AI 工厂的回报由盈利能力、使用寿命和需求三项决定,并以高效、耐用、通用三大特性最大化投资回报,每兆瓦工厂成本约 $60 million。
OpenAI 的 Ari Weinstein 和 Nikunj Handa 在 Latent Space 播客中回应关于 Computer Use 进步不足的质疑,并详解 DevDay 发布的 Agents API 与 Decisions API。
教程演示如何用 Amazon Bedrock Knowledge Bases 和 AgenticRetrieveStream API 构建能以自然语言查询理赔记录并返回带引用答案的助手。
教程演示如何在 Amazon Bedrock AgentCore Runtime Instances 上用作曲、交付、合规三个智能体协作,产出一个可播放的 .wav 音频。
CoreWeave 在 CoreWeave Fully Connected 大会上宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T Ethernet 网络,并推出连接训练、评估与改进环节的 CoreWeave Forge。
Amazon Bedrock 在印度提供 Anthropic Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5 的境内推理。
在 AWS 上搭建合同智能平台:用 AI 智能体把合同 PDF 的关键字段结构化入库,解决 RAG 语义搜索无法跨数百份合同做聚合查询的问题。
Condé Nast 与 AWS Generative AI Innovation Center 合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,将单次内容发现任务耗时从平均 250 分钟降至 2 分钟以内。
GitHub Security Lab 推出 Fuzzing Taskflow,指向一个 GitHub 仓库即可自动完成 C/C++ 项目的 fuzzing、覆盖率迭代与崩溃分诊。
GitHub 在 GitHub Copilot 应用中重建了 Pull Request 视图,让一个含 2,200 个文件、超百万行变更和 400 多条行内评论的开源 PR 像普通 PR 一样打开和滚动。
Microsoft Research 宣布为 Physical AI Toolchain 新增机器人推理卸载能力,可用 Kubernetes 工具把机器人 AI 工作负载容器化并分发到板载计算、边缘 GPU 与云端,集成 ROS2、LeRobot 与机器人仿真器,本次发布含 SO-101 和 UR10e 的卸载示例项目。
Google DeepMind 宣布为 Private AI Compute 平台加入安全的服务端持久记忆层,让助手具备跨设备的长期连续性,同时保持设备端级别的隐私标准。
GPT-6 改进了 prompt caching,提高 cache 命中率,并新增诊断、显式断点(explicit breakpoints)和相关控制项。这些改动用于降低延迟和成本。
NVIDIA 在加拿大多伦多 ROSCon 发布开源免费的 Isaac ROS 5.0,为机器人开发引入智能体工作流与新平台支持。
推荐理由:原文列出智能体技能与生态伙伴的接入方式,读者可看到 AI 智能体嵌入机器人开发的具体路径。
NVIDIA 推出 DSX Ready 认证计划,对符合 NVIDIA DSX AI 工厂参考设计要求的合作伙伴产品进行认证,首批涵盖电池储能系统(BESS)与冷却分配单元(CDU)两类。
NVIDIA 称 Physical AI 规模化部署需在硬件、软件、AI、运行环境与部署全生命周期每一层持续保障安全,而非部署前的一次性检查。ABI Research 预计 2035 年 L3-L5 自动驾驶汽车保有量达 49 million,Omdia 估计 2026-2035 年部署约 60 million 台工业机器人。
GitHub 借助 GitHub Copilot app 和 Copilot CLI,把 Copilot agent 运行时从 TypeScript 重写为超过 800,000 行生产 Rust,128 个 PR 合入 main,8 月 21 日运行时达到 100% Rust,性能提升若干数量级。
推荐理由:原文用会话日志量化了智能体写代码时的探索比例与编译器报错分布,并给出原地原子替换的迁移方法,可迁移到其他大规模重构。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中亮相,在 Qwen3-VL 上吞吐最高为 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高为 2.5 倍。
Perplexity 使用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,承担端到端工作,且人工检查频率比此前模型低得多。来源为 OpenAI News。
OpenAI 将 Habitat 从一个 Python 库演进为全球分布式存储平台,服务 10 亿 ChatGPT 用户,峰值处理 22M requests per second。文章介绍了这一在线存储系统快速扩展背后的设计与演进过程。
Gemini Omni 1.1 Flash 发布,新增场景延长、首尾帧插值、360p 快速草稿、4K 上采样和视频参考五项创意控制,已通过 Gemini API 在 Google AI Studio 与 Agent Platform API 开放。
推荐理由:逐项给出五项新控制能力与对应 API 用法,方便开发者判断是否把生成视频流程迁到 Omni 1.1。
Berkeley 研究团队为 K-Search 增加 MLX 后端与结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核适配 Apple Silicon,在 Apple Silicon 上达到接近专家级性能。
Berkeley AI Research 发布长文综述自适应并行推理(APR),分析让模型自行决定何时分解子任务、开多少并发线程、如何协调线程的研究进展。