OpenAI Academy 推出新学习路径
OpenAI Academy 推出面向员工、开发者、领导者、教育者和学生的新学习路径,帮助他们建立并展示实用 AI 技能。
OpenAI Academy 推出面向员工、开发者、领导者、教育者和学生的新学习路径,帮助他们建立并展示实用 AI 技能。
V7 借助 GPT-5.6 Luna 将成本降低 78%,同时提升准确率。V7 用 GPT-5.6 把零散的公司文件转化为智能体可直接使用的上下文,用于完成复杂且带来源引用的工作。
GitHub Podcast 最新一期拆解了 5 个 AI 热门观点,结论是 RAG 并未死,Skills 与 MCP 解决的是不同问题——MCP 提供标准化工具接入,Skills 承载上下文与最佳实践,可共存于同一工作流。节目还指出开发者仍需为 AI 生成代码负责、招聘方更看重对 AI 使用的判断力,以及为适配代码库而微调模型未必说明代码质量差。
OpenAI 推出澳大利亚青少年安全蓝图(Australian Youth Safety Blueprint),面向更安全的 AI 体验给出一份六支柱路线图,旨在保护并赋能年轻人。
Aniimo 本周登陆 GeForce NOW,玩家可在 Steam Deck 和新支持的 Firefox 浏览器等设备上串流游玩,免去 45GB 下载。Pawprint Studio 的这款免费开放世界生物捕捉 RPG 随本周 11 款新作一同加入,007 First Light 同步获得路径追踪更新,Active Matter、Outer Wilds 等新作也加入云端阵容。
Cooley 基于 ChatGPT Work 打造了 GO Public,把智能引入 IPO 流程。它帮助律师更早发现关键问题,把判断力集中在最重要的环节。
GitHub 借助 GitHub Copilot app 和 Copilot CLI,把 Copilot agent 运行时从 TypeScript 重写为超过 800,000 行生产 Rust,128 个 PR 合入 main,8 月 21 日运行时达到 100% Rust,性能提升若干数量级。
推荐理由:原文用会话日志量化了智能体写代码时的探索比例与编译器报错分布,并给出原地原子替换的迁移方法,可迁移到其他大规模重构。
OpenAI 推出面向法律行业的 Astra for Law(OpenAI for Law),提供法律领域的前沿智能、律所定制工作流、连接的法律数据源,以及面向机密客户工作的法律级管控。
OpenAI 公开了一套用于追踪、调查和披露模型对齐问题的框架,同时发布了六份关于模型意外或令人担忧行为的报告。材料为官方摘要,未提供框架的具体流程与报告细节。
OpenAI 与 AARP 将在美国 10 个城市为 1,000 名老年人提供免费的 ChatGPT 实操 workshop,帮助他们安全地掌握实用的 AI 技能。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中亮相,在 Qwen3-VL 上吞吐最高为 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高为 2.5 倍。
OpenAI 推出 AI 驱动的广告新体验,包括 Sponsored Agents、面向营销人员的工具,以及与 HubSpot 和 Shopify 的集成。相关能力可通过 OpenAI 平台使用。
Hex 借助 GPT-6 Astra,让旗下数据 agent 把复杂分析的答案转成可交互的可视化报告,员工乐于分享这些成果。
ChatGPT Work 与 Codex analytics 的分析能力帮助团队了解 AI 使用量与支出、识别培训需求,并将 AI 采用情况与业务成果对应起来。
OpenAI Economic Research 显示,劳动者正把 AI 用于传统岗位职责之外的场景,并弄清哪些新活动会成为其工作的常规部分。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,面向语音智能体带来近实时推理升级。
推荐理由:两个版本的分工和基准分数写得很清楚,读者可以直接据此判断自己的语音场景该选哪一档。
Fyxer 借助 OpenAI 模型、微调(fine-tuning)、记忆功能和真实用户反馈,打造了一款能整理收件箱并起草邮件的 AI 行政助理。它会按每位用户各自的口吻撰写邮件草稿。
Perplexity 使用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,承担端到端工作,且人工检查频率比此前模型低得多。来源为 OpenAI News。
GitHub 日韩市场营销负责人 Tomoko Tanaka 用 GitHub Copilot 把活动从筹备到会后跟进的流程自动化,原本手工拼几天的搭建如今由一个 GitHub Issue 触发完成。
推荐理由:文章给出把日常流程写成 runbook 交给 Copilot 执行的完整路径,其中用一个 DRY_RUN 开关先演练再上线的做法可迁移到其他自动化。
GPT-6 Astra 提升了 Devin 测试软件并证明其可用的能力。其目标是让工程师少审代码、多交付产品。
OpenAI 将 Habitat 从一个 Python 库演进为全球分布式存储平台,服务 10 亿 ChatGPT 用户,峰值处理 22M requests per second。文章介绍了这一在线存储系统快速扩展背后的设计与演进过程。
GitHub Copilot app 内置 diff、terminal、browser 三个面板,审查、运行、预览 agent 改动无需离开 app。diff 面板以绿色高亮新增、红色高亮删除,可接受改动或让 Copilot 再改;terminal 面板可运行项目命令与 Run 脚本,支持同时开多个窗口。
César de la Fuente 的实验室使用 Codex 和 ChatGPT 在现存与已灭绝基因组中搜索抗菌候选分子,以对抗耐药性(drug-resistant)感染。
OpenAI 在 ChatGPT Work 中推出 Data agent,可连接公司数据、发现洞察,并用自然语言通过 AI 构建交互式仪表盘。
Google DeepMind 推出 AlphaGenome Atlas 平台,预先计算并开放人类基因组约 9 billion 个单核苷酸变异的效应预测,含配套论文、免费网站门户和 AlphaGenome API。
推荐理由:原文把数据规模与 AlphaFold 数据库对比,读者可据此理解这次开放的资源在生命科学研究中的定位。
GitHub Copilot 在 CLI 中以 /experimental 开启 Project HydraFusion 研究预览,全计划可用,它在运行时从多家供应商的模型里生成执行计划,按质量、成本和延迟自动选择 Single、Cascade、Critique 三种执行模式之一。
推荐理由:三个基准的成本与质量对照数据齐全,读者可据此判断多模型编排在什么任务上划算、在什么任务上有损失。
Google DeepMind 与 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测是迄今最先进准确的全球天气 AI 模型,每小时基于实时卫星数据生成一次预报。
推荐理由:模型改为直接学习实时卫星与站点观测,读者可据此看清它与依赖 NWP 数据的前代模型在训练来源上的差异。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个新模型,均基于同一核心智能,定价与 3.7 Flash 相同,为 $0.75 per million input tokens 和 $3.75 per million output tokens。
推荐理由:文中列出的多项基准成绩与每百万 token 定价,便于读者横向比较新模型的能力与成本。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上线 agentic video understanding 视频分析功能,token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出了 token、成本与准确率的具体变化和 API 启用方式,便于判断它会怎样改变长视频分析的成本结构。
Microsoft Research 开源 GigaPath-Flash 与 GigaTIME-Flash,在 PANDA、EBRAINS 全切片基准上以约 50 倍更少算力取得与原 GigaPath 相差 3% 以内的性能。
Gemini Omni 1.1 Flash 发布,新增场景延长、首尾帧插值、360p 快速草稿、4K 上采样和视频参考五项创意控制,已通过 Gemini API 在 Google AI Studio 与 Agent Platform API 开放。
推荐理由:逐项给出五项新控制能力与对应 API 用法,方便开发者判断是否把生成视频流程迁到 Omni 1.1。
Google DeepMind 宣布试点全球首个针对专有前沿模型的双盲评测,与 Singapore AI Safety Institute、OpenMined、AVERI、MLCommons 合作,在隐私保护环境中用保密基准测试 Gemini Flash Lite 模型。
Google DeepMind 发布语音转写模型 Gemini 3.5 Transcribe,据 Artificial Analysis 测量其流式场景平均 WER 为 4.0%,非流式为 2.6%,最终转写耗时相比 Chirp 3 改善 70%,FLEURS 基准上流式与非流式 WER 分别为 5.50% 和 5.04%。
推荐理由:原文给出流式与非流式的 WER 数据和相比 Chirp 3 的延迟改进,读者可据此评估它能否替代现有语音转写方案。
Google DeepMind 宣布与 EVE Universe 背后的独立工作室 Fenris Creations 开展新研究合作,共同原型验证 AI 带来的全新玩法。
Microsoft Research 发布深度学习交换关联泛函 Skala 1.1,训练数据量为首个公开版本的 2.5 倍,并宣布 Skala 已在 CP2K 中可用,正在接入 Psi4、FHI-aims、ORCA 和 VASP。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码与智能体的最强主力模型,发布价为 3.6 Flash 的一半,即每 1M 输入 token $0.75、输出 $3.75,优惠价持续到年底。
推荐理由:距离 3.6 Flash 仅三周发布,价格降到一半且多项基准有两位数提升,可据此判断 Flash 系列的迭代节奏与成本变化。
MindTopo 是 Microsoft Research 提出的新 benchmark,用连续性、分离、顺序、包围、打结五类任务评测多模态大语言模型的拓扑空间推理能力。测试显示各模型静态识别明显优于交互规划,且两者都远低于人类水平;规划失误多发生在场景已被理解之后,模型会丢失结构关系或提出违反环境动力学的动作。
Google DeepMind 发布多语言手语到文本翻译模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 与 Live Transcribe 上提供 ASL 到英语的手语转文字听写,可用于搜索、撰写消息并向 Gemini 提问,后续将支持更多设备与语言。
推荐理由:文中说明了手语翻译区别于语音转写的两大难点,以及用姿势坐标替代 gloss 的设计,便于理解方案取舍
微软研究院介绍研究模型 CARE-X,一个把胸部 X 光报告生成与带置信度的结构化诊断预测放进同一模型的视觉语言模型,未获任何监管机构批准、不用于临床诊断。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext Cyclones、WeatherNext 2 和 WeatherNext 2-mini 三个模型,单一模型在气旋路径、强度与风场结构预报上达到 SOTA 精度,平均比以往模型多出超过 24 小时的提前量,三天预报精度相当于旧模型的两天。
推荐理由:文中说明了单一模型同时处理路径与强度的做法,并给出比以往多出一天以上预警时间的量化口径,便于判断其应用价值。