在 Amazon SageMaker AI 上用多轮 RL 微调 search agent
Amazon SageMaker AI 的多轮强化学习(MTRL)被用于微调 Qwen3.6-27B,构建可自主调用 BM25 词法搜索与向量搜索两个工具的企业 search agent。
Amazon SageMaker AI 的多轮强化学习(MTRL)被用于微调 Qwen3.6-27B,构建可自主调用 BM25 词法搜索与向量搜索两个工具的企业 search agent。
Amazon Payments 在 Amazon SageMaker AI 上用多目标 contextual bandit(LinUCB)做产品获客漏斗个性化,七周在线 A/B 测试中一个客户群体的最终漏斗转化实现高个位数百分比的相对提升,另一群体则无改善——问题出在内容而非模型。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构开放 2800 余种病毒蛋白复合体的预测 3D 结构,通过 AlphaFold Database 供全球科学家免费使用。
推荐理由:文中说明了病毒蛋白复合体数据的开放规模和可复用的结构预测流程,便于研究者判断如何接入自己的课题。
Fyxer 借助 OpenAI 模型、微调(fine-tuning)、记忆功能和真实用户反馈,打造了一款能整理收件箱并起草邮件的 AI 行政助理。它会按每位用户各自的口吻撰写邮件草稿。
Google DeepMind 推出 AlphaGenome Atlas 平台,预先计算并开放人类基因组约 9 billion 个单核苷酸变异的效应预测,含配套论文、免费网站门户和 AlphaGenome API。
推荐理由:原文把数据规模与 AlphaFold 数据库对比,读者可据此理解这次开放的资源在生命科学研究中的定位。
Microsoft Research 开源 GigaPath-Flash 与 GigaTIME-Flash,在 PANDA、EBRAINS 全切片基准上以约 50 倍更少算力取得与原 GigaPath 相差 3% 以内的性能。
微软研究院介绍研究模型 CARE-X,一个把胸部 X 光报告生成与带置信度的结构化诊断预测放进同一模型的视觉语言模型,未获任何监管机构批准、不用于临床诊断。
Microsoft Research 开源智能体训练框架 Orchard,核心是基于 Kubernetes 的可复用环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中直接训练智能体,并同步发布训练数据与评测方法。
推荐理由:环境层与三套训练配方一并开源,读者可以据此判断小参数模型在真实 harness 中训练能达到什么水平。
Berkeley AI Research 提出 ABBEL 框架,用自然语言信念状态取代完整交互历史作为智能体工作上下文,并通过信念评分监督摘要内容。
Berkeley AI Research 介绍一种以分治(divide and conquer)取代 TD learning 的 off-policy 强化学习价值学习方法:把轨迹切成等长两段组合价值,Bellman 递归次数可从线性降为对数级。作者与 Aditya 共同主导的近期工作已把该方法扩展到 goal-conditioned RL 等复杂任务。