用 NVIDIA NeMo Agent Toolkit 与 Amazon S3 Vectors 构建智能体记忆并部署到 EKS
AWS 官方教程演示把 Amazon S3 Vectors 实现为 NVIDIA NeMo Agent Toolkit(NAT)的自定义记忆提供者,并部署到 Amazon EKS。
AWS 官方教程演示把 Amazon S3 Vectors 实现为 NVIDIA NeMo Agent Toolkit(NAT)的自定义记忆提供者,并部署到 Amazon EKS。
OpenAI 为 Lenfest AI Collaborative and Fellowship Program 追加支持,提供 $5 million 资金,以及最高 $5 million 的软件额度和工程支持。该项目由 Lenfest Institute 推动,此次扩大规模。
GitHub Security Lab 推出 Fuzzing Taskflow,指向一个 GitHub 仓库即可自动完成 C/C++ 项目的 fuzzing、覆盖率迭代与崩溃分诊。
Microsoft Research 宣布为 Physical AI Toolchain 新增机器人推理卸载能力,可用 Kubernetes 工具把机器人 AI 工作负载容器化并分发到板载计算、边缘 GPU 与云端,集成 ROS2、LeRobot 与机器人仿真器,本次发布含 SO-101 和 UR10e 的卸载示例项目。
Microsoft Research 开源 GigaPath-Flash 与 GigaTIME-Flash,在 PANDA、EBRAINS 全切片基准上以约 50 倍更少算力取得与原 GigaPath 相差 3% 以内的性能。
Google DeepMind 发布实验性开源模型 DiffusionGemma,用文本扩散方式一次并行生成整段文本,在专用 GPU 上文本生成速度最高提升 4 倍。
推荐理由:把扩散式并行解码用到 26B MoE 文本模型上,讲清了本地低并发场景下速度与质量的取舍边界。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的无编码器统一多模态模型,16GB 内存或统一显存即可运行。其基准表现接近 26B MoE 模型但内存占用不足一半,视觉与音频输入直接进入 LLM 主干,并配备 Multi-Token Prediction(MTP)drafter 降低延迟,采用 Apache 2.0 许可。
推荐理由:讲清了去掉多模态编码器如何降低延迟与内存占用,读者可据此判断本地跑智能体的可行性。