Google DeepMind 开源实验模型 DiffusionGemma,文本生成提速最高 4 倍
Google DeepMind 发布实验性开源模型 DiffusionGemma,用文本扩散方式一次并行生成整段文本,在专用 GPU 上文本生成速度最高提升 4 倍。
推荐理由:把扩散式并行解码用到 26B MoE 文本模型上,讲清了本地低并发场景下速度与质量的取舍边界。
内容形态
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
24 条精选近 30 天 11 条共收录 37 条
Google DeepMind 发布实验性开源模型 DiffusionGemma,用文本扩散方式一次并行生成整段文本,在专用 GPU 上文本生成速度最高提升 4 倍。
推荐理由:把扩散式并行解码用到 26B MoE 文本模型上,讲清了本地低并发场景下速度与质量的取舍边界。
Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,可自动检测 70+ 语言并连续生成流畅自然的译音,保留说话人的语调、节奏和音高,全程只落后说话人几秒。
推荐理由:解释了连续生成与等待上下文之间的取舍,读者可据此理解近实时同传的延迟表现。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的无编码器统一多模态模型,16GB 内存或统一显存即可运行。其基准表现接近 26B MoE 模型但内存占用不足一半,视觉与音频输入直接进入 LLM 主干,并配备 Multi-Token Prediction(MTP)drafter 降低延迟,采用 Apache 2.0 许可。
推荐理由:讲清了去掉多模态编码器如何降低延迟与内存占用,读者可据此判断本地跑智能体的可行性。
Google DeepMind 发布 Omni 系列首个模型 Gemini Omni Flash,可将图像、音频、视频和文本任意组合作为输入来生成视频,并支持用自然语言多轮编辑且保持角色与场景连贯。
推荐理由:原文写清了输入组合、对话式多轮编辑与分阶段开放节奏,便于判断它会怎样进入现有视频创作流程。