Runway WorldPrompt 解析:实时世界模型的工程与局限
Runway 本月初推出研究预览 GWM Worlds 2,其 WorldPrompt 输入格式可固定首帧等场景要素并实时注入带时间戳的事件,本文结合 Runway 高管访谈解读其实时化工程路径。
Runway 本月初推出研究预览 GWM Worlds 2,其 WorldPrompt 输入格式可固定首帧等场景要素并实时注入带时间戳的事件,本文结合 Runway 高管访谈解读其实时化工程路径。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为原生实时对话模型加入近实时视频生成的可视化形象,同步起在 Gemini Enterprise 中开放。
推荐理由:文中说明了异步工具调用与语音对话并行的实现方式,对做企业级语音智能体的读者有直接参考价值。
invideo 借助 GPT-6 Astra 规划剪辑以获得更精准的编辑,把色彩校正与调色效率提升 3 倍,并在一天内产出 50 个自定义特效。
Higgsfield AI 借助 GPT-6 Astra 在一天内推出新的视频功能,让小型企业更轻松地创作视频广告,并更快地将新创意工具推向市场。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上线 agentic video understanding 视频分析功能,token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出了 token、成本与准确率的具体变化和 API 启用方式,便于判断它会怎样改变长视频分析的成本结构。
Gemini Omni 1.1 Flash 发布,新增场景延长、首尾帧插值、360p 快速草稿、4K 上采样和视频参考五项创意控制,已通过 Gemini API 在 Google AI Studio 与 Agent Platform API 开放。
推荐理由:逐项给出五项新控制能力与对应 API 用法,方便开发者判断是否把生成视频流程迁到 Omni 1.1。
Google DeepMind 发布图像模型 Nano Banana 2 Lite,并首次把视频生成与对话式编辑模型 Gemini Omni Flash 经 Gemini API 和 Google AI Studio 开放给开发者。
推荐理由:文中给出两款模型的定位分工、单价和开放入口,读者可据此判断是否把现有图像与视频工作流迁移过去。
Google DeepMind 发布 Omni 系列首个模型 Gemini Omni Flash,可将图像、音频、视频和文本任意组合作为输入来生成视频,并支持用自然语言多轮编辑且保持角色与场景连贯。
推荐理由:原文写清了输入组合、对话式多轮编辑与分阶段开放节奏,便于判断它会怎样进入现有视频创作流程。