长视频生成可以回头看了!牛津提出「记忆增稳」,速度提升12倍

[复制链接]
周大 发表于 2025-9-5 14:59:09 | 显示全部楼层 |阅读模式
牛津大学团队提出VMem(Surfel-Indexed View Memory),一种基于3D几何记忆索引的视频生成方法。该方法通过将生成视图按surfel(表面元素)索引,实现对历史参考帧的高效检索,从而在仅需K=4上下文的情况下保持长时一致性,推理速度达4.2秒/帧,较传统21帧上下文方案快12倍。在RealEstate10K等基准测试中,VMem在回环轨迹等任务中表现更优,尤其在长期一致性与图像质量方面超越LookOut、GenWarp等方法。VMem具备即插即用特性,可作为外部记忆模块接入现有世界模型,提升其长期记忆与空间推理能力。目前方法仍受限于非实时性、室内数据依赖及评测指标不足,未来有望通过模型优化与算力提升进一步改进。
来源:https://mp.weixin.qq.com/s/muSPVne06AdhhpNyMrnR8Q

搜索|Archiver|手机版|靠浦网络|靠浦ai课堂 ( 鄂ICP备17024134号-3 )

GMT+8, 2025-9-27 16:25 , Processed in 0.281481 second(s), 23 queries .

Powered by Discuz! X3.5

© 2001-2025 Discuz! Team.

快速回复 返回顶部 返回列表