千帧长视频时代到来！MIT全新扩散算法让任意模型突破时长极限

发布时间：2025-02-26

点击次数：

2025年，视频生成技术，特别是基于扩散模型的视频生成，持续发展创新，涌现出众多令人惊艳的文生视频和图生视频模型。然而，长视频生成一直是该领域的一大难题。麻省理工学院（mit）团队近期发表的论文《history-guided video diffusion》提出了一种名为diffusion forcing transformer (dfot) 的全新算法，无需改变现有模型架构，即可实现视频生成长度提升近50倍，达到近千帧。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

论文地址：https://www.php.cn/link/70cd9109e88def5e20c6887a8d9af139 项目主页：https://www.php.cn/link/9d0bbb435db57b64859584c8e160a485

生成的视频长度惊人，需截短并降低帧率才能展示。先睹为快：

千帧长视频时代到来！MIT全新扩散算法让任意模型突破时长极限

现有视频扩散模型广泛采用无分类器引导（CFG）来提升采样质量，但通常仅利用首帧信息，忽略了后续帧的重要性。MIT团队的研究表明：历史信息是提升视频生成质量的关键！

该论文通过混合长短历史模型的预测结果，提出了一系列“历史引导”算法，显著提升了视频扩散模型的质量、生成长度、鲁棒性和可组合性。

在X平台上，论文共同一作陈博远分享的研究成果获得了极高的关注度。

谷歌研究科学家George Kopanas高度评价了这项工作，认为其成果令人印象深刻。

核心方法：

MedPeer科研绘图

生物医学领域的专业绘图解决方案，告别复杂绘图，专注科研创新

166 查看详情 MedPeer科研绘图

论文首先训练了一个能够根据不同历史信息进行去噪预测的视频模型，包括不同长度的历史、历史的不同子集以及特定频率域的历史。然而，现有模型架构缺乏这种灵活性。 DFoT算法巧妙地将Diffusion Forcing中的噪声掩码概念引入视频生成架构，通过控制噪声掩码来实现对任意子序列的预测，无需修改模型架构。

DFoT训练完成后，可以灵活地进行采样。例如，通过控制噪声掩码，可以选择使用前几帧作为条件，或进行无条件生成，或使用特定长度的历史作为条件。

基于此，论文提出了一系列“历史引导”算法，进一步提升了模型性能。

实验结果：

DFoT在Kinetics 600数据集上超越了所有同架构的视频扩散算法，甚至与谷歌的闭源大模型结果不相上下。在RealEstate10K数据集上，DFoT实现了单图生成近千帧的突破性成果。

总结：

DFoT算法及其提出的“历史引导”策略显著提升了视频扩散模型的性能。该研究提供了完整的开源实现和Huggingface在线体验，方便研究者进一步探索。 Huggingface地址：https://www.php.cn/link/af8772553fadf9c4d0e4b49aec689da3

以上就是千帧长视频时代到来！MIT全新扩散算法让任意模型突破时长极限的详细内容，更多请关注其它相关文章！

# 视频生成 # 谷歌 # 变现 # 工程 # 孝感网站建设与优化 # seo网站优化上排名推广教程 # 新媒体网络营销推广项目 # 在哪儿能找网站建设信息 # 入侵网站建设美丽图片 # 数字营销推广计划名称 # 服饰网站建设美丽文案 # 芜湖网站优化服务如何做 # 推广网站优化方案 # 优化网站视觉的方法 # 麻省理工学院 # 首个 # 多项 # 掩码 # 腾讯 # 还能 # 首次 # 时长 # 奥迪 # 提出了 # 2025 # 2025年

相关栏目：【行业新闻62819 】【科技资讯67470 】

上一篇：500万TPM+20msTPOT，火山引擎用「AI云原生」重

返回列表

下一篇：小米双Ultra发布会明天召开至少五大旗舰新品同台发布