FlashVideo

2个月前发布 4 00

FlashVideo是一个由字节跳动和香港大学联合开发的高效高分辨率视频生成框架,特别适用于文本到视频的生成。通过创新的两阶段框架设计和流匹配技术,FlashVideo 能在短时间内生成 1080p 高清视频,优化视频流畅性,并减少计算成本。

收录时间:
2025-02-20
FlashVideoFlashVideo

FlashVideo是一个由字节跳动和香港大学联合开发的高效高分辨率视频生成框架,特别适用于文本到视频的生成。通过创新的两阶段框架设计和流匹配技术,FlashVideo 能在短时间内生成 1080p 高清视频,优化视频流畅性,并减少计算成本。该平台提供快速预览功能,让用户在 30 秒内获得初步结果,并决定是否继续生成高分辨率视频。该框架已开源,代码可以在 GitHub 上获取。

技术特点

  • 两阶段框架设计:视频生成分为“低分辨率优先”和“高分辨率增强”两个阶段。第一阶段使用 50 亿参数的低分辨率模型(270p)快速生成符合文本描述的视频内容,第二阶段进行分辨率提升和细节优化,最终生成 1080p 高清视频。
  • 流匹配技术:创新性地使用流匹配(Flow Matching)技术,仅需 4 步即可完成高分辨率细节生成,相比传统方法提速显著。
  • 快速预览功能:用户可以在 30 秒内获得初步结果,再决定是否继续生成高分辨率视频。
  • 先进模型架构:首次将 RetNet 架构应用于视频生成,大大提高了效率,将推理时间复杂度从 O(L^2) 降低至 O(L)。
  • 冗余帧插值方法:优化视频的流畅性,进一步提升生成视频的质量。

主要优势

生成速度:1080p 视频仅需 102 秒,比传统方法快 4 倍。

计算成本:相比单阶段模型降低 90% 显存消耗。

生成质量:通过动态时序模块保持动作连贯性,支持每秒 24 帧流畅度。

应用场景

  • 在线广告:用于网站广告,通过创意动画和视频广告吸引用户。
  • 教育培训:用于制作教育课程,通过动画与视频结合讲解复杂概念。
  • 企业宣传:用于品牌推广,增强品牌形象,提升品牌认知度和促进销售。

FlashVideo 的代码在 2025 年 2 月 12 日宣布开源,可以在 GitHub 上获取。

GitHub:https://github.com/FoundationVision/FlashVideo

项目地址:https://jshilong.github.io/flashvideo-page/

数据统计

相关导航

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...