ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

LongCat-Video粗到细生成策略揭秘:时间和空间双维度如何同时加速推理

LongCat-Video粗到细生成策略揭秘:时间和空间双维度如何同时加速推理 LongCat-Video粗到细生成策略揭秘时间和空间双维度如何同时加速推理【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-VideoLongCat-Video 是美团开源的 13.6B 参数视频生成模型支持文生视频、图生视频与视频续写。它最大的亮点之一是粗到细Coarse-to-Fine生成策略先沿时间轴和空间轴生成低成本的草稿再做高清细化从而在几分钟内产出 720p、30fps 的高质感视频。本文带你读懂这套推理加速方案的设计思路。为什么需要粗到细的视频生成策略视频生成的推理成本对分辨率和帧数极其敏感分辨率从 480p 提到 720p画面 token 数接近翻倍帧率从 15fps 提到 30fps时间维度的 token 数直接翻倍注意力计算量与序列长度的平方成正比序列越长越慢。如果一步到位地生成 720p 30fps 视频显存和耗时都会失控。LongCat-Video 的思路很朴素把大部分去噪计算花在低分辨率草稿上只用一小部分算力做高清细化。这和人类绘画先画线稿、再上色精修的流程一致。双维度粗到细时间轴 空间轴同时做文章在 run_demo_text_to_video.py 中可以清晰看到两阶段流程阶段一粗480p / 15fps / 93帧 → 快速出草稿视频 阶段二细720p / 30fps → 超分 插帧的精修成片时间维度加速从 15fps 草稿到 30fps 成片阶段一生成 93 帧、以 15fps 输出的草稿视频阶段二的 generate_refine 会先用三线性插值把帧数翻倍new_frame_size 2 * num_frame再通过去噪让相邻帧间的运动变得平滑自然——相当于生成式插帧最终输出 30fps 成片。时间轴的粗到细还有一层妙处细化阶段的去噪从半步噪声开始。代码中latent_up (1 - t_thresh) * latent_up t_thresh * noisepipeline_longcat_video.py意味着细化视频只携带 50% 的噪声因此去噪时间表被截断为t 0.5的后半段t_thresh逻辑见 L1218-L1222——细化只需要低噪声精修不需要从头重建画面。空间维度加速480p 底稿到 720p 高清超分空间轴同理阶段一锁定 480p 分辨率桶配置定义在 bukcet_config.py阶段二将目标切换为 720p。草稿先双线性下采样对齐尺寸再编码进 VAE 潜空间在半噪声状态下做后半程去噪完成高清化。两个维度组合起来的效果720p 30fps 的成片主体计算量却只相当于一个 480p 15fps 的视频。Block Sparse Attention720p 细化阶段的关键加速引擎分辨率越高注意力矩阵越长、越稀疏——视频里大部分像素对其实相互影响很弱。LongCat-Video 因此实现了Block Sparse AttentionBSA块稀疏注意力核心实现位于 longcat_video/block_sparse_attention/bsa_interface.py基于 Triton 的前向/反向稀疏注意力内核利用 TMA 等硬件特性加速flash_attn_bsa_varlen_mask.py变长序列的块稀疏注意力实现communicate.py多卡并行时的点对点通信。注意一个细节BSA只在细化阶段开启pipe.dit.enable_bsa()见 run_demo_text_to_video.py。因为草稿阶段分辨率低序列短、算力压力小而 720p 阶段序列最长稀疏注意力收益最大。这正是 README 中Block Sparse Attention 在高分辨率下进一步提升效率的具体落地。长视频场景粗到细 KV 缓存的叠加收益生成分钟级长视频时策略进一步叠加。在 run_demo_long_video.py 中首段由阶段一生成之后每个新片段通过generate_vc视频续写基于前 13 帧条件帧滚动生成开启use_kv_cacheTrue条件帧的 KV 只需计算一次并复用_cache_clean_latents后续片段省掉重复注意力开销全部草稿完成后统一进入 720p 细化阶段。也就是说长视频的粗可以无限长细只在最后集中做一次时间复杂度被显著摊薄。快速上手一键体验 LongCat-Video 推理加速git clone --single-branch --branch main https://gitcode.com/GitHub_Trending/lo/LongCat-Video cd LongCat-Video pip install -r requirements.txt按 README.md 安装依赖并下载权重后运行文生视频 demo脚本会自动走完草稿→细化全流程torchrun run_demo_text_to_video.py --checkpoint_dir./weights/LongCat-Video --enable_compile多卡并行可通过--context_parallel_size2开启 Ulysses 上下文并行longcat_video/context_parallel/进一步摊薄长序列的显存压力。总结时间 空间双维度加速的价值维度草稿阶段粗细化阶段细空间480p720p超分时间15fps / 93 帧30fps帧数翻倍去噪完整 50 步仅低噪声后半程注意力标准注意力Block Sparse AttentionLongCat-Video 的粗到细策略本质上是把贵的计算挪到低成本阶段、让贵的阶段只做必要的精修再叠加蒸馏加速cfg_step_lora把 50 步压缩到 16 步、KV 缓存和块稀疏注意力最终实现几分钟生成 720p 30fps 视频的体验。这套思路对任何追求高效推理的视频生成项目都值得借鉴。【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表