ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

给视频加上“深度感“:CogVideoX从平面素材到立体画面的实操路径

给视频加上“深度感“:CogVideoX从平面素材到立体画面的实操路径 给视频加上深度感CogVideoX从平面素材到立体画面的实操路径【免费下载链接】CogVideotext and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)项目地址: https://gitcode.com/GitHub_Trending/co/CogVideo静态图片和视频之间往往只差一个纵深感画面动起来、空间立起来它才是视频。CogVideo 是清华开源的 AI 视频生成模型支持文生视频、图生视频、视频编辑三类任务。本文从环境安装、提示词写法一路走到多卡加速与 LoRA 微调给出完整路线。两条命令装好依赖跑通第一条文生视频环境要求只有 Python 3.10 到 3.12克隆仓库后一条命令装依赖git clone https://gitcode.com/GitHub_Trending/co/CogVideo cd CogVideo pip install -r requirements.txt首跑建议直接用官方示例 inference/cli_demo.py它统一覆盖 t2v、i2v、v2v 三种生成类型python inference/cli_demo.py --prompt A girl riding a bike. --model_path THUDM/CogVideoX1.5-5b --generate_type t2v值得先弄懂的参数如下--num_inference_steps默认 50步数越多画质越好、耗时越长--guidance_scale默认 6.0取值越大画面越贴合提示词帧数2B 与 5B 为 49 帧8N1约 6 秒 8fps1.5 系列为 81 或 161 帧16N1对应 5 秒或 10 秒 16fps分辨率1.0 系列固定 720x4801.5 系列为 1360x768精度2B 用 FP16 训练5B 与 1.5 用 BF16 训练推理时按训练精度执行效果最稳让画面动起来i2v 是最接近 2D 转 3D 的路径手里有一张满意的静态图想让它立起来选 I2V 模型CogVideoX-5B-I2V 或更新的 CogVideoX1.5-5B-I2V。I2V 把静态图当作视频首帧配合提示词生成后续运动上图是 inference/gradio_composite_demo/ 里官方提供的 I2V 示例图之一1.5-I2V 支持任意分辨率短边 768长边在 768 到 1360 之间且能被 16 整除V2V 以已有视频为输入按提示词重新演绎适合给旧素材加戏想改内容又保留原视频的运动轨迹用 inference/ddim_inversion.py 走 DDIM 反演再加噪的流程目前支持 5B 与 1.5-5B在 2B 上效果不佳2B 模型基于 3D Causal VAE 压缩与重建视频重建几乎无损这是视频编辑链路可用性的基础提示词写出深度长、细、用英文CogVideoX 是在详细的长文本上训练的a girl riding a bike 这类短提示词能出画面但细节和动态层次有限。官方给出的解法是 inference/convert_demo.py调用大模型默认 GLM-4可换成 GPT、Gemini 等任意大语言模型把短提示词扩写成细粒度长描述t2v 和 i2v图片加短提示词两种模式都支持。两条硬约束要注意提示词仅支持英文长度上限 224 token1.5 系列或 226 token1.0 系列。扩写时有意识地放进两类线索画面会明显立体前景与背景物体的空间关系以及光影变化或镜头运动。若打算准备微调数据可用 tools/caption/video_caption.py 配合开源的 CogVLM2-Caption 批量给视频数据生成英文描述直接作为训练集文本。显存与速度两大瓶颈量化、多卡并行与 LoRA 微调显存不够量化到 INT8inference/cli_demo_quantization.py 是量化推理示例diffusers 加 TorchAO开启显存优化后的最低占用大致如下模型FP16/BF16INT8TorchAOCogVideoX-2B4GB3.6GBCogVideoX-5B5GB4.4GBCogVideoX1.5-5B10GB7GBINT8 会拖慢推理速度定位是显存吃紧时的保底手段。单卡模式下还可以开启enable_sequential_cpu_offload()以及 VAE 的 slicing、tiling以速度换显存。生成太慢多卡并行两条路线可选。一是在from_pretrained里加device_mapbalanced把模型摊到多张卡此时必须去掉enable_sequential_cpu_offload()官方实测 2B、5B、1.5 多卡推理分别约需 10GB、15GB、24GB。二是 xDiT 并行引擎 tools/parallel_inference/parallel_inference_xdit.py配套的 run.sh 给出了四卡样例torchrun 启动--ulysses_degree 2 --ring_degree 1 --use_cfg_parallel把注意力与去噪负载分到各卡。想要专属风格LoRA 微调通用风格不满足时finetune/ 目录提供 LoRA 与 SFT 两种训练方式启动脚本为 train_ddp_t2v.sh、train_ddp_i2v.sh、train_zero_t2v.sh、train_zero_i2v.sh。显存门槛参考2B LoRA 需 16GB5B LoRA 需 24GB1.5 LoRA 需 35GBSFT 走 zero-3 加 offload 后5B 八卡 5090 约 28GB 即可。训练出的 LoRA 权重可用 tools/load_cogvideox_lora.py 加载复现。到这里你已拥有从一张静态图、一句提示词到可编辑、可微调深度视频的完整链路下一步先跑通 cli_demo.py参数稳定后用 convert_demo.py 打磨提示词对比同一镜头的立体感提升。【免费下载链接】CogVideotext and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)项目地址: https://gitcode.com/GitHub_Trending/co/CogVideo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表