
Open-Sora-Plan 文本生成视频实战指南如何用一句话生成第一个视频【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-PlanOpen-Sora-Plan 是一个开源的文本生成视频text-to-video项目用一句文字描述就能生成短视频。单张 24GB 显存显卡可运行 v1.3 模型生成 93 帧 480p 视频适合想运行或微调开源视频生成模型的开发者与 AI 爱好者。先看效果三步生成第一个视频从 0 到一段可播放的视频分三步克隆仓库并安装依赖按 README.md 中 Resource 表下载 v1.3 的模型权重扩散模型与 WF-VAE 各一份运行下面的生成命令。官方示例脚本用 8 卡并行单卡可先跑 29 帧、256×256 的小规格验证环境。# 29帧短视频先用小规格验证环境 python -m opensora.sample.sample \ --model_path ./weights/opensora_v1_3 --version v1_3 \ --ae WFVAEModel_D8_4x8x8 --ae_path ./weights/wfvae \ --num_frames 29 --height 256 --width 256 \ --text_prompt A cat drinking milk \ --fps 16 --guidance_scale 7.5 --num_sampling_steps 50 \ --save_img_path ./output三个常见使用场景文生视频、提示词精炼、图生视频这一节说明仓库里实际能做什么。三个典型场景每个都按输入什么、得到什么、适合什么场合来讲。文本生成视频一句话快速预览镜头输入一句画面描述。建议用英文仓库自带示例提示词库 examples/sora.txt每行一条。得到29~93 帧的短视频16~18fps 下约 2~6 秒分辨率按权重规格选择如 480p、640p。适合场合创意验证、分镜素材预览、演示展示。不想敲命令的话仓库自带 Gradio 网页控制台 opensora/serve/页面上输入提示词、拖动滑条调整帧数、引导尺度与采样步数结果直接在浏览器里播放。提示词精炼把短句扩写成完整描述输入一句话的简单描述训练数据包含中文样本。得到补全了主体、动作、场景可选镜头语言、光影、氛围的完整提示词。适合场合原描述太简略、生成结果主体漂移时先精炼再交给扩散模型。实现是一个基于 LLaMA 3.1 的 LoRA 小模型用 32555 条精炼样本对训练训练与推理流程见 docs/Prompt_Refiner.md 和 opensora/models/prompt_refiner/。图生视频让一张静图动起来输入一张首帧图片v1.2/v1.3 的 i2v 权重还支持指定起始帧和结束帧。得到以该图为开场的短视频。适合场合分镜动画化、产品静图预览。对应权重见 README 的 Resource 表带_i2v后缀的条目控制台有独立的 i2v 脚本 opensora/serve/gradio_web_server_i2v.py。安装与运行环境要求与最小命令集这一节把硬件、软件和容易踩的坑一次说清照着做就能跑起来。项目要求或说明操作系统Linux官方脚本在 Linux 上验证Python≥3.8依赖版本已固定如 torch 2.1.0建议按 pyproject.toml 装GPUv1.3 官方数据24GB 显存可跑 93 帧 480p分辨率与帧数越低显存占用越小NPUv1.5 权重仅支持昇腾 910 系列 MindSpeed-MM 框架GPU 用户建议先用 v1.3磁盘各版本权重均为 GB 级按要下载的版本预留空间最小命令集git clone https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan cd Open-Sora-Plan pip install -e .注意事项帧数需满足 4n11、29、45、61、77、93……宽高需为 32 的倍数否则输入不被模型接受。上文生成命令节选自官方脚本 scripts/text_condition/gpu/sample_t2v_v1_3.sh未列出的参数文本编码器路径、采样方法等以该脚本为准。仓库不含模型权重需单独下载版本与权重的对应关系见 README 的 Resource 表。深入使用批量生成、参数调优与训练入口前面跑通单条视频后进阶内容主要围绕三件事批量、调参、再训练。批量生成--text_prompt支持传入文本文件每行一条提示词一次任务产出多条视频适合成批制作素材。参数调优guidance_scale控制视频对提示词的跟随程度num_sampling_steps影响质量与耗时seed与num_samples_per_prompt用于固定随机性、对比多次结果。多卡与训练官方脚本用 torchrun 起 8 卡推理想自己训练或微调入口在 opensora/train/涵盖 VAE 与扩散模型scripts/accelerate_configs/ 提供 DDP 与 DeepSpeed ZeRO2/ZeRO3 的现成配置。它是怎么工作的压缩与去噪的两级流水线不用理解全部细节记住两件事即可。第一生成是一条三级流水线。文本编码器先把句子翻译成语义向量DiT 扩散模型在潜空间里逐步去噪类似给一张模糊图片反复擦雾最后 VAE 把潜表征解码成可见画面。命令里的--model_path和--ae_path分别指向前两级和后一级的权重。第二WF-VAE 负责高倍压缩。它把视频在时间×高×宽三个方向上按 8×8×8 压缩相当于给行李箱抽真空扩散模型只需在紧凑的潜空间里做精细工作计算量大幅下降。WF-VAE 引入小波分析让压缩更保真同等压缩率下 PSNR峰值信噪比衡量还原质量的指标高于部分开源项目使用的 VAE。仓库里的 examples/rec_video.py 可以拿一段现成视频做压缩—还原往返测试直观检验还原效果。Open-Sora-Plan 适合想运行、微调或研究开源文本生成视频模型的开发者与 AI 爱好者。版本更新、权重下载和相关论文入口都在仓库 README 中建议以 README 作为跟进项目的主入口。【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考