
Duix.Avatar本地数字人视频生成完全指南一段10秒视频克隆自己免费生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款真·开源的本地数字人项目。你只需提供一段 10 秒左右、自己出镜说话的视频就能完成形象和声音的双克隆之后输入文案它会自动生成口型对得上的口播视频。全程在你的电脑上离线运行素材不会上传到任何云端。如果你需要做产品口播、课程录课或个人短视频又不想为付费数字人服务掏钱这篇指南带你从零跑到第一个成片。它到底能帮你解决什么先说清楚它值不值得你花时间装下面三个场景有一个对上号就值得动手。把出镜这件事一劳永逸拍口播视频最贵的是人打光、布景、重录、后期。用 Duix.Avatar 克隆一次自己的形象和声音后数字人模型会一直存在我的形象列表里以后写什么文案就说什么文案不再需要真人站在镜头前。批量产出数字人口播视频同一形象可以反复使用。今天生成产品介绍明天生成课程讲解后天生成节日问候——画面人物始终是你只有文案在变内容产出的边际成本接近于零。素材和数据留在本机从视频分离、声音克隆到音视频合成整条链路都在本地 GPU 上完成。对不能把人脸、声音素材交给云服务的团队和个人来说这是选择本地部署而不是在线 SaaS 的关键理由。动手前的准备这一段核对硬件配置、装好依赖并拉起服务端是后面一切的地基。机器要求硬性一块英伟达显卡且已正确安装显卡驱动——全部算力在本地 GPU 上没有它服务起不来内存 32G 及以上参考配置i5-13400F RTX 4070磁盘Windows 下需要 D 盘存放数字人和作品空闲 30G 以上Docker 镜像默认写在 C 盘空闲 100G 以上首次启动要下载约 70G 镜像系统Windows 10 19042.1526 及以上或 Ubuntu 22.04装软件Windows 先在终端执行wsl --install装好 WSL再安装 Docker Desktop 并首次启动接受协议、跳过登录即可安装最新的英伟达显卡驱动装完执行nvidia-smi能显示出显卡信息就算成功如果打算从源码构建客户端另外装 Node.js 18直接用官方打包好的客户端则不需要获取项目并启动服务端git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar克隆完成后进入项目的 deploy/ 目录执行下面这条命令启动服务端cd deploy docker-compose up -d首次拉取镜像约需半小时建议连 WiFi。在 Docker 里看到 asr、tts、gen-video 三个服务都变为 Running服务端就就绪了。显存紧张可以改用轻量版只启动视频合成一个服务在命令里加-f docker-compose-lite.ymlUbuntu 用户则用docker-compose-linux.yml。C 盘空间不够的话不要硬装打开 Docker Desktop 的设置 → Resources把磁盘镜像位置改到剩余空间 100G 以上的磁盘。客户端从项目 Releases 获取官方安装包Windows 是 .exe 安装程序Ubuntu 是 AppImage双击即可启动。第一次跑通目标只有一个四步生成第一条数字人视频。先看到成片再回头研究细节。打开客户端点Create Avatar创建形象上传一段 10 秒左右的说话视频注意两个硬性条件视频必须有声音且必须是本人在说话——程序要用这段声音做声音克隆等模型生成完毕我的形象里会出现你的数字人点Create Video创建视频选中刚建好的形象输入一段文案点击生成成片会出现在我的作品里可以直接预览和保存。到这里最小闭环已经跑通。核心能力拆解下面三个能力就是这个项目值钱的地方逐个讲清它是什么、怎么用、适合谁。声音与形象双克隆你上传的说话视频会被拆成两路处理一路分离出纯语音送入语音服务基于 fish-speech 模型完成声音克隆同时用语音识别基于 fun-asr把视频里的话转成文字作为参考另一路无声视频用于构建形象模型。两条结果都会留存供后续合成时反复调用。适合想拥有一个可长期复用的数字分身的人——克隆一次无限次使用。文字与语音驱动视频生成克隆完成后生成视频有两种入口输入文字系统先用你的克隆音色合成语音再由视频服务驱动数字人做口型并合成音视频或者直接上传现成的音频文件跳过文字转语音这一步让它按音频的节奏驱动口型。脚本支持中、英、日、韩、法、德、阿拉伯语、西班牙语共 8 种语言。适合做系列口播、多语言内容搬运和日常播报视频。开放 API接入你自己的系统服务端启动后会在本机暴露端口声音克隆与语音合成走 18180 端口视频合成任务提交和进度查询走 8383 端口。想集成进自己的产品调用代码就在客户端源码 src/main/service/ 里照着写就行。适合需要把数字人能力嵌进自有业务系统的开发者。让效果更好的调优清单克隆素材光线均匀、正面出镜、无遮挡、人声清晰稳定宁可重录 10 秒干净的也别用带环境音的长视频长文案分段生成再拼接别一次塞超长文本排队50 系列显卡在 deploy/ 目录改用docker-compose -f docker-compose-5090.yml up -d30/40 系列配 CUDA 12.8 也可用这套磁盘镜像下载约 70GC 盘不够就按前文改 Docker 磁盘位置不要边下边清理保持更新项目更新频繁不少问题新版已修服务端到 deploy 目录重新执行docker-compose up -d客户端拉取代码后重新构建卡住了怎么办按问题—原因—解法速查这四条更多细节看 常见问题文档。问题一docker-compose up -d报连接 registry-1.docker.io 超时原因Docker Hub 官方源连接不稳定。 解法开全局代理或在 Docker 的 daemon.json 里给registry-mirrors配置国内镜像源保存、重启 Docker 后重新执行命令。问题二新增模特克隆形象时直接报错失败原因上传的视频没有声音或画面里没有人说话声音克隆无料可用。 解法重录一段 10 秒左右、人声清晰的说话视频再上传。问题三三个 Docker 服务起不来或反复重启原因缺英伟达显卡或驱动没装好本地 GPU 算力无法挂载。 解法执行nvidia-smi确认能显示显卡信息安装或更新驱动后重启服务。问题四报错信息看不明白定位不到原因解法两端都看日志。客户端点右上角设置里的Open Log查看本地日志Docker 中点进对应服务打开日志面板把关键几行复制出来对照排查。你的本地数字人工作台已经搭好。先去生成一条口播视频感受一下嘴型与声音的效果再尝试 8 种语言脚本和开放 API让它慢慢变成你的内容生产线。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考