
Duix.Avatar数字人实战指南一段短视频克隆你的外貌与声音全本地离线生成视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一个可以完全在本地离线运行的开源 AI 数字人工具包只用一段几十秒的短视频就能做出一个外貌和声音都像你的数字人再用文字或音频驱动它生成带口型的讲话视频。全程不需要联网素材也不会上传到云端。一、先看看能得到什么 项目说明核心功能外貌声音克隆文字/语音驱动生成带口型同步的数字人视频文案支持中、英、日、韩等 8 种语言硬件要求必须配备 NVIDIA 显卡推荐 i5-13400F 32GB 内存 RTX 4070磁盘空闲 100GB 以上上手耗时首次部署约半小时镜像下载约 70GB 流量取决于网速图Duix.Avatar 数字人客户端主界面上方是创建视频与定制数字人两个入口下方为我的作品与我的数字模特列表二、原理速览人话版 外貌克隆face2face 如何逐帧模仿视频合成服务 face2face 把你的参考视频当作表情源它逐帧分析视频里人脸的动作让数字人照着做一遍。可以理解为皮影戏——参考视频是动作模型是皮影最后生成的视频里口型会与音频对齐。合成服务在本地监听 8383 端口。声音克隆两个容器配合先听再学声音部分由两个容器协作完成fun-asrASR即把语音转成文字先把上传视频里说的话转写出来fish-speech-ziming 再从这段音频里学习你的音色之后用你的声音朗读新文本。API 中topP、temperature默认固定为 0.7普通用户无需改动。部署架构三个容器各管一摊ASR、TTS、视频合成以独立 Docker 容器运行都跑在 GPU 上这也是本项目强依赖 NVIDIA 驱动的原因。素材与结果都写入本地目录如 Windows 下的D:\duix_avatar_data数据不出机器。三、上手指南数字人本地部署步骤 1. 准备确认硬件与系统支持 Windows 1019042.1526 及以上和 Ubuntu 22.04。Windows 下先检查并更新 WSLwsl --list --verbose wsl --update⚠️ 注意没有 NVIDIA 显卡或驱动没装好三个服务都启动不了。这是社区最高频的问题动手前先执行nvidia-smi确认驱动正常。图C 盘空闲不足 100GB 时在此界面将 Docker 镜像存储目录改到其他磁盘2. 部署docker-compose 启动服务git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d首次启动会拉取镜像与模型约 70GB 流量、半小时左右。Docker 中看到三个容器 Running 即部署成功。若场景只需视频合成服务可改用精简编排只启动一个服务Duix.Avatar-gen-videodocker-compose -f docker-compose-lite.yml up -d✅ 建议镜像拉取慢或超时时在 Docker Desktop 的 Docker Engine 里配置镜像源配置示例见 doc/常见问题.md。图在 registry-mirrors 字段配置国内镜像源加速数字人服务镜像拉取3. 安装客户端Windows双击 release 页提供的安装包Duix.Avatar-x.x.x-setup.exe安装Ubuntu 22.04直接双击Duix.Avatar-x.x.x.AppImage运行无需安装。⚠️ 注意定制模型的素材视频必须带人声说话程序要从这段声音里做声音克隆无声视频会失败。4. 使用训练模型并生成视频先点Create Avatar上传视频训练模型再到Create Video里选择模型输入文字或上传音频开始合成。文案支持中、英、日、韩、法、德、阿、西 8 种语言。⚠️ 注意合成过程中别关闭客户端出问题时通过设置菜单的 Open Log 导出日志排查。图在客户端设置菜单点击 Open Log 打开日志目录便于定位部署与合成问题四、谁适合用场景速配 用户类型配置与用法建议个人创作者 / 自媒体RTX 4070 32GB 内存的台式机只做音频驱动视频时用 lite 版编排即可教育 / 培训团队RTX 4090、32GB 以上内存、100GB 磁盘批量产出讲解类视频开发者 / 二次集成直接调本地接口语音合成http://127.0.0.1:18180/v1/invoke视频合成http://127.0.0.1:8383/easy/submit五、进阶与资源二次开发入口与调优建议 二次开发入口服务逻辑在 src/main/service/模型训练、视频合成、声音对外请求封装在 src/main/api/容器编排在 deploy/含docker-compose-linux.yml与 50 系显卡用的docker-compose-5090.yml。合成进度可用http://127.0.0.1:8383/easy/query?code${taskCode}查询参数为合成接口传入的code。调优建议视频仅用于线上发布时先用 720P 出片验证能明显省时省显存50 系显卡请换用docker-compose-5090.yml官方预览版 PyTorch30/40 系 CUDA 12.8 也适用。官方文档doc/常见问题.md问题可在项目 Issues 区提交跟踪。Duix.Avatar 把数字人制作门槛压到一张 NVIDIA 显卡 一段短视频且数据始终留在本地。随着模型与接口的持续迭代虚拟授课、产品口播等场景有望从棚内拍摄变成本地按需渲染。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考