
免费本地部署3个Docker镜像跑通你的AI数字人【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一个免费开源的本地 AI 数字人克隆工具整套服务离线跑在你自己的电脑上靠文本或音频驱动生成口播视频。用起来很直接录一段 10 秒的正面自拍传上去输入要说的话一会儿就得到一段口型对得上、声音也是你的视频。跑起来之前先确认这几件事先说硬性门槛三个后端服务全部走 GPU 推理没有 NVIDIA 独显的机器这套东西是点不亮的所以搭之前先对一下配置——NVIDIA 独显RTX 4070 起步显存越大越从容32 GB 内存100 GB 左右空闲磁盘Windows 1019042 及以上或 Ubuntu 22.04Docker 装最新版达标的话把仓库拉到本地后面所有操作都在这个目录里完成git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar机器和系统都确认没问题跟着下面两节走基本就是一篇完整的数字分身部署教程。从 clone 到第一次看到画面服务端是三个 Docker 容器fun-asr 做语音识别fish-speech-ziming 做声音克隆与合成duix.avatar 负责视频生成。先把三个镜像拉下来再到 deploy 目录执行 compose 启动docker pull guiji2025/fun-asr docker pull guiji2025/fish-speech-ziming docker pull guiji2025/duix.avatarcd deploy docker-compose up -d拉镜像这一步别急镜像体积不小网络一般的话十几分钟到半小时都能拉完。启动后打开 Docker Desktop或在终端跑docker ps三个容器状态都变成 Running这一关就算过了。客户端和服务端是分开的Windows 用户去项目 Release 页下载最新安装包双击 setup 一路下一步Ubuntu 用户下载 AppImage 版本在终端执行chmod x Duix.Avatar-x.x.x.AppImage赋予执行权限后直接双击运行。客户端自己不算任何东西它只负责把界面操作翻译成对本地三个服务的请求。打开客户端点 Create Avatar上传一段 10 秒左右的正面视频——光线充足、人脸占画面主体、全程在说话因为声音也要拿去克隆。提交后客户端会显示进度第一次跑服务端还要预热几分钟到十几分钟都算正常。完成后回首页你的数字分身已经躺在 My Avatars 列表里了。它到底在本地做了什么把它拆开看一个离线数字人工具做的事其实就是两条线。人脸线训练阶段从你上传的视频里抽帧提取脸型、表情、动作特征得到一个只属于你的数字模特生成阶段把目标音频的口型驱动到这个模特上口型对齐就是这么来的。声音线视频里的人声被送去语音合成服务克隆之后无论输入什么文本都用你的声音念出来。两条线互相独立同一张脸可以配不同语速的脚本同一声音也可以换个模特复用。驱动方式有两种。文本驱动时你输入脚本客户端先把文本送进声音克隆服务生成音频再走口型合成音频驱动时直接上传现成录音跳过合成那一步。文本输入支持中、英、日、韩、法、德、西、阿 8 种语言。客户端侧的训练、合成、语音三块逻辑分别落在 model.js、video.js、voice.js想核对某一步到底干了什么翻这三个文件就行。另外 My Avatars 支持建多个模特生成视频前点一下就能切换不同栏目用不同形象也互不干扰。客户端右上角的齿轮菜单里有两个实用入口Open Log 直接打开客户端日志文件Language switch 切换中英文界面排查问题和演示时都用得上。拿它解决两个真实问题先说企业培训。以前做一套新员工培训视频得约讲师、订场地、排后期一条十几分钟的内容改一版就得重录一轮。现在做法变成让业务专家对着手机录 10 秒自我介绍并说两句话克隆成数字模特之后把培训文档转成脚本用文本驱动模式批量产出风格统一、随时更新。讲师从整天泡在棚里变成录一次 10 秒重拍这块的预算基本归零。第二个场景是自媒体口播。很多创作者被每天必须出镜拖垮光线、状态、场地都不稳定。用这套工具的套路是状态最好那天录一次 10 秒素材之后把文章或选题摘要粘进文本框批量产出文本驱动口播视频一条十几分钟就能完成同一份素材还能换语言脚本出多语言版本不用另请配音。省下来的是每天几小时的出镜加剪辑时间账号日更第一次不靠意志力。跑慢、跑崩了怎么排查如果你看到三个容器起不来或者客户端所有操作都转圈没反应先查显卡驱动。在终端跑一下nvidia-smi能看到显卡和驱动版本说明正常看不到就是驱动没装好——这个项目所有推理都在本地 GPU 上没驱动服务是启动不了的这是硬条件不是玄学。你发现克隆进行到一半特别慢、容器频繁退出多半是 Docker 资源分配不够。Windows 的 Docker Desktop 走 WSL 后端默认给的内存偏小三个服务根本装不下进 Settings → Resources → Advanced 把内存和磁盘额度调大Apply restart 再试。拉镜像慢到像卡死的话一般是 Docker Hub 连接不稳去 Docker Engine 设置里加几个镜像源再重试。口型对不上时先听一遍源音频底噪大、人声和 BGM 糊在一起识别出的音素就会错位把音频先降噪再跑一遍。再检查文本里有没有生僻词、中英夹杂的长串这类词会让发音时长和口型节奏对不上换个说法通常就正常了。排查时客户端日志和容器日志都翻一遍客户端右上角菜单能直接打开日志容器侧在 Docker Desktop 里点进对应服务的 Logs 页签报错一般在最后几十行里。几个值得花两分钟做的事一是把 Docker 的内存和磁盘预算给足。三个服务同开时16 GB 内存、按 60 GB 起步预留磁盘是比较舒服的下限Windows 用户在 Docker Desktop 的 Resources 页调整Ubuntu 用户改 WSL2 的配置二是把数据卷指到你想要的位置。默认 compose 把数据挂在d:/duix_avatar_data下不想占 D 盘的话改 deploy/docker-compose.yml 里三个服务各自的 volumes 映射指向有空间的盘改完docker-compose up -d重建容器生效。模型和素材都落在这几个目录里顺手把整个目录备份一份机器重装时不慌。收尾它适合谁不适合谁如果你有一张 N 卡、预算里塞不下外包视频团队、又介意素材和数据出内网这套东西值得花一下午搭一遍尤其适合要批量出口播的个人和小团队。说句实话主力机只有核显的轻薄本或者追求影视级超写实效果的用户现在就不必折腾了。社区更新比较频繁卡壳时先去 常见问题 翻一遍想把它接进自己的生产流程服务端和客户端都留了 API 入口从 src/main/api/ 下的 f2f、tts 两个文件看起即可。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考