
vox-director的A-roll模式详解真人出镜视频如何自动重剪为Vox风拼贴并保唇形同步【免费下载链接】vox-directorTurn one topic into a finished Vox-style paper-collage explainer/ad video — automated end to end on Atlas Cloud ffmpeg. An agent skill.项目地址: https://gitcode.com/gh_mirrors/vo/vox-directorvox-director 是一个开源 Agent 技能能把一个主题自动变成完整的Vox 风纸拼贴解说视频而它的A-roll 模式则解决另一件事你手里已经有一段真人出镜的口播视频对着镜头说话的讲师、主播、创始人vox-director 会把它自动重剪为 Vox 风格拼贴片——真人的脸、口型、眼神、手势逐帧保留只有轮廓边缘和周围世界变成撕纸拼贴并且全程保持唇形同步。A-roll 模式是什么B-roll 的反向玩法vox-director 有三种输入形态先弄清 A-roll 站在哪个位置模式输入核心逻辑B-roll默认一个主题词从零生成拼贴海报再带动效A-roll本文一段真人出镜口播视频把真实素材本身重剪成拼贴风C-roll一张照片照片抠成贴纸锚进拼贴世界A-roll 的关键区别没有海报要生成关键帧就是主播本人的实拍画面。整条流程是音频优先——先转录、按说话节奏切段再逐段重剪而不是 B-roll 那种先写文案。什么时候用 A-roll当你把一段真人说话的视频文件交给 Agent而不是给它一个主题去写稿时就走这条路。A-roll 三步工作流从口播视频到拼贴成片第一步ASR 自动转录切段scripts/asr_beats.pypython3 scripts/asr_beats.py 项目目录 口播视频.mp4这一步做了三件事抽音轨 转录提取视频自带音频调用xai/stt-v1得到词级时间戳的完整文稿按说话节奏自动切 beat在句尾标点. ! ?或超过 0.35 秒的自然停顿处切刀每段最长不超过9.5 秒为视频编辑模型单次调用 10 秒上限留出余量短于 2 秒的残段会自动并入前一段——无需手动打点生成beats.json草稿每段带start/end/text和可选的content_beats字段给某段填一句贴纸/印章创意生成时会作为叠层元素。 这个草稿是强制确认关口先审阅分镜用 scripts/style_bakeoff.py 跑一次风格试映可直接用主播这段素材当试映源选定theme后再进入生成——AI 提案你拍板。第二步逐段重剪为拼贴风格scripts/aroll_clips.pypython3 scripts/aroll_clips.py 项目目录对每个 beat从源视频切出该时间段带 0.15 秒微垫上传后交给视频编辑模型重剪。核心提示词策略内置于脚本主播被处理为摄影质感的纸片贴纸真实长相 粗黑描边 撕纸轮廓边缘口型、眼神线、手势逐帧跟随源视频不做任何改动只有轮廓边缘和人物周围的世界背景、道具、半调网点、报纸碎片、胶带角才是拼贴风格约束背景元素永不遮挡脸和手。⚠️ 一个用重跑换来的铁律绝不能要求模型重绘或给脸部加半调网点纹理——强措辞和软措辞都会触发模型拒绝。脚本的提示词已经绕开了这个坑。第三步原始音频回灌合成scripts/aroll_assemble.pypython3 scripts/aroll_assemble.py 项目目录这一步是唇形同步的最终保险每个生成片段都与其原始时间段的真实音频重新混流——无论这段是哪个模型生成的声音都直接取自未动的源视频随后把所有 beat 归一化到同一画幅24fps并拼接为final.mp4。唇形同步是怎么保住的三层机制A-roll 的卖点保口型不是单点技术而是三层叠加提示词锁定帧级重剪提示词明确要求 LIP MOVEMENTS 与面部表演逐帧跟随源视频、只换世界不换人短段切分防漂移每段 ≤9.5 秒视频模型在短片段上几乎无法让口型跑偏原始音频回灌确定性成片音轨 100% 来自源视频对应时间段口型与声音在物理上不可能错位——这是不依赖任何模型音频透传行为的硬保证。模型路由与自动降级A-roll 对真人内容的模型选择有讲究详见 SKILL.md A-roll 章节角色模型说明默认重剪google/gemini-omni-flash/video-edit接受真人 摄影感纸片贴纸处理已验证自动兜底bytedance/seedance-2.0/reference-to-video任一 beat 被默认模型拒绝时自动重试两个模型都失败才会提示该 beat 缺失video_model/video_model_fallback可在beats.json中覆盖。脚本还内置画幅路由确认关当项目画幅与模型支持比例无精确匹配时会停下询问确认后才继续保证全片画幅一致。快速上手一条口播视频变拼贴片前置条件一个能读工作流的编码 AgentClaude Code、Codex 等 Atlas Cloud API Key 本地ffmpeg。安装与快速开始见 README.md完整工作流见 SKILL.zh.md。# 1. 转录切段 → 生成 beats.json 草稿审阅 选风格 python3 scripts/asr_beats.py out/my-talking-head my-video.mp4 # 2. 逐段重剪为 Vox 风拼贴含自动降级重试 python3 scripts/aroll_clips.py out/my-talking-head # 3. 原始音频回灌 拼接成片 python3 scripts/aroll_assemble.py out/my-talking-head三个脚本各司其职切段 / 重剪 / 合成全程由一个beats.json驱动中间有一个人工确认关口参考项目文件scripts/asr_beats.py、scripts/aroll_clips.py、scripts/aroll_assemble.py。小结A-roll 模式 ASR 自动切段免手动打点 纸片贴纸式重剪只换世界不换人 原始音频回灌口型硬保证。你只需要录一段对着镜头说话的视频vox-director 就能交回一条保留你真实表演的 Vox 风拼贴短片。【免费下载链接】vox-directorTurn one topic into a finished Vox-style paper-collage explainer/ad video — automated end to end on Atlas Cloud ffmpeg. An agent skill.项目地址: https://gitcode.com/gh_mirrors/vo/vox-director创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考