ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

十天,把 Fusion Xpark GB10 锻成短视频生产工厂 Agent

十天,把 Fusion Xpark GB10 锻成短视频生产工厂 Agent 序报名那晚我们立了一个现在想起来手心冒汗的 FlagDGX Spark Hackathon 报名截止那晚三个人坐在出租屋地板上啃外卖。Fusion Xpark GB10 是当周才寄到的新机器连屏幕都还没装上。别做 Demo 了阿耘嘴里嚼着鸡腿说“做个短视频生产工厂 Agent。”我队长和小北对视了三秒。工厂级小北问。“工厂级。”“三个人十天”“对。”那个晚上我们立了三个字不抽卡。不是一句话生成一段视频不是把同一段提示词点 20 次看哪个能交差。我们要做的是一条有状态、可审计、可重跑、可修复的短视频生产线——用户上传素材 → 多智能体协同拆镜 → ComfyUI 渲染 → 审核 Agent 抽帧评分 → 失败自动修复 → 成片自动拼接。分工也很快定下来我是队长把控架构与 Agent 编排阿耘啃模型优化与决策引擎小北是工程担当Web 前端、状态机、SSE 事件流都归他。谁也没告诉对方第十天晚上回头看的时候那条路上至少有三次我们以为项目要黄了。一、选题让AI 视频生成升级为AI 视频生产半小时的冷水第一天装机、装驱动、起 ComfyUI。MiniMax-H3 第一次吐片那一刻小群里——队里三个人的小群——一片欢呼“通了通了。”欢呼只持续了半小时。阿耘把生成日志往桌上一拍三个问题像连珠炮“单次成功有什么用用户已有素材怎么办角色跨镜头漂移怎么办失败了谁知道为什么”小群安静了 10 分钟。这是我们第一次意识到生成式 AI 的敌人从来不是生成不出来而是生成得不对还说不清哪里不对。三条不可违反的纪律那个晚上我们做了一个反直觉的决定先不优化生成先画生产线。视频生成只是流水线一环。围绕它必须铺出五条带Web 产品层工作台不是展示是控制面编排与决策层FastAPI SSE 状态机 决策引擎创作与资产层编剧、选角、导演、提示词优化 Agent 资产库生成与质检层ComfyUI Adapter 抽帧质检 证据链交付与恢复层FFmpeg 合成 幂等 command_id 事件游标。小北更激进工作台必须第一个起“看都看不见的系统演示不了也交付不了。”我同意。于是运行中被我们拆成排队 → 加载 → 采样 → 评分 → 等待审核这些真实阶段。后来证明这个决定救了演示环节的命。第二天我们开了纪律大会。三条不可违反的规矩写在白板上所有 LLM 输出必须落到结构化契约——剧本、角色、场景、道具、分镜、剪辑六层 JSON Schema由代码钳制。所有 Agent 必须经状态机——谁都不许绕过哪怕是 StepFun 主 Agent也得按 ShotSpec 写。所有失败必须带证据——质检不是打总分是给证据链ScoreReport 没有证据等于零分。这三条纪律后来写进了01-项目说明文档.md。二、编写项目从一张白板到一条能跑的产线五层架构不是想出来的是画出来的第三天我们在白板上画了 4 小时架构图。线划了改、改了划、划了擦。小北擦完最后一版的时候说“今天必须把空壳跑起来明天再不写代码就黄。”那天傍晚FastAPI 状态机 SSE 事件流第一次在浏览器里跳出来——一行字“Hello stage”。三个人同时笑了。主角在第三镜换了脸第四天我们硬着头皮跑了一次端到端伪成片四层架构 一组 mock 数据 一个真实的 ComfyUI 渲染调用。渲染是成功的但接下来发生的事让我们的心沉到了谷底主角在第三个镜头里换了一张脸。“模型不懂这句话是不存在的。模型只有模型给的提示不够结构化”。那一夜我们连夜补招把主 Agent 设计成可插拔模型层默认 StepFun 阶跃星辰但允许换成任何 OpenAI-compatible给角色立资产登记卡description 必须全片逐字一致给每个镜头加reference_assets引用第一个就是定妆照给 LLM 输出加结构化契约从漂移事件链变成可定位的契约违例。凌晨四点小北在群里发了一句“模型负责创作代码负责纪律。”这条后来写进了01-项目说明文档.md的「作品特点」。三、调优 Agent七角色流水线与差点散架的那一夜七角色上线看起来很美第五天七个 Agent 同时上线制片助理、编剧、选角、导演、提示词优化、审核、修复。我拉起一台隔离环境跑规划链路制片助理 → 编剧 → 选角 → 导演 → 提示词优化 → 审核 → 修复。第一次跑完端到端吐出了一个 30 秒、9:16 的完整短剧——结构整齐、角色稳定、镜头清晰。完美了。但是——这是阿耘加的字——“第三个镜头的次运动没生效画面像静帧。”第一次崩盘审核放行了静帧接下来 12 小时发生的事按时间顺序14:00 — 审核 Agent 抽帧评分给出 0.92 的高分通过14:15 — 我们看回放发现第三镜其实没动14:30 — 阿耘说“决策引擎在第二镜后就 keep 0 了节省算力但违反了secondary_motion契约”14:45 — 小北说“审核放行了但事实没通过。质检是失职的。”15:00 — 三个人第一次在群里摔表情包。我们意识到两件事多 Agent 不是角色扮演——它的价值是每步可验证、可替换、可审计。谁跳过状态机系统就崩。质检不能只看总分——必须带证据。那天夜里我们写下了01-项目说明文档.md「质量与修复闭环」的那段审核 Agent 是质检不是裁判质检必须有证据。四、大模型调优530 秒 → 340 秒凌晨两点我们知道有戏了阿耘的至暗时刻第六天是阿耘一个人的至暗时刻。要把 MiniMax-H3 的 ComfyUI 工作流冻结成 API JSON 模板听起来只是把节点图 export 出来做起来全是坑允许替换的输入只有提示词、素材路径、seed、尺寸、时长——多一个字段模型就失控少一个模型出乱码Adapter 要逐场调每个 Run 必须记录工作流哈希、模型配置、素材版本、输出文件H3 启动参数还得带--fp8_e4m3fn-unet --bf16-vae --bf16-text-enc --reserve-vram 2.0——少一个就 OOM。阿耘改了十几版 Adapter。凌晨两点他在群里发“现在每个成片镜头都能回溯到它是怎么被生出来的。”我们回“睡觉吧。”他没睡。他开始调决策引擎。决策引擎从省钱到决策凌晨前后——也可以算这一天的尾巴——阿耘把009jev Native SLA 路径接上了本地 Laya 决策引擎从采样首步开始逐层选 keep rate。第一次实测数据出来的时候我们三个人盯着屏幕沉默了几秒5 秒、4 step、热缓存端到端从 530.2 秒降到 340.1 秒降幅 35.9%。这不是 benchmark 数字。这是每条合格视频的生产成本直接砍掉三分之一。那天早上我们奢侈地吃了一顿豆浆油条。这是十天里唯一的庆祝。五、视频生产与完工质检证据链、决策可替换、沉淀成 Skill第二次崩盘审核又放行了角色漂移这一天下午我拉起一个生产线程跑 30 秒的 demo 短剧。前两个镜头完美。第三个镜头——主角又换了脸。但审核 Agent 给的是总分合格。推翻质检设计那一夜我们三个人坐在小屋里白板上画满了质检应该是什么。小北说“**质检不能只输出总分。**系统必须记录文件可不可解码、时长对不对、音轨存不存在、抽帧有没有漂移、动作有没有完成、有没有水印、有没有多余人物。每个 ScoreReport 必须带证据。”阿耘补刀“**关键项失败不可被总分抵消。**角色脸对不上分再高也是废品。”我加最后一句“**修复不是无限重试。**预算耗尽自动转人工审核。”那天夜里没有新功能上线。但我们三个都知道它从能跑变成了敢交付。唯一一次吵架决策层要不要接第二条路径隔天上午我们吵了一架——十天里唯一的一次。议题是要不要花时间接入 OpenJev GGUF 作为第二条决策路径。小北反对“Laya 已经跑通了。剩两天稳住交付是正事。绑死一个模型算什么大事”阿耘坚持“决策层如果绑死在一个模型上这个架构就是半成品。评审一眼看穿。”我拍板“接。只给半天。”结果OpenJev 用llama-server跑在宿主机上客户端严格遵守和 Laya 相同的问题构建与返回契约——一次通过。实测400.1 秒比基线降 24.5%。争吵的结论是甜的——决策层被证明可替换系统不会绑死在单个模型上。小北认输请了两杯咖啡。这十天里最大的收获是架构的尊严不来自能跑来自能换。完整流水线跑通又一天我们用完整流水线跑了一条 60 秒的成片5 个场景、12 个镜头、12 个审核 ScoreReport、2 次自动修复、1 次人工审核。没崩。同日下午我们用#/chat跑了第二条上传一段 docx 字幕 → 自动规划分镜 → 渲染 → 质检 → 拼接。成片出来的时候三个人又沉默了几秒——这回是另一种沉默。它真在生产了。最后一天把踩过的坑沉淀成后来者的路标第十天我们没有加任何新功能。我们做了一件事把经验沉淀成两个 Agent Skill。Skill 1learning-video—— 文档图片 → 1080P 学习视频把前面提过的经验沉淀成 Markdowndocx 提取、CLIPS模板、gen_learning_video.py、concat_learn.sh、dewatermark.sh。Skill 2short-drama-script—— 短剧分镜的结构化提示词规范把踩过的坑写成路标一镜一主动作角色 description 全片逐字一致道具登记 count 限定 start/end_state 互斥否定约束用英文渲染只取reference_assets第一张…共六大层契约、十条写作侧预防对照。Skill 的价值在于把这次调通了变成下次可以复用。也把我们踩过的坑变成后来者的路标。尾声十天之后我们怎么理解这台机器Fusion Xpark GB10 不再是一块显卡十天前Fusion Xpark GB10 对我们而言是一块能跑大模型的本地显卡。十天后它是一台本地内容生产的调度中心StepFun 主 Agent 在上面思考MiniMax-H3 在上面渲染Laya 和 OpenJev 在上面决策质检和事件流在上面守住交付底线。三个人十天的五条经验如果要总结三个人十天学到的东西只有五条生产线先于生成——没有状态机和证据链单次成功毫无意义模型负责创作代码负责纪律——结构化契约比 prompt 技巧可靠得多多 Agent 的价值不是像团队是可审计——可验证、可替换、可修复优化要落到端到端成本——35.9% 不是 benchmark是每条片子的生产成本直接砍掉三分之一最后一天用来沉淀——Skill 比新 feature 更长寿。这就是短视频工厂 Agent 的十日历程三个人的队伍一台 Fusion Xpark GB10一条真的能跑的生产线。我们没有把AI 视频生成做完我们把短视频生产做成了。
返回列表