ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI短剧制作全流程:从剧本到成片的6步工作流

AI短剧制作全流程:从剧本到成片的6步工作流 说起来AI短剧这阵风刮了也快一年了身边做内容的朋友几乎都在问同一个问题用AI生成单个好看的镜头已经不难了难的是把它们串成一部能审片、能上线、能过甲方眼的完整短剧。我也是从一堆零碎片段里爬出来的踩了无数坑才把整套流程跑通。今天这篇就把我一直在用的6步工作流完整拆开从故事梗概怎么落到可审片成片每一步该怎么操作、用什么工具、避什么坑一次讲透。这6步工作流不是什么高深理论就是我日常接项目、做原创短剧的真实作业流程剧本拆解、视觉资产锁定、分镜设计、批量生成、后期合成、审片成片。每一步都是前面一步的产物顺序不能乱。你只要照着走一遍哪怕第一次接触AI短剧也能产出一部逻辑完整、角色一致、画面稳定的成片而不是一堆好看但拼不起来的素材碎片。1. 从故事梗概到剧本拆解AI短剧的剧本是给“流程”看的很多人做AI短剧第一步就搞反了上来就写几个镜头让AI出图结果做到一半发现剧情接不上角色前后矛盾只能推倒重来。我现在的习惯是先写故事梗概再拆成分场表这一步花的时间越多后面生成素材时返工越少。1.1 三句话梗概和三百字大纲怎么写AI短剧和传统影视最大的区别是它没有现场导演所有信息都要靠提示词和参考图传递。所以剧本必须先压缩成极度清晰的信息单元。我的做法是先写三句话梗概主角是谁、想要什么、阻碍是什么。比如一部古装复仇短剧梗概可以是厨娘苏晚被诬陷下毒三年后携新身份回京凭借一手药膳绝技进入将军府逐步揭开当年真相。三句话必须包含人物、目标、阻碍三个要素这是后续所有角色的行动逻辑基础。然后扩写成三百字左右的分场大纲把起承转合标出来一般3-5集的内容对应5-8个场次就够了。AI短剧不适合动辄几十集的叙事体量除非你打算用工作流批量跑否则单片10-30集的体量最容易控制质量。大纲里要明确每一场的核心信息这一场要告诉观众什么、角色情绪是什么、剧情推进到哪一步。这里有个关键点AI短剧的剧本是给“流程”看的不是给演员看的。它需要的是机器可读的逻辑链条而不是文学性的描写。所以我把大纲里的场景、情绪、动作都标注清楚确保每一条提示词都能从这里找到依据。1.2 分场表设计每一行都是后面的提示词来源分场表是我整个工作流里最重要的中间产物。我用表格管理字段包含场号、场景描述、时间白天/夜晚、出场角色、剧情要点、角色情绪、运镜需求、转场方式、参考素材编号。比如第一场厨房白天苏晚在案板前切菜想起三年前被冤枉的场景。这一行记录里场景描述、角色状态、情绪基调都有了后面写分镜提示词时直接引用就可以。转场方式也要提前想好比如闪回用淡入淡出两个地点切换用match cut这些会直接影响生成镜头时的运动参数设定。分场表的另一个作用是对齐预期。做商业项目时我通常会把这个表格发给编剧或甲方确认他们看表就能理解成片大概长什么样。这样一来后面的生成工作是在一个被确认过的框架里进行不会出现甲方看完成片说“这跟我想要的完全不一样”的尴尬局面。如果你用Coze、Dify这类工作流平台甚至可以把分场表写成一个结构化数据节点后面生成提示词时直接从节点里读取字段实现自动化。不过我自己的习惯是前期控制人力先手动跑通再考虑自动化因为剧本阶段的信息密度太高机器很难完全替代人脑判断。2. 角色视觉资产锁定解决AI短剧最大的翻车点AI短剧最大的翻车点就是角色不一致同一个角色上个镜头还是个圆脸下个镜头就变成了瓜子脸观众一眼就出戏。这个问题不解决内容再好看也没法审片。所以第二步我会花大量时间做角色视觉资产锁定。2.1 角色一致性方案的三个层级角色一致性方案有三条路从易到难适合不同预算和精度要求。第一层级纯提示词描述。在每次生成时都带上“圆脸、杏眼、小巧鼻梁、嘴角有颗痣”这样的描述。优点是零成本缺点是稳定性差AI每次生成都会有细微偏差哪怕加长描述也一样同一个角色不同镜头之间还是可能微妙地不像。第二层级角色参考图图生图。先用一张定妆图我通常用Midjourney或Stable Diffusion生成后续生成镜头时把这张定妆图作为IP-Adapter或reference图传入让生成工具参考人物特征。这个方案比纯提示词稳定得多是目前的主流做法能保证七八成像。第三层级训练角色LoRA。在SDXL或SD1.5的基础上用20-50张同一个角色的高质量图片训练一个小模型生成时调用这个LoRA角色一致性可以达到九成以上。代价是需要显卡时间而且角色确定后不好改适合主要角色集中、集数较长的项目。我实际接项目的标配是“第二层级为主第三层级补主角色”。具体做法是先给每个主要角色出一张定妆图再围绕这张图在ComfyUI里跑图生图流程——正面提示词描述该角色的神态和当前动作参考图负责锁定脸型特征再用ControlNet约束姿势和构图这样出来的镜头基本能达到审片标准。2.2 定妆图和工作流节点组织定妆图是关键资产我一般每套角色出10张左右备选从中挑一张五官最端正、角度最正面、光线最均匀的作为主参考图。这张图还要统一抠图、清理背景吗不用因为我们要的是人脸特征参考背景不影响。在ComfyUI里我会组织这样一个节点逻辑角色参考图通过Image节点读入接IPAdapter或InstantID节点正面提示词里写角色当前动作和环境负面提示词统一写“模糊、变形、多余肢体、五官歪斜”。ControlNet节点可选需要严格构图的镜头才接Canny或Depth普通镜头自由发挥反而更有AI质感。这一阶段最容易踩的坑是“每张图都单独生成没有沉淀资产”。现在我的习惯是每确定一个角色就把参考图、LoRA文件、常用提示词片段全部归档到一个独立文件夹下次用同一个角色时直接调用。如果没有这一步做第二集时又要重新生成同一角色的参考图脸部特征可能会偏离第一集到审片时才发现前后不一致返工成本极高。3. 分镜设计与AI提示词工程把剧本翻译成机器能懂的镜头语言剧本拆完、角色锁定之后就进入了最耗脑力的环节把分场表翻译成分镜表再为每个镜头写出提示词。这是整个工作流中最需要专业镜头语言功底的一步AI工具只是执行者真正的导演思维体现在这里。3.1 分镜表结构镜头号、景别、运动方式我会在分场表的基础上给每一场做分镜表。字段包括镜头号、景别远景/全景/中景/近景/特写、镜头运动固定/推/拉/摇/移/跟、人物动作、人物情绪、环境要素、镜头时长秒、转场方式。以刚刚那部古装复仇短剧为例第一场厨房戏我拆成了4个镜头镜头1是全景苏晚站在灶台前厨房环境交代空间镜头2是中近景她低头切菜表情平静中带着隐忍镜头3是特写手部动作与刀法引出药膳技能镜头4是闪回镜头画面快速切换到她被押出府衙的画面转场方式设定为闪白。这份分镜表为什么必须包含镜头运动方式因为大部分AI视频工具比如可灵、即梦、Dreamina输出后不能cinematic。你只有把镜头运动直接写进提示词生成出来的素材才具备可用度。比如室内推镜头的提示词要写成“镜头缓慢向前推进从全景推至苏晚面部”而不是“一个镜头”后者生成的结果往往是固定的机位剪起来非常死板。3.2 提示词三段式模板和负面提示词我用的提示词模板是基本固定的三段式不搞花活主体描述段“苏晚二十岁左右中国古装女性圆脸杏眼身着素色粗布汉服站在古风厨房灶台前。”这一段直接引用分场表中的人物设定信息。动作情绪段“低头切菜面无表情但眼神中透出隐忍与不甘。”这一段对应分镜表中的动作和情绪字段。镜头与质感段“中近景镜头轻微下摇从面部到手部光线为清晨柔光电影感画面浅景深细节丰富写实风格。”这一段直接决定了生成结果的光影和镜头语言。负面提示词我固定写一串“模糊、像素化、五官扭曲、肢体变形、多余手指、背景穿帮、水印、文字、低质量。”不要觉得负面提示词废话实测下来写不写差距极大尤其是“多余手指”和“文字水印”这两项不写经常会莫名其妙出现。用代码块放一个我常用的ComfyUI正向提示词示例供参考masterpiece, best quality, cinematic lighting, depth of field, a chinese ancient female, round face, almond eyes, plain cloth hanfu, standing in an ancient kitchen, cutting vegetables on a chopping board, calm expression with hidden bitterness, looking down, medium close-up shot, subtle camera push-in, soft morning light through window, 8k uhd, photorealistic, film grain这里还有一个经验提示词里的情绪表达比外貌描述更影响成片的“演感”。AI模型对情绪词的反应出人意料地敏锐“眼神中带着隐忍”比“表情难过”更能生成出有内容的画面。这也是为什么分场表里我特别强调角色情绪字段。4. AI视频片段批量生成管理是核心命门分镜表和提示词准备好后就进入AI视频生成环节。这一步看似简单就是把提示词一条条喂进工具里但实际上最大的难点不是生成而是管理。4.1 主流AI视频工具怎么选、参数如何定市面上主流的AI视频生成工具有可灵Kling、即梦Jimeng、Runway Gen-3、Luma Dream Machine等各有特点。我的选型逻辑是国内平台优先因为上传快、生成稳定、审片流程也方便可灵我先期用得最多对中文提示词的理解好运镜指令响应准确适合批量生成即梦的画质渲染偏细腻适合高质感场景Luma胜在运动流畅但它的免费额度不稳定多镜头项目不建议依赖它。参数设置也有门道。官方默认的时长一般是5-10秒做短剧我通常选5秒因为短剧节奏快5秒一个镜头刚好是一句台词的体量太长后面剪辑时还要掐头去尾等于浪费生成token。运动幅度这个参数很关键建议先从低参数开始画面太静止再加一点避免出现人物形变。生成的分辨率建议直接用1080p不要用720p后期拉伸画面会糊。生成数量不能省。每个镜头至少要生成3条候选重要镜头甚至生成5条以上。为什么AI生成具有不确定性同一条提示词出两次结果会有细微差异而最终剪辑时只有某一条的动势、表情、光影符合戏剧需求。多版本候选是保证审片质量的底气。4.2 用表格做生成任务追踪命名规范决定后期效率管理生成素材我用一张表格字段包含任务编号、对应镜头号、工具名称、提示词版本、生成时间、视频文件URL、运动幅度参数、满意度评分、备注。这张表是流水线的心脏每天结束前必做的一件事就是更新这张表。文件命名规范同样重要。我的命名规则是集数_场次_镜头号_生成序号_参数标记。比如“E01S01L01_V2_motion5.mp4”一眼就能看出这是第一集第一场第一个镜头的第二个候选版本运动幅度参数是5。不夸张地说命名规范决定了后期剪辑的效率不规范的命名会让你在素材堆里找半小时。这一环节最常见的坑是“跑得太快忘了记录”。生成工具界面里结果很直观你很容易直接下载而忘了更新表格到第二天素材上百条时就彻底乱套。所以我的建议是先建好表格和文件夹再开始生成每生成一条立即把文件下载到对应文件夹并登记。这个过程很机械但绝对不能省。还有一个容易被忽视的点同一个场景里的光线方向要保持一致。AI生成时如果你不约束同一个厨房场景可能一次是左窗光、一次是右窗光剪辑起来光线跳跃会非常明显。我的做法是在分场表的“环境要素”里加一项“主光源方向”写提示词时统一带上“light from left window”之类的描述保证素材的连贯性。5. 从素材到成片剪辑、配音、音效的合成流程素材批量产出后就进入了后期合成环节。这一步对AI短剧来说目标和传统视频一样但注入了几个AI时代特有的讲究。5.1 粗剪定节奏AI生成素材的取舍逻辑AI短剧剪辑和传统影视有本质区别传统影视的素材是连续拍摄的剪辑师有大量冗余可以选AI素材是离散生成的每一条都是独立片段剪辑的本质是“选择和拼接”。我通常用剪映或Premiere做粗剪先把分镜表按顺序铺在时间线上然后用备选素材替换掉不合格的片段。粗剪阶段只关心节奏每个镜头是否足够传达本条信息镜头间的衔接是否顺畅整体叙事是否推进。这个阶段不调色、不加音效、不整字幕。镜头间的衔接有几个硬标准运动方向一致上一个镜头主角往右走下一个镜头最好保持同一方向感景别变化不要太大全景直接切特写会跳光线情绪统一。AI素材本身连贯性就不如实拍所以剪辑时更要通过镜头顺序和持续时间来“骗过”观众。一个AI短剧剪辑的独家技巧善用AI生成素材的“呼吸感”。很多AI视频在首尾几帧有轻微漂移或模糊处理时在剪辑软件里给每段素材的边缘切掉3-5帧让硬切更顺滑减少生成痕迹。这个细节你肉眼看单条素材看不出问题但放到成片里非常影响观感。5.2 配音、音效和字幕AI短剧的“半条命”AI短剧的听觉层和视觉层一样重要。很多人只关注画面做完画面就发结果成片干瘪得像默片。配音优先用AI配音工具快速出demo版本比如剪映自带配音功能、魔音工坊、讯飞等。demo版本的目的是先确认台词、节奏、时长属于“试听版”。审片版阶段我会尽量换真人配音因为AI配音的情感表现力目前还不够支撑短剧这种情绪浓度较高的内容。当然如果你的预算有限用高质感AI音色加后期变速、变调处理也能过关。音效层是重点。AI短剧往往是纯生成画面没有现场收音听起来会非常“假”所以需要老老实实补音效。环境音这一步尤其重要比如厨房场景要用柴火噼啪声、切菜声室内场景加一点低频空间声转场处加过渡音效。没有这些画面就悬浮在空中。BGM方面短剧通常是情绪推动型可以直接用音乐库里的情绪类配乐关键节点再单独卡点。字幕我建议在成片规范确定后统一生成用剪映的自动字幕功能快速识别然后手动校对一遍。注意AI视频的画面质量通常不够干净字幕样式要选择有描边或阴影的款式防止文字和画面糊在一起。6. 审片标准与导出交付什么是“可审片成片”流程走到最后一步很多人以为导出就完事了但“可审片成片”其实是个有明确标准的交付物。这个标准不是画面多精美而是能让审片人一次性看完整部剧的节奏、情节和视听表现力而不是被各种技术瑕疵打断。6.1 审片清单按单集逐项打钩我的审片清单包含下面这些项逐集过角色一致性同一角色在不同镜头里脸部特征是否统一至少八成像。口型与台词台词时长是否与画面匹配口型是否基本对得上AI短剧不要求完全对口但要避免大段台词配一个完全没张嘴的脸。衔接连贯性镜头之间的运动方向、光线、视线是否一致有没有跳切感。音频规范人声音量居中BGM不压人声音效层次合理没有爆音或音量失衡。字幕质量无错别字标点统一不遮挡人脸。节奏整体感单集时长是否在指标范围内前3秒有没有吸引力的钩子结尾是否留下悬念。审查通过后才进行最终导出。6.2 导出参数和平台适配交付前最后一道门槛导出参数直接决定成片在不同平台的呈现效果。我的基准导出设置是分辨率1080p帧率30fps编码H.264码率8Mbps左右音频格式AAC采样率48kHz。如果平台支持2K或4K再提升一个档位但优先保证码率够用避免画面拉丝。不同平台的适配要求有差异抖音、快手这类竖屏短视频平台适合9:16竖屏输出封面字大且信息集中B站和视频号支持更高画质横屏16:9也可以如果做海外发行则要注意SRT字幕文件和独立音轨文件是否完整。这一步最容易出问题的是“在不同平台各导出一版”导出前一定要确认平台的画幅要求。我试过一次在剪映里直接导出9:16的抖音版本结果字幕全部被底部按钮挡住后来只好重新调整安全边距再导出一版白白浪费了一晚上。现在我的做法是导出前先在预览窗口打开“平台安全边距”参考线把字幕和人脸都限制在安全区以内再输出。另外无论是用剪映还是PR导出后都要做二次播放检查重点看转场处的画面有无卡顿、音频有无爆音、最后输出文件是否被平台压缩过度。这套检查很可能需要你再微调一版导出参数但比起发布后才发现问题这一步的钱和时间必须花。我个人的经验是AI短剧能不能成片大概三分靠生成质量七分靠流程管理。工具迭代快今天的好工具三个月后可能就不好用了但工作流的骨架不会变——先有清晰的信息结构再做资产锁定然后按分镜批量生成最后严格审查输出。你只要把这套流程跑通一次后续做新剧就是同样的流水线换个故事效率会越来越快踩坑概率也会显著下降。如果想进一步提高效率还可以把分场表、提示词模板、命名规范都沉淀成团队共享的sop文档下次直接复制使用。最后再分享一个小技巧审片时把音频关掉只看画面能最快发现逻辑断点和视觉衔接问题这个习惯帮我发现了不少藏在细节里的硬伤。
返回列表