ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI漫剧全流程制作:从提示词到视听语言

AI漫剧全流程制作:从提示词到视听语言 最近有朋友问我“AI漫剧到底怎么入坑刷了一堆AI绘画和AI视频生成教程画单张图没问题一做成视频人物就崩剪辑节奏也乱完全不像能连续追下去的剧。”这个痛点我太熟悉了。现在市面上绕来绕去的说法很多核心其实就三件事提示词、AI绘画、图生视频再加上一个很多人完全忽略的视听语言。只要这四块能串成一条生产管线漫剧就不是“抽卡碰运气”而是可以稳定复现的批量流程。这篇文章我就把跑通这条线的完整思路拆开讲既适合从零开始的新手也适合已经能出单张图、却一直卡在成片环节的人。1. AI漫剧创作的核心链路从脚本到成片先搭骨架1.1 漫剧不是“会画画会动”就够先看整条流水线漫剧本质上是用AI批量生产的分镜视频它的完整链路是脚本 分镜 角色与场景设定 AI绘画 图生视频 剪辑配音。很多人顺序搞反了先画一张特别满意的图再硬塞进视频工具里让它动。结果画面是动了但镜头构图没留余地人物位置也不合理生成出来的运动生硬得像PPT过渡。我建议把第一步放在“脚本”上而不是“画图”上。脚本里要先确定这一集讲什么、有几个场景、主要角色做什么动作。然后据此拆成分镜表标清楚镜头号、景别、时长、画面内容。这一步做完AI绘画和图生视频才不是无头苍蝇。为什么非得这样因为图生视频模型非常依赖输入画面里的“信息布局”。如果角色在画面正中、背景太杂乱、脸部占比太大模型在做运动估计时很容易把背景当成主体或者把人脸扭曲掉。反过来如果分镜阶段就明确“这是一个中景、人物在画面左侧、右侧留出运动空间”那么后续每一步都在为这个镜头服务成功率会指数级上升。另外别把AI视频生成当成万能导演。它的能力边界是“让静态画面获得可信的运动”而不是“替你想清楚怎么讲故事”。镜头怎么切、情绪怎么推、什么时候给特写这些都必须由你提前设计好。AI只是执行层面的一环不能替代创作决策。1.2 工具选型按“可控性”选不按“画质”选漫剧是连续剧不是单张壁纸。工具不能只看哪家画质更炫要看哪家能让你更稳定地控制输出。我实测下来的梯队大致是这样环节主力工具方向选择理由备选方案AI绘画ComfyUI / Stable Diffusion WebUI 这类可本地部署方案可精细控制角色一致性、批量出图、替换LoRAMidjourney、即梦等在线平台人物一致性角色LoRA 参考图集同一个角色能跨镜头保持五官、服装稳定固定特征描述词 图生图强参考图生视频支持首尾帧/参考图的视频生成模型首尾帧锁定后中间帧更稳定适合叙事Runway、Pika、Seedance等剪辑配音剪辑软件 AI配音/配乐导出协作方便批量处理字幕剪映、Premiere、AU等在选择图生视频工具时优先看三个功能是否支持首尾帧、是否支持参考图/角色图、运动幅度能否自己调节。很多工具宣传片很炸但实际不支持首尾帧只能输入一张图和一句提示词结果就是你完全无法控制中间过程。漫剧需要大量分镜拼接如果每个镜头都不能稳定还原你指定的开始和结束姿态剪出来人物会像换了个人。1.3 新人最容易忽略的“素材管理”工具选好之后先别急着生成。建立一套素材管理规范能救后期命。我的做法是给每个主要角色建一个独立文件夹里面至少包含正面大头照、半身照、全身照、三视图、表情参考图、服装细节图。每张图都配上对应的提示词和生成参数用固定格式命名比如“角色名_场景_姿态_版本号”。很多新手的问题是角色设定只存在于脑子里生成第一集时还能靠新鲜感到第三集就彻底漂移。等到第十集想回头找当时的提示词发现已经在聊天记录里翻不到了。所以“角色卡”必须落到文件层面服装颜色、发型、配饰、脸部特征全部写清楚。50集的量级没有素材库就是灾难。2. 提示词漫剧画面与人物一致性的根基2.1 五段式结构把“稳定项”和“变量项”分开AI绘画的提示词不是越长越好而是结构越清晰越好。我建议所有漫剧底稿提示词都按这个五段式写主体特征 当前状态 环境背景 镜头信息 画质风格。举个例子一个身穿深青色长袍的古风剑客黑发束冠脸型瘦削眼神锐利 站在空旷的山巅身后是翻滚的云海风吹动衣摆 中景浅景深人物居左右侧留出空间 电影感光影细节丰富国风插画风格高精度这里面“主体特征”是稳定项每次生成这个角色都要原样保留“当前状态、环境背景、镜头信息”是变量项可以随分镜变化“画质风格”决定整部剧的统一观感尽量全局固定。很多AI漫剧看起来像拼贴画就是因为风格词每次都在换。五段式的另一个好处是方便“复制复用”。当你要生成同一角色的另一个镜头只需要复制整段提示词然后改掉“环境背景”和“镜头信息”稳定项完全不动。这样比每次都从空白写起靠谱得多。2.2 人物一致性固定特征清单和三视图如果你不想给每个角色都训练LoRA至少要做一份“固定特征清单”。这份清单相当于角色身份证每次写提示词时把它嵌入。举个例子一个女主角的固定特征可以写成浅棕色双马尾少女琥珀色眼睛瓜子脸右侧眼角有泪痣 穿白色连帽卫衣胸前挂银色钥匙吊坠背帆布包把这些特征按顺序写成一行放在提示词最前面。至于天气、表情、姿势都放到后面去。实测下来固定特征描述越长、越具体角色一致性越好。但也不要长到包含“背景里有一棵树”这种非必要信息因为背景属于环境变量。三视图是确立角色形象的关键。提示词里可以写“character design sheet, front view, side view, back view, white background, same character, consistent face”。三视图不是用来直接做视频的而是用来确认“这个角色到底长什么样”。有了三视图之后再生成任意角度AI能有一个相对统一的参照。更稳妥的做法是把三视图导入到图生视频工具里当参考图让模型照着角色特征运动。2.3 稳定输出测试鹈鹕测试法思路AI绘画社区里有个“鹈鹕测试”的说法本质是拿一只特征极其强烈的动物去验证提示词是否足够稳定。鹈鹕有大嘴、白羽毛、橙色喉囊如果同一个提示词反复生成后这些关键特征每次都在那说明这套提示词的可复用性很强如果第一张有大嘴、第二张嘴变没了说明提示词某个环节权重不够或者写法有问题。我的项目里也沿用了这个思路每个重要角色生成后先不急着进分镜而是用同一段提示词连续生成六到八张图检查脸上特征、服装细节、身体结构是否稳定。如果出现忽胖忽瘦、衣服颜色漂移就先修提示词而不是靠后期补。这个测试只需要十几分钟却能省下后面几十个小时的返工。另外提示词中可以通过括号调节权重比如(black hair:1.2)表示加强黑色头发的权重。什么特征容易飘就给什么特征更高权重。但注意权重别堆到1.5以上否则画面容易过拟合出现塑料感。2.4 负面提示词先堵住常见的崩坏漫剧项目里负面提示词和正向提示词同等重要。我常用的负面提示词清单如下blurry, distorted face, extra fingers, bad anatomy, watermark, text, lowres, duplicate, mutated, deformed, worst quality, normal quality, jpeg artifacts这些词能显著减少脸部扭曲、手指畸形、画面模糊的问题。中文模型里也可以补充“水印、文字、模糊、低清、错误结构”。负面提示词不要写得太长重点堵住当前最容易崩的几个点就行。比如画手部特写时就把“extra fingers, bad hands”权重拉高。有些提示词内容不符合平台规范或社会共识这类别碰也不需要靠它来提升效率。漫剧能火的核心是故事和情绪不是擦边内容。3. AI绘画从角色设定到分镜底稿的落地方法3.1 分镜底稿为什么和单张插画不一样给漫剧画底稿和画一张能发社交媒体的插画完全是两码事。单张插画追求构图完整、视觉冲击力分镜底稿则必须为后续图生视频服务要考虑的事情更多。第一是画幅比例我常用16:9或者2.39:1因为视频平台默认横屏第二是主体位置要预留运镜空间比如镜头要横移画面主体就不能顶满左右边缘第三是场景层次至少分成前景、中景、背景三层。举个例子如果镜头是“从窗外缓慢推近到人物面部”那底稿里窗框要作为前景出现在画面边缘人物不能太大太满中间还要有过渡空间。这样图生视频模型才有足够的视觉线索去做推镜运动。如果底稿直接怼脸特写再告诉AI“推镜头”它只能硬做结果就是人脸变形或缩放生硬。所以我在分镜表里一定会列“镜头信息”这一栏写清楚景别、运镜、人物位置、画面纵深。每一张底稿都对照分镜表来出。这样做的目的是让AI绘画只是“执行分镜视觉方案”而不是“自由创作”。3.2 批量出图用局部重绘修关键细节漫剧一集可能需要十几张底稿逐张精修太慢。我的工作流通常是先用文生图批量出粗稿然后挑出构图方向正确的图进入图生图局部重绘修手部、脸部、道具这类细节。局部重绘的核心是蒙版操作把不满意区域涂掉让模型只重绘涂过的部分保留其余画面。具体步骤分四步上传粗稿后在局部重绘面板里把待修区域用蒙版涂出来正向提示词写“细腻的手部结构”或“清晰的面部五官”负向提示词继续保留通用防崩词汇重绘幅度控制在0.4到0.6之间。重绘幅度太大会连背景一起改太小又修不掉问题建议多试两次找到手感。批量出图后一定要做“帧间一致性检查”。把同场景的几张底稿放在一个预览里快速切着看。如果背景颜色忽蓝忽黄、服装细节忽多忽少就回到提示词里统一风格描述。漫剧观众的注意力很敏锐色彩跳变一眼就能看出是AI拼接感。3.3 漫剧底稿的通用提示词模板我整理了一套可以直接套用的底稿提示词结构给新项目起步用{固定角色特征来自角色卡} {当前动作/表情} {场景环境描述} {景别}{人物在画面中的位置与空间关系} {镜头运动方向提示} {画风统一词}{光影和画质词} {负向提示词}画风统一词很重要比如“中国风厚涂”“日系赛璐璐”“韩漫风格”只能选一个整部剧固定。光影词也要保持一致漫剧我一般用“cinematic lighting, soft shadows, rim light”。如果你每集风格词都不同观众会觉得每集像不同的剧。至于画面质量词可以直接堆几个固定的masterpiece, best quality, highly detailed, sharp focus。这些词更像是给模型的“纪律信号”告诉它优先保质量。但注意不要在中文模型里机械堆英文词有时中英文混写反而效果好关键看模型训练数据。4. 图生视频让静态画面动起来的关键技术4.1 图生视频到底在做什么图生视频模型的底层逻辑是输入一张静态图模型根据图中的主体、边缘、景深、遮挡关系去预测后续若干帧生成一段连续运动画面。这个过程不是“理解角色”而是做像素层面的运动估计。这就是为什么人物一致性很大程度上取决于原图质量如果原图里脸部模糊、手部残缺模型运动时只会进一步放大这些缺陷。理解这点对参数设置很有帮助。帧数越长不确定性越高人物越容易漂移运动幅度越大画面越容易扭曲。漫剧里很多镜头其实不需要剧烈运动人物情绪靠的是细微表情和镜头移动。所以新手不要把“大幅运动”当成AI视频生成能力强的标志稳定比猛烈重要。4.2 参数控制运动幅度、首尾帧与镜头提示词图生视频的关键参数通常有这几个时长/帧数、运动强度、提示词、首尾帧、画面比例。我给漫剧项目的参考配置如下参数推荐范围说明单镜头时长3至6秒太长容易崩太短剪辑没有节奏运动强度30%至60%打斗场景可偏高文戏尽量低首尾帧能开就开锁定起始和结束构图中间过程更稳定提示词短句描述运动方式不需要复制原图详解重点是“人物/镜头怎么动”运镜提示词建议直接写清楚运动方式。比如“camera slowly pushes in on the character”表示镜头缓慢推近“character walks in place with wind blowing hair”表示人物原地走动、头发被风吹动。中文模型也可以写“镜头缓慢推向人物背景保持不动”。这里有个经验如果画面需要人物走路别直接写“人物向前走”这会让模型认为整个人包括视角都要前移导致背景疯狂漂移。改成“人物原地踏步镜头跟随”会稳定非常多。AI视频生成对“哪些东西动、哪些东西不动”的区分能力有限我们要在提示词里帮它划清界限。4.3 从“能动能看”到“能剪进片子里”的翻车处理能生成一段动图不代表能剪进正片。漫剧最常遇到的三个翻车点面部扭曲、背景漂移、人物闪烁。我处理这几个问题的优先级是运动幅度降一半 提高原图清晰度 增加首尾帧约束 换一个更简单的运动描述。面部扭曲大多出现在转头、说话、眨眼这些需要脸部局部变形的动作。解决思路是不要让角色做大表情先把情绪放在眼神和光影里。漫剧里角色说话尽量嘴部动作小配合配音观众反而觉得自然。背景漂移则是因为模型把背景当成了可运动内容对策是在提示词里强调“background static, only camera moves”。人物闪烁常常发生在光线变化大的镜头里。同一个角色在不同画面里忽明忽暗这是生成模型的随机性问题。我会把人物的光影描述写得非常固定比如“左上角暖光阴影在右侧”每一集都保持同一套光效。这套“光效纪律”能明显降低后期调色工作量。4.4 运镜提示词把镜头语言写进生成参数图生视频里最容易被低估的是运镜提示词。很多人只写人物在做什么完全没写镜头怎么动。结果生成出来的画面是静止的或者动得莫名其妙。镜头语言必须显式写出来因为模型不读心。我常用的运镜提示词对照表镜头动作中文提示词英文提示词参考推镜头镜头缓慢推向人物camera slowly pushes in拉镜头镜头缓慢拉远展示环境camera slowly pulls back横移镜头从右向左横移camera pans left跟随镜头跟随人物移动camera follows the character环绕镜头环绕人物半圈camera orbits around the character固定机位镜头固定人物动作static shot, character moving写运镜提示词时尽量只保留一个主要运镜方向。如果又推又拉又环绕模型处理不过来画面会产生晕眩感。漫剧调性普遍偏电影感宁可运镜“少而稳”也不要花里胡哨。真正的高手是靠剪辑节奏切出层次而不是靠一个镜头里塞进太多运动。5. 视听语言漫剧运镜、景别、节奏与声音配合5.1 景别先定景别再定画面内容视听语言被大量AI创作者忽略但它恰恰是漫剧能不能“看得下去”的分水岭。景别决定了观众看什么、看得多清楚。远景用来交代环境人物在画面中很小全景展示人物全身和环境关系中景展示人物动作和对话近景聚焦表情特写强调情绪和细节。一张底稿在生成前就应该确定景别。比如一个悲伤场景先给一个中景展示人物低头不语再切一个特写落在手指微微发抖上。这个推进过程本身就是叙事。如果你把所有镜头都生成成中景人物永远站在画面正中观众很快就会视觉疲劳。在AI绘画提示词中对应景别词也很简单wide shot, full shot, medium shot, close-up, extreme close-up。中文模型可以写“远景、全景、中景、近景、特写”。关键是每个镜头写清楚不要默认让AI自己选否则出的图永远是安全但平庸的半身像。5.2 运镜的动机每个运动都要有理由运镜不是为了让画面不无聊而是为了叙事。推镜头制造“发现感”或“压力感”适合角色意识到某件事拉镜头强调“孤独感”或“被环境包裹”适合展现角色渺小摇镜头用来扫视环境建立空间关系跟镜头则让观众跟着角色一起探索代入感更强。比如宫廷权谋题材里角色站在大殿中镜头从低角度慢慢推进压迫感会立刻起来。这就是低角度广角加缓慢推镜的综合效果。写提示词时可以写“low angle shot, camera slowly pushes toward the emperor, the hall feels vast and oppressive”。运镜提示词里还可以加入“微动”比如风吹头发、窗帘轻微浮动、烛火摇晃。这些微动不需要额外镜头提示它们能让画面活起来同时对稳定性的影响小。我的习惯是每个镜头底稿都带一个背景元素做微动比如云海、树叶、衣摆。AI在运动估计时会优先处理这些细节人物的变形概率反而会降低。5.3 一集漫剧的节奏镜头数与时长的经验值以1分钟短漫剧为例我一般会把镜头控制在8到15个平均每个镜头3到5秒。如果一集有一分钟以上镜头数可以放宽到20个左右但要注意“平均镜头时长”不应低于2.5秒否则观众还没看清画面就切走会产生明显眩晕感。节奏感和情绪直接相关激烈冲突的镜头可以短到2秒甚至更短靠快速切换制造紧张抒情文戏镜头可以长到6秒让观众慢慢投入。我习惯在分镜表上额外加一列“情绪节奏”标出这组镜头是“紧”还是“松”。剪辑时把紧的镜头串在一起再插入一个松的镜头作为呼吸口观众就不会觉得喘不过气。5.4 声音设计是漫剧质感的隐形天花板画面再好看声音一塌糊涂立刻显得业余。漫剧至少需要三层声音配音或对白、音乐、音效。很多AI配音工具能生成自然度不错的旁白但不要所有角色都用同一种音色。给主要角色设定不同的音色哪怕是微小差别也能增强人物辨识度。音效层容易被忽略。脚步声、衣服摩擦声、门轴转动声这些细节音效能极大提升沉浸感。AI工具解决不了的复杂音效可以找免费音效库替换。音乐方面要注意节奏点情绪突然转变时音乐也要相应切换。我编片时喜欢先用旁白粗剪出对白节奏再铺音乐最后补音效这样逻辑最顺。字幕也不能忽视好的字幕设计包括字体、字号、描边、位置统一。AI视频生成出来的画面本来就有漂移感如果字幕还一跳一跳观众更难受。6. 新手从0到1的完整流程清单与避坑经验6.1 按这个顺序做才不会频繁返工我会把一集漫剧的流程固定下来每步都有验收标准。第一步写脚本明确剧情三要素人物目标、障碍、结果。第二步出角色卡把人物特征写死。第三步画分镜表每格填好镜头号、景别、运镜、内容、时长。第四步生成底稿要求构图与分镜表一致。第五步检查底稿一致性同一个场景连看三张不许有明显偏差。第六步图生视频单镜头生成成功后先存为素材不要急着全流程跑完。第七步剪辑按分镜表顺序拼接。第八步配音配乐铺对话和音乐。第九步加字幕和片头片尾导出前整体看三遍。很多新手卡在“想一步到位”。实际上做得快的人都是把流程拆成关卡每个关卡有质量问题就停下修而不是等到最后一集发现问题再回头改。6.2 崩溃问题排查手册问题可能原因排查与对策人物长相每集都在变没有固定特征词或参考图回角色卡检查提示词是否一致训练LoRA画面动起来人物扭曲运动幅度太大或原图结构不清降低运动幅度改用更简单的动作描述背景跟着人物一起漂模型没区分前景背景提示词强调镜头固定或提高背景细节权重同一场景颜色跳跃画风格词和光影词不一致统一风格词组固定光源方向视频生成后镜头没有运动缺少运镜提示词在提示词里明确写出镜头运动方式生成结果风格极不稳定检查为什么不用固定风格词和负面词单独建立风格提示词模板全局套用排查问题时别一次性改太多变量。每改一次只调一个参数生成对比否则你根本不知道是哪个动作修好的。这个习惯能让你在反复抽卡时保持冷静。6.3 五十集项目的持久战建议做50集漫剧和做5支单集完全不同持久战的关键是“流水线纪律”。我会在项目根目录下建这些文件夹01_脚本、02_角色卡、03_分镜表、04_底稿、05_视频素材、06_音频、07_合成输出。每一集的命名格式都统一比如“EP01_镜头01_中景_推镜_底稿_v2”。文件名里带上版本号和分镜信息后期替换素材时非常方便。每完成一集我都会把这一集用到的关键提示词、角色卡、风格词保存为独立文件放在项目模板库里。下一集直接复用。时间长了你的模板会越来越厚新集数出片速度会比第一集快很多。角色一致性的终极方案还是LoRA。如果项目预算和硬件允许给每个主要角色训练独立的LoRA训练素材用角色三视图加日常表情图。训练好之后同一角色在AI绘画阶段的稳定性会大幅提升图生视频阶段只需要把参考图和LoRA同时配合使用基本能做到连续剧级别的统一。最后说一个我自己踩坑换来的体会AI漫剧创作最重要的不是找最牛的提示词也不是追求单张画面的惊艳而是把整条流水线跑顺让“稳定输出”成为常态。每个项目刚开始都会崩崩几次之后你才知道自己的角色卡哪里写松了、运镜词哪里没写清楚、风格词哪里互相打架了。把这些经验沉淀成自己的模板库比随便抽卡有意义得多。如果你正准备开一个新项目不妨先把这条流程搭起来哪怕从三集试水开始也好。做完整条线之后你回头再看AI绘画和图生视频的每一个生成结果都会心里有数。
返回列表