
简介这是一份围绕AI音乐视频制作全流程的实战资料面向想用DeepSeek、豆包、即梦、剪映等工具完成MV创作的视频创作者、自媒体运营者及AI工具学习者。资源以PDF文档呈现共1个文件压缩包大小约3.98MB内容系统梳理了从歌词提示词优化、画面描述词生成、即梦出图与视频片段制作到剪映剪辑添加字幕与音乐的操作思路并完整演示了《只字不提》MV的案例。文中包含多次优化后的提示词参考、即梦生成图片与视频片段的实操要点以及剪辑时添加转场和字幕的具体流程能帮助读者理解各工具如何在创作链路中分工协作避免重复踩坑。已有1530人学习下载读者可直接对照完整案例复用流程这份资料不仅讲解工具用法还能帮助理解不同AI工具的定位与短板掌握相互配合的实战组合方法。1. 用 DeepSeek豆包即梦剪映做《只字不提》AI 音乐视频的成片难点不在“生成”而在“流程”当手里已经有一版《只字不提》的音频时做 AI 音乐视频最耗时间的不是让 AI 唱歌而是把“克制”“遗憾”“欲言又止”这些情绪变成一帧帧能看的画面。DeepSeek 负责拆歌词、定分镜结构豆包负责把情绪补成具体的中文视觉意象即梦负责把分镜生成短视频素材最后剪映完成音轨对齐、歌词字幕和节奏调色。这条“AI音乐视频制作”链路能在一两天内交付一支不露馅的竖屏 MV特别适合个人创作者做单曲混剪也适合小团队拿同一条流程批量测试不同歌曲的视觉模板。最容易翻车的地方不是单个工具不会用而是分镜崩、人物换脸、音画错位。下面按我实际沿用的做法把步骤和参数讲清楚。2. 拆《只字不提》歌词让 DeepSeek 先出分镜表豆包再补视觉细节2.1 为什么先把歌词拆成“情绪—画面—运动”的映射表AI 视频模型并不理解“含蓄”或“忧伤”它只能理解“灰青色雨窗、逆光、旧毛衣、缓慢推进”这类具体名词。所以在动手生成任何视频之前第一步是把整首《只字不提》按歌曲结构拆成镜头组。这首歌通常适合走“平静开头—回忆展开—情绪暗涌—爆发后回落”的弧线我一般会按前奏、主歌、预副歌、副歌、桥段、尾声拆出 8 到 12 个镜头组每个镜头组只对应一小段歌词。拆解时不要写“这里表现遗憾”而要写成可见的画面比如“雨天旧窗、人物低头、玻璃上的水痕”。下面的表是我常用的映射结构不同人声版本可以按实际段落调整歌曲段落情绪关键词画面概念镜头运动建议时长前奏平静、收着雨滴滑落的窗户、窗边桌面固定镜头人物几乎不动6-8 秒主歌回忆浮现旧街灯、空椅子、逆光剪影极慢推近8-10 秒预副歌拉扯、想说没说人物低头到抬眸光线变化横移慢摇6-8 秒副歌暗涌大雨、闪回、车灯扫过轻微手持晃动10 秒左右桥段放下又提起信纸、墨迹、侧脸特写固定镜头加前景遮挡8 秒尾声归于不提人物走远、雨停、窗帘轻动固定镜头8-10 秒这张表的价值是让后续所有工具都围绕同一套视觉语言工作而不是让每一段视频各说各话。2.2 DeepSeek 与豆包的分工结构归 DeepSeek画面语感归豆包很多教程会把 DeepSeek 和豆包混着用我的做法是明确分工DeepSeek 负责分镜表、镜头时长、转场方式豆包负责把抽象情绪转成即梦能读懂的中文画面提示词。原因是 DeepSeek 在长文本、结构化输出上更稳给它 10 个字段的约束它能规规矩矩返回一张表格而豆包对中文画面感的把控更自然会主动补出“雨沿着玻璃留下断断续续的痕迹”这类更贴合画面的描述。这就是所谓多AI协作的用法不是看谁更强而是让每个模型做自己最擅长的环节。如果你要批量做多首歌曲的 MV可以在 DeepSeek 上把“分镜师”写好成固定系统提示词然后通过 API 一次传入多首歌词逐条生成分镜。网页版用来调提示词很顺手API 适合把流程脚本化。无论用哪个入口关键是把任务边界划清别让豆包一口气写完整首歌的分镜也别让 DeepSeek 直接输出即梦提示词。2.3 可直接复制的提示词模板分镜表和即梦提示词两段式以下是我会直接粘给 DeepSeek 的分镜提示词模板你是一名电影分镜师。请为歌曲《只字不提》设计一支 MV主题是“对一段回忆只字不提”情绪克制、内敛但中间有暗涌。 请按“前奏—主歌—预副歌—副歌—桥段—尾声”输出 10 个镜头组不要解释直接给表格。 每个镜头组包含 1. 镜头编号 2. 对应歌曲段落 3. 画面主体 4. 环境与光线 5. 色调 6. 镜头运动 7. 时长秒 8. 转场方式 出片画幅为 9:16。所有镜头保持同一个人物黑长发、墨绿色针织衫、年龄约 25 岁的女性。 限制不要使用“忧伤、遗憾、氛围感”之类空泛词所有画面必须由具体名词组成。这段提示词里有两个关键点。第一把人物外观写死在 prompt 里后续所有镜头都围绕“黑长发、墨绿色针织衫”展开避免即梦每段生成不同的人。第二明确要求“不要空泛词”DeepSeek 才会输出可被文生视频工具执行的画面元素。拿到分镜表后再把它贴给豆包做视觉润色以下分镜来自 DeepSeek请逐条改写成即梦可用的中文视频提示词。 要求 1. 统一结构主体环境光线色调镜头运动 2. 不要写成标签堆叠用自然中文描述 3. 每条不超过 60 字 4. 禁止出现“字幕、logo、水印、文字” 5. 同一人物外观必须出现在每条开头 分镜表 粘贴 DeepSeek 输出的表格粘贴时建议分 3 到 4 次提交豆包对长文本的上下文保持能力更稳一次处理 10 个镜头容易在后半段忘记人物外观约束。输出后每一条就是即梦的“文生视频提示词”你可以直接进入下一章开始生成素材。3. 在即梦把分镜变成视频素材比例、时长、运动速度和主角一致性3.1 先生成关键帧图再让画面动起来即梦这类 AI 视频工具通常都有“文生视频”和“图生视频”两种入口。常见做法是先“文生图”生成一张关键帧再基于这张图做“图生视频”。如果你偷懒直接输入一段文字生成视频第一帧构图大概率在开盲盒后续角色走样、画面畸变都会在这一步埋下隐患。对《只字不提》这种抒情慢歌来说画面崩一次就得重生成一次成本反而更高。我习惯的流程是先在即梦的 AI 图片生成里按豆包润色后的提示词生成关键帧图片。生成时一张提示词跑 3 到 4 个不同版本挑人物最正常、构图边缘有余量的一张再进行图生视频。所谓“构图边缘有余量”指的是画面主体周围有足够的留白因为后面进剪映时可能要裁切比例主体太满会被切掉。3.2 画幅、时长、运动速度三个必须手动确认的参数即梦生成视频时通常有画幅、时长、运动速度之类的参数可调这些参数直接决定素材在剪映里好不好用。我的默认配置如下参数推荐设置理由画幅9:16 竖屏适配抖音、视频号等竖屏场景后期裁切空间大时长5 到 8 秒抒情主歌用 5 秒更稳副歌高潮段可用 8 到 10 秒运动速度慢或适中主歌用“慢”副歌用“适中”避免快速镜头产生形变画面风格电影感偏好让整体色调统一为青灰、旧时光质感画面附加不带字幕、不带水印特效保证剪映里字幕轨道独立可控有一点值得注意即梦版本和入口不同参数名可能叫“运镜强度”或“运动幅度”你只要把它理解为“镜头动得多猛”就行。AI 生成的视频如果运动速度太快人物五官和边缘线条会因为补帧而扭曲慢歌尤其明显。前两次生成可以保守一点先固定镜头加人物微动确认构图稳定后再做带运镜的段落。3.3 让《只字不提》里的主角始终是“同一个人”做整支 MV 最容易露馅的就是主角不一致。上一段是黑长发墨绿针织衫下一段换个侧脸角度脸型就变成另一个人。解决这个问题最可靠的手段是全程使用同一张首帧参考图从这张图去变化环境而不是只靠文字重画一个人。实际操作时可以给即梦输入下面这类提示词主体墨绿色针织衫、黑色长发的年轻女性站在老式木窗前侧脸眼神低垂。 环境旧式房间窗上有雨水窗外是灰色阴雨天。 光线逆光室内昏暗窗户玻璃上有一点高光。 色调青灰色电影感。 运动镜头固定人物缓慢抬头窗外雨声隐约。这段提示词的作用是把“主体—环境—光线—色调—运动”分开描述让模型先锁定人物再生成场景运动。注意人物描述放在最前面不要先写“雨水窗户”再写人物否则模型会把场景当作画面核心人物细节会被自动简化。每生成一段视频后保留这帧关键帧图片作为下一次图生视频的参考这样多段素材之间的主角才可能保持一致。4. 在剪映里把素材拼成 MV音轨对齐、歌词字幕与关键帧节奏4.1 素材进剪映前先按场景编号整理从即梦下载下来的素材命名往往是乱码几十个视频堆在一起时根本分不清哪个是主歌哪个是副歌。我一般会在本地建一个临时目录按分镜号重新命名mkdir -p mv_work/{raw,audio,output} mv 01_scene_rain_window.mp4 mv_work/raw/01.mp4 mv 02_scene_street_lamp.mp4 mv_work/raw/02.mp4 mv 03_scene_low_head.mp4 mv_work/raw/03.mp4命名规则是“序号—场景”序号对应分镜表里的镜头编号。这一步看起来琐碎但剪映时间线越长你越需要快速找到某个镜头。如果不小心拖动了一段素材至少能凭文件名立刻判断它的位置。另一个要点是不要反复使用同一段 AI 素材AI 画面重复出现会让观众明显察觉到素材复用。4.2 先放音轨再加画面按波形踩点而不是用眼睛猜剪映新建项目时我会先把影片比例设为 9:16帧率 30fps。之后第一步不是拖视频而是把《只字不提》的音频拖到音轨上放大时间轴到能看清波形细节。这样做是因为慢歌的节奏点不在鼓点上而在人声气口上副歌进来的那一句人声会明显变强波形会突然宽起来这些位置就是换镜头的天然节点。具体操作为在副歌进入点手动添加时间线标记不要依赖自动踩点。把每个即梦素材拖到视频轨道片段开头对齐上一句歌词结束的位置。素材之间预留 5 到 10 帧重叠用叠化转场避免画面生硬切换。对每个片段做“变速”前先检查它是否本来就带运动AI 视频变速后容易丢失流畅度。自动踩点适合鼓点明显的快歌而《只字不提》这类叙事慢歌更依赖人声气口手动踩点虽然慢但卡出来的副歌进点会非常准。4.3 歌词字幕用剪映智能识别但必须逐句校准剪映免费版就带有智能字幕识别功能操作上选中音频轨道点击“智能字幕—识别歌词”它会按人声大致断句生成字幕。对普通录音效果来说识别率不错但《只字不提》这类咬字轻、气声多的歌一定会有错字。所谓“只字不提”被识别成“至此不提”“直至不提”都很常见歌词错字出现在 MV 里非常影响观感。我的做法是让剪映识别后把它当成草稿然后按下面的顺序人工校准先把识别结果逐句对照歌词原稿修改错字。关闭自动断句改成手动分段一句歌词不跨两屏。把字幕位置保持在画面下方安全区内不要贴边。统一字幕样式慢歌建议用细体、白字、轻微阴影不要用带描边的综艺字体。校准字幕时最好开着音频波形边听边看断点位置。前奏和间奏里的识别结果要直接删掉否则字幕会出现在没有人声的地方观众会立刻意识到这是自动生成的。4.4 关键帧的用法主歌“压住”副歌“松开”剪映里给视频片段添加关键帧可以做出放大、位移、旋转等效果。关键是控制“压住”还是“松开”主歌段落画面应该尽量稳比如让素材从 100% 比例缓慢缩放到 102%观众几乎感觉不到只有一种轻微的呼吸感副歌段落可以让比例从 102% 放大到 106%同时向上移动一点点配合人声增强画面才有“放开”的感觉。操作上不需要给每段素材都加关键帧。整支 MV 最忌每个镜头都在运动观众看 3 分钟会头晕。我更建议把关键帧的重点放在副歌前后那 2 到 3 个镜头上其他段落保持固定镜头或画面内部运动。即梦素材本身已经带运动时剪映里就不要再叠加缩放两个运动叠加起来会糊成一片。提示AI 视频素材本身已经有镜头运动剪辑时不要再用太多转场动画。宁可让素材在时间线上“静”也不要让画面每一层都在动。动的是情绪节奏不是每一帧。5. 制作 AI MV 的 5 个常见翻车点从人物变形到音画不同步5.1 场景连续但人物“换脸”AI MV 最常见的问题现象分镜表里明明是同一个黑长发女生前一个镜头是侧脸下一个镜头变成正脸时脸型、眼距、发际线全变了看起来像换了个人拍。原因文生视频和图生视频对脸部的控制依赖首帧图如果首帧只用“中远景”甚至“全身”面部细节没有得到足够权重镜头运动时模型会自动重绘五官。解决把关键帧图裁剪成“脸部占画面三分之一左右”的中近景再做图生视频每段视频尽量从同一张参考图出发不要频繁切换参考对象。如果发现某几段人物已经走样宁可重新生成那一段也不要留在成片里赌观众注意不到。5.2 横竖比例混用导出后黑边和裁切发虚现象素材进剪映后上下或左右出现黑边画面被拉伸变形导出后发现五官比例不对。原因即梦生成时选了 16:9 或 3:4模板却是 9:16剪映默认缩放方式不会自动裁掉多余画面而是一味放大造成边缘拉虚。解决即梦生成时就统一按 9:16 出片如果手上只剩横版素材在剪映里打开“画面—裁剪—填充”把主体放到居中偏上位置再裁。生成前留意画面主体不要顶满画框留下裁切安全距离后期才不会裁掉重要内容。5.3 歌词识别错字破坏这支歌的沉浸感现象字幕里出现“至此不提”“直至不提”等错位词观众一眼看到就出戏。原因剪映智能字幕是基于人声识别气声和轻声字容易被替换成同音字慢歌尤其明显。解决不要让剪映识别结果直接成为最终字幕。先导出识别文本在原曲基础上人工校对一遍或者干脆在剪映里手动输入歌词并逐句对齐音频波形。发布前再从头到尾读一遍字幕主打一个慢歌字幕零错字。5.4 每段素材都在运动看 3 分钟头晕现象三分钟看下来每段镜头都在推拉摇移镜头切到副歌时不爽反而让人恶心。原因即梦生成的视频普遍自带运镜倾向提示词里如果再写“缓慢推进”“轻微横移”整条 MV 就成了没有停顿的视觉轰炸。解决前奏和主歌段落用固定镜头加人物微动把“雨、窗帘、车窗水流”当作画面内部运动来源副歌高潮再放宽运镜幅度。剪映里可以用片段的“基础—缩放”把默认放大 100% 的静态感找回来让观众有地方喘气。5.5 导出时音画不同步重剪成本最高现象导出后副歌人声已经在发力画面却还停在上一段情绪里整段节奏全乱。原因大多不是导出问题而是时间线上视频片段和音频波形没有逐帧对齐或者片段刚好被拖过了歌词边界点。解决把剪映时间轴放到最大检查每一段视频的进点是否和波形增强点对齐副歌进入前留 3 到 5 帧的提前量让画面先进入高潮构图人声再跟上。导出前按空格播放预览不要只看画面要闭眼听节奏确认情绪点都在它们该在的位置。6. 导出成片前的三个验证习惯和一个 FFmpeg 检查命令6.1 关掉画面听一遍检查情绪是否靠音频成立我习惯在导出前把预览窗口遮住只盯着剪映时间线听完整首歌。不看画面时副歌是否到了、间奏会不会太长、结尾有没有收住都会变得非常明显。画面会掩盖音频剪辑的失误但音频不会骗人。如果关掉画面后你感觉某一段特别“空”那说明这段视频在情绪上是不必要的镜头再美也留不住观众。6.2 逐帧检查副歌前后和结尾定格用方向键在剪映预览中逐帧移动重点看副歌进来前后各 3 帧。副歌第一句人声最强时画面是否正好在最大运动状态如果画面这时还是静止的高潮力度就弱了。另一处要检查的是结尾最后一句很多人导出后在最后一帧突然黑场观感像被截断。我的做法是给高潮结尾处加 3 到 4 秒定版只保留字幕或一张静态关键帧让情绪落下来。6.3 用 FFmpeg 最后跑一遍流信息省一次返工剪映导出完成后我会顺手用 FFmpeg 检查最终文件的编码信息和解码完整性ffprobe -v error -show_entries streamcodec_type,codec_name,width,height,r_frame_rate,duration -of compact mv_final.mp4 ffmpeg -v error -i mv_final.mp4 -f null -第一条命令检查导出的视频流是否为 1080×1920、帧率是否正常、时长是否和歌曲一致。第二条命令会完整解码一遍整个文件如果中间存在损坏帧会看得到错误提示没有提示就基本可以认定文件是完整的。发布前最好把导出文件另存为“mv_v1.mp4”之后想调整字幕或换某个镜头时不要覆盖旧版这是给成片留的后悔药。现在我做任何 AI MV 都会保留这条习惯链先无画面听一遍再逐帧查高潮点最后用 FFmpeg 验证文件流草稿按版本号存档。靠这套流程我至少没有被“导出后才发现字幕错字、音画不同步”这种返工拖住第二次。希望帮到你。本文还有配套的精品资源点击获取