
先说结论这套“即梦 豆包 剪映”的组合是我目前跑下来最顺手的 AI 动画短剧生产链路。很多人以为难点在于“怎么生成一张好看的图”实际上真正拉开差距的是你能不能把一条创意稳定地变成几十个镜头再让角色在镜头之间不跑偏最后用剪辑把节奏救回来。这篇文章不是教你怎么点按钮而是把我连续做了三条 AI 短剧后验证过的完整流程拆给你看。不论你是完全零基础的新手还是已经会剪辑但想切入 AI 短剧赛道的创作者只要跟着这个流程走一遍第一天能出粗糙成品第二天能做完整故事第三天就可以开始谈报价。我会把分镜脚本模板、角色设计提示词、镜头语言拆解表、即梦的提示词公式、剪映的成片自检清单都放在对应章节里你需要做的就是把它们复制到自己的文档里边做边填。1. 这套组合拳的底层逻辑即梦负责“画”豆包负责“想”剪映负责“剪”1.1 三条流水线别让工具越权我最初也犯过一个错误试图用即梦写剧本用它生成分镜表结果越写越乱。原因很简单即梦的核心能力是图像和视频生成它可以画出“雨夜里撑伞的男人”但它不太擅长帮你梳理“这个男人为什么出现在雨夜里他的动机是什么下一幕要发生什么”。豆包才是那个负责“想”的角色。它擅长把一段零散的想法结构化比如你说“我要做一条关于外卖员穿越的短剧”它能帮你拆成“三幕结构”“十个关键情节点”甚至“每一段的情绪曲线”还能直接输出可以喂给即梦的画面描述。剪映负责最后的一切整理片段排序、配音、BGM、音效、字幕、调色、转场。我见过有人在即梦里反复调提示词想达到“剪辑感”那是在拿一把菜刀掏耳勺费劲且不专业。正确逻辑是即梦只负责把单张画面和短片段做到最好至于怎么串联、怎么卡点、怎么配乐全部丢给剪映。这套分工一旦想清楚效率是翻倍的因为每个工具都只做自己最擅长的事你不会再花一小时纠结某个工具里“这个功能到底怎么用来代替另一个工具”。1.2 目标定义你在做的究竟是哪种 AI 短剧动手之前先把“短剧”两个字再拆细一点。同样是 AI 短剧市面上至少有两类技术路径完全不同一类是漫剧/剧情动画短片比如两三分钟内的诡异反转、情感共鸣、科幻片段强调人物表演、镜头连续性、情绪递进。它需要更精细的角色设计、镜头语言和前后一致性制作成本高但辨识度也高。另一类是AI 解说/图文转视频最常见的形式是博主用 AI 生成画面配上真人声音或者有声书式旁白内容偏“讲故事”。这类对单张画面的质量要求高但对镜头连续性的要求低一些可以用相对固定的模板批量产出适合练手和走量。我建议第一天不要贪心明确告诉自己先做出“一条 30 秒以内的剧情动画短片”把完整链路跑通再考虑做复杂叙事还是大批量解说。1.3 环境准备笔记本就行但这些流程要先搭好这套流程完全是云端为主所以我用普通的办公笔记本也能完成不需要专业显卡。真正需要提前准备的是这么几件事账号体系即梦、豆包、剪映各自注册好并且尽量让三者的登录账号在同一套手机号体系下导出素材时路径更清晰。文件夹结构这是我踩过最大的坑。做了两周之后素材乱到我自己都找不到哪张图对应哪个镜头。现在我的标准结构是这样project/ai_short_drama/ 01_storyboard 分镜脚本 02_characters 人物定妆图 03_scenes 场景概念图 04_video 生成视频片段 05_audio 配音与音乐 06_edit 剪映工程与导出时间预算别以为自己一天就能产出一条大片。我做第一条 30 秒短片实际花了大概 5 个小时其中分镜和角色设计占了一半时间。到第三条的时候全流程压缩到了两个小时左右。这才是“3 天学完”的真实节奏——不是第三天突然成交而是第三天你已经能稳定用两小时交付一个短样片。2. 分镜脚本让豆包把“一个念头”拆成“一份能拍的画面清单”2.1 给豆包的输入不是一句简单要求而是角色需求风格三件套分镜脚本是整个项目的图纸图纸如果模糊后面出图、剪辑、配音全部跟着歪。很多人让豆包写分镜只丢一句话“帮我写一个悬疑短剧的分镜”回来的东西多半是空泛的“主角走进老宅——发现秘密——惊慌逃跑”这种脚本拿去给即梦生成画面你会发现镜头之间毫无逻辑人物姿态和情绪对不上。正确的做法是先给豆包喂一个“输入包”包含三样东西角色、需求、风格。我用一个实际例子示范角色28岁女性程序员银色短发蓝色风衣戴圆框眼镜性格冷静但有点社恐 需求创作一条30秒竖屏AI短剧分镜脚本剧情完整结尾有反转 风格赛博都市冷色调二维插画质感节奏快镜头数15到20个 输出要求每个镜头包含镜头编号、景别、画面内容、台词、时长把这段话丢给豆包之后它会吐给你一个相对规整的分镜表。但这只是初稿。我会要求它继续细化两轮第一轮把“画面内容”改成更可视化的描述比如“她抬头手指停在键盘上窗外蓝光一闪”第二轮把每个镜头的时长和情绪节奏标出来。2.2 实战分镜模板拿“深夜办公室遭遇”当例子下面是我用这套方法让豆包生成的一个简化版分镜表已经经过我的人工修改你可以直接拿来做参考格式。场景是一条 20 秒悬疑短片。镜头编号景别画面内容台词/音效时长S01全景深夜办公室只有一盏台灯她坐在电脑前键盘敲击声3sS02特写她听到门外声音瞳孔忽然放大安静玻璃响2sS03中景她缓缓转头视线看向办公室门口呼吸声3sS04全景门口站着一个和她穿同样衣服的人影低频音效3sS05特写她吓得往后一靠椅子发出刺耳声椅子摩擦声2sS06中景门口人影往前一步灯光忽明忽暗电流音3sS07特写她摘掉眼镜嘴角浮出一丝笑“终于来了。”4s你看这张表已经可以直接指导后面的所有工作。每个镜头都有数字编号这个编号在后续的素材管理里就是身份证号。2.3 为什么镜头编号要提前排好没有做过项目的人很难理解为什么我要在分镜阶段就死磕编号。等到了第 5 章你会在即梦里生成几十张图、几十段视频如果每张素材都叫“图1”“图2”你会完全乱套。但如果你从一开始就把所有素材命名为“S03_全景_取景2”那在剪映时间轴上只需要按文件名排序镜头顺序自己就出来了。这是三个工具协作的核心秘密保持一套统一的命名规范贯穿分镜表、即梦素材和剪映时间轴。2.4 分镜表整理成文档豆包生成的分镜表我不建议直接保存在聊天记录里。最好复制到自己的表格软件里整理成规整的表格再在右侧加两列“即梦画面描述”和“动作描述”。这样等会写提示词时就能直接对着表格逐行抄而不是重新想。简单说分镜脚本不只是一个“创意草稿”它应该是整个项目的作业指导书。前期花 30 分钟把它写清楚后期至少省下三小时返工时间。3. 人物设计防“跑脸”是 AI 动画制作里最关键的一场仗3.1 从豆包生成角色设定卡开始做 AI 动画短剧角色不统一是最常见的问题。第一幕是黑发女主第二幕变成了棕发第三幕连五官都不一样了。这个问题的根源在于你只用了一句“漂亮女孩”去描述角色AI 每一次都在自由发挥。解决思路是反过来先写一份极其详细的角色设定卡把 AI 自由发挥的空间压缩到最小。我还是用豆包来生成这份设定卡直接给它一段指令请为我的AI短剧设计主角“林晓”的视觉设定卡要求包含 外貌脸型、眼睛、发型、发色、身高 服装整套配色、单品细节、配饰 标志性道具必须随身出现的东西 色彩方案这个人身上出现最多的3种颜色 画风描述二维动画质感、赛博都市冷色调 避免模糊词例如“帅”“美”全部改为具体描述豆包会给你一份相对完整的设定卡。比如林晓可以是瓜子脸银色齐肩短发蓝色风衣浅灰高领内搭圆框眼镜左耳有一个“十字星”耳钉主色是银、蓝、深灰。这段描述会反复出现在你后续所有提示词里它就像一个记忆锚点。3.2 用即梦生成定妆图最好有正面、侧面、表情三张角色设定卡拿到后下一个动作不是急着做镜头而是先“定妆”。在即梦里生成三张图正面站姿、侧面转头、一个明显情绪表情比如微笑或惊讶。这步关注的不是画得多好看而是稳定。我们想要的是“以后每次提到林晓都用这套特征去复现”的底图。因此我会用同一段提示词生成 4 到 8 张候选图选出一张脸型五官最稳定、细节最顺眼的把它作为后续所有图生视频、垫图参考的基准底图。3.3 防“跑脸”的三个实操方法第一个方法是垫图/参考图。即梦的图片生成或者图生视频功能里通常都支持上传参考图。这个功能的作用是告诉 AI“主角长这样你照着画”。每次生成新镜头时我都会把定妆图拖进去效果比纯提示词稳定非常多。第二个方法是提示词里强制重复设定信息。哪怕用了垫图我还是会在每个镜头提示词里把角色设定卡的核心信息再写一遍“银色齐肩短发、蓝色风衣、圆框眼镜、冷色调”。原因很简单垫图负责整体气质文字负责细节约束两者叠加角色漂移的概率才会降到最低。第三个方法是控制画面内要素的数量。AI 在复杂画面里很容易把两个人物搞混。如果一场对话戏里有两个角色我会先分别生成两个人各自的特写镜头再生成一个双人同框的远景镜头。在双人同框镜头里把两个人的特征同时写进提示词哪怕稍微复杂一点也要写清楚“左边的人是谁、右边的人是谁、分别穿什么”。3.4 用“画面锚点”来降低返工成本还有一个很多人不知道的技巧我叫它“画面锚点”在生成第一幕镜头时不只记录这张图的 prompt还额外记录它的关键设定词比如“蓝灰色调、赛博城市夜景、细雨、霓虹灯倒影”。往后的镜头无论场景怎么换这些氛围词要尽量保留。这样整条片子看下来画面风格才是一致的不会像拼贴画。角色设计这一关我要多说一句宁可多花一个晚上做定妆也不要急着生成所有镜头。我见过太多人第一天就猛出一堆图结果做到第三天发现角色全不一样全部推翻重来。别问我是怎么知道的。4. 镜头语言AI 短剧能不能火分镜阶段就已经决定了大半4.1 把“镜头”写清楚AI 才能听你的话镜头语言不是玄学它就是在告诉看的人“此刻你应该看哪里感觉到什么。”你如果不写清楚AI 就会给你一个平视的中景画面里的人像木头一样站在正中间整条片子自然没有电影感。在给即梦的每一段提示词里我要求自己至少包含这几个镜头要素景别特写、近景、中景、全景、远景机位/角度平视、俯视、仰视、低角度运动方式固定、推进、拉远、跟随、环绕情绪氛围压抑、明亮、紧张、安静拿第 2 章的分镜表举个例子。S01 是全景那提示词里就写“深夜办公室全景顶视角往下压压迫感强”S02 是特写就写“人物眼睛特写瞳孔收缩镜头缓慢推进能看清睫毛和镜片反光”。这样生成出来的画面即使构图不完全符合预期方向也不会偏太多。4.2 短视频的镜头法则特写优先运动克制通过实际播放数据我会说一句可能被专业导演嫌弃的话在短视频平台特写永远比全景吃香带情绪的脸永远比大场景留住人。因此我做 AI 短剧时分镜比例通常是特写 40%、中景 30%、全景 20%、远景 10%。全景用来交代环境不能停留超过三秒特写用来抓情绪是卡点和配乐的重点。运动方面尽量保持单一方向运动。不要一个镜头里既推近又环绕再拉远AI 视频生成模型在复杂运动下很容易变形、闪烁。最稳的组合是固定机位 人物小幅动作或缓慢推进 人物静止。宁可保守也不要让角色胳膊突然多一根。4.3 用“镜头拆分表”把一段戏翻译成画面我把第 2 章那段 20 秒的“深夜办公室”戏再拆给你看一遍但这次标注了更细的画面运动方向镜头景别镜头运动画面内容情绪S01全景缓慢推进她独自坐在办公室窗外霓虹闪烁压抑S02特写固定瞳孔放大手指悬在键盘上警觉S03中景缓慢横移她转头看向门口紧张S04全景固定门口站着同样的角色惊悚S05特写疾推后期处理椅子摩擦声后她后退恐慌S06中景轻微晃动人影迈步向前加剧S07特写固定她摘掉眼镜微笑反转做完这个表你会发现即梦的每个镜头需要生成的视频其实就是一个 2 到 4 秒的短片段。S01 可以说只是“一个静谧的环境镜头镜头慢慢推近”S02 则是一个“她瞳孔放大的面部特写几乎没有动作”。语言越简单AI 越容易渲染稳定。4.4 转场是救急的不是炫技的关于转场我的态度比较务实AI 短剧因为生成的是片段拼贴镜头之间天然会有跳跃感适当使用转场可以掩盖这种不自然。但转场绝不能多每条片子里 2 到 3 个醒目的转场就够了其余用硬切反而更像真实电影。我最常用的是“加速推进转场”在上一镜头末尾用剪映把画面快速放大到 120%下一镜头从特写直接切入观众会产生一种“唰”一下被拽进下一场戏的感觉这比花哨的模糊转场干净得多。5. 即梦实操从一张定妆图到每一段动态画面的完整走查5.1 把分镜表翻译成即梦提示词的公式到了这一步终于要打开即梦开始干活了。但注意我们不是直接把分镜表里的“画面内容”复制进即梦而是要先翻译成一套生成提示词。我用的公式是这样的画面主体 环境背景 景别机位 镜头运动 角色锁定 氛围光色 质量词拿 S02 镜头来举例。分镜表里写的是“她听到门外声音瞳孔忽然放大”翻译成即梦提示词后是这样画面主体银色短发女性圆框眼镜蓝色风衣表情惊讶瞳孔放大 环境背景深夜办公室暗光窗外霓虹灯 景别机位面部特写平视固定机位 镜头运动轻微呼吸感几乎不动 角色锁定与参考图一致 氛围光色冷蓝色调侧光打在脸上 质量词细节丰富电影感8k质感你看到区别了吗我不再写抽象的“她”而是把所有视觉信息全部显式化。即梦不读心它只读到词。5.2 先出图别急着上视频在即梦里我的顺序永远是先“文生图”再“图生视频”而不是直接“文生视频”。因为文生视频在首帧上不可控角色形象和构图容易跑偏而图生视频可以锁定你满意的那张画面。具体操作是生成 4 到 8 张图中选出结构、情绪、脸部都最好的那张放大、保存。然后用这张图作为图生视频的输入图。这里有一个小习惯生成图时如果有几十分接近的图不要急着选最精致的而是选构图最“正”的。画面里人物居中、比例正常、没有畸形部位这种图生成视频时更稳定。过度精致的细节点进视频之后往往会因为动态而糊掉。5.3 图生视频动作描述要短幅度要小图生视频的动作描述和提示词不一样不需要堆砌很多形容词只需要清晰的动作短句。比如她缓慢转过头眼睛看向门口方向肩膀微微缩紧这种“缓慢”“微微”之类的幅度词对稳定性很有帮助。我不会写“她猛地站起来打翻桌上的水杯”这种剧烈动作十次有八次会生成出诡异效果。如果你想表现这种张力建议拆成两个镜头先给一个手部特写拿起杯子再给一个中景她站起转身。用剪辑去制造爆发力而不是让 AI 一镜到底。5.4 即梦实操中的几个典型翻车现场我把自己实际遇到过的翻车情况整理成一个表方便以后对着排查。问题原因处理方式脸部崩坏动作幅度大、角度刁钻改用小幅度动作或用面部特写重新出图再生成视频手部畸形手部特写时手指数量出错尽量避免手部特写拍不到脸部那就用特写肩部轮廓角色换衣服提示词中服装细节丢失把角色设定卡的服装关键词固定复制进每一段提示词画面抖动闪烁运动路径复杂缩短生成片段时长剪映中做去闪或加轻晃动修饰文字乱码画面中带字不在画面里生成文字标题字幕一律后期用剪映加还有一个经验是如果一段视频跑了三遍还是不满意及时止损。不要跟 AI 死磕某一个镜头。强行耗时间会消磨你的耐心我一般会换一个角度来表达同样的信息比如原本是脸部特写的改成从背后拍再补一个环境音效。5.5 素材入库文件名即命运所有从即梦下载下来的视频或图片我都会立即重命名格式为“镜头编号_内容_第几次尝试”。例如S03_转头看门口_取景2.mp4 S01_深夜办公室全景_t1.png这个习惯能在剪映阶段省掉至少 30% 的挑选时间。刚开始你觉得下载完就在上传文件夹里找起来很方便等做到第 20 个镜头时就会感谢自己当初的命名规范。6. 剪映把一堆片段变成“成片”的最后冲刺赛道6.1 先把分镜素材全部拖入时间轴按镜头编号排列打开剪映新建项目把你生成好的视频按 S01、S02、S03 的顺序依次拖入轨道。此时什么都不要想不要急着加滤镜、加转场先把所有镜头按顺序铺好。这一步看起来简单其实很关键。它是在做一个“粗剪”目的是让叙事线先成立。铺完之后快速播放一遍检查故事是否能看懂。如果某个镜头缺失赶紧回即梦去补而不是在剪映里硬用别的素材填空。6.2 配音与音效的优先级排序我会在确认画面叙事通畅之后再处理声音因为声音是帮助观众理解画面的重要线索也是让 AI 画面看起来更高级的关键。剪映的文本朗读功能有很多配音员可以选择我会根据片子风格选择不同的声音。悬疑片选择一个低沉、语速略慢的男声治愈系选择一个轻柔的女声。设置完音色后我通常会把语速调到 0.9 倍或者 1.1 倍之间以匹配画面节奏。配音的排布不需要每一秒都说话。安静的画面里只留环境音效效果往往更好。比如 S02 里她听到声音愣住这一下我故意把配音停住只保留一声玻璃的脆响紧张感一下就出来了。音效可以从剪映音效库找搜索关键词“高跟鞋”“玻璃响”“心跳”“电流”等很多现成的素材可以直接用。音效的位置尽可能精确到画面上某个动作发生的瞬间也就是说画面里她脚刚刚动的那一帧音效就要同步响这样观众才不会觉得“声音慢了半拍”。6.3 字幕的新建与统一AI 短剧如果没有字幕完播率至少掉一半因为很多人习惯静音刷视频。剪映的“智能字幕”功能很省事语音识别之后能自动生成字幕但 AI 识别时人名或专业名词经常出错比如“林晓”可能被识别成“林小”所以识别之后一定要回头校对一遍。我会在字幕样式里先设定好一个模板比如白色字体、黑色描边、字号合适然后应用到全部字幕。确保同一条片子里字幕位置统一不要出现一个字幕在顶部、下一个在底部的情况。6.4 成片前的三道自检关卡第一条自检是“脸”从第一帧到最后一帧快速过一遍重点看主角的脸、发型、服装是否连续。如果某一帧里发型突然变短我宁可删掉这一段换别的镜头也不能让它留在成片里。第二条自检是“音”关闭画面只看音频时间轴看配音、音效、音乐有没有爆音或突然中断人声是否清晰。第三条自检是“节奏”全片连续播放两遍第一遍不用刻意分析就凭直觉感受有没有明显的无聊段落第二遍再看如果一个镜头超过 4 秒还没有任何运动或变化那大概率要切短。这三道检查都做完之后再导出成片。字幕的加粗、封面、标题这些导出后再处理也不迟。7. 3天变现路线从第一支练习作品到第一次接单报价7.1 第一天的目标不是做出爆款而是跑通闭环很多人把“3天变现”理解为第一天就开始接单这不太现实。我的建议是第一天只做一件事按照前六章的流程用两天分别制作一个 30 秒以内的完整短片。不要贪多不要一个晚上切换三个题材选定一个题材从分镜到成片完整走完一条线。第一支作品大概率会粗糙这没关系。它的意义在于让你把整个链路中所有可能出现的问题都暴露出来你知道脸会跑偏你知道运动幅度太大会崩你知道剪映里的字幕会被识别成错别字这些经验看多少教程都学不会只有亲手做一遍才能内化。7.2 第二天做出三支不同风格的小样片流程熟练以后第二天就不要再做同一种东西了。如果第一支做的是悬疑片第二支可以做治愈系第三支可以做赛博科幻。这不是在浪费精力而是在准备你的作品集。接单的时候客户的需求是多种多样的。一个客户问“你能不能做古风”你说“我没做过但我可以做”和你说“给你看看我之前做过的样片”完全是两种信任度。所以第二天就用最小成本把三种常见风格各做一条 15 秒样片你之后谈单的时候才能拿出有说服力的东西。7.3 第三天整理作品集和报价单作品集不用很复杂把三支样片截取封面图配上标题和一句话介绍就够了。然后是报价单我建议按“单镜头报价”方式做先给客户一个区间再根据修改次数浮动。下面是一个简化版报价参考项目类型规格参考报价区间竖屏AI短剧30秒内15-20个镜头含配音字幕800-2000元企业宣传AI动画45秒-1分钟定制角色2000-5000元AI漫画解说3分钟图文成片500-1500元单张AI海报/封面1张50-200元这个报价只是参考不是标准答案。不同城市、不同客户预算差异很大关键是你要建立一个锚点按时长和镜头数来计费而不是按“我觉得做这个花了多少小时”。7.4 接单的第一步是什么接单渠道我建议从两个维度同时铺一个是身边的资源把作品集发给认识的自媒体运营者、电商老板、装修公司这些人都需要日常短视频素材另一个是线上接单平台比如兼职类的社区、设计外包平台搜“AI绘图”“AI视频”等关键词。第一次谈单时一定要在交付标准里写清楚三件事修改次数比如最多两次、交付物格式MP4、MP3、字幕文件等、授权范围是仅用于这一个账号还是可以多次使用。还有一个细节不要接内容本身有版权风险的单子比如用某部热门动漫的角色形象做商用视频。AI 生成的内容再好看一旦涉及侵权最后承担责任的还是执行者自己。接单之前先问清楚用途这是保护自己最重要的一步。7.5 变现的真实预期管理最后说点实在话。这套流程做熟之后完成一条 30 秒短剧的效率大概在两到三个小时其中一大部分时间花在 AI 生成等待和素材筛选上。如果你的成品质量不错、作品集投放准确一个月接到几个单并不是天方夜谭。但它不会让你一夜暴富本质上是一个技能变现过程。我个人做这套流程最大的收获反而不是那几单收入而是掌握了一套“把想象快速变成画面”的能力。客户说“我想要一个未来世界的故事”我不会发懵而是会打开豆包写分镜打开即梦出图剪映配音剪辑两个小时后就能给对方一个可以讨论的画面雏形。这种确定感才是这个工具组合真正值钱的地方。文档里需要完整的分镜模板、角色设定卡和报价单你在正文里已经看到表格结构了直接复制到表格软件里就能用。之后每次做新项目先打开文档模板改掉角色描述和剧情省下从零开始想结构的时间。