ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

AI漫剧制作全流程:从剧本分镜到图生视频的保姆级教程

AI漫剧制作全流程:从剧本分镜到图生视频的保姆级教程 最近有不少朋友来问我朋友圈里经常刷到的 AI 漫剧到底是怎么做出来的自己也想试试可网上的教程要么只讲某个平台的单点操作要么就是几十秒听不出重点的短视频。这篇文章我把整套流程拆开讲从剧本、分镜、AI 绘画、图生视频到配音和剪辑每一个环节都会说明“用什么工具、填什么参数、为什么要这么做”手把手带你把一个 10 秒左右的 AI 漫剧片段完整做出来。适合刚入门的小白也适合已经接触过 AI 绘画、但还不会串完整流程的同学。1. AI漫剧是什么为什么值得学1.1 什么是AI漫剧AI 漫剧简单说就是用 AI 工具生成漫画风格的静态画面再通过图生视频技术让画面动起来最后配上台词、音效和剪辑节奏形成一种类似动态漫画的短剧内容。它介于“漫画”和“真人短剧”之间既有漫画的画面美感又有短剧的观看节奏非常适合手机端竖屏播放。从技术链路来看AI 漫剧并不是某一个大模型单独完成的而是多个 AI 能力的组合大语言模型负责写剧本、拆台词。AI 绘画模型负责生成角色和场景。视频生成模型负责让画面运动起来。语音合成模型负责配音。传统剪辑工具负责把所有素材组装成片子。所以它本质上是一个“AI 影视流程”的工程化创作过程。1.2 为什么现在大家都在做 AI 漫剧过去做一部二维动画短片需要原画师、动画师、剪辑师、配音演员等多个角色协作成本按秒计算。而 AI 漫剧把这套流程大幅压缩一个人加上几个 AI 工具就能完成过去一个小团队才能做的事情。这也带来了几个明确的优势制作门槛低不需要会手绘不需要懂 3D 建模关键是会写提示词、会拆镜头。产出速度快一个 1 分钟左右的片段熟练之后可能只需要半天。批量复制性强角色和画风确定后后续续集只需要换剧情和场景。平台流量红利明显目前短视频平台上有大量 AI 漫剧账号观众对这种形式的新鲜感还在持续。1.3 需要提前纠正的心态有不少人觉得 AI 漫剧就是“输入一句话自动生成一部剧”这个理解需要纠正。现实是AI 目前只能在“视觉生成”这一步替代传统绘画和动画但在剧本结构、分镜设计、角色一致性、剪辑节奏这些环节人的判断仍然决定作品质量。如果你把 AI 当成一个“非常高产但需要你指挥的美术师”心态就对了。你需要告诉它画什么、用什么角度、表达什么情绪它才能真正产出可用的素材。2. 全流程概览与实际分工在动手之前先建立整体认知。一条完整的 AI 漫剧制作链路可以拆成下面六步。文字剧本 → 分镜拆解 → AI 绘画出图 → 图生视频 → 配音/音效 → 剪辑合成下面用一张表把每个环节说清楚。阶段核心任务使用的工具类型产出物1. 剧本确定故事主题、角色、台词大语言模型、写作软件分集剧本2. 分镜将剧本拆成一个个镜头表格、思维导图分镜表3. 绘画根据分镜描述生成静态画面AI 绘画工具分镜静态图4. 视频把静态图变成动态片段图生视频工具视频片段5. 配音为台词生成语音加背景音乐语音合成、音乐素材库音频文件6. 剪辑拼接片段、对齐音画、调色剪辑软件成片2.1 为什么必须要有“分镜”这一步很多人第一次做 AI 漫剧拿到剧本就急着去生成图片。结果经常是图倒是很精美但连不起来角色、场景、角度全都不统一剪出来像一堆幻灯片。分镜的作用是在生成图片之前把文字转换成具体的画面需求。一个合格的分镜表至少要写明画面里有哪些角色和物体。角色在做什么动作。镜头距离角色多远景别。镜头是固定还是移动运镜。画面的情绪基调。对应台词和时长。分镜表越清楚后面每一张图就越有方向剪辑时的连贯性也越好。3. 制作环境与工具选择3.1 硬件要求AI 视频生成这一步绝大多数情况下由云端算力完成对本地电脑的压力不大普通办公本也能跑通流程。但如果你打算在本地部署 Stable Diffusion就需要一块性能还不错的显卡。一个参考配置范围如下CPUi5 或以上即可。内存16GB 及以上。显卡NVIDIA 显卡显存 8GB 以上建议 12GB 或更高。硬盘建议预留 50GB 以上空间用于存放模型和素材。如果你用的都是在线网页工具那么普通的轻薄本也足够。剪辑环节建议内存稍大一些因为现在的剪辑软件对内存占用并不低。3.2 软件工具矩阵市面上的 AI 工具更新非常快我这里给出目前比较常见的几类选择仅供选型参考。做一个具体项目时你可以根据自己的组合习惯来搭工作流。用途常见工具说明AI 绘画Midjourney、Stable Diffusion、ComfyUI、通义万相、文心一格网页端出图质量稳定本地端可控性高AI 视频可灵、即梦、Runway、Pika、Luma核心能力是图生视频也可以做文生视频AI 配音剪映内置配音、ElevenLabs、TTSMaker根据台词文本直接合成自然语音剪辑合成剪映、必剪、Premiere、DaVinci负责拼接、配乐、字幕、调色3.3 新手选型建议我的建议是先用网页工具走通一条完整流程再考虑本地部署。理由很简单本地部署 Stable Diffusion 会牵扯到 Python 环境、模型下载、显卡驱动、显存优化等一系列问题容易让新手在第一步就被劝退。网页工具虽然可控性不如本地部署但对于理解“提示词 → 图 → 视频”这条主链路已经足够了。当你用网页工具做完几个完整作品对流程有了体感再回本地折腾部署你会更容易理解那些参数和模型文件到底在干嘛。4. 核心概念与参数拆解4.1 AI绘画生成从文字到画面AI 绘画的核心是“通过文本提示词生成图像”。常见的形式有两种文生图直接输入描述AI 生成一张图片。图生图输入一张图片加上文字描述AI 在保留原图结构的基础上改造出新图。在 AI 漫剧制作中图生图用得多一些。因为你需要先确定角色长相再用这张角色图去生成不同场景里的画面否则同一个角色每次生成都可能长不一样。下面这些参数是 AI 绘画中最常遇到的参数作用常见问题提示词描述画面内容、画风、光线、构图提示词越具体画面越可控反向提示词告诉模型不要出现的内容可用来排除模糊、多手指、畸形种子值控制随机性相同种子可复现同图选一个合适的种子值保持一致性步数影响生成质量和耗时步数过高提升有限一般取 20-50提示词符合度控制画面服从提示词的程度值太高容易出现过度锐化宽高比决定画面长宽比例竖屏短剧建议 9:16 或 3:4以 Stable Diffusion WebUI 为例一个典型配置如下提示词 masterpiece, best quality, 1girl, silver hair, red eyes, cyberpunk city, night, neon lights, rain, looking at viewer, half body, dynamic angle, cinematic lighting, detailed illustration 反向提示词 lowres, bad anatomy, bad hands, missing fingers, extra digits, blurry, jpeg artifacts, watermark这里要说明的是画风关键词用masterpiece、best quality拉高画面质量。人物描述放在最前面越重要越靠前。cinematic lighting是影视感的关键词在漫剧画面里非常实用。反向提示词可以有效减少畸形手、模糊等常见问题。4.2 AI视频生成从图片到动态AI 视频生成是目前整个链路里最“玄学”的环节。主流的方案是“图生视频”上传一张静态图再写一句“运动描述”AI 会分析画面内容并生成一段几秒钟的视频。图生视频的关键参数如下参数作用建议运动幅度控制画面动态强弱新手先从小幅度开始镜头控制推拉摇移等运镜方式优先使用工具预设的镜头方向视频时长单次生成的秒数大多数工具默认 5-10 秒帧率视频流畅度常见 24fps 或 30fps运动提示词描述画面里谁在动、怎么动越具体越好如“头发被风吹动”运动提示词也有一些技巧。不要把描述重心放在整个场景上而要放在“主体的动作”和“镜头的运动”上。一个典型的运动提示词the girl turns her head and smiles, hair flowing in the wind, camera slowly pushes in这句提示词前两段描述人物的动作最后一段描述镜头的动作。AI 视频模型对“人物动作”和“镜头运动”的理解能力在逐渐增强所以描述越结构化效果越稳定。4.3 镜头语言基础AI 漫剧虽然是 AI 生成的画面但它本质上还是影视内容镜头语言依然决定观众看下来的体验。初学者不需要掌握特别深的理论但只要理解下面三组概念成片质感就能提升一大截。第一组是“景别”。景别作用使用场景远景交代环境和空间关系故事开场、转场中景展示人物动作和对话常见叙事镜头特写突出表情、细节、情绪高情绪片段一组 10 秒的片段里如果全是同一个景别画面会非常平。合理穿插特写和中景节奏感立刻能拉起来。第二组是“运镜”。推镜头靠近主体增强情绪张力。拉镜头远离主体展示环境常用于结尾。摇镜头在固定位置旋转展示场景全貌。移镜头横向移动有跟随感。图生视频工具大多内置了“推进”“拉远”“左移”“右移”等运镜选项。你可以根据分镜表提前规划好每个镜头用哪种运动。第三组是“转场”。硬切两个镜头直接衔接节奏快。叠化前一个画面淡出后一个淡入适合时间流逝。缩放转场后一镜头从某一局部放大进入短视频里常用。这些转场既可以靠剪辑软件实现也可以在生成视频时通过“运动提示词”提前预留。4.4 角色一致性方案角色一致性是 AI 漫剧制作里最大的痛点。同一个角色第 3 秒和第 6 秒可能脸就变了。要解决这个问题有几个常用方案。第一使用参考图。在 AI 绘画工具里上传定好的角色图再配合文字提示词让模型基于这张图生成新的画面。大部分支持图生图或参考图功能的工具都能实现。第二固定种子值。绘画工具中的种子值决定了初始噪声同一个种子值在相同提示词下能复现相似结构。实际制作时可以先选一个满意的种子值后续所有该角色的镜头都尽量使用同一个种子再通过修改场景和动作关键词来变化构图。第三训练角色 LoRA。如果你已经熟悉 Stable Diffusion可以收集角色不同角度的图片训练一个专属角色模型。这种方法一致性最好但成本也最高适合做长系列作品时投入。5. 保姆级实战从 0 到 1 制作 10 秒 AI 漫剧片段前面铺垫了不少概念下面进入实战环节。这次我们做的目标是一段约 10 秒的竖屏 AI 漫剧片段包含 3 个镜头有简单的剧情、台词和配音。5.1 编写一段短剧本剧本不需要长关键是结构完整。这里以“废墟中的少女机甲师”为主题写一个微型片段场景战后废墟城市 角色少女机甲师「星野」银发红瞳身穿白色战斗服 镜头情绪孤独、回忆、决定 台词 星野内心独白“这座城市的天空已经很久没有放晴了。” 星野对 AI 伙伴“启动引擎我们再去试一次。”这三句话刚好对应三个镜头方便拆解。5.2 拆解分镜脚本把上面的剧本拆成分镜表。注意每一行都要包含镜头描述、景别、运镜、台词和预估时长。镜号画面描述景别运镜台词时长S01女孩站在废墟楼顶抬头看灰色天空雨丝飘落中景缓慢推进内心独白第一句4秒S02女孩眼角特写眼神从迷茫变得坚定特写固定内心独白第二句3秒S03她转身走进身后的机甲驾驶舱舱门关闭指示灯亮起中景跟随横移“启动引擎”3秒分镜拆完之后后面的提示词生成就不再漫无目的了。你可以清楚地知道每张图应该画什么。5.3 编写提示词并生成角色设定图在生成每个镜头之前先做一张角色设定图。这张图会变成一个“锚点”后续所有镜头都尽量以它为参考。角色设定图提示词示例masterpiece, best quality, 1girl, silver hair, red eyes, white pilot suit, short hair, determined expression, full body, standing pose, character sheet, simple grey background, studio lighting, anime style, detailed lineart角色图生成后检查是否符合你心中的“星野”。如果不满意修改提示词重新生成如果满意把这个结果保存到一个固定目录后续每个镜头都使用这张图作为参考图。5.4 生成每个分镜的静态图接下来逐个生成分镜头画面。以 S01 为例提示词如下masterpiece, best quality, 1girl, silver hair, red eyes, white pilot suit, standing on ruined building rooftop, ruined city, gray sky, rain, broken metal bars, medium shot, looking up at sky, sad atmosphere, cinematic lighting, detailed illustration生成之后注意检查三件事角色长相是否和设定图一致。画面构图是否符合分镜表里的“中景”。场景氛围是否传达出“孤独、压抑”。如果角色脸部变了先别急着修细节。回到图生图模式把设定图和当前图叠一下再加关键词重新融合这样比修图更快。三个镜头都生成后你的素材目录应该是这样ai-manju-demo/ ├── scripts/ │ └── story_001.md ├── prompts/ │ ├── character_prompt.md │ └── shot_prompts.md ├── assets/ │ ├── raw/ │ │ ├── character_sheet.png │ │ ├── shot01_v1.png │ │ ├── shot02_v1.png │ │ └── shot03_v1.png │ ├── clean/ │ └── audio/ ├── clips/ └── output/这个目录结构方便你后续做系列作品时复用素材不会越做越乱。5.5 用图片生成视频图片准备好之后进入图生视频环节。以上传 S01 图为例你需要在视频工具里设置如下参数上传图片选择shot01_v1.png运动提示词girl looks up at the sky, rain falls slowly, camera slowly pushes in时长4 秒镜头方向推进运动幅度低这里有一个容易踩的坑运动幅度太大人物面部会发生明显变形。你想让雨飘得更明显那就把“rain falls”写进提示词而不要盲目拉高运动幅度。S02 和 S03 也按照分镜表里的运镜设定依次生成。S02 建议固定镜头S03 建议横移镜头这样三个镜头之间的运动方式有变化。生成完成后把三段视频保存到clips/目录。5.6 生成配音并完成剪辑配音可以直接在剪映里操作。把台词文本粘贴到文本朗读功能里选一个偏“冷静叙事”的声音按分镜时长导出三句配音。剪辑时把三段视频按顺序放上轨道然后把三句配音对齐到对应镜头。注意 S01 是 4 秒S02 是 3 秒S03 是 3 秒配音时长要尽量匹配否则容易出现“画面已经切了声音还没说完”的问题。最后加上背景音乐、简单的字幕条导出成片。如果你希望批量自动化处理视频合并也可以使用 ffmpeg 命令行。假设你有三个视频片段和一段音频可以这样合并# 将片段列表写入 concat 文件 cat clips.txt EOF file clips/shot01.mp4 file clips/shot02.mp4 file clips/shot03.mp4 EOF # 合并三个片段 ffmpeg -f concat -safe 0 -i clips.txt -c copy temp.mp4 # 混入音轨 ffmpeg -i temp.mp4 -i assets/audio/voice_mix.mp3 -c:v copy -c:a aac final_output.mp4最终输出的final_output.mp4就是这个 10 秒 AI 漫剧片段的成片。6. 常见问题与排查思路AI 漫剧流程里新手最容易卡住的几个点我整理成了表格。问题现象常见原因解决思路生成的人物脸部崩坏提示词缺少画质关键词或运动幅度过大增加best quality降低运动幅度同一角色在多张图中长相不一致没有使用参考图或固定种子值用角色设定图做参考固定种子视频片段画面闪烁严重静态图和运动提示词不匹配简化运动提示词降低运动幅度画面像 PPT运动感不足提示词只描述了场景没有描述动作在提示词中同时描述主体动作和镜头运动竖屏构图被裁剪忘了设置 9:16 宽高比在绘画和视频工具中都检查画幅比例配音和画面时长不对齐分镜表没有控制台词时长写分镜时就限定时长剪辑时按镜头精切生成素材太多不好管理没有统一命名和目录规范按S01_E02_Shot03的方式归档部分平台对画面内容审核严格没有读平台内容规则避免暴力、敏感构图理性合规创作下面挑几个重点问题详细说明。6.1 角色崩坏角色崩坏的根本原因是 AI 绘画的随机性。每次生成时模型都会重新“理解”人物特征导致角色五官细节发生变异。解决优先级如下第一步使用角色设定图作为参考图。第二步固定种子值。第三步在提示词中明确写出发色、眼睛颜色、服装样式。第四步如果前三步还不够考虑训练角色 LoRA。只要角色一致性做好后面所有环节的效率都会明显提升。6.2 视频画面闪烁图生视频工具在生成几秒的片段时偶尔会出现动态区域的不稳定。闪烁往往发生在光线变化、布料飘动、雨雪等粒子效果较强的画面里。我的建议是优先做小幅度运动让 AI 不做过激判断。粒子效果多的场景运动幅度尽量保持低。成片后用剪辑软件的降噪功能轻微处理。如果画面中有大面积雨雪又不希望闪烁太严重可以尝试减少雨雪的密度提示词比如把heavy rain改成light rain。6.3 竖屏尺寸被裁剪不少 AI 绘画工具默认生成的是 1:1 或 16:9 的图片把这张图直接丢进视频工具再裁剪到 9:16角色很容易被切头或切身体。更稳妥的做法是在绘画阶段就直接设置 9:16 或 3:4 的宽高比确保构图居中人物主体不要顶到画面边缘。7. 工程化与效率提升建议7.1 素材命名规范AI 漫剧往往不是一次性项目而是连载式内容。前期命名不规范后期剪辑时就会浪费时间。推荐按以下格式命名S01_E02_Shot03_V2.png含义是“第 1 季第 2 集第 3 个镜头的第 2 版”。同时在prompts/目录里保存对应的提示词文件这样你可以随时回溯“这张图当时是怎么生成的”。7.2 提示词工程化不要每次生成都临时编提示词。把提示词拆成固定模块能大幅提高出图效率。比如你可以建立四个模块质量词masterpiece, best quality 角色词1girl, silver hair, red eyes, white pilot suit 环境词ruined city, rain, gray sky 风格词anime style, cinematic lighting每次生成新镜头时只需要改环境词其他模块保留即可这样既省时间又能维持角色一致性。7.3 批量处理思路当镜头数量变多时手动一张一张生成会比较累。如果你用的是支持 API 的绘画工具可以考虑写脚本批量提交。下面是一个使用 Python 管理素材和提交提示词文件的简单示例它不会真正调用某一个具体 AI 的 API只展示批量流程思路# 文件路径tools/generate_batch.py # 用途读取 prompts 目录下的提示词文件逐个打印出来并保存生成记录 本脚本是批量生成思路的最小示例。 实际使用时要根据你选择工具的 API 文档接入对应接口。 import os PROMPT_DIR prompts/shot_prompts OUTPUT_LOG output/generation_log.txt def list_prompt_files(directory): files [] for fname in os.listdir(directory): if fname.endswith(.txt): files.append(os.path.join(directory, fname)) return sorted(files) def main(): prompt_files list_prompt_files(PROMPT_DIR) if not prompt_files: print(未找到提示词文件请先在 prompts 目录创建 .txt 文件。) return with open(OUTPUT_LOG, a, encodingutf-8) as log: for index, prompt_file in enumerate(prompt_files, start1): with open(prompt_file, r, encodingutf-8) as f: prompt f.read().strip() print(f[{index}] {prompt_file}: {prompt[:80]}...) log.write(f{prompt_file}\n{prompt}\n---\n) if __name__ __main__: main()这段代码的作用是把每个镜头的提示词文件批量读取出来并做记录方便后续核对。真正的 API 调用要比这复杂但核心思路是一样的把“提示词”和“生成参数”结构化然后批量执行。7.4 质量把控与备份在正式做长篇内容之前先花时间建立自己的质量基线。比如角色图至少生成 5 版从中选 1 版。每个镜头图至少选 2 个候选再转视频。视频片段生成后立刻预览有严重变形就重做。另外原始素材和成片一定要备份。AI 工具生成的内容尤其是视频往往有随机性错过了可能很难完全复现。7.5 版权与合规意识AI 漫剧创作涉及版权问题要养成几个习惯了解所用 AI 工具的服务条款确认生成内容能否商用。不要直接模仿现有动漫、影视 IP 的角色和画风。背景音乐优先使用无版权素材库或者购买商用授权。发布到平台前确认内容符合平台审核规则。这些问题在前期不注意后期可能带来下架甚至法律风险需要从一开始就重视。8. 总结与下一步这篇教程从 AI 漫剧的概念讲起带你梳理了从剧本、分镜、AI 绘画、图生视频到剪辑的完整链路。核心要点是AI 漫剧不是一个“一键生成”的神奇工具而是一套流程。角色一致性是最大的关键点分镜脚本是质量的基石其他环节更多是技术执行。下一步你可以先按照第 5 节的实战流程完整做一个 10 秒片段感受一下整个链路。等跑通之后再考虑横向扩展做更长剧情、训练自己的角色 LoRA、或者用 API 搭建半自动化的批量生产流程。过程中遇到问题时回到第 6 节的排查表大部分高频卡点都能找到对应思路。如果这篇文章对你有帮助可以收藏备用。等你做出自己的第一条 AI 漫剧片段再回来看一遍应该会有不一样的理解。
返回列表