AI漫剧入门 · 讲义与学习笔记
用AI工具从零完成一集带分镜、配音、配乐和剪辑的动画短片
整理:boyne
第 1 关 · AI漫剧概念与工具生态
理解AI漫剧是什么、典型流水线长什么样,并对主流工具栈建立整体认知。
AI漫剧的定义
你读过漫画、也听过有声书吧?AI漫剧就像是这两者的「合体升级版」——把漫画的画面和讲故事的声音绑在一起,再加上一段背景音乐,组成一个可以看+听的小短剧。区别是:所有画面都是AI画的,所有声音都是AI念的,音乐也是AI生成的。
AI漫剧是什么
AI漫剧是一种**用AI工具制作、风格偏漫画/插画的短篇故事视频**。它的核心是四个组件:
- **画面**:用AI绘图或图生视频工具(如即梦、可灵)根据文字描述生成图片或动态镜头
- **配音**:用AI配音工具(如ChatTTS)把剧本文字念出来,生成角色对白和旁白
- **配乐**:用AI音乐工具(如Suno)按情绪和风格描述生成背景音乐
- **剪辑**:用剪映等工具把所有素材按时间线拼起来,加字幕和转场
flowchart LR
A[剧本文字] --> B[AI 画面]
A --> C[AI 配音]
A --> D[AI 配乐]
B --> E[剪映合成]
C --> E
D --> E
E --> F[成片]
长什么样
视觉上,AI漫剧**像会动的漫画**。画面以插画风格为主——可以是日漫风、国漫风、欧美卡通风、或者更精细的厚涂插画风。镜头会推拉摇移,但运动幅度不会像3D动画那么大,更像是「漫画格子被赋予生命」。
叙事上,它**像连载短剧**——有主角、有冲突、有高潮、有结尾,情节推进快、节奏紧。
典型时长
- **单集**:通常 **1-3 分钟**
- **一部作品**:通常 **5-10 集**,总时长 10-30 分钟
这个时长是为了适配短视频平台的用户习惯——在抖音、快手、小红书、B站上,1-3分钟的竖屏内容最容易被看完、被转发、被收藏。
主要用途
- **网文推文**:把网络小说改编成短剧,吸引读者去读原文
- **短视频内容创作**:在自媒体平台发布,靠流量和广告变现
- **IP孵化**:低成本试水一个故事概念,反响好再投入真人版或正式动画
- **品牌营销**:用AI漫剧风格讲品牌故事,风格新颖、成本低
- **个人创作表达**:任何人都能讲故事,不用学画画、不用学配音
一个小例子
假设你要做一集「穿越古代开咖啡店」的AI漫剧:
- 主角设定:一个现代女孩穿越到唐朝,在长安街头开了家咖啡店
- 时长:2 分钟
- 画面:AI 生成的古代街道、咖啡店、角色插画(用即梦画)
- 配音:AI 念的旁白和角色对白(用 ChatTTS 念)
- 配乐:古风与现代轻快融合的背景音乐(用 Suno 生成)
- 剪辑:剪映把所有素材按分镜顺序拼起来,加字幕和转场
你一个人,用 2-3 天,就能做出一集「看起来像专业团队作品」的东西——这就是 AI 漫剧的魅力。
**要点**:AI漫剧是用AI工具生成的、以漫画/插画风格呈现的 1-3 分钟短剧,本质是「AI画+AI念+AI配乐+人工剪辑」的组合体。
与相邻形态的边界
想象一下你面前有两段视频——左边像「会动的漫画书」,右边像「可以随时暂停的动画电影」。前者是AI漫剧,后者是AI动画短片。两者都靠AI生成、都讲一个故事、都在手机上能刷到,但骨子里是两种东西。
画面风格:插画感 vs 动画感
AI漫剧的视觉基底是**插画/漫画**——线稿明确、色块分明、人物像「立绘」,像从漫画格里「摘」出来的一帧。AI动画短片的视觉基底是**动画**——角色线条更圆润、动作更连贯、光影更细腻,整体像「日TV动画」或「皮克斯短片」的降维版。
简单记:**AI漫剧=画得好看,AI动画短片=动得自然**。
运动幅度:轻摇轻推 vs 流畅动画
这是两者最硬核的差异:
- **AI漫剧**:角色基本不动或只有微动(眨眼、头发飘、口型微张),主要靠镜头推拉摇移和场景切换推进剧情。可以理解成「在PPT上放图,然后放大缩小换页」。
- **AI动画短片**:角色有完整动作——走路、跑、挥拳、表情变化——运动是连续的、有物理感的。
技术原因是AI漫剧主要靠**静态图+图生视频**(即梦出图、可灵图生视频),AI动画短片会更多用**关键帧动画、AnimateDiff、可灵首尾帧、视频续写**等让角色真正「动起来」的技术。
flowchart LR
A1[AI漫剧·静态插画] --> A2[AI漫剧·图生视频小段] --> A3[AI漫剧·镜头推拉]
B1[AI动画·关键帧动画] --> B2[AI动画·角色动态] --> B3[AI动画·连续镜头]
工具栈:轻装 vs 重装
虽然工具名字大量重叠,但**用法和重心完全不同**:
| 环节 | AI漫剧 | AI动画短片 | |------|--------|------------| | 出图 | 即梦、Midjourney | Midjourney、SD | | 动态 | 可灵(图生视频) | 可灵、SVD、AnimateDiff | | 配音 | ChatTTS | ChatTTS、ElevenLabs | | 配乐 | Suno | Suno、AIVA | | 剪辑 | 剪映 | 剪映、PR、AE |
AI漫剧的工具是「**出图为主、动作为辅**」,AI动画短片的工具是「**动作为主、出图为辅**」。
节奏与体量:快闪短剧 vs 短片叙事
AI漫剧1-3分钟一集、节奏紧、靠冲突推进——像抖音短剧,一集一个爽点。AI动画短片可以2-10分钟,叙事更从容,有起承转合。
一个具体例子
同样是「主角走进咖啡店」这5秒:
- **AI漫剧做法**:即梦画一张主角在咖啡店门口的插画,可灵让画面轻微推进+门帘飘动,配旁白「她推开了门」。总耗时15分钟。
- **AI动画短片做法**:可灵让主角从街头走到门口、推门、进门、环顾四周,配环境音和脚步音效。总耗时1-2小时。
差距就在「动」的程度上。
怎么选
- 想**快速出片、刷短视频、试水IP** → 选AI漫剧
- 想**做有质感的短片、参加比赛** → 选AI动画短片
- 两者**可以混用**——AI漫剧里偶尔插一段AI动画短片风格的镜头,会很出彩
**要点**:AI漫剧和AI动画短片的核心差异是「动多少」——AI漫剧以插画+小幅运动为主,靠镜头和剪辑讲故事;AI动画短片以流畅的角色动作为主,靠动画本身讲故事。工具名重叠,但用法和重心完全不同。
典型制作流水线
一个AI漫剧的成片,拆开看其实就是把「会说话的画」按顺序拼起来。整条流水线有七步,但它们不是死板的串行——主线必须一环扣一环,配音配乐这种支线完全可以并行,最后在剪辑那一关「合流」。
可以先把它想象成做一道复杂菜:备料可以同时切,炖煮必须等上一步好,但摆盘是把所有东西聚拢的瞬间。流水线也是同一个逻辑。
第1步|剧本
**输入**:一句想法 / 一个主题 / 一个场景设定 **输出**:分场剧本,包含——
- 场景描述(在哪里)
- 人物动作(在做什么)
- 对白 / 旁白(在说什么)
- 情绪基调(什么氛围)
AI漫剧的剧本要「**画面优先**」——「主角很紧张」很难画,「主角手指微微颤抖、瞳孔放大、嘴唇轻咬」AI才知道该怎么渲染。
**举个例子**:做一个90秒的「女孩在雨夜找到走失小猫」AI漫剧。剧本可以拆成3场:
- 雨夜街头,红雨衣女孩焦急张望(0-30秒)
- 听到巷子里传来喵叫,犹豫着走过去(30-60秒)
- 在纸箱下发现小猫,蹲下抱起(60-90秒)
第2步|分镜
**输入**:剧本 **输出**:镜号、景别(远/中/近/特写)、画面描述、时长、对应台词或旁白
这是**最关键的一步**。每个「镜」就是一次出图请求。一部2分钟的AI漫剧通常有20-40个镜。
那场「雨夜找猫」的第1镜,分镜可以写成:
- 镜号:01
- 景别:全景
- 画面描述:雨夜街道,一个穿红色雨衣的女孩站在路灯下,四周是模糊的霓虹灯
- 时长:4秒
- 旁白:那天雨下得很大
这个「画面描述」就是稍后要原样贴进AI绘图工具的提示词。
第3步|出图
**输入**:分镜的画面描述 + 风格关键词 **输出**:一张张静态画面
每个镜会生成1张或多张候选图,由人来挑出最贴合分镜意图的那张。
「风格关键词」是出图的灵魂——比如「日漫风格、电影感调色、高对比度、雨夜氛围」——这组词决定了30张图之间能不能看起来「出自同一部作品」。
第4步|镜头动态化
**输入**:静态图 + 运动方向提示 **输出**:5-10秒的视频片段
这一步是AI漫剧「动起来」的核心,但**动的主要是镜头**(推进、拉远、摇移、平移),不是角色大幅动作。一张静态图配一个「缓慢推近」的提示,就能变成一段5秒的小视频。
第5步|配音
**输入**:台词文本 + 角色情绪 **输出**:音频文件
AI配音工具把对白念出来,给每个角色选一个固定的声音,调整语速、情绪、停顿。
第6步|配乐
**输入**:整体情绪 + 时长 **输出**:BGM(背景音乐)
雨夜找猫这种故事,一段带雨声氛围的钢琴曲就够了。配乐可以无脑循环,也可以跟着情节起伏。
第7步|剪辑合成
**输入**:所有视频片段 + 配音 + 配乐 **输出**:完整成片
把所有素材拖进剪辑软件(剪映),按分镜顺序拼接,对齐音画,加转场,导出。
串行主线 + 并行支线:流水线的大局
新手最常踩的坑就是**死板地一步步往下走**。其实流水线是这种结构:
flowchart LR
A[剧本] --> B[分镜]
B --> C[出图]
C --> D[镜头动态化]
A --> E[配音]
B --> F[配乐]
E --> G[剪辑合成]
F --> G
D --> G
G --> H[成片]
主线是「剧本 → 分镜 → 出图 → 动态化」,必须一环扣一环。但**配音只要剧本定稿就能开始,配乐只要分镜的情绪基调明确就能开始**,它们和主线并行推进,最后在「剪辑合成」那一步和视频片段一起汇合。
这就是为什么一部2分钟的AI漫剧,串行做要10小时,并行做只要3-4小时——结构对了,效率翻倍。
一个反直觉的事实:质量藏在最前面那两步
**剧本和分镜决定了成片80%的质量**。剧本烂,神仙工具也救不回来;分镜模糊,AI出的图就只能靠运气。每一次返工几乎都出在这两步。
还有一件事:流水线是「迭代」不是「单行道」
每一步都有质检点。出图后你会发现某些镜的画面描述要改;动态化后你会想换掉某段镜头。所以**箭头其实可以往回指**——分镜不满意就回去改剧本,出图不理想就回去改分镜描述。
**要点**:AI漫剧制作是一条「串行主线(剧本→分镜→出图→动态化)+ 并行支线(配音、配乐)」的流水线,支线和主线并行推进、最终在剪辑合成阶段汇合;剧本和分镜决定80%的成片质量,流水线每一步都允许迭代回改,不是单向推进。
主流工具栈速览
你打开工具栏之前,先在脑子里画一张「谁负责干什么」的地图。AI漫剧的工具多如牛毛,但新手只需要先认识五件武器——它们正好覆盖一条完整流水线。
工具地图
flowchart LR
A[剧本 ChatGPT] --> B[分镜 人工设计]
B --> C[出图 即梦]
C --> D[图生视频 可灵]
D --> G[剪辑合成 剪映]
A --> E[配音 ChatTTS]
B --> F[配乐 Suno]
E --> G
F --> G
G --> H[成片]
整条流水线的工具分工可以一句话概括:**剧本靠语言大模型,分镜靠人脑,出图靠即梦,动态化靠可灵,配音靠ChatTTS,配乐靠Suno,最后全部在剪映里合流**。
分工具速览
即梦(字节跳动)—— 出图主力
**定位**:AI绘图工具,也支持图生视频。 **擅长**:
- 中文提示词理解强
- 出图风格多样(写实/动漫/插画)
- 国内直接用,无需科学上网
- 支持「同角色一致性」——同一个角色出多张图能保持脸一致
**短板**:图生视频效果不如可灵。
新手做AI漫剧,**80%的图都在即梦里出**。
可灵(快手)—— 图生视频主力
**定位**:图生视频工具,一张静态图 → 一段5-10秒动态视频。 **擅长**:
- 人物动作自然(推、拉、摇、移都可以)
- 镜头运动流畅
- 国内直接用
**短板**:纯文生图不如即梦强。
**即梦 + 可灵的组合,是当前国内AI漫剧最主流的「出图→动态化」方案**。
剪映(字节跳动)—— 剪辑合成主力
**定位**:免费剪辑软件,国内装机量最大的剪辑工具。 **擅长**:
- 拖拽式剪辑,零基础也能上手
- 自带AI配音、AI字幕、AI封面
- 模板、转场、特效丰富
- 直接导出到抖音/西瓜视频
**短板**:专业调色、复杂特效不如PR/达芬奇。
AI漫剧的**剪辑环节基本都用剪映**——工具门槛低,又能直接对接发布平台。
Suno —— 配乐生成
**定位**:AI音乐生成工具。 **擅长**:
- 输入一段歌词 + 风格描述(如「忧伤钢琴曲、雨夜氛围」)→ 自动生成完整歌曲
- 也可生成纯音乐BGM(不输入歌词)
- 多种风格可选:流行、古风、电子、纯音乐
**短板**:生成的音乐有时需要多刷几次才能挑出合适的。
ChatTTS —— 配音生成
**定位**:开源的文本转语音工具。 **擅长**:
- 中英文双语
- 语气自然,能模拟停顿、笑声
- 本地运行,免费
- 支持多种角色音色
**短板**:界面不如商业TTS工具(如剪映自带配音)友好,需要一定动手能力。
**替代方案**:剪映自带的「AI配音」功能(声音种类多、操作简单),适合完全不想折腾的人。
一个具体例子
要做那个「雨夜找猫」2分钟AI漫剧,工具搭配可以这样:
- 剧本:自己写 / ChatGPT辅助
- 分镜:人工设计30个镜的画面描述
- 出图:即梦,按风格关键词出60张图,挑选30张
- 动态化:可灵,每张图配一个镜头运动提示,输出30段5秒视频
- 配音:剪映自带AI配音,挑一个「温柔女孩」音色
- 配乐:Suno,输入「钢琴、雨夜氛围、忧伤、2分钟」生成BGM
- 剪辑:剪映,拖入所有素材,串起来导出
这套组合**全部工具国内都能用,全部免费或低门槛**。
选择工具的三个原则
- **按需选工具**:预算紧、纯新手 → 全部用国内免费工具(上面的搭配);预算足、要商业级质量 → 考虑Midjourney、Runway等付费工具
- **少即是多**:先精通一套工具,**别在选工具上浪费时间**——工具只是手段,能稳定出片才是目的
- **同一环节只用一个**:别同时开3个出图工具来回切,风格会乱
**要点**:AI漫剧的新手工具栈是「即梦出图 + 可灵动效 + 剪映剪辑 + Suno配乐 + ChatTTS/剪映配音」,五件武器正好覆盖一条完整流水线,国内可直接用、零门槛上手;先精通一套组合,比同时摆弄十个工具更出活。
学习笔记
AI漫剧概念与工具生态 · 学习笔记
一、AI漫剧的定义与核心组件
AI漫剧是一种**用AI工具制作、风格偏漫画/插画的短篇故事视频**。它把漫画画面与讲故事的声音绑定在一起,再配背景音乐,组成可看+听的短剧。所有画面由AI生成,所有声音由AI念出,音乐也由AI生成。
核心由四个组件构成:
- **画面**:用AI绘图或图生视频工具(如即梦、可灵)根据文字描述生成图片或动态镜头
- **配音**:用AI配音工具(如ChatTTS)把剧本文字念出来,生成角色对白和旁白
- **配乐**:用AI音乐工具(如Suno)按情绪和风格描述生成背景音乐
- **剪辑**:用剪映等工具把所有素材按时间线拼起来,加字幕和转场
本质是「AI画+AI念+AI配乐+人工剪辑」的组合体。
二、视觉与叙事特征
- **视觉上**像「会动的漫画」:画面以插画风格为主(日漫/国漫/欧美卡通/厚涂插画风),镜头会推拉摇移,但运动幅度不像3D动画那么大,更像「漫画格子被赋予生命」
- **叙事上**像连载短剧:有主角、有冲突、有高潮、有结尾,情节推进快、节奏紧
三、典型时长与用途
- **单集**:通常1-3分钟
- **一部作品**:通常5-10集,总时长10-30分钟
这个时长适配短视频平台(抖音、快手、小红书、B站)的用户习惯。
主要用途:网文推文、短视频内容创作、IP孵化、品牌营销、个人创作表达。
四、与AI动画短片的边界
两者的核心差异是「动多少」:
| 维度 | AI漫剧 | AI动画短片 | |------|--------|------------| | 画面风格 | 插画/漫画,线稿明确、色块分明、人物像「立绘」 | 动画,角色线条更圆润、动作更连贯、光影更细腻 | | 运动幅度 | 角色基本不动或只有微动(眨眼、头发飘、口型微张),主要靠镜头推拉摇移和场景切换 | 角色有完整动作(走路、跑、挥拳、表情变化),运动连续、有物理感 | | 节奏体量 | 1-3分钟一集,靠冲突推进,像抖音短剧 | 2-10分钟,叙事更从容,有起承转合 | | 工具重心 | 出图为主、动作为辅 | 动作为主、出图为辅 |
技术原因:AI漫剧主要靠**静态图+图生视频**(即梦出图、可灵图生视频),AI动画短片会用**关键帧动画、AnimateDiff、可灵首尾帧、视频续写**等让角色真正动起来的技术。
口诀:**AI漫剧=画得好看,AI动画短片=动得自然**。
五、典型制作流水线(七步)
flowchart LR
A[剧本] --> B[分镜]
B --> C[出图]
C --> D[镜头动态化]
A --> E[配音]
B --> F[配乐]
E --> G[剪辑合成]
F --> G
D --> G
G --> H[成片]
- **剧本**:输入为想法/主题/场景设定,输出为分场剧本(场景描述、人物动作、对白/旁白、情绪基调)。剧本要「**画面优先**」——不写「主角很紧张」,写「主角手指微微颤抖、瞳孔放大、嘴唇轻咬」
- **分镜**:最关键的一步,输出镜号、景别、画面描述、时长、对应台词/旁白。每个「镜」就是一次出图请求。2分钟AI漫剧通常有20-40个镜。「画面描述」就是稍后原样贴进AI绘图工具的提示词
- **出图**:输入分镜画面描述+风格关键词,输出一张张静态画面。「风格关键词」决定多张图之间能否看起来「出自同一部作品」
- **镜头动态化**:输入静态图+运动方向提示,输出5-10秒视频片段。动的主要是镜头(推进、拉远、摇移、平移),不是角色大幅动作
- **配音**:输入台词文本+角色情绪,输出音频文件
- **配乐**:输入整体情绪+时长,输出BGM
- **剪辑合成**:输入所有视频片段+配音+配乐,输出完整成片
串行主线 + 并行支线
主线是「剧本→分镜→出图→动态化」,必须一环扣一环。但**配音只要剧本定稿就能开始,配乐只要分镜情绪基调明确就能开始**,它们和主线并行推进,最后在「剪辑合成」那一步与视频片段汇合。这就是为什么串行做要10小时的片子,并行做能大幅压缩时间。
六、主流工具栈
工具分工一句话概括:**剧本靠语言大模型,分镜靠人脑,出图靠即梦,动态化靠可灵,配音靠ChatTTS,配乐靠Suno,最后全部在剪映里合流**。
各工具定位:
- **即梦**(字节跳动):出图主力,中文提示词理解强、支持「同角色一致性」、国内直接用,新手80%的图都在即梦里出;短板是图生视频效果不如可灵
- **可灵**(快手):图生视频主力,一张静态图→一段5-10秒动态视频,人物动作自然、镜头运动流畅。即梦+可灵是当前国内AI漫剧最主流的「出图→动态化」方案
- **剪映**(字节跳动):剪辑合成主力,免费、拖拽式、零基础上手、自带AI配音/字幕/封面、直接导出到抖音/西瓜视频
- **Suno**:AI音乐生成工具,输入歌词+风格描述或纯音乐描述,自动生成完整歌曲或BGM
- **ChatTTS**:开源文本转语音工具,中英文双语、语气自然、模拟停顿和笑声、本地运行免费;短板是界面不够友好。**替代方案**:剪映自带的「AI配音」功能(声音种类多、操作简单)
工具选择三原则
- **按需选工具**:预算紧、纯新手→全部用国内免费工具;预算足、要商业级质量→考虑Midjourney、Runway等付费工具
- **少即是多**:新手先掌握五件武器就够覆盖完整流水线
- 国内主流搭配(剧本+分镜→即梦→可灵→剪映自带配音→Suno→剪映)**全部工具国内都能用,全部免费或低门槛**
第 2 关 · 剧本与分镜设计
能为一个一到三分钟的短片写出可执行的小剧本,并画出符合AI工具可拍性的分镜表。
短片剧本结构
想象你在跟朋友推荐一部刚刷到的短剧——你大概只会说「开头超惊艳」「中间反转」「结尾炸裂」,然后对方就被你钩住去搜来看了。一到三分钟的AI漫剧本质上就是这样一场「微型说服」:它没有时间铺垫世界观,也没有篇幅讲配角支线,所有力量都压在一条主线上,要么让观众在三分钟内完成一次情绪起伏,要么失败。
这个体量决定了它的剧本不能用电影或小说的结构来套。电影可以花20分钟建人物,AI漫剧只有90到180秒——起承转合必须**极简化、密集化、可视化**。
起承转合:压缩到三分钟
极简的四段式是AI漫剧最稳的骨架:
- **起(钩子+人物亮相,0-15秒)**:第一句话、第一个画面就要让观众知道「这故事跟什么有关、为什么我要看下去」。钩子可以是悬念(她手里那封信是写给谁的)、反差(一个看起来无害的快递员打开了不该开的门)或冲突(她追了他三条街只为还一把伞)。钩子之后紧跟主角亮相——一个动作、一句台词、一种表情,让观众秒认人。
- **承(推进+障碍,15-60秒)**:把钩子挑明的方向推进一格,引入第一个障碍或转折信号。短片里不需要复杂因果链,一个「她发现他是卧底」或「那把伞其实是钥匙」就够了。
- **转(核心反转,60-100秒)**:这是整部短片的命脉。观众在前两段积累的所有判断在这里被推翻或重塑。反转不一定要大,但必须「在意料之外、情理之中」——回头看第一段时能发现伏笔。
- **合(落点+余韵,100-120/180秒)**:给一个情绪落点。可以是高潮动作的收束(她把伞捅向他的胸口),也可以是留白(她把信折成纸飞机扔出窗外,镜头拉远)。落点之后1-2秒的静默或环境音,比再来一句台词更高级。
flowchart LR
A["起<br/>钩子+主角亮相<br/>0-15秒"] --> B["承<br/>推进+障碍<br/>15-60秒"]
B --> C["转<br/>核心反转<br/>60-100秒"]
C --> D["合<br/>落点+余韵<br/>100-180秒"]
节拍:每15-20秒一个小事件
节拍是观众能「感觉到」的最小叙事单位。经验上,AI漫剧每**15-20秒**就应该有一个新的视觉或情绪刺激——一个动作变化、一句关键台词、一个镜头切换、一次配乐变奏。如果超过25秒画面还停留在同一件事上又没有运镜托住,观众就会划走。
换句话说,120秒的短片里应该有**6-8个节拍**。这听起来很密,但配上分镜表的镜头切换和AI配乐的段落变化,其实是自然能撑满的。
一个具体例子:90秒短片《伞》
- **0-10秒(钩子)**:雨夜,便利店门口,女生撑着透明伞回头。画面色调冷蓝。
- **10-25秒(人物)**:她看向店内的男生,他正把最后一瓶热咖啡递给流浪汉。配乐:轻柔钢琴。
- **25-50秒(承)**:男生推门出来,撞到她的伞。两人对视。她把伞倾向他,自己淋湿半边。配乐渐强。
- **50-75秒(转)**:镜头切到男生手里那瓶热咖啡——原来他买咖啡是给她的,但被她先递给了流浪汉。两人意识到彼此都「错位地善良」。配乐:弦乐升调。
- **75-90秒(合)**:男生脱下外套盖在她头上,镜头从两人中景拉远到雨巷全景,结束。配乐回落到钢琴单音,渐隐。
90秒里塞进了5个节拍,没有一句多余台词,每个镜头都承载推进或转折。
**要点:** 一到三分钟的AI漫剧剧本不靠铺陈,靠密度——起承转合压缩进90秒,每15-20秒一个节拍,钩子在前5秒决胜负,反转是命脉。
角色与场景设定
上一节我们给《伞》写出了90秒的故事骨架。但如果你现在打开AI绘图工具,把这90秒的故事整段喂给AI——生成的画面大概率是:每个镜头里女生长得不一样,男生一会儿高一会儿矮,便利店一会儿是便利店一会儿变成了咖啡馆。问题出在哪?
**为什么需要单独的角色与场景设定**
AI绘图工具理解的不是「故事」,而是「画面描述」。「女生回头」这句话里,AI不知道这个女生长什么样、穿什么衣服、什么发色;对AI来说,同一个女生在镜头1和镜头5里,**等于两个陌生人**。
解决办法:在写剧本的同时,为每一个要反复出现的角色和每一个关键场景建立一份「档案卡」——卡片里的关键词,将直接成为后续AI绘图时的prompt锚点。
flowchart LR
A["剧本里反复出现的角色"] --> B["角色档案卡"]
B --> C["视觉+性格关键词"]
C --> D["AI绘图prompt"]
D --> E["多个镜头里<br/>可识别的同一形象"]
F["剧本里的关键场景"] --> G["场景档案卡"]
G --> H["场景+光线+氛围"]
H --> I["AI绘图prompt"]
I --> J["稳定的场景画面"]
**角色档案:两层关键词**
视觉关键词 = AI能直接画出来的东西。具体到五官、发型、服饰、配饰:
- 性别、年龄段、身高体型
- 发型发色、肤色、五官特征
- 服饰(款式 + 颜色 + 材质)
- 标志性道具(伞、项链、伤疤、眼镜)
性格关键词 = AI不会直接画出来,但会影响神态、姿态、站位的东西。比如「内向倔强」会让AI倾向于生成低头、不直视镜头的形象;「锋利冷峻」则倾向抬眼、薄唇紧抿。性格关键词要简短,三个以内最稳。
**场景档案:场景 + 光线 + 氛围**
场景层:地点类型(便利店/天台/教室)、空间布局、关键陈设。 光线与氛围层:时间(雨夜/黄昏)、主光源、色温(冷蓝/暖橙)、情绪底色。这一层往往是被忽略但最影响画面质感的地方——同一个便利店,雨夜的冷蓝霓虹和正午的白日光,画出来的情绪天差地别。
**一个具体例子:《伞》的三张档案卡**
角色·女生
- 视觉:黑色长发齐刘海、白皙皮肤、白色连衣裙过膝、身形纤细
- 性格:内敛倔强、不善言辞
- 标志物:透明长柄雨伞
角色·男生
- 视觉:黑色短发清爽、浅灰色连帽卫衣、深色长裤、清瘦
- 性格:温柔细腻、慢热
- 标志物:双手总插在卫衣口袋
场景·雨夜便利店
- 场景:街角独立玻璃房便利店、暖黄店内光、货架与收银台整齐
- 光线:外部冷蓝雨夜 vs 内部暖黄,形成冷暖对比
- 氛围:孤独感的偶遇
**在分镜里怎么用**
- 角色第一次出场时,在镜头备注里贴上完整的档案卡关键词;之后每次只写角色名 + 当前动作,AI就能保持形象稳定。
- 场景切换时,明确标注「场景:雨夜便利店」,让AI知道进入了哪个空间。
- 道具变化要主动标注——比如「女生手里的透明伞换成了一把黑色折叠伞」,否则AI会沿用上一镜的伞。
**要点:** AI漫剧的角色与场景档案不是写给观众看的,是写给AI看的——视觉关键词决定「画得像不像同一个人」,光线氛围关键词决定「画面的情绪」,而性格关键词通过影响神态姿态间接塑造人物。
分镜表设计
分镜表像是剧本的「施工蓝图」——剧本告诉建筑师「这栋房子是给谁住的」,蓝图则告诉每一个工人具体要砌哪面墙、用什么砖、装哪扇窗。AI绘图和图生视频工具也是工人,它们没读过你的剧本,只看得到分镜表里那一行一行的具体指令。
**分镜表是什么**
一份分镜表把90秒的剧本拆成一组**可独立生产**的镜头。每一行是一个镜头,每一列是一个字段——这个字段就是后续AI工具生成时真正会读到的信息。分镜表不是给你自己看的备忘,是写给AI看的「合同」。
**核心字段与每个字段的用处**
**镜号**:1、2、3……的序号。它的唯一作用是让你在讨论、剪辑、反馈时能精准定位某一镜(「第7镜女生那个特写再调一下」),而不是「就是那个……她抬头那个」。
**景别**:人物或场景在画面里占多大比例。它直接决定AI要画多细、留多少出错空间。常用五种:
- **特写**:只有脸——情绪、眼神、微表情
- **近景**:头与肩——对话、表情交流
- **中景**:膝盖以上——动作、肢体语言
- **全景**:全身 + 环境——交代「在哪」
- **远景**:大空间,人物很小——氛围、孤独感、天地关系
**运镜**:相机的运动方式。常见六种——
- **固定**:相机不动,最稳
- **推**:相机靠近主体(强调情绪)
- **拉**:相机远离主体(揭示环境)
- **摇**:水平旋转(环视、跟随视线)
- **移**:横向平移(与主体并行的移动)
- **跟**:从背后跟随主体(代入感)
对AI图生视频工具来说,运镜就是运动prompt。固定和单一方向的推/拉最稳;「推+摇同时进行」这种复合运镜最容易翻车。
**画面内容**:这一镜里到底有什么——谁在、做什么、什么光线、什么道具。这是**真正喂给AI绘图工具的那一列**,需要把上一节写好的角色档案、场景档案关键词直接贴进来。
**台词/旁白**:完整的一句话台词或旁白文本,标注谁说的。对AI配音工具来说要写成干净文本,情绪用括号备注如「(轻声)」「(温柔地)」。
**时长**:这一镜多少秒。AI图生视频工具一次通常生成3-5秒的片段,时长字段就是告诉你总共要拼接几段。
**音效/配乐**:音乐起止、关键音效。这一列不是给AI绘图看的,是给剪辑阶段用的——但现在写下来能帮你把节奏在脑子里跑一遍。
**备注**:兜底字段。贴哪张角色档案、要不要上传参考图、有什么「必须出现」或「必须避免」——AI工具的「使用说明」都放这里。
flowchart LR
A["剧本一句话"] --> B["分镜表的一行"]
B --> C1["画面内容"]
B --> C2["运镜 + 时长"]
B --> C3["备注里的档案卡"]
C1 --> D1["AI绘图工具<br/>生成静态图"]
C2 --> D2["AI图生视频工具<br/>生成动态片段"]
C3 --> D1
C3 --> D2
D1 --> E["剪辑合成"]
D2 --> E
**一个具体例子:《伞》第4-7镜**
| 镜号 | 景别 | 运镜 | 画面内容 | 台词/旁白 | 时长 | 音效/配乐 | 备注 | |---|---|---|---|---|---|---|---| | 4 | 全景 | 固定 | 雨夜便利店外景,暖黄店内光与冷蓝雨夜对比,女生撑透明伞站在玻璃门外 | 旁白:「那天雨很大。」 | 3s | 雨声+钢琴前奏 | 贴「场景·雨夜便利店」 | | 5 | 近景 | 推 | 女生侧脸特写,雨水从伞沿滑落,眼神望向店内男生 | (无台词) | 4s | 雨声持续 | 贴「角色·女生」档案 | | 6 | 中景 | 固定 | 男生隔玻璃抬头看到女生,浅灰卫衣,双手仍在口袋里 | 男生:「……要进来吗?」 | 4s | 钢琴低音铺底 | 贴「角色·男生」档案 | | 7 | 特写 | 推 | 女生嘴角微微上扬,眼里有光 | (无台词) | 3s | 钢琴渐强 | 情绪高点,prompt强调眼神 |
注意第5镜的「推」+「4s」——这意味着用一段4秒的AI视频片段,做一次从近景到更近的推进,把上一节角色档案里的「女生·黑色长发齐刘海、白色连衣裙、透明伞」关键词直接复制进画面内容字段。
**常见踩坑**
- **一镜塞太多角色**:AI同时稳定生成的角色通常不超过2个,3个以上基本会崩。
- **画面内容写得像散文**:「女生有点难过」不是prompt,「女生低头,刘海遮住半边脸,特写」才是。
- **忘了写时长**:没有时长你估不出总片长,也算不出要生成多少段AI视频。
- **两镜挤成一行**:景别或地点一换,就该起新一行。
**要点:** 分镜表是剧本与AI工具之间的合同——镜号用于定位,景别控制情绪,运镜控制运动,画面内容是真正喂给AI的prompt,时长决定要拼接几段视频,备注用来贴档案卡和补充说明。把它写得像给没读过剧本的人留的清晰便条——因为AI就是那个没读过剧本的人。
分镜的AI可拍性判据
拍电影像装修——剧本是设计图,分镜是施工图,但AI工具是「装修队」,它不是什么都愿意干、什么都干得好。拿到一镜分镜,先别急着喂给AI,先给它做一次「可拍性体检」——把会让它翻车的特征一项项打勾过一遍。
**为什么需要这道体检**
同样一句「女生在便利店门口撑着透明伞回头」,AI可能一次就出图,也可能十次都崩——差别不在画面好不好看,而在这句话里藏了多少AI处理不了的复杂元素。AI这支「施工队」有固定的能力边界:跨过边界它就会画歪角色、扭曲动作、丢失道具、甚至把两个角色合成一个人。把判据前置,比事后救场省十倍时间。
**八大可拍性判据**
把体检表拆成八个维度,每一镜逐项打分:
**1. 角色数量 ≤ 2** AI同时稳定生成超过2个角色就开始翻车:脸容易糊、肢体容易交叉错位、衣服颜色会串。第3个角色尽量安排在「画外」或「下一镜的远景里」。
**2. 运镜复杂度:固定或单方向** 固定镜头、单方向推/拉/移最稳。复合运镜(推+摇、跟+移同时进行)容易让AI图生视频工具产生画面撕裂或主体变形。90秒短片里80%的镜头用固定或单方向就够了。
**3. 动作幅度:小到中** 静态(站着说话、坐着发呆)最稳。简单动作(走两步、抬手、转头)次之。复杂动作(跑、打斗、舞蹈、翻越)最容易崩——尤其是涉及全身大幅度运动时。
**4. 画面元素数量 ≤ 7** 主体1个 + 角色1-2个 + 关键道具2-3个 + 背景元素1-2个。超过7个关键元素,AI就开始「丢东西」或「重复」——比如一把雨伞变成两把。
**5. 光线:均匀或单一对比** 自然光、室内暖光、夜景单点光源都OK。强逆光、霓虹闪烁、复杂光斑、快速光线变化是翻车高发区。
**6. 镜头时长:3-5秒为标准段** AI图生视频工具一次通常生成3-5秒。短于3秒浪费,5-8秒还凑合,超过8秒角色会漂移、场景会走形。一镜如果剧本要求10秒,就拆成2-3段拼接。
**7. 对话/口型:能避免就避免** 多角色对话对AI视频是地狱难度——口型对不上是常态。短片里能「用动作+旁白」交代的,就别用「真人对话」。
**8. 跨镜一致性:提供参考图** 角色在不同镜里会不会变脸?衣服会不会变色?必须为每个常驻角色准备1-2张「定妆照」作为参考图,AI出图时同步上传。
flowchart LR
A[拿到一镜分镜] --> B{角色 ≤ 2?}
B -->|否| BX[拆镜或让配角画外]
B -->|是| C{运镜是固定或单方向?}
C -->|否| CX[降为单方向运镜]
C -->|是| D{动作是小到中?}
D -->|否| DX[拆成多镜静态拼接]
D -->|是| E{时长 3 到 5 秒?}
E -->|否| EX[拆段或压时长]
E -->|是| F[通过 可拍]
BX --> Z[重新设计]
CX --> Z
DX --> Z
EX --> Z
**用《伞》做一次实际体检**
| 镜号 | 角色 | 运镜 | 动作 | 时长 | 风险点 | 判据结果 | |---|---|---|---|---|---|---| | 4 | 1人 | 固定 | 站立 | 3s | 无 | ✅ 通过 | | 5 | 1人 | 推 | 静态特写 | 4s | 「推」要稳 | ✅ 通过 | | 6 | 2人 | 固定 | 站立 | 4s | 玻璃反光可能糊脸 | ⚠️ 加备注「避免玻璃反光遮脸」 | | 7 | 1人 | 推 | 微笑 | 3s | 推+微表情 | ✅ 通过 |
整段只有第6镜需要小心,其余都可以直接喂给AI。
**翻车之后的降级策略**
如果体检不通过,不要硬上。按代价从小到大四档处理:拆镜(把复杂场景拆成简单场景的拼接)→ 借位(让多个角色分镜出现)→ 简化动作(角色只做静态/简单动作)→ 重写剧本(让情节绕开难拍段落)。拆镜几乎零成本,重写剧本代价最大——先试前面三档。
**要点:** AI可拍性判据 = 8项体检表——角色≤2、运镜简单、动作中小、元素≤7、光线均匀、时长3-5秒、避免口型、备好参考图。任何一项不通过,就用「拆镜→借位→简化→重写」四档策略降难度,而不是赌AI能撑住。

学习笔记
剧本与分镜设计
一、短片剧本结构
一到三分钟的AI漫剧本质上是「微型说服」:没有时间铺世界观,没有篇幅讲支线,所有力量压在一条主线上,要么让观众在3分钟内完成一次情绪起伏,要么失败。
电影可以花20分钟建人物,AI漫剧只有90到180秒——起承转合必须**极简化、密集化、可视化**。
起承转合:压缩到三分钟
四段式骨架:
- **起(钩子+人物亮相,0-15秒)**:第一句话、第一个画面就要让观众知道「这故事跟什么有关、为什么我要看下去」。钩子可以是悬念、反差或冲突。之后紧跟主角亮相——一个动作、一句台词、一种表情,让观众秒认人。
- **承(推进+障碍,15-60秒)**:把钩子方向推进一格,引入第一个障碍或转折信号。不需要复杂因果链。
- **转(核心反转,60-100秒)**:整部短片的命脉。前两段积累的所有判断在这里被推翻或重塑。必须「在意料之外、情理之中」——回头看第一段能发现伏笔。
- **合(落点+余韵,100-120/180秒)**:给一个情绪落点。落点之后1-2秒的静默或环境音,比再来一句台词更高级。
节拍:每15-20秒一个小事件
节拍是观众能「感觉到」的最小叙事单位。AI漫剧每**15-20秒**就应该有一个新的视觉或情绪刺激——动作变化、关键台词、镜头切换、配乐变奏。如果超过25秒画面还停留在同一件事上又没有运镜托住,观众就会划走。
120秒的短片里应该有**6-8个节拍**。
例子:90秒短片《伞》
- **0-10秒(钩子)**:雨夜,便利店门口,女生撑透明伞回头。冷蓝色调。
- **10-25秒(人物)**:她看向店内男生,他正把最后一瓶热咖啡递给流浪汉。配乐:轻柔钢琴。
- **25-50秒(承)**:男生推门出来,撞到她的伞。两人对视。
- **50-75秒(转)**:镜头切到男生手里那瓶热咖啡——原来他买咖啡是给她的,但被她先递给了流浪汉。两人意识到彼此都「错位地善良」。
- **75-90秒(合)**:男生脱下外套盖在她头上,镜头从两人中景拉远到雨巷全景。
90秒里塞进了5个节拍,没有一句多余台词。
二、角色与场景设定
AI绘图工具理解的不是「故事」,而是「画面描述」。同一个女生在镜头1和镜头5里,对AI等于两个陌生人。
解决办法:为每一个反复出现的角色和每一个关键场景建立一份「档案卡」——卡片里的关键词将直接成为AI绘图时的prompt锚点。
角色档案:两层关键词
- **视觉关键词** = AI能直接画出来的东西:性别、年龄段、身高体型、发型发色、肤色、五官特征、服饰(款式+颜色+材质)、标志性道具(伞、项链、伤疤、眼镜)。
- **性格关键词** = AI不会直接画出来,但会影响神态、姿态、站位。三个以内最稳。
场景档案:场景 + 光线 + 氛围
- **场景层**:地点类型、空间布局、关键陈设。
- **光线与氛围层**:时间、主光源、色温、情绪底色。这一层往往是被忽略但最影响画面质感的地方。
例子:《伞》的三张档案卡
- **角色·女生**:视觉——黑色长发齐刘海、白皙皮肤、白色连衣裙过膝、身形纤细;性格——内敛倔强、不善言辞;标志物——透明长柄雨伞。
- **角色·男生**:视觉——黑色短发清爽、浅灰色连帽卫衣、深色长裤、清瘦;性格——温柔细腻、慢热;标志物——双手总插在卫衣口袋。
- **场景·雨夜便利店**:街角独立玻璃房便利店、暖黄店内光、货架与收银台整齐;外部冷蓝雨夜 vs 内部暖黄,形成冷暖对比;孤独感的偶遇。
在分镜里怎么用
- 角色第一次出场时,在镜头备注里贴上完整的档案卡关键词;之后每次只写角色名 + 当前动作。
- 场景切换时,明确标注「场景:雨夜便利店」。
- 道具变化要主动标注,否则AI会沿用上一镜的道具。
三、分镜表设计
分镜表是写给AI看的「合同」——每一行是一个镜头,每一列是一个字段。
核心字段与用处
- **镜号**:1、2、3……的序号,用于精准定位某一镜。
- **景别**:
- 特写:只有脸——情绪、眼神、微表情
- 近景:头与肩——对话、表情交流
- 中景:膝盖以上——动作、肢体语言
- 全景:全身 + 环境——交代「在哪」
- 远景:大空间,人物很小——氛围、孤独感
- **运镜**:固定(最稳)、推、拉、摇、移、跟。固定和单一方向的推/拉最稳;复合运镜最容易翻车。
- **画面内容**:这一镜里到底有什么——谁在、做什么、什么光线、什么道具。**真正喂给AI绘图工具的那一列**,需把角色档案、场景档案关键词直接贴进来。
- **台词/旁白**:完整的一句话,标注谁说的。情绪用括号备注如「(轻声)」「(温柔地)」。
- **时长**:这一镜多少秒。AI图生视频工具一次通常生成3-5秒的片段。
- **音效/配乐**:音乐起止、关键音效。给剪辑阶段用。
- **备注**:贴角色档案、是否上传参考图、必须出现或必须避免的内容。
例子:《伞》第4-7镜
| 镜号 | 景别 | 运镜 | 画面内容 | 台词/旁白 | 时长 | 音效/配乐 | 备注 | |---|---|---|---|---|---|---|---| | 4 | 全景 | 固定 | 雨夜便利店外景,暖黄店内光与冷蓝雨夜对比,女生撑透明伞站在玻璃门外 | 旁白:「那天雨很大。」 | 3s | 雨声+钢琴前奏 | 贴「场景·雨夜便利店」 | | 5 | 近景 | 推 | 女生侧脸特写,雨水从伞沿滑落,眼神望向店内男生 | (无台词) | 4s | 雨声持续 | 贴「角色·女生」档案 | | 6 | 中景 | 固定 | … | … | … | … | … |
四、分镜的AI可拍性判据
AI工具是「装修队」,有固定能力边界。跨过边界就会画歪角色、扭曲动作、丢失道具。把判据前置,比事后救场省十倍时间。
八大判据
- **角色数量 ≤ 2**:超过2个角色AI开始翻车——脸糊、肢体交叉错位、衣服颜色串。
- **运镜复杂度:固定或单方向**:复合运镜(推+摇、跟+移同时进行)容易产生画面撕裂或主体变形。90秒短片里80%的镜头用固定或单方向就够了。
- **动作幅度:小到中**:静态最稳,简单动作次之,复杂动作(跑、打斗、舞蹈、翻越)最容易崩。
- **画面元素数量 ≤ 7**:主体1个 + 角色1-2个 + 关键道具2-3个 + 背景元素1-2个。超过7个关键元素,AI开始「丢东西」或「重复」。
- **光线:均匀或单一对比**:自然光、室内暖光、夜景单点光源OK。强逆光、霓虹闪烁、复杂光斑、快速光线变化是翻车高发区。
- **镜头时长:3-5秒为标准段**:短于3秒浪费,5-8秒还凑合,超过8秒角色会漂移、场景会走形。10秒就拆成2-3段拼接。
- **对话/口型:能避免就避免**:多角色对话口型对不上是常态。能「用动作+旁白」交代的,就别用「真人对话」。
- **跨镜一致性:提供参考图**:必须为每个常驻角色准备1-2张「定妆照」作为参考图,AI出图时同步上传。
用《伞》做一次实际体检
| 镜号 | 角色 | 运镜 | 动作 | 时长 | 风险点 | 判据结果 | |---|---|---|---|---|---|---| | 4 | 1人 | 固定 | 站立 | 3s | 无 | ✅ 通过 | | 5 | 1人 | 推 | 静态特写 | 4s | 「推」要稳 | ✅ 通过 | | 6 | 2人 | 固定 | 站立 | 4s | 玻璃反光可能糊脸 | ⚠️ 加备注「避免玻璃反光遮脸」 | | 7 | 1人 | 推 | 微笑 | 3s | 推+微表情 | ✅ 通过 |
整段只有第6镜需要小心,其余都可以直接喂给AI。
第 3 关 · AI绘图与画面生成基础
能使用至少一种AI绘图工具,根据分镜表批量生成可用的角色图与场景图,并完成初筛与精修。
AI绘图工具入门
AI绘图工具入门
一个「听话但挑指令」的画师
想象你走进一家奇怪的画室,里面坐着一个技艺精湛但有点「死板」的画师——你说什么他画什么,但你不说清楚的地方,他就随便发挥。你今天要「红头发」,不写他可能给你画成黑头发;你要「日漫风格」,不写他可能画成油画风。
AI绘图工具就是这样一个画师。它的核心逻辑是:**你用文字描述画面,他把它「画」出来**。文字描述得越精确,画面越接近你想要的。这套文字描述在AI绘图圈有个专门的名字——**提示词(Prompt)**。
三大主流工具:定位与差异
目前做AI漫剧最常接触到的有三款工具,各自适合不同的人群:
**即梦(jimeng.jianying.com)**:字节跳动出品,国产,**网页/App直接用,中文友好,免费额度充裕**,生成的图片和视频质量已经足够做短剧。本模块和后续练习都默认用即梦。**零基础首选**。
**Midjourney**:行业标杆之一,画面质感顶级,但需要通过Discord聊天界面输入指令,对英文提示词要求高,**付费订阅**。适合追求极致画质、愿意折腾英文提示词的学习者。
**Stable Diffusion(SD)**:**开源免费**,可以装在自己电脑上跑,也可以用云端平台(如Civitai、哩布哩布)。**自由度最高**——可以加各种插件做角色一致性、局部重绘,是后期做复杂项目的利器,但**门槛最高**,需要懂参数、懂模型,最好有块像样的显卡。
用一张图来记忆三者的入门路径:
flowchart LR
A[零基础入门] --> B[即梦]
C[追求画质且愿付费] --> D[Midjourney]
E[愿意折腾且有显卡] --> F[Stable Diffusion]
共同的工作流程
不管哪款工具,**操作界面长得都差不多**——本质上都是这三步:
- **输入提示词**:在文本框里写一段文字描述画面
- **调整参数**:设定画面比例、风格、生成数量等
- **点击生成**:等几秒到几十秒,出来一张或多张图片
flowchart LR
A[写提示词] --> B[设参数] --> C[点生成] --> D[看结果]
D -->|不满意| A
D -->|满意| E[下载使用]
必须认识的几个核心参数
虽然不同工具的参数名字略有差异,但下面这几个是**所有AI绘图工具都有的核心参数**:
- **画面比例(Aspect Ratio)**:决定图片是横屏、竖屏还是方形。做短视频选9:16竖屏,做横屏短片选16:9,做封面/海报选1:1或3:4。
- **风格(Style)**:一些工具直接给你风格选项(写实、动漫、油画、水彩),另一些让你在提示词里写(如「日漫风格」「厚涂插画」)。
- **迭代步数(Steps)**:AI「画」多少步停下。步数越多细节越好,但越慢。一般20-30步够用。
- **引导系数 / CFG**:你提示词的「权威性」。数值越高,AI越严格按你说的画,但过高会变得死板、过低会跑题。一般7-12之间。
- **种子值(Seed)**:相当于这张图的「身份证号」。同样的提示词+同样的种子值,可以**复现完全一样的图**。这一点对角色一致性至关重要(后面小节会专门讲)。
具体例子
打开即梦,选「AI生图」,在提示词框里输入:
> 一个穿校服的少女站在樱花树下,微笑,日漫风格,电影光影,9:16竖屏
其他参数先用默认,点「生成」,几秒后出来四张图。挑一张最接近你想象的——这就是AI绘图的基本动作。如果都不满意,**改提示词**(加细节/换描述)或者**再点一次生成**(每次随机出不同结果),直到满意为止。
要点:
AI绘图工具的三个关键词——**提示词**(告诉它画什么)、**参数**(控制比例/风格/步数)、**种子值**(让结果可复现)。零基础入门**首选即梦**(中文、免费、易上手),进阶再考虑Midjourney和Stable Diffusion。

提示词与画面控制
上一节我们把 AI 绘图工具比作「技艺精湛但很挑指令」的画师——**提示词就是给画师下的指令单**。指令单写得清楚,画师才能一次画准。这一节,我们来学怎么把指令单写明白。
四要素模板:一张画面拆成四块
任何一张图,都可以拆成「**谁、在什么环境、长什么样、用什么拍**」四块。提示词写得好不好,关键看你有没有把这四块都照顾到。
**1. 主体(Subject)——画面里画的是谁/什么**
这是最核心的要素。主体要写得**具体、可视化**,不能含糊。
- ❌ 差写法:「一个女生」
- ✅ 好写法:「一个穿白色校服的 16 岁少女,黑色长发齐腰,刘海遮住右眼,蓝色眼睛」
主体描述要包含:人物的外貌、服装、姿态、表情。多角色同框时,按「从主到次」的顺序写,前面的权重更高。
**2. 风格(Style)——画成什么样子**
风格决定了画面最终的美术气质。常见风格关键词:
- **画风类**:日漫风格、厚涂插画、水彩、赛博朋克插画、迪士尼 3D、皮克斯风格
- **媒介类**:油画、铅笔素描、照片写实、概念设计图
- **年代/地域类**:90 年代动画、浮世绘、新艺术运动
短剧做日漫漫剧,直接写「日漫风格」或「anime style, studio quality」就够用。
**3. 镜头(Camera/Composition)——用什么视角拍**
镜头语言直接决定画面的「电影感」。常用关键词:
- **景别**:特写(close-up)、中景(medium shot)、远景(wide shot)、全景(full body)
- **视角**:正面、侧面、仰拍、俯拍、过肩镜头
- **构图**:居中构图、三分法、对称构图
分镜表里的「镜头说明」一栏,几乎可以直接照搬到提示词的镜头位。
**4. 氛围(Mood/Lighting)——光影与情绪**
氛围词是让画面「有感觉」的关键,常用关键词:
- **光线**:电影光影、黄金时段光线、霓虹灯、侧逆光、丁达尔光
- **情绪**:温馨、紧张、孤独、史诗感、日常感
- **天气/时段**:黄昏、雨夜、晴天午后、星空
用一张图来记忆四要素的输入顺序:
flowchart LR
A[主体<br/>谁/是什么] --> D[组合成提示词]
B[风格<br/>画成什么样] --> D
C[镜头<br/>怎么拍] --> D
E[氛围<br/>什么感觉] --> D
负面提示词:告诉画师「不要画什么」
光说「要什么」不够,还得说「**不要什么**」——这就是**负面提示词(Negative Prompt)**。
负面提示词常用来排除:
- **画面瑕疵**:模糊、低质量、变形的手、扭曲的脸、多余的手指、水印
- **风格跑偏**:写实风格里排除「3D 渲染」「动漫」
- **内容禁忌**:NSFW 内容、暴力血腥(视平台要求)
在即梦里,负面提示词一般在高级选项或「不想出现的元素」框里填写。**一套通用的负面提示词模板**可以长期复用:
> 低质量、模糊、变形的手、多余的手指、扭曲的脸、水印、文字、签名
角色一致性是漫剧的生命线——你**不希望某一帧里主角突然多长出六根手指**,负面提示词就是第一道防线。
一个完整的提示词例子
现在我们把四要素串起来,写一条做漫剧分镜的提示词。假设分镜描述是「女主在教室窗边看樱花,表情忧郁」:
> 16 岁少女,黑长直发型,白色水手服校服,坐在靠窗的课桌旁看向窗外,窗外是盛开的樱花树,侧脸特写,**日漫风格,厚涂插画,电影光影,黄昏暖光,氛围忧郁安静,9:16 竖屏**
负面提示词:
> 低质量、模糊、变形的手、多余手指、扭曲的脸、水印、3D 渲染、写实风格
把这套丢进即梦,就能得到一张分镜底图。**主体+风格+镜头+氛围**四要素全在一条提示词里各司其职,AI 也好理解。
要点:
**四要素模板 = 主体 + 风格 + 镜头 + 氛围**——按这个顺序写,画面可控性最高;**负面提示词**用来排除瑕疵和跑偏的风格,是分镜出图不可或缺的安全网。
批量出图与筛选
上一节我们学会了写提示词,能让即梦画出我们想要的那张图。但实际做漫剧时,**画师一张一张慢慢磨是不可能**的——分镜表可能有几十上百格,每格都要出图,效率就是生命线。这一节,我们来学漫剧生产最核心的工作流:**批量出图、横向对比、按需筛选、二次精修**。
为什么需要「批量」
AI 绘图有个脾气:哪怕你写**完全相同的提示词**,每次生成的图也会不一样。这不是 bug,是 AI 内部的「随机性」在工作。
这意味着两件事:
- **不能赌单张**:第一张出图就刚好完美?概率很低。专业做法是**一次跑多张**(比如 4 张、8 张),从中挑最好的。
- **批量是反脆弱**:拍电影时,导演绝不会只拍一条镜头就过。摄影指导会连续拍十几条,从中选最合适的。AI 出图也是同一个逻辑。
**类比**:你在餐厅点菜,不会只尝一口就决定好不好吃。AI 绘图也是——多出几张图,**「摆在一起看」才能真正判断哪张最贴分镜**。
一次跑多张:批量出图的操作
在即梦里,批量出图有几种常见方式:
**1. 同提示词多张生成(最常用)**
在生成数量选项里把「生成数量」从 1 调到 4 或 8。即梦会用同一份提示词,**一次性产出多张同主题、不同细节的图**。这是最高效的批量方式。
**2. 微调提示词跑多组**
针对同一个分镜,**改一两个词**(比如镜位从「中景」改成「近景」、氛围从「温馨」改成「冷清」),每组跑 4 张。最后把 4-5 组共 16-20 张图放在一起对比,挑出最符合分镜意图的那一张。
**3. 固定种子值复现**
有时候你在某张图上「差一点点就完美」——构图对了,但人物表情差一点。这时可以用**种子图(Seed)功能**:记下当前图的种子值,固定下来只微调提示词,能保留构图只换细节。
> 即梦的种子图功能位置:进入「高级设置」或单张图片的「详细信息」里,通常能看到一串数字「Seed: 12345678」,记下它就能复现这张图。
横向对比:把候选图摆在一起看
批量出图后,**最忌讳「一张张滑着看」**——眼睛会疲劳,判断会失准。正确做法是**横向对比**:
flowchart LR
A[同一分镜<br/>4-8 张候选图] --> B[九宫格排版<br/>同屏对比]
B --> C{按分镜字段<br/>逐项核对}
C -->|主体不符| D[筛掉]
C -->|镜头不对| D
C -->|氛围偏差| D
C -->|最贴合分镜| E[进入精修]
C -->|基本可用但细节差| F[微调提示词<br/>二次出图]
**九宫格排版**:把 4 张或 9 张候选图拼成一张大图,所有信息一目了然。即梦在生成多张图时会自动排版,你也可以下载到本地后用截图工具拼图。
**对照分镜字段**:打开分镜表,对照每一项字段——
- 镜头号对不对?
- 景别(特写/中景/远景)对不对?
- 角色动作对不对?
- 场景元素(樱花、教室、窗)是否齐全?
- 情绪氛围(温馨/忧郁/紧张)是否到位?
**快速筛选原则**:90% 的图会被筛掉,这很正常。**能从 8 张里挑出 1-2 张够用的,就已经很高效**。
按分镜字段筛选:建立「打分维度」
为了避免「凭感觉选」,建议给每张候选图打一个**简短的勾选清单**。可以从分镜表里直接抽字段:
| 检查项 | 候选图 A | 候选图 B | 候选图 C | |--------|---------|---------|---------| | 主体身份对 | ✓ | ✓ | ✗ | | 服装一致 | ✓ | ✗ | ✓ | | 景别正确 | ✓ | ✓ | ✓ | | 表情到位 | ✗ | ✓ | ✓ | | 氛围贴合 | ✓ | ✗ | ✓ | | **综合** | 中 | 中 | **优** |
打分不需要多复杂,**4-6 个核心维度就够**。打分的目的不是艺术评判,是**快速过滤明显不合格的图**。
二次精修:局部微调而非重画
当候选图「**80% 满意、20% 需要改**」时,进入二次精修。
**精修的常见方式**:
- **局部重绘(Inpainting)**:在即梦里框选图中不满意的部分(比如人物的脸、背景的某个物件),只对框选区域重新生成,其他部分保持不变。**这是精修最高效的工具**。
- **微调提示词重新出图**:固定种子值,只改一两个词(比如把「黄昏暖光」改成「阴天冷光」),跑一组新图,从里面挑细节更对的。
- **多图融合**:即梦有「相似图」或「图生图」功能,输入原图作为参考,AI 会基于原图生成变体。挑细节更对的那张。
**精修的反模式**:**整张图重画**。如果一张图构图、角色、场景都对,只是某个细节(比如发色、表情)有问题,一定要用局部重绘,不要图省事重画整张——重画意味着前面 80% 的工作白费。
最小可行工作流:四步走
把这一节的内容串成一个**完整工作流**:
- **出图**:单分镜用「同提示词 4 张」+「微调提示词跑 2-3 组」,一次得到 8-12 张候选
- **对比**:九宫格排版,按分镜字段打分
- **筛选**:选 1-2 张进入精修,其他归档(不删,留作参考)
- **精修**:用局部重绘修细节,满意后导出为分镜底图
这个流程的关键是**「批量出图 + 横向对比 + 局部精修」三件套**。养成这个习惯,一部 60 格的漫剧分镜,你能在 1-2 天内全部出完底图。
要点:
**批量出图是用「数量换质量」**——单张赌运气,批量看对比;**横向对比要按分镜字段打分**,避免凭感觉;**精修用局部重绘而非整张重画**,保住前一步的成果。
角色与场景一致性入门
漫剧最难的一关,不是「画得像」,而是「**画得像同一个人**」。
试一下:用即梦画「樱花树下穿校服的女孩」,再画「教室里坐着的穿校服的女孩」——你会发现两张图的人物**长相完全不一样**:眼睛、脸型、发型都对不上。这叫「**角色一致性崩坏**」,观众一秒钟就出戏。
**类比**:电视剧演员要在第 1 集和第 20 集保持同一个人。AI 绘图天生没有「记忆」,每次生成都是独立任务。**L1 阶段的同角色复现,就是用「外部约束」弥补 AI 的记忆缺失**——主要靠三件套配合。
三件套之一:固定描述(角色设定卡)
**核心思路**:把角色的所有可识别特征**写进一份固定描述**,每次出图都原封不动地贴进提示词。
一份合格的角色卡应该包含:
- **面部特征**:圆脸、齐刘海、眼睛大而圆、嘴唇薄
- **发型发色**:黑色长直发,长度到腰
- **体型身高**:身高 160cm,瘦小,肩膀窄
- **标志性物件**:左侧扎一个红色蝴蝶结、戴银色圆形耳钉
- **服装**:白色水手服校服、蓝色百褶裙、白色过膝袜
**关键纪律**:**一个字都不要改**。把「齐刘海」改成「斜刘海」,AI 就会生成另一个人。建议把角色卡存成文本文件,每次复制粘贴。
**反面案例**:写「一个可爱的女孩」「一个校服女生」——这种泛泛的描述每次出图都是不同的人,根本没法一致。
三件套之二:参考图(垫图)
**核心思路**:在提示词之外,再给 AI **一张已经画好的角色图作为参考**。即梦的「图生图」或「参考图」功能就是干这个的。
**两种用法**:
- **首图法**:第一次画好角色后,把这张图保存为「角色参考图」。后续每次出图前上传,AI 会基于这张图生成同一个人。
- **多角度法**:为同一个角色画 3-4 张不同角度的参考图(正面、45 度、侧面),让 AI 多角度理解这个人,应对特写、远景等不同镜头。
**实操细节**:参考图上传后,提示词里仍要带上完整的角色卡描述。**描述 + 参考图双管齐下**,效果比单独任何一种都好——单用描述太「空」,单用参考图 AI 会过度照抄旧图、失去新场景的灵活性。
三件套之三:种子图(Seed)
**核心思路**:生成一张满意的角色图后,**记下它的种子值**(一串数字)。后续用同样的提示词 + 同样的种子值,AI 会生成**构图非常接近**的图。
**典型场景**:
- 画了一张完美的角色立绘,但想要同一角色出现在「黄昏教室」
- 复制提示词,只把场景部分改成「黄昏的教室」
- **保持种子值不变**重跑——AI 会保留角色的大致长相,只换场景
> 即梦里查看种子值:进入单张图片的「详细信息」或「高级设置」,通常能看到一串数字「Seed: 12345678」,记下它就能复现这张图。
**但要注意**:种子图保留的是「构图和细节趋势」,**不能 100% 保证长相完全一致**。它更像「同一个人换衣服」而不是「完全复刻」。在 L1 阶段,**这是辅助手段,不是主力**。
三件套的组合用法
flowchart LR
A[反复调试<br/>画一张满意角色立绘] --> B[保存为参考图<br/>记下种子值]
B --> C[每个分镜出图]
C --> D[粘贴角色卡]
D --> E[上传参考图]
E --> F[保持种子值]
F --> G[同角色不同场景出图]
G --> H{角色一致?}
H -->|是| I[采用]
H -->|否| J[微调角色卡描述<br/>重跑]
J --> G
**工作流精要**:
- **画好第一张**——把角色立绘当作「标准照」,反复改提示词直到满意
- **立绘出图后立即**保存参考图 + 记种子值(两件事配套,缺一不可)
- **每个分镜**都先粘贴角色卡,再上传参考图,再固定种子值
- **出图后第一件事是看角色**——脸变了就回到第 1 步微调角色卡
L1 阶段的真实能力边界
**L1 能做到的**:
- 同一角色在 5-10 个分镜里**大致保持**(脸型、发型、标志性物件一致)
- 简单服装的连续性(校服、学生装)
- 同一场景在不同角度下保持
**L1 做不到的**:
- 几十格分镜**每一格**都像素级一致(这需要 L2 的 LoRA 训练)
- 复杂服装细节精确复现(比如衣服上的 logo、图案)
- 同一角色从童年到成年的精确过渡
**给学习者的建议**:**接受「大致一致」**。某一格角色崩了,要么局部重绘修脸,要么换参考图重跑,**不要追求每张图都完美**。L1 阶段,**整体观感**比单格完美更重要——观众看的是「这个角色在剧情里」,不会拿放大镜逐像素比对。
一个具体例子
主角「小樱」要在 3 个场景出现:
**角色卡**(全程一字不改):
> 圆脸,齐刘海,黑色长直发长到腰,眼睛大而圆,嘴唇薄,左侧扎一个红色蝴蝶结,身高 160cm,瘦小肩膀窄,白色水手服校服蓝色百褶裙白色过膝袜
**场景 1(教室近景)**:
> 提示词:[角色卡] 坐在教室课桌前,窗边,午后阳光从左边照进来,景别近景,表情认真看书 > 上传立绘参考图,种子值 12345678
**场景 2(樱花树下远景)**:
> 提示词:[角色卡] 站在樱花树下,微风吹起头发,景别远景,表情微笑 > 上传同一张立绘,种子值 12345678
**场景 3(黄昏屋顶)**:
> 提示词:[角色卡] 坐在屋顶上看着夕阳,景别中景,表情沉思 > 上传同一张立绘,种子值 12345678
**预期效果**:3 张图里的小樱,**脸型、发型、蝴蝶结、衣服**都高度一致,只是场景、景别、表情不同。这就是 L1 阶段同角色复现的「标准操作」。
要点:
**L1 阶段的角色一致性靠「角色卡 + 参考图 + 种子图」三件套**——角色卡固定描述不变,参考图提供视觉锚点,种子图保留构图趋势;**接受「大致一致」**,别追求像素级完美,那是 L2 阶段的事。
学习笔记
AI绘图与画面生成基础
一、AI绘图的核心逻辑
AI绘图工具的核心逻辑:**用文字描述画面,工具把它「画」出来**。文字描述得越精确,画面越接近想要的效果。这套文字描述有专门名字——**提示词(Prompt)**。
类比:像一个「技艺精湛但很挑指令」的画师——你说什么他画什么,不说清楚的地方他随便发挥。
二、三大主流工具对比
| 工具 | 出品 | 费用 | 门槛 | 特点 | |------|------|------|------|------| | 即梦 | 字节跳动 | 免费额度充裕 | 零基础首选 | 网页/App直接用,中文友好,图片视频质量足够做短剧 | | Midjourney | 行业标杆 | 付费订阅 | 需懂英文提示词 | 画面质感顶级,通过Discord聊天界面输入 | | Stable Diffusion | 开源 | 免费 | 门槛最高 | 可装在本地或用云端平台(如Civitai、哩布哩布),自由度最高,需懂参数和模型,最好有显卡 |
三、共同工作流程
所有AI绘图工具操作本质相同——三步走:
- **输入提示词**:在文本框写文字描述画面
- **调整参数**:设定画面比例、风格、生成数量等
- **点击生成**:等几秒到几十秒,出来一张或多张图
不满意则回到第1步改提示词或再点生成。
四、核心参数
- **画面比例(Aspect Ratio)**:决定横屏/竖屏/方形。短剧选9:16竖屏,横屏短片选16:9,封面/海报选1:1或3:4
- **风格(Style)**:写实、动漫、油画、水彩等
- **迭代步数(Steps)**:AI「画」多少步停下。一般20-30步够用
- **引导系数(CFG)**:提示词的「权威性」。一般7-12之间
- **种子值(Seed)**:图的「身份证号」。同样提示词+同样种子值可复现完全一样的图,对角色一致性至关重要
五、提示词四要素
任何一张画面拆成四块:
- **主体(Subject)**:画面里是谁/什么。要**具体、可视化**,不能含糊。包含外貌、服装、姿态、表情。多角色按主到次顺序,前面的权重更高
- **风格(Style)**:画风类(日漫、厚涂插画、赛博朋克、迪士尼3D、皮克斯)、媒介类(油画、铅笔素描、照片写实、概念设计图)、年代/地域类(90年代动画、浮世绘、新艺术运动)
- **镜头(Camera/Composition)**:景别(特写/中景/远景/全景)、视角(正面/侧面/仰拍/俯拍/过肩)、构图(居中/三分法/对称)
- **氛围(Mood/Lighting)**:光线(电影光影、黄金时段、霓虹灯、侧逆光、丁达尔光)、情绪(温馨/紧张/孤独/史诗感/日常感)、天气/时段(黄昏/雨夜/晴天午后/星空)
输入顺序:主体→风格→镜头→氛围,组合成提示词。
六、负面提示词
光说「要什么」不够,还要说「**不要什么**」——这就是**负面提示词(Negative Prompt)**。
排除三类问题:
- 画面瑕疵:模糊、低质量、变形的手、扭曲的脸、多余的手指、水印
- 风格跑偏:写实里排除「3D渲染」「动漫」
- 内容禁忌:NSFW、暴力血腥
通用模板可长期复用:低质量、模糊、变形的手、多余的手指、扭曲的脸、水印、文字、签名。
七、批量出图工作流
为什么需要批量
AI绘图的脾气:哪怕完全相同的提示词,每次生成的图都不一样。意味着:
- **不能赌单张**:第一张就完美概率很低,要一次跑多张(4-8张)
- 类比:导演不会只拍一条镜头就过,AI出图也是连续拍多条选最合适的
批量出图方式
- **同提示词多张生成**(最常用):生成数量从1调到4或8,一次性产出多张同主题不同细节的图
- **微调提示词跑多组**:改一两个词(镜位从「中景」改「近景」、氛围从「温馨」改「冷清」),每组跑4张,4-5组共16-20张对比
- **固定种子值复现**:记下当前图的种子值(Seed: 12345678),固定只微调提示词,保留构图只换细节
横向对比
最忌讳「一张张滑着看」——眼睛会疲劳。正确做法:
- **九宫格排版**同屏对比
- 对照分镜字段逐项核对:镜头号、景别、角色动作、场景元素、情绪氛围
- 90%的图会被筛掉很正常,能从8张里挑出1-2张够用就已高效
八、角色一致性三件套
漫剧最难的是「画得像同一个人」——AI天生没有「记忆」,每次生成都是独立任务。L1阶段用「外部约束」弥补。
1. 固定描述(角色设定卡)
把角色的可识别特征写进固定描述,每次出图都原封不动地贴进提示词。
应包含:面部特征、发型发色、体型身高、标志性物件、服装。
**关键纪律:一个字都不要改**。把「齐刘海」改成「斜刘海」,AI就会生成另一个人。建议存成文本文件每次复制粘贴。
2. 参考图(垫图)
给AI一张已画好的角色图作为参考,即梦的「图生图」或「参考图」功能。
- **首图法**:第一次画好保存为「角色参考图」后续上传
- **多角度法**:画3-4张不同角度(正面、45度、侧面)让AI多角度理解
**描述+参考图双管齐下**效果最好——单用描述太「空」,单用参考图AI会过度照抄旧图。
3. 种子图(Seed)
记下满意图的种子值,后续用同样提示词+同样种子值,AI会生成构图非常接近的图。
典型场景:完美立绘想换场景,复制提示词只改场景部分,保持种子值重跑。
**但要注意**:种子图保留「构图和细节趋势」,**不能100%保证长相完全一致**。更像「同一个人换衣服」而非「完全复刻」。在L1阶段这是辅助手段,不是主力。
组合工作流
画好第一张角色立绘→保存为参考图+记下种子值→每个分镜出图时粘贴角色卡+上传参考图+保持种子值→同角色不同场景出图→不一致则微调角色卡描述重跑。