AI漫剧入门 · 讲义与学习笔记

用AI工具从零完成一集带分镜、配音、配乐和剪辑的动画短片

整理:boyne

第 1 关 · AI漫剧概念与工具生态

理解AI漫剧是什么、典型流水线长什么样,并对主流工具栈建立整体认知。

AI漫剧的定义

你读过漫画、也听过有声书吧?AI漫剧就像是这两者的「合体升级版」——把漫画的画面和讲故事的声音绑在一起,再加上一段背景音乐,组成一个可以看+听的小短剧。区别是:所有画面都是AI画的,所有声音都是AI念的,音乐也是AI生成的。

AI漫剧是什么

AI漫剧是一种**用AI工具制作、风格偏漫画/插画的短篇故事视频**。它的核心是四个组件:

flowchart LR
    A[剧本文字] --> B[AI 画面]
    A --> C[AI 配音]
    A --> D[AI 配乐]
    B --> E[剪映合成]
    C --> E
    D --> E
    E --> F[成片]

长什么样

视觉上,AI漫剧**像会动的漫画**。画面以插画风格为主——可以是日漫风、国漫风、欧美卡通风、或者更精细的厚涂插画风。镜头会推拉摇移,但运动幅度不会像3D动画那么大,更像是「漫画格子被赋予生命」。

叙事上,它**像连载短剧**——有主角、有冲突、有高潮、有结尾,情节推进快、节奏紧。

典型时长

这个时长是为了适配短视频平台的用户习惯——在抖音、快手、小红书、B站上,1-3分钟的竖屏内容最容易被看完、被转发、被收藏。

主要用途

一个小例子

假设你要做一集「穿越古代开咖啡店」的AI漫剧:

你一个人,用 2-3 天,就能做出一集「看起来像专业团队作品」的东西——这就是 AI 漫剧的魅力。

**要点**:AI漫剧是用AI工具生成的、以漫画/插画风格呈现的 1-3 分钟短剧,本质是「AI画+AI念+AI配乐+人工剪辑」的组合体。

与相邻形态的边界

想象一下你面前有两段视频——左边像「会动的漫画书」,右边像「可以随时暂停的动画电影」。前者是AI漫剧,后者是AI动画短片。两者都靠AI生成、都讲一个故事、都在手机上能刷到,但骨子里是两种东西。

画面风格:插画感 vs 动画感

AI漫剧的视觉基底是**插画/漫画**——线稿明确、色块分明、人物像「立绘」,像从漫画格里「摘」出来的一帧。AI动画短片的视觉基底是**动画**——角色线条更圆润、动作更连贯、光影更细腻,整体像「日TV动画」或「皮克斯短片」的降维版。

简单记:**AI漫剧=画得好看,AI动画短片=动得自然**。

运动幅度:轻摇轻推 vs 流畅动画

这是两者最硬核的差异:

技术原因是AI漫剧主要靠**静态图+图生视频**(即梦出图、可灵图生视频),AI动画短片会更多用**关键帧动画、AnimateDiff、可灵首尾帧、视频续写**等让角色真正「动起来」的技术。

flowchart LR
    A1[AI漫剧·静态插画] --> A2[AI漫剧·图生视频小段] --> A3[AI漫剧·镜头推拉]
    B1[AI动画·关键帧动画] --> B2[AI动画·角色动态] --> B3[AI动画·连续镜头]

工具栈:轻装 vs 重装

虽然工具名字大量重叠,但**用法和重心完全不同**:

| 环节 | AI漫剧 | AI动画短片 | |------|--------|------------| | 出图 | 即梦、Midjourney | Midjourney、SD | | 动态 | 可灵(图生视频) | 可灵、SVD、AnimateDiff | | 配音 | ChatTTS | ChatTTS、ElevenLabs | | 配乐 | Suno | Suno、AIVA | | 剪辑 | 剪映 | 剪映、PR、AE |

AI漫剧的工具是「**出图为主、动作为辅**」,AI动画短片的工具是「**动作为主、出图为辅**」。

节奏与体量:快闪短剧 vs 短片叙事

AI漫剧1-3分钟一集、节奏紧、靠冲突推进——像抖音短剧,一集一个爽点。AI动画短片可以2-10分钟,叙事更从容,有起承转合。

一个具体例子

同样是「主角走进咖啡店」这5秒:

差距就在「动」的程度上。

怎么选

**要点**:AI漫剧和AI动画短片的核心差异是「动多少」——AI漫剧以插画+小幅运动为主,靠镜头和剪辑讲故事;AI动画短片以流畅的角色动作为主,靠动画本身讲故事。工具名重叠,但用法和重心完全不同。

典型制作流水线

一个AI漫剧的成片,拆开看其实就是把「会说话的画」按顺序拼起来。整条流水线有七步,但它们不是死板的串行——主线必须一环扣一环,配音配乐这种支线完全可以并行,最后在剪辑那一关「合流」。

可以先把它想象成做一道复杂菜:备料可以同时切,炖煮必须等上一步好,但摆盘是把所有东西聚拢的瞬间。流水线也是同一个逻辑。

第1步|剧本

**输入**:一句想法 / 一个主题 / 一个场景设定 **输出**:分场剧本,包含——

AI漫剧的剧本要「**画面优先**」——「主角很紧张」很难画,「主角手指微微颤抖、瞳孔放大、嘴唇轻咬」AI才知道该怎么渲染。

**举个例子**:做一个90秒的「女孩在雨夜找到走失小猫」AI漫剧。剧本可以拆成3场:

  1. 雨夜街头,红雨衣女孩焦急张望(0-30秒)
  2. 听到巷子里传来喵叫,犹豫着走过去(30-60秒)
  3. 在纸箱下发现小猫,蹲下抱起(60-90秒)

第2步|分镜

**输入**:剧本 **输出**:镜号、景别(远/中/近/特写)、画面描述、时长、对应台词或旁白

这是**最关键的一步**。每个「镜」就是一次出图请求。一部2分钟的AI漫剧通常有20-40个镜。

那场「雨夜找猫」的第1镜,分镜可以写成:

这个「画面描述」就是稍后要原样贴进AI绘图工具的提示词。

第3步|出图

**输入**:分镜的画面描述 + 风格关键词 **输出**:一张张静态画面

每个镜会生成1张或多张候选图,由人来挑出最贴合分镜意图的那张。

「风格关键词」是出图的灵魂——比如「日漫风格、电影感调色、高对比度、雨夜氛围」——这组词决定了30张图之间能不能看起来「出自同一部作品」。

第4步|镜头动态化

**输入**:静态图 + 运动方向提示 **输出**:5-10秒的视频片段

这一步是AI漫剧「动起来」的核心,但**动的主要是镜头**(推进、拉远、摇移、平移),不是角色大幅动作。一张静态图配一个「缓慢推近」的提示,就能变成一段5秒的小视频。

第5步|配音

**输入**:台词文本 + 角色情绪 **输出**:音频文件

AI配音工具把对白念出来,给每个角色选一个固定的声音,调整语速、情绪、停顿。

第6步|配乐

**输入**:整体情绪 + 时长 **输出**:BGM(背景音乐)

雨夜找猫这种故事,一段带雨声氛围的钢琴曲就够了。配乐可以无脑循环,也可以跟着情节起伏。

第7步|剪辑合成

**输入**:所有视频片段 + 配音 + 配乐 **输出**:完整成片

把所有素材拖进剪辑软件(剪映),按分镜顺序拼接,对齐音画,加转场,导出。

串行主线 + 并行支线:流水线的大局

新手最常踩的坑就是**死板地一步步往下走**。其实流水线是这种结构:

flowchart LR
    A[剧本] --> B[分镜]
    B --> C[出图]
    C --> D[镜头动态化]
    A --> E[配音]
    B --> F[配乐]
    E --> G[剪辑合成]
    F --> G
    D --> G
    G --> H[成片]

主线是「剧本 → 分镜 → 出图 → 动态化」,必须一环扣一环。但**配音只要剧本定稿就能开始,配乐只要分镜的情绪基调明确就能开始**,它们和主线并行推进,最后在「剪辑合成」那一步和视频片段一起汇合。

这就是为什么一部2分钟的AI漫剧,串行做要10小时,并行做只要3-4小时——结构对了,效率翻倍。

一个反直觉的事实:质量藏在最前面那两步

**剧本和分镜决定了成片80%的质量**。剧本烂,神仙工具也救不回来;分镜模糊,AI出的图就只能靠运气。每一次返工几乎都出在这两步。

还有一件事:流水线是「迭代」不是「单行道」

每一步都有质检点。出图后你会发现某些镜的画面描述要改;动态化后你会想换掉某段镜头。所以**箭头其实可以往回指**——分镜不满意就回去改剧本,出图不理想就回去改分镜描述。

**要点**:AI漫剧制作是一条「串行主线(剧本→分镜→出图→动态化)+ 并行支线(配音、配乐)」的流水线,支线和主线并行推进、最终在剪辑合成阶段汇合;剧本和分镜决定80%的成片质量,流水线每一步都允许迭代回改,不是单向推进。

主流工具栈速览

你打开工具栏之前,先在脑子里画一张「谁负责干什么」的地图。AI漫剧的工具多如牛毛,但新手只需要先认识五件武器——它们正好覆盖一条完整流水线。

工具地图

flowchart LR
    A[剧本 ChatGPT] --> B[分镜 人工设计]
    B --> C[出图 即梦]
    C --> D[图生视频 可灵]
    D --> G[剪辑合成 剪映]
    A --> E[配音 ChatTTS]
    B --> F[配乐 Suno]
    E --> G
    F --> G
    G --> H[成片]

整条流水线的工具分工可以一句话概括:**剧本靠语言大模型,分镜靠人脑,出图靠即梦,动态化靠可灵,配音靠ChatTTS,配乐靠Suno,最后全部在剪映里合流**。

分工具速览

即梦(字节跳动)—— 出图主力

**定位**:AI绘图工具,也支持图生视频。 **擅长**:

**短板**:图生视频效果不如可灵。

新手做AI漫剧,**80%的图都在即梦里出**。

可灵(快手)—— 图生视频主力

**定位**:图生视频工具,一张静态图 → 一段5-10秒动态视频。 **擅长**:

**短板**:纯文生图不如即梦强。

**即梦 + 可灵的组合,是当前国内AI漫剧最主流的「出图→动态化」方案**。

剪映(字节跳动)—— 剪辑合成主力

**定位**:免费剪辑软件,国内装机量最大的剪辑工具。 **擅长**:

**短板**:专业调色、复杂特效不如PR/达芬奇。

AI漫剧的**剪辑环节基本都用剪映**——工具门槛低,又能直接对接发布平台。

Suno —— 配乐生成

**定位**:AI音乐生成工具。 **擅长**:

**短板**:生成的音乐有时需要多刷几次才能挑出合适的。

ChatTTS —— 配音生成

**定位**:开源的文本转语音工具。 **擅长**:

**短板**:界面不如商业TTS工具(如剪映自带配音)友好,需要一定动手能力。

**替代方案**:剪映自带的「AI配音」功能(声音种类多、操作简单),适合完全不想折腾的人。

一个具体例子

要做那个「雨夜找猫」2分钟AI漫剧,工具搭配可以这样:

这套组合**全部工具国内都能用,全部免费或低门槛**。

选择工具的三个原则

  1. **按需选工具**:预算紧、纯新手 → 全部用国内免费工具(上面的搭配);预算足、要商业级质量 → 考虑Midjourney、Runway等付费工具
  2. **少即是多**:先精通一套工具,**别在选工具上浪费时间**——工具只是手段,能稳定出片才是目的
  3. **同一环节只用一个**:别同时开3个出图工具来回切,风格会乱

**要点**:AI漫剧的新手工具栈是「即梦出图 + 可灵动效 + 剪映剪辑 + Suno配乐 + ChatTTS/剪映配音」,五件武器正好覆盖一条完整流水线,国内可直接用、零门槛上手;先精通一套组合,比同时摆弄十个工具更出活。

学习笔记

AI漫剧概念与工具生态 · 学习笔记

一、AI漫剧的定义与核心组件

AI漫剧是一种**用AI工具制作、风格偏漫画/插画的短篇故事视频**。它把漫画画面与讲故事的声音绑定在一起,再配背景音乐,组成可看+听的短剧。所有画面由AI生成,所有声音由AI念出,音乐也由AI生成。

核心由四个组件构成:

本质是「AI画+AI念+AI配乐+人工剪辑」的组合体。

二、视觉与叙事特征

三、典型时长与用途

这个时长适配短视频平台(抖音、快手、小红书、B站)的用户习惯。

主要用途:网文推文、短视频内容创作、IP孵化、品牌营销、个人创作表达。

四、与AI动画短片的边界

两者的核心差异是「动多少」:

| 维度 | AI漫剧 | AI动画短片 | |------|--------|------------| | 画面风格 | 插画/漫画,线稿明确、色块分明、人物像「立绘」 | 动画,角色线条更圆润、动作更连贯、光影更细腻 | | 运动幅度 | 角色基本不动或只有微动(眨眼、头发飘、口型微张),主要靠镜头推拉摇移和场景切换 | 角色有完整动作(走路、跑、挥拳、表情变化),运动连续、有物理感 | | 节奏体量 | 1-3分钟一集,靠冲突推进,像抖音短剧 | 2-10分钟,叙事更从容,有起承转合 | | 工具重心 | 出图为主、动作为辅 | 动作为主、出图为辅 |

技术原因:AI漫剧主要靠**静态图+图生视频**(即梦出图、可灵图生视频),AI动画短片会用**关键帧动画、AnimateDiff、可灵首尾帧、视频续写**等让角色真正动起来的技术。

口诀:**AI漫剧=画得好看,AI动画短片=动得自然**。

五、典型制作流水线(七步)

flowchart LR
    A[剧本] --> B[分镜]
    B --> C[出图]
    C --> D[镜头动态化]
    A --> E[配音]
    B --> F[配乐]
    E --> G[剪辑合成]
    F --> G
    D --> G
    G --> H[成片]
  1. **剧本**:输入为想法/主题/场景设定,输出为分场剧本(场景描述、人物动作、对白/旁白、情绪基调)。剧本要「**画面优先**」——不写「主角很紧张」,写「主角手指微微颤抖、瞳孔放大、嘴唇轻咬」
  2. **分镜**:最关键的一步,输出镜号、景别、画面描述、时长、对应台词/旁白。每个「镜」就是一次出图请求。2分钟AI漫剧通常有20-40个镜。「画面描述」就是稍后原样贴进AI绘图工具的提示词
  3. **出图**:输入分镜画面描述+风格关键词,输出一张张静态画面。「风格关键词」决定多张图之间能否看起来「出自同一部作品」
  4. **镜头动态化**:输入静态图+运动方向提示,输出5-10秒视频片段。动的主要是镜头(推进、拉远、摇移、平移),不是角色大幅动作
  5. **配音**:输入台词文本+角色情绪,输出音频文件
  6. **配乐**:输入整体情绪+时长,输出BGM
  7. **剪辑合成**:输入所有视频片段+配音+配乐,输出完整成片
串行主线 + 并行支线

主线是「剧本→分镜→出图→动态化」,必须一环扣一环。但**配音只要剧本定稿就能开始,配乐只要分镜情绪基调明确就能开始**,它们和主线并行推进,最后在「剪辑合成」那一步与视频片段汇合。这就是为什么串行做要10小时的片子,并行做能大幅压缩时间。

六、主流工具栈

工具分工一句话概括:**剧本靠语言大模型,分镜靠人脑,出图靠即梦,动态化靠可灵,配音靠ChatTTS,配乐靠Suno,最后全部在剪映里合流**。

各工具定位:

工具选择三原则
  1. **按需选工具**:预算紧、纯新手→全部用国内免费工具;预算足、要商业级质量→考虑Midjourney、Runway等付费工具
  2. **少即是多**:新手先掌握五件武器就够覆盖完整流水线
  3. 国内主流搭配(剧本+分镜→即梦→可灵→剪映自带配音→Suno→剪映)**全部工具国内都能用,全部免费或低门槛**

第 2 关 · 剧本与分镜设计

能为一个一到三分钟的短片写出可执行的小剧本,并画出符合AI工具可拍性的分镜表。

短片剧本结构

想象你在跟朋友推荐一部刚刷到的短剧——你大概只会说「开头超惊艳」「中间反转」「结尾炸裂」,然后对方就被你钩住去搜来看了。一到三分钟的AI漫剧本质上就是这样一场「微型说服」:它没有时间铺垫世界观,也没有篇幅讲配角支线,所有力量都压在一条主线上,要么让观众在三分钟内完成一次情绪起伏,要么失败。

这个体量决定了它的剧本不能用电影或小说的结构来套。电影可以花20分钟建人物,AI漫剧只有90到180秒——起承转合必须**极简化、密集化、可视化**。

起承转合:压缩到三分钟

极简的四段式是AI漫剧最稳的骨架:

flowchart LR
    A["起<br/>钩子+主角亮相<br/>0-15秒"] --> B["承<br/>推进+障碍<br/>15-60秒"]
    B --> C["转<br/>核心反转<br/>60-100秒"]
    C --> D["合<br/>落点+余韵<br/>100-180秒"]

节拍:每15-20秒一个小事件

节拍是观众能「感觉到」的最小叙事单位。经验上,AI漫剧每**15-20秒**就应该有一个新的视觉或情绪刺激——一个动作变化、一句关键台词、一个镜头切换、一次配乐变奏。如果超过25秒画面还停留在同一件事上又没有运镜托住,观众就会划走。

换句话说,120秒的短片里应该有**6-8个节拍**。这听起来很密,但配上分镜表的镜头切换和AI配乐的段落变化,其实是自然能撑满的。

一个具体例子:90秒短片《伞》

90秒里塞进了5个节拍,没有一句多余台词,每个镜头都承载推进或转折。

**要点:** 一到三分钟的AI漫剧剧本不靠铺陈,靠密度——起承转合压缩进90秒,每15-20秒一个节拍,钩子在前5秒决胜负,反转是命脉。

角色与场景设定

上一节我们给《伞》写出了90秒的故事骨架。但如果你现在打开AI绘图工具,把这90秒的故事整段喂给AI——生成的画面大概率是:每个镜头里女生长得不一样,男生一会儿高一会儿矮,便利店一会儿是便利店一会儿变成了咖啡馆。问题出在哪?

**为什么需要单独的角色与场景设定**

AI绘图工具理解的不是「故事」,而是「画面描述」。「女生回头」这句话里,AI不知道这个女生长什么样、穿什么衣服、什么发色;对AI来说,同一个女生在镜头1和镜头5里,**等于两个陌生人**。

解决办法:在写剧本的同时,为每一个要反复出现的角色和每一个关键场景建立一份「档案卡」——卡片里的关键词,将直接成为后续AI绘图时的prompt锚点。

flowchart LR
    A["剧本里反复出现的角色"] --> B["角色档案卡"]
    B --> C["视觉+性格关键词"]
    C --> D["AI绘图prompt"]
    D --> E["多个镜头里<br/>可识别的同一形象"]

    F["剧本里的关键场景"] --> G["场景档案卡"]
    G --> H["场景+光线+氛围"]
    H --> I["AI绘图prompt"]
    I --> J["稳定的场景画面"]

**角色档案:两层关键词**

视觉关键词 = AI能直接画出来的东西。具体到五官、发型、服饰、配饰:

性格关键词 = AI不会直接画出来,但会影响神态、姿态、站位的东西。比如「内向倔强」会让AI倾向于生成低头、不直视镜头的形象;「锋利冷峻」则倾向抬眼、薄唇紧抿。性格关键词要简短,三个以内最稳。

**场景档案:场景 + 光线 + 氛围**

场景层:地点类型(便利店/天台/教室)、空间布局、关键陈设。 光线与氛围层:时间(雨夜/黄昏)、主光源、色温(冷蓝/暖橙)、情绪底色。这一层往往是被忽略但最影响画面质感的地方——同一个便利店,雨夜的冷蓝霓虹和正午的白日光,画出来的情绪天差地别。

**一个具体例子:《伞》的三张档案卡**

角色·女生

角色·男生

场景·雨夜便利店

**在分镜里怎么用**

**要点:** AI漫剧的角色与场景档案不是写给观众看的,是写给AI看的——视觉关键词决定「画得像不像同一个人」,光线氛围关键词决定「画面的情绪」,而性格关键词通过影响神态姿态间接塑造人物。

分镜表设计

分镜表像是剧本的「施工蓝图」——剧本告诉建筑师「这栋房子是给谁住的」,蓝图则告诉每一个工人具体要砌哪面墙、用什么砖、装哪扇窗。AI绘图和图生视频工具也是工人,它们没读过你的剧本,只看得到分镜表里那一行一行的具体指令。

**分镜表是什么**

一份分镜表把90秒的剧本拆成一组**可独立生产**的镜头。每一行是一个镜头,每一列是一个字段——这个字段就是后续AI工具生成时真正会读到的信息。分镜表不是给你自己看的备忘,是写给AI看的「合同」。

**核心字段与每个字段的用处**

**镜号**:1、2、3……的序号。它的唯一作用是让你在讨论、剪辑、反馈时能精准定位某一镜(「第7镜女生那个特写再调一下」),而不是「就是那个……她抬头那个」。

**景别**:人物或场景在画面里占多大比例。它直接决定AI要画多细、留多少出错空间。常用五种:

**运镜**:相机的运动方式。常见六种——

对AI图生视频工具来说,运镜就是运动prompt。固定和单一方向的推/拉最稳;「推+摇同时进行」这种复合运镜最容易翻车。

**画面内容**:这一镜里到底有什么——谁在、做什么、什么光线、什么道具。这是**真正喂给AI绘图工具的那一列**,需要把上一节写好的角色档案、场景档案关键词直接贴进来。

**台词/旁白**:完整的一句话台词或旁白文本,标注谁说的。对AI配音工具来说要写成干净文本,情绪用括号备注如「(轻声)」「(温柔地)」。

**时长**:这一镜多少秒。AI图生视频工具一次通常生成3-5秒的片段,时长字段就是告诉你总共要拼接几段。

**音效/配乐**:音乐起止、关键音效。这一列不是给AI绘图看的,是给剪辑阶段用的——但现在写下来能帮你把节奏在脑子里跑一遍。

**备注**:兜底字段。贴哪张角色档案、要不要上传参考图、有什么「必须出现」或「必须避免」——AI工具的「使用说明」都放这里。

flowchart LR
    A["剧本一句话"] --> B["分镜表的一行"]
    B --> C1["画面内容"]
    B --> C2["运镜 + 时长"]
    B --> C3["备注里的档案卡"]
    C1 --> D1["AI绘图工具<br/>生成静态图"]
    C2 --> D2["AI图生视频工具<br/>生成动态片段"]
    C3 --> D1
    C3 --> D2
    D1 --> E["剪辑合成"]
    D2 --> E

**一个具体例子:《伞》第4-7镜**

| 镜号 | 景别 | 运镜 | 画面内容 | 台词/旁白 | 时长 | 音效/配乐 | 备注 | |---|---|---|---|---|---|---|---| | 4 | 全景 | 固定 | 雨夜便利店外景,暖黄店内光与冷蓝雨夜对比,女生撑透明伞站在玻璃门外 | 旁白:「那天雨很大。」 | 3s | 雨声+钢琴前奏 | 贴「场景·雨夜便利店」 | | 5 | 近景 | 推 | 女生侧脸特写,雨水从伞沿滑落,眼神望向店内男生 | (无台词) | 4s | 雨声持续 | 贴「角色·女生」档案 | | 6 | 中景 | 固定 | 男生隔玻璃抬头看到女生,浅灰卫衣,双手仍在口袋里 | 男生:「……要进来吗?」 | 4s | 钢琴低音铺底 | 贴「角色·男生」档案 | | 7 | 特写 | 推 | 女生嘴角微微上扬,眼里有光 | (无台词) | 3s | 钢琴渐强 | 情绪高点,prompt强调眼神 |

注意第5镜的「推」+「4s」——这意味着用一段4秒的AI视频片段,做一次从近景到更近的推进,把上一节角色档案里的「女生·黑色长发齐刘海、白色连衣裙、透明伞」关键词直接复制进画面内容字段。

**常见踩坑**

**要点:** 分镜表是剧本与AI工具之间的合同——镜号用于定位,景别控制情绪,运镜控制运动,画面内容是真正喂给AI的prompt,时长决定要拼接几段视频,备注用来贴档案卡和补充说明。把它写得像给没读过剧本的人留的清晰便条——因为AI就是那个没读过剧本的人。

分镜的AI可拍性判据

拍电影像装修——剧本是设计图,分镜是施工图,但AI工具是「装修队」,它不是什么都愿意干、什么都干得好。拿到一镜分镜,先别急着喂给AI,先给它做一次「可拍性体检」——把会让它翻车的特征一项项打勾过一遍。

**为什么需要这道体检**

同样一句「女生在便利店门口撑着透明伞回头」,AI可能一次就出图,也可能十次都崩——差别不在画面好不好看,而在这句话里藏了多少AI处理不了的复杂元素。AI这支「施工队」有固定的能力边界:跨过边界它就会画歪角色、扭曲动作、丢失道具、甚至把两个角色合成一个人。把判据前置,比事后救场省十倍时间。

**八大可拍性判据**

把体检表拆成八个维度,每一镜逐项打分:

**1. 角色数量 ≤ 2** AI同时稳定生成超过2个角色就开始翻车:脸容易糊、肢体容易交叉错位、衣服颜色会串。第3个角色尽量安排在「画外」或「下一镜的远景里」。

**2. 运镜复杂度:固定或单方向** 固定镜头、单方向推/拉/移最稳。复合运镜(推+摇、跟+移同时进行)容易让AI图生视频工具产生画面撕裂或主体变形。90秒短片里80%的镜头用固定或单方向就够了。

**3. 动作幅度:小到中** 静态(站着说话、坐着发呆)最稳。简单动作(走两步、抬手、转头)次之。复杂动作(跑、打斗、舞蹈、翻越)最容易崩——尤其是涉及全身大幅度运动时。

**4. 画面元素数量 ≤ 7** 主体1个 + 角色1-2个 + 关键道具2-3个 + 背景元素1-2个。超过7个关键元素,AI就开始「丢东西」或「重复」——比如一把雨伞变成两把。

**5. 光线:均匀或单一对比** 自然光、室内暖光、夜景单点光源都OK。强逆光、霓虹闪烁、复杂光斑、快速光线变化是翻车高发区。

**6. 镜头时长:3-5秒为标准段** AI图生视频工具一次通常生成3-5秒。短于3秒浪费,5-8秒还凑合,超过8秒角色会漂移、场景会走形。一镜如果剧本要求10秒,就拆成2-3段拼接。

**7. 对话/口型:能避免就避免** 多角色对话对AI视频是地狱难度——口型对不上是常态。短片里能「用动作+旁白」交代的,就别用「真人对话」。

**8. 跨镜一致性:提供参考图** 角色在不同镜里会不会变脸?衣服会不会变色?必须为每个常驻角色准备1-2张「定妆照」作为参考图,AI出图时同步上传。

flowchart LR
    A[拿到一镜分镜] --> B{角色 ≤ 2?}
    B -->|否| BX[拆镜或让配角画外]
    B -->|是| C{运镜是固定或单方向?}
    C -->|否| CX[降为单方向运镜]
    C -->|是| D{动作是小到中?}
    D -->|否| DX[拆成多镜静态拼接]
    D -->|是| E{时长 3 到 5 秒?}
    E -->|否| EX[拆段或压时长]
    E -->|是| F[通过 可拍]
    BX --> Z[重新设计]
    CX --> Z
    DX --> Z
    EX --> Z

**用《伞》做一次实际体检**

| 镜号 | 角色 | 运镜 | 动作 | 时长 | 风险点 | 判据结果 | |---|---|---|---|---|---|---| | 4 | 1人 | 固定 | 站立 | 3s | 无 | ✅ 通过 | | 5 | 1人 | 推 | 静态特写 | 4s | 「推」要稳 | ✅ 通过 | | 6 | 2人 | 固定 | 站立 | 4s | 玻璃反光可能糊脸 | ⚠️ 加备注「避免玻璃反光遮脸」 | | 7 | 1人 | 推 | 微笑 | 3s | 推+微表情 | ✅ 通过 |

整段只有第6镜需要小心,其余都可以直接喂给AI。

**翻车之后的降级策略**

如果体检不通过,不要硬上。按代价从小到大四档处理:拆镜(把复杂场景拆成简单场景的拼接)→ 借位(让多个角色分镜出现)→ 简化动作(角色只做静态/简单动作)→ 重写剧本(让情节绕开难拍段落)。拆镜几乎零成本,重写剧本代价最大——先试前面三档。

**要点:** AI可拍性判据 = 8项体检表——角色≤2、运镜简单、动作中小、元素≤7、光线均匀、时长3-5秒、避免口型、备好参考图。任何一项不通过,就用「拆镜→借位→简化→重写」四档策略降难度,而不是赌AI能撑住。

![AI可拍性判据 = 给每一镜做一次「施工前体检」](https://tma-media.oss-cn-beijing.aliyuncs.com/tma/illustrations/afe549f8-294f-47f3-8321-9147eb826276.jpg)

学习笔记

剧本与分镜设计

一、短片剧本结构

一到三分钟的AI漫剧本质上是「微型说服」:没有时间铺世界观,没有篇幅讲支线,所有力量压在一条主线上,要么让观众在3分钟内完成一次情绪起伏,要么失败。

电影可以花20分钟建人物,AI漫剧只有90到180秒——起承转合必须**极简化、密集化、可视化**。

起承转合:压缩到三分钟

四段式骨架:

节拍:每15-20秒一个小事件

节拍是观众能「感觉到」的最小叙事单位。AI漫剧每**15-20秒**就应该有一个新的视觉或情绪刺激——动作变化、关键台词、镜头切换、配乐变奏。如果超过25秒画面还停留在同一件事上又没有运镜托住,观众就会划走。

120秒的短片里应该有**6-8个节拍**。

例子:90秒短片《伞》

90秒里塞进了5个节拍,没有一句多余台词。

二、角色与场景设定

AI绘图工具理解的不是「故事」,而是「画面描述」。同一个女生在镜头1和镜头5里,对AI等于两个陌生人。

解决办法:为每一个反复出现的角色和每一个关键场景建立一份「档案卡」——卡片里的关键词将直接成为AI绘图时的prompt锚点。

角色档案:两层关键词
场景档案:场景 + 光线 + 氛围
例子:《伞》的三张档案卡
在分镜里怎么用

三、分镜表设计

分镜表是写给AI看的「合同」——每一行是一个镜头,每一列是一个字段。

核心字段与用处
例子:《伞》第4-7镜

| 镜号 | 景别 | 运镜 | 画面内容 | 台词/旁白 | 时长 | 音效/配乐 | 备注 | |---|---|---|---|---|---|---|---| | 4 | 全景 | 固定 | 雨夜便利店外景,暖黄店内光与冷蓝雨夜对比,女生撑透明伞站在玻璃门外 | 旁白:「那天雨很大。」 | 3s | 雨声+钢琴前奏 | 贴「场景·雨夜便利店」 | | 5 | 近景 | 推 | 女生侧脸特写,雨水从伞沿滑落,眼神望向店内男生 | (无台词) | 4s | 雨声持续 | 贴「角色·女生」档案 | | 6 | 中景 | 固定 | … | … | … | … | … |

四、分镜的AI可拍性判据

AI工具是「装修队」,有固定能力边界。跨过边界就会画歪角色、扭曲动作、丢失道具。把判据前置,比事后救场省十倍时间。

八大判据
  1. **角色数量 ≤ 2**:超过2个角色AI开始翻车——脸糊、肢体交叉错位、衣服颜色串。
  2. **运镜复杂度:固定或单方向**:复合运镜(推+摇、跟+移同时进行)容易产生画面撕裂或主体变形。90秒短片里80%的镜头用固定或单方向就够了。
  3. **动作幅度:小到中**:静态最稳,简单动作次之,复杂动作(跑、打斗、舞蹈、翻越)最容易崩。
  4. **画面元素数量 ≤ 7**:主体1个 + 角色1-2个 + 关键道具2-3个 + 背景元素1-2个。超过7个关键元素,AI开始「丢东西」或「重复」。
  5. **光线:均匀或单一对比**:自然光、室内暖光、夜景单点光源OK。强逆光、霓虹闪烁、复杂光斑、快速光线变化是翻车高发区。
  6. **镜头时长:3-5秒为标准段**:短于3秒浪费,5-8秒还凑合,超过8秒角色会漂移、场景会走形。10秒就拆成2-3段拼接。
  7. **对话/口型:能避免就避免**:多角色对话口型对不上是常态。能「用动作+旁白」交代的,就别用「真人对话」。
  8. **跨镜一致性:提供参考图**:必须为每个常驻角色准备1-2张「定妆照」作为参考图,AI出图时同步上传。
用《伞》做一次实际体检

| 镜号 | 角色 | 运镜 | 动作 | 时长 | 风险点 | 判据结果 | |---|---|---|---|---|---|---| | 4 | 1人 | 固定 | 站立 | 3s | 无 | ✅ 通过 | | 5 | 1人 | 推 | 静态特写 | 4s | 「推」要稳 | ✅ 通过 | | 6 | 2人 | 固定 | 站立 | 4s | 玻璃反光可能糊脸 | ⚠️ 加备注「避免玻璃反光遮脸」 | | 7 | 1人 | 推 | 微笑 | 3s | 推+微表情 | ✅ 通过 |

整段只有第6镜需要小心,其余都可以直接喂给AI。

第 3 关 · AI绘图与画面生成基础

能使用至少一种AI绘图工具,根据分镜表批量生成可用的角色图与场景图,并完成初筛与精修。

AI绘图工具入门

AI绘图工具入门

一个「听话但挑指令」的画师

想象你走进一家奇怪的画室,里面坐着一个技艺精湛但有点「死板」的画师——你说什么他画什么,但你不说清楚的地方,他就随便发挥。你今天要「红头发」,不写他可能给你画成黑头发;你要「日漫风格」,不写他可能画成油画风。

AI绘图工具就是这样一个画师。它的核心逻辑是:**你用文字描述画面,他把它「画」出来**。文字描述得越精确,画面越接近你想要的。这套文字描述在AI绘图圈有个专门的名字——**提示词(Prompt)**。

三大主流工具:定位与差异

目前做AI漫剧最常接触到的有三款工具,各自适合不同的人群:

**即梦(jimeng.jianying.com)**:字节跳动出品,国产,**网页/App直接用,中文友好,免费额度充裕**,生成的图片和视频质量已经足够做短剧。本模块和后续练习都默认用即梦。**零基础首选**。

**Midjourney**:行业标杆之一,画面质感顶级,但需要通过Discord聊天界面输入指令,对英文提示词要求高,**付费订阅**。适合追求极致画质、愿意折腾英文提示词的学习者。

**Stable Diffusion(SD)**:**开源免费**,可以装在自己电脑上跑,也可以用云端平台(如Civitai、哩布哩布)。**自由度最高**——可以加各种插件做角色一致性、局部重绘,是后期做复杂项目的利器,但**门槛最高**,需要懂参数、懂模型,最好有块像样的显卡。

用一张图来记忆三者的入门路径:

flowchart LR
    A[零基础入门] --> B[即梦]
    C[追求画质且愿付费] --> D[Midjourney]
    E[愿意折腾且有显卡] --> F[Stable Diffusion]

共同的工作流程

不管哪款工具,**操作界面长得都差不多**——本质上都是这三步:

  1. **输入提示词**:在文本框里写一段文字描述画面
  2. **调整参数**:设定画面比例、风格、生成数量等
  3. **点击生成**:等几秒到几十秒,出来一张或多张图片
flowchart LR
    A[写提示词] --> B[设参数] --> C[点生成] --> D[看结果]
    D -->|不满意| A
    D -->|满意| E[下载使用]

必须认识的几个核心参数

虽然不同工具的参数名字略有差异,但下面这几个是**所有AI绘图工具都有的核心参数**:

具体例子

打开即梦,选「AI生图」,在提示词框里输入:

> 一个穿校服的少女站在樱花树下,微笑,日漫风格,电影光影,9:16竖屏

其他参数先用默认,点「生成」,几秒后出来四张图。挑一张最接近你想象的——这就是AI绘图的基本动作。如果都不满意,**改提示词**(加细节/换描述)或者**再点一次生成**(每次随机出不同结果),直到满意为止。

要点:

AI绘图工具的三个关键词——**提示词**(告诉它画什么)、**参数**(控制比例/风格/步数)、**种子值**(让结果可复现)。零基础入门**首选即梦**(中文、免费、易上手),进阶再考虑Midjourney和Stable Diffusion。

![AI绘图工具就像一位技艺精湛但「很挑指令」的画师——你说什么他才画什么。](https://tma-media.oss-cn-beijing.aliyuncs.com/tma/illustrations/deded218-1b34-4462-b1ee-c6cc4c75fd1d.jpg)

提示词与画面控制

上一节我们把 AI 绘图工具比作「技艺精湛但很挑指令」的画师——**提示词就是给画师下的指令单**。指令单写得清楚,画师才能一次画准。这一节,我们来学怎么把指令单写明白。

四要素模板:一张画面拆成四块

任何一张图,都可以拆成「**谁、在什么环境、长什么样、用什么拍**」四块。提示词写得好不好,关键看你有没有把这四块都照顾到。

**1. 主体(Subject)——画面里画的是谁/什么**

这是最核心的要素。主体要写得**具体、可视化**,不能含糊。

主体描述要包含:人物的外貌、服装、姿态、表情。多角色同框时,按「从主到次」的顺序写,前面的权重更高。

**2. 风格(Style)——画成什么样子**

风格决定了画面最终的美术气质。常见风格关键词:

短剧做日漫漫剧,直接写「日漫风格」或「anime style, studio quality」就够用。

**3. 镜头(Camera/Composition)——用什么视角拍**

镜头语言直接决定画面的「电影感」。常用关键词:

分镜表里的「镜头说明」一栏,几乎可以直接照搬到提示词的镜头位。

**4. 氛围(Mood/Lighting)——光影与情绪**

氛围词是让画面「有感觉」的关键,常用关键词:

用一张图来记忆四要素的输入顺序:

flowchart LR
    A[主体<br/>谁/是什么] --> D[组合成提示词]
    B[风格<br/>画成什么样] --> D
    C[镜头<br/>怎么拍] --> D
    E[氛围<br/>什么感觉] --> D

负面提示词:告诉画师「不要画什么」

光说「要什么」不够,还得说「**不要什么**」——这就是**负面提示词(Negative Prompt)**。

负面提示词常用来排除:

在即梦里,负面提示词一般在高级选项或「不想出现的元素」框里填写。**一套通用的负面提示词模板**可以长期复用:

> 低质量、模糊、变形的手、多余的手指、扭曲的脸、水印、文字、签名

角色一致性是漫剧的生命线——你**不希望某一帧里主角突然多长出六根手指**,负面提示词就是第一道防线。

一个完整的提示词例子

现在我们把四要素串起来,写一条做漫剧分镜的提示词。假设分镜描述是「女主在教室窗边看樱花,表情忧郁」:

> 16 岁少女,黑长直发型,白色水手服校服,坐在靠窗的课桌旁看向窗外,窗外是盛开的樱花树,侧脸特写,**日漫风格,厚涂插画,电影光影,黄昏暖光,氛围忧郁安静,9:16 竖屏**

负面提示词:

> 低质量、模糊、变形的手、多余手指、扭曲的脸、水印、3D 渲染、写实风格

把这套丢进即梦,就能得到一张分镜底图。**主体+风格+镜头+氛围**四要素全在一条提示词里各司其职,AI 也好理解。

要点:

**四要素模板 = 主体 + 风格 + 镜头 + 氛围**——按这个顺序写,画面可控性最高;**负面提示词**用来排除瑕疵和跑偏的风格,是分镜出图不可或缺的安全网。

批量出图与筛选

上一节我们学会了写提示词,能让即梦画出我们想要的那张图。但实际做漫剧时,**画师一张一张慢慢磨是不可能**的——分镜表可能有几十上百格,每格都要出图,效率就是生命线。这一节,我们来学漫剧生产最核心的工作流:**批量出图、横向对比、按需筛选、二次精修**。

为什么需要「批量」

AI 绘图有个脾气:哪怕你写**完全相同的提示词**,每次生成的图也会不一样。这不是 bug,是 AI 内部的「随机性」在工作。

这意味着两件事:

**类比**:你在餐厅点菜,不会只尝一口就决定好不好吃。AI 绘图也是——多出几张图,**「摆在一起看」才能真正判断哪张最贴分镜**。

一次跑多张:批量出图的操作

在即梦里,批量出图有几种常见方式:

**1. 同提示词多张生成(最常用)**

在生成数量选项里把「生成数量」从 1 调到 4 或 8。即梦会用同一份提示词,**一次性产出多张同主题、不同细节的图**。这是最高效的批量方式。

**2. 微调提示词跑多组**

针对同一个分镜,**改一两个词**(比如镜位从「中景」改成「近景」、氛围从「温馨」改成「冷清」),每组跑 4 张。最后把 4-5 组共 16-20 张图放在一起对比,挑出最符合分镜意图的那一张。

**3. 固定种子值复现**

有时候你在某张图上「差一点点就完美」——构图对了,但人物表情差一点。这时可以用**种子图(Seed)功能**:记下当前图的种子值,固定下来只微调提示词,能保留构图只换细节。

> 即梦的种子图功能位置:进入「高级设置」或单张图片的「详细信息」里,通常能看到一串数字「Seed: 12345678」,记下它就能复现这张图。

横向对比:把候选图摆在一起看

批量出图后,**最忌讳「一张张滑着看」**——眼睛会疲劳,判断会失准。正确做法是**横向对比**:

flowchart LR
    A[同一分镜<br/>4-8 张候选图] --> B[九宫格排版<br/>同屏对比]
    B --> C{按分镜字段<br/>逐项核对}
    C -->|主体不符| D[筛掉]
    C -->|镜头不对| D
    C -->|氛围偏差| D
    C -->|最贴合分镜| E[进入精修]
    C -->|基本可用但细节差| F[微调提示词<br/>二次出图]

**九宫格排版**:把 4 张或 9 张候选图拼成一张大图,所有信息一目了然。即梦在生成多张图时会自动排版,你也可以下载到本地后用截图工具拼图。

**对照分镜字段**:打开分镜表,对照每一项字段——

**快速筛选原则**:90% 的图会被筛掉,这很正常。**能从 8 张里挑出 1-2 张够用的,就已经很高效**。

按分镜字段筛选:建立「打分维度」

为了避免「凭感觉选」,建议给每张候选图打一个**简短的勾选清单**。可以从分镜表里直接抽字段:

| 检查项 | 候选图 A | 候选图 B | 候选图 C | |--------|---------|---------|---------| | 主体身份对 | ✓ | ✓ | ✗ | | 服装一致 | ✓ | ✗ | ✓ | | 景别正确 | ✓ | ✓ | ✓ | | 表情到位 | ✗ | ✓ | ✓ | | 氛围贴合 | ✓ | ✗ | ✓ | | **综合** | 中 | 中 | **优** |

打分不需要多复杂,**4-6 个核心维度就够**。打分的目的不是艺术评判,是**快速过滤明显不合格的图**。

二次精修:局部微调而非重画

当候选图「**80% 满意、20% 需要改**」时,进入二次精修。

**精修的常见方式**:

**精修的反模式**:**整张图重画**。如果一张图构图、角色、场景都对,只是某个细节(比如发色、表情)有问题,一定要用局部重绘,不要图省事重画整张——重画意味着前面 80% 的工作白费。

最小可行工作流:四步走

把这一节的内容串成一个**完整工作流**:

  1. **出图**:单分镜用「同提示词 4 张」+「微调提示词跑 2-3 组」,一次得到 8-12 张候选
  2. **对比**:九宫格排版,按分镜字段打分
  3. **筛选**:选 1-2 张进入精修,其他归档(不删,留作参考)
  4. **精修**:用局部重绘修细节,满意后导出为分镜底图

这个流程的关键是**「批量出图 + 横向对比 + 局部精修」三件套**。养成这个习惯,一部 60 格的漫剧分镜,你能在 1-2 天内全部出完底图。

要点:

**批量出图是用「数量换质量」**——单张赌运气,批量看对比;**横向对比要按分镜字段打分**,避免凭感觉;**精修用局部重绘而非整张重画**,保住前一步的成果。

角色与场景一致性入门

漫剧最难的一关,不是「画得像」,而是「**画得像同一个人**」。

试一下:用即梦画「樱花树下穿校服的女孩」,再画「教室里坐着的穿校服的女孩」——你会发现两张图的人物**长相完全不一样**:眼睛、脸型、发型都对不上。这叫「**角色一致性崩坏**」,观众一秒钟就出戏。

**类比**:电视剧演员要在第 1 集和第 20 集保持同一个人。AI 绘图天生没有「记忆」,每次生成都是独立任务。**L1 阶段的同角色复现,就是用「外部约束」弥补 AI 的记忆缺失**——主要靠三件套配合。

三件套之一:固定描述(角色设定卡)

**核心思路**:把角色的所有可识别特征**写进一份固定描述**,每次出图都原封不动地贴进提示词。

一份合格的角色卡应该包含:

**关键纪律**:**一个字都不要改**。把「齐刘海」改成「斜刘海」,AI 就会生成另一个人。建议把角色卡存成文本文件,每次复制粘贴。

**反面案例**:写「一个可爱的女孩」「一个校服女生」——这种泛泛的描述每次出图都是不同的人,根本没法一致。

三件套之二:参考图(垫图)

**核心思路**:在提示词之外,再给 AI **一张已经画好的角色图作为参考**。即梦的「图生图」或「参考图」功能就是干这个的。

**两种用法**:

**实操细节**:参考图上传后,提示词里仍要带上完整的角色卡描述。**描述 + 参考图双管齐下**,效果比单独任何一种都好——单用描述太「空」,单用参考图 AI 会过度照抄旧图、失去新场景的灵活性。

三件套之三:种子图(Seed)

**核心思路**:生成一张满意的角色图后,**记下它的种子值**(一串数字)。后续用同样的提示词 + 同样的种子值,AI 会生成**构图非常接近**的图。

**典型场景**:

> 即梦里查看种子值:进入单张图片的「详细信息」或「高级设置」,通常能看到一串数字「Seed: 12345678」,记下它就能复现这张图。

**但要注意**:种子图保留的是「构图和细节趋势」,**不能 100% 保证长相完全一致**。它更像「同一个人换衣服」而不是「完全复刻」。在 L1 阶段,**这是辅助手段,不是主力**。

三件套的组合用法

flowchart LR
    A[反复调试<br/>画一张满意角色立绘] --> B[保存为参考图<br/>记下种子值]
    B --> C[每个分镜出图]
    C --> D[粘贴角色卡]
    D --> E[上传参考图]
    E --> F[保持种子值]
    F --> G[同角色不同场景出图]
    G --> H{角色一致?}
    H -->|是| I[采用]
    H -->|否| J[微调角色卡描述<br/>重跑]
    J --> G

**工作流精要**:

  1. **画好第一张**——把角色立绘当作「标准照」,反复改提示词直到满意
  2. **立绘出图后立即**保存参考图 + 记种子值(两件事配套,缺一不可)
  3. **每个分镜**都先粘贴角色卡,再上传参考图,再固定种子值
  4. **出图后第一件事是看角色**——脸变了就回到第 1 步微调角色卡

L1 阶段的真实能力边界

**L1 能做到的**:

**L1 做不到的**:

**给学习者的建议**:**接受「大致一致」**。某一格角色崩了,要么局部重绘修脸,要么换参考图重跑,**不要追求每张图都完美**。L1 阶段,**整体观感**比单格完美更重要——观众看的是「这个角色在剧情里」,不会拿放大镜逐像素比对。

一个具体例子

主角「小樱」要在 3 个场景出现:

**角色卡**(全程一字不改):

> 圆脸,齐刘海,黑色长直发长到腰,眼睛大而圆,嘴唇薄,左侧扎一个红色蝴蝶结,身高 160cm,瘦小肩膀窄,白色水手服校服蓝色百褶裙白色过膝袜

**场景 1(教室近景)**:

> 提示词:[角色卡] 坐在教室课桌前,窗边,午后阳光从左边照进来,景别近景,表情认真看书 > 上传立绘参考图,种子值 12345678

**场景 2(樱花树下远景)**:

> 提示词:[角色卡] 站在樱花树下,微风吹起头发,景别远景,表情微笑 > 上传同一张立绘,种子值 12345678

**场景 3(黄昏屋顶)**:

> 提示词:[角色卡] 坐在屋顶上看着夕阳,景别中景,表情沉思 > 上传同一张立绘,种子值 12345678

**预期效果**:3 张图里的小樱,**脸型、发型、蝴蝶结、衣服**都高度一致,只是场景、景别、表情不同。这就是 L1 阶段同角色复现的「标准操作」。

要点:

**L1 阶段的角色一致性靠「角色卡 + 参考图 + 种子图」三件套**——角色卡固定描述不变,参考图提供视觉锚点,种子图保留构图趋势;**接受「大致一致」**,别追求像素级完美,那是 L2 阶段的事。

学习笔记

AI绘图与画面生成基础

一、AI绘图的核心逻辑

AI绘图工具的核心逻辑:**用文字描述画面,工具把它「画」出来**。文字描述得越精确,画面越接近想要的效果。这套文字描述有专门名字——**提示词(Prompt)**。

类比:像一个「技艺精湛但很挑指令」的画师——你说什么他画什么,不说清楚的地方他随便发挥。

二、三大主流工具对比

| 工具 | 出品 | 费用 | 门槛 | 特点 | |------|------|------|------|------| | 即梦 | 字节跳动 | 免费额度充裕 | 零基础首选 | 网页/App直接用,中文友好,图片视频质量足够做短剧 | | Midjourney | 行业标杆 | 付费订阅 | 需懂英文提示词 | 画面质感顶级,通过Discord聊天界面输入 | | Stable Diffusion | 开源 | 免费 | 门槛最高 | 可装在本地或用云端平台(如Civitai、哩布哩布),自由度最高,需懂参数和模型,最好有显卡 |

三、共同工作流程

所有AI绘图工具操作本质相同——三步走:

  1. **输入提示词**:在文本框写文字描述画面
  2. **调整参数**:设定画面比例、风格、生成数量等
  3. **点击生成**:等几秒到几十秒,出来一张或多张图

不满意则回到第1步改提示词或再点生成。

四、核心参数

五、提示词四要素

任何一张画面拆成四块:

  1. **主体(Subject)**:画面里是谁/什么。要**具体、可视化**,不能含糊。包含外貌、服装、姿态、表情。多角色按主到次顺序,前面的权重更高
  2. **风格(Style)**:画风类(日漫、厚涂插画、赛博朋克、迪士尼3D、皮克斯)、媒介类(油画、铅笔素描、照片写实、概念设计图)、年代/地域类(90年代动画、浮世绘、新艺术运动)
  3. **镜头(Camera/Composition)**:景别(特写/中景/远景/全景)、视角(正面/侧面/仰拍/俯拍/过肩)、构图(居中/三分法/对称)
  4. **氛围(Mood/Lighting)**:光线(电影光影、黄金时段、霓虹灯、侧逆光、丁达尔光)、情绪(温馨/紧张/孤独/史诗感/日常感)、天气/时段(黄昏/雨夜/晴天午后/星空)

输入顺序:主体→风格→镜头→氛围,组合成提示词。

六、负面提示词

光说「要什么」不够,还要说「**不要什么**」——这就是**负面提示词(Negative Prompt)**。

排除三类问题:

通用模板可长期复用:低质量、模糊、变形的手、多余的手指、扭曲的脸、水印、文字、签名。

七、批量出图工作流

为什么需要批量

AI绘图的脾气:哪怕完全相同的提示词,每次生成的图都不一样。意味着:

批量出图方式
  1. **同提示词多张生成**(最常用):生成数量从1调到4或8,一次性产出多张同主题不同细节的图
  2. **微调提示词跑多组**:改一两个词(镜位从「中景」改「近景」、氛围从「温馨」改「冷清」),每组跑4张,4-5组共16-20张对比
  3. **固定种子值复现**:记下当前图的种子值(Seed: 12345678),固定只微调提示词,保留构图只换细节
横向对比

最忌讳「一张张滑着看」——眼睛会疲劳。正确做法:

八、角色一致性三件套

漫剧最难的是「画得像同一个人」——AI天生没有「记忆」,每次生成都是独立任务。L1阶段用「外部约束」弥补。

1. 固定描述(角色设定卡)

把角色的可识别特征写进固定描述,每次出图都原封不动地贴进提示词。

应包含:面部特征、发型发色、体型身高、标志性物件、服装。

**关键纪律:一个字都不要改**。把「齐刘海」改成「斜刘海」,AI就会生成另一个人。建议存成文本文件每次复制粘贴。

2. 参考图(垫图)

给AI一张已画好的角色图作为参考,即梦的「图生图」或「参考图」功能。

**描述+参考图双管齐下**效果最好——单用描述太「空」,单用参考图AI会过度照抄旧图。

3. 种子图(Seed)

记下满意图的种子值,后续用同样提示词+同样种子值,AI会生成构图非常接近的图。

典型场景:完美立绘想换场景,复制提示词只改场景部分,保持种子值重跑。

**但要注意**:种子图保留「构图和细节趋势」,**不能100%保证长相完全一致**。更像「同一个人换衣服」而非「完全复刻」。在L1阶段这是辅助手段,不是主力。

组合工作流

画好第一张角色立绘→保存为参考图+记下种子值→每个分镜出图时粘贴角色卡+上传参考图+保持种子值→同角色不同场景出图→不一致则微调角色卡描述重跑。