适用于 AI 图片、图生视频和二维动效结合的竖屏漫剧。本教程不绑定某一款工具,重点是建立一套可重复、可检查、可批量生产的工作流。
一、先理解成片是怎样生产出来的
漫剧不是“生成几张漫画,再让它们动起来”。它是一条环环相扣的视听生产线:
选题与规格
↓
故事大纲与单集剧本
↓
角色、场景、道具设定
↓
文字分镜和声音预演
↓
低成本分镜草图
↓
正式分镜图和镜头任务单
↓
图生视频 / 分层动效 / 口型
↓
配音、音效、音乐
↓
剪辑、字幕、调色、混音
↓
质检、修改、导出、归档
这条生产线有六个锁定点:
- 锁剧本:不再改主要情节和台词长度。
- 锁角色:不再改核心外观、主服装和标志物。
- 锁分镜:不再改镜头数、景别和主要运镜。
- 锁声音:确定配音文件和对白节奏。
- 锁画面:正式分镜图通过后再批量做视频。
- 锁成片:只修复错误,不再整体重构。
如果在视频阶段重写剧本,或在合成阶段修改人设,已有镜头大概率都要返工。
每个阶段必须交付什么
| 阶段 | 输入 | 交付物 | 通过标准 |
|---|---|---|---|
| 剧本 | 选题、受众、时长 | 单集剧本、台词表 | 按时长读完,冲突和结尾清楚 |
| 角色 | 剧本、风格 | 角色圣经、角色参考图 | 多角度可识别,特征不冲突 |
| 分镜 | 剧本、配音初稿 | 分镜表、动态预演 | 镜头时长与声音对得上 |
| 分镜图 | 分镜表、角色设定 | 每镜关键帧 | 人物一致,空间和动作可衔接 |
| 视频 | 关键帧、运动指令 | 单镜头视频 | 主体不变形,动作在时间内完成 |
| 合成 | 视频、人声、音效 | 可发布成片 | 叙事清楚,声画同步,技术指标合格 |
二、第 0 步:建立项目规格
先确定生产边界,再写故事。建议建立一页《项目规格卡》。
2.1 项目规格卡模板
项目名:
类型:都市 / 恋爱 / 逆袭 / 悬疑 / 古风 / 奇幻 / 搞笑
目标观众:
一句话卖点:
主要发布平台:
画幅:9:16
分辨率:1080 × 1920
帧率:25 fps 或 30 fps
单集时长:
单集预计镜头数:
每周产量:
视觉风格:
故事基调:
旁白比例:
表演方式:静态漫画动效 / 图生视频 / 混合
质量优先级:角色一致性 / 动作 / 更新速度 / 成本
2.2 时长与镜头数的参考
| 成片时长 | 建议镜头数 | 单镜常用时长 | 建议口播字数 |
|---|---|---|---|
| 60 秒 | 12~20 | 2~5 秒 | 160~230 字 |
| 90 秒 | 18~28 | 2~6 秒 | 220~320 字 |
| 120 秒 | 24~36 | 2~6 秒 | 300~430 字 |
| 180 秒 | 30~50 | 3~7 秒 | 450~650 字 |
上表是起点,不是硬性规则。悬疑可以增加停顿,搞笑和口播类可以更快。一开始不要一集塞入太多人物、场景和高难度动作。
2.3 新项目的安全上限
- 核心角色:2~4 人。
- 单集场景:1~3 个。
- 单集主道具:1~3 件。
- 复杂全身动作:最好不超过 2 个。
- 一个镜头中的主动作:只保留 1 个。
三、剧本:先做故事工程,再写台词
3.1 用一句话验证选题
用这个句式写故事前提:
当[引爆事件]发生后,
一个[有明确缺陷的主角]必须[完成目标],
否则[付出代价],
但[核心阻碍 / 反派 / 规则]正在阻止他。
示例:
当林夏收到一段来自明天的录音后,这个从不相信别人的调查记者必须在零点前找到录音中的死者,否则她会成为下一个受害者,但所有证据都指向她自己。
一句话前提里如果没有目标、阻碍和代价,就很难持续生产戏剧冲突。
3.2 连续剧要先做季度大纲
不要边更新边想主线。至少先完成:
- 开局状态:主角原本怎么生活。
- 引爆事件:什么事打破平衡。
- 中点反转:观众对事件的理解发生根本变化。
- 最低谷:主角失去什么。
- 最终选择:主角如何证明自己已改变。
- 季终答案:解决哪个承诺,保留哪个新问题。
然后把每集压缩为一行:
EP01:主角发现异常,但证据指向自己。
EP02:主角试图验证录音,结果造成第一个真实后果。
EP03:盟友加入,但他隐瞒了自己也收到录音。
...
3.3 单集的八拍结构
- 0~3 秒,异常:给结果、危险或一句反常台词。
- 3~10 秒,定位:谁在哪里,正在做什么。
- 10~20 秒,目标:主角这一集想解决什么。
- 20~35 秒,第一阻碍:原有方法失效。
- 35~50 秒,升级:问题变得更糟,代价变大。
- 50~65 秒,发现:出现新线索或新关系。
- 65~82 秒,反转:新线索改变了对前面事件的理解。
- 82~90 秒,钩子:在观众最想知道下一步时结束。
不同时长可等比缩放。钩子不等于无故中断,它应当在本集完成一次小回报后,引出更大问题。
3.4 把文学语言改成可拍语言
| 不易画出来 | 可以直接画出来 |
|---|---|
| 她感到不安 | 她第三次确认门锁,手却始终没离开门把 |
| 他想起了过去 | 照片从书中滑落,他看到照片上被划掉的人 |
| 他非常生气 | 他把杯子放下,杯底在桌面磕出一声脆响 |
| 她不相信他 | 她没接他递来的钥匙,反而后退了半步 |
每句动作都要能回答:“画面中具体哪个东西发生了什么变化?”
3.5 台词的五条规则
- 一句只传达一个主要信息。
- 角色不说彼此都知道的事。
- 能用动作表达的,尽量不用台词复述。
- 给每个人不同的句长、用词和停顿习惯。
- 对白要有潜台词:人物嘴上说 A,真正想得到的可能是 B。
3.6 标准剧本格式
第 01 集:《消失的录音》
预计时长:90 秒
本集目标:林夏确认录音是否伪造
本集反转:录音时间来自明天
本集钩子:录音里出现此刻才发生的声音
场景 1|公司会议室|夜|内景
人物:林夏、周明
场景目标:林夏拿回被隐藏的录音笔
场景冲突:周明不相信她没说过录音中的话
【画面】
林夏推开会议室门。桌上的录音笔亮着红灯。
女人的声音从录音笔中传出,音色与林夏完全一样。
录音中的林夏(急促,远处有雨声):
“别让周明打开那扇门。”
林夏停住,文件夹从手里滑落。
林夏(压低声音):
“这句话……我从来没说过。”
周明从阴影中抬头,按停录音笔。
周明:
“可我们都听见了。”
3.7 锁剧本前的验收
- 用计时器正常语速朗读,时长误差不超过 10%。
- 前 3 秒出现异常、冲突、结果或关键问题。
- 前 15 秒能识别主角、目标和当前麻烦。
- 每一场都使局面发生变化。
- 删掉任何一场后如果剧情仍然完整,这场就可能不必要。
- 旁白不重复画面已经表达的内容。
- 结尾同时完成“本集小回报”和“下集新问题”。
四、角色:一致性来自“规格”,不是运气
4.1 为每个主要角色建立角色圣经
角色圣经包含四层信息。
故事层
- 姓名、年龄、职业、阶层、成长环境。
- 表面目标、真实需求、最大恐惧。
- 主要缺陷、优势和角色弧光。
- 与其他人的关系和隐瞒信息。
外观层
- 性别呈现、视觉年龄、身高比例、体型。
- 脸型、眉形、眼型、虹膜颜色、鼻子、嘴唇。
- 发型、发色、分缝、长度、刘海。
- 皮肤色值、雀斑、疤痕、痣等稳定特征。
服装层
- 主服装从内到外分层记录。
- 服装主色、辅色和材质。
- 鞋、包、眼镜、耳饰、手表、戒指。
- 换装规则:哪些场景可以换,哪些集数必须连续。
表演层
- 默认站姿、坐姿、手势和行走速度。
- 高兴、愤怒、紧张、怀疑、哭泣时的具体表现。
- 说话速度、常用词、口头禅和停顿。
- 声音年龄、音色、音高、力度和情绪边界。
4.2 用“识别锦囊”避免角色串脸
每个角色都应有 3~5 个不依赖画风也能识别的特征:
林夏:
1. 深棕色齐肩直发
2. 右侧银色细发夹
3. 灰绿色眼睛
4. 墨绿色短外套
5. 看人时习惯微微压低下巴
不要把“漂亮”“帅气”“冷酷”当成识别特征,因为它们不具体、不稳定。
4.3 角色视觉参考图的必备项
- 正面全身,自然站姿。
- 45 度半身。
- 正侧面和背面。
- 头部近景,看清五官。
- 至少 6 种基础表情。
- 主服装的正反面。
- 标志物和常用道具的独立图。
- 与主要对手角色同框的身高对比图。
生成参考图时,背景尽量简单,光线中性,不要用剧烈透视和夸张动作。参考图的任务是“定义角色”,不是单张海报好看。
4.4 角色提示词模板
【身份】25岁东亚女性,都市调查记者
【身形】高挑、偏瘦,肩背挺直
【面部】鹅蛋脸,偏细长的灰绿色眼睛,平直眉,薄唇
【头发】深棕色齐肩直发,三七分,右侧银色细发夹
【服装】白衬衫,墨绿色齐腰短外套,黑色直筒长裤,黑色短靴
【气质】冷静、克制、高警觉,不夸张微笑
【固定风格】现代悬疑国漫,干净线稿,赛璐珞光影,克制低饱和配色
【一致性】保持脸型、五官比例、发型、发夹、外套完全一致
实际生成时,优先使用工具支持的角色参考图、一致性参考、固定随机种子或专用角色模型。只靠每次重写文字提示词,一致性上限通常较低。
4.5 角色状态表
连续剧必须记录角色在每集末的状态:
| 集数 | 角色 | 服装 | 身体状态 | 携带物 | 已知信息 | 与他人关系 |
|---|---|---|---|---|---|---|
| EP01 末 | 林夏 | 白衬衫+绿外套 | 右手轻微擦伤 | 录音笔 | 录音来自未来 | 开始怀疑周明 |
这张表能防止“上集手上的伤消失”、“道具忽然换人”、“角色知道了尚未发生的事”。
五、场景和道具:先建世界,后拍镜头
5.1 场景设定表
每个重复使用的场景建立:
- 场景名和剧情功能。
- 空间布局:门、窗、桌、椅和主通道的位置。
- 主色、材质、时代、建筑风格。
- 白天、黄昏、夜晚的光线版本。
- 建立镜头、主视角、反打视角、高机位视图。
- 可以移动和不可移动的物件。
如果一个场景会在多集中出现,建议先生成一张顶视布局图或简单平面图,再从固定方向生成空镜。
5.2 场景提示词模板
【地点】现代媒体公司的小型会议室
【布局】长桌居中,入口在画面左后方,落地窗在右侧,尽头有一面灰白写字板
【时间】深夜,室外下雨
【光线】室内只开一排冷白顶灯,窗外偶尔有车灯反光
【材质】深灰地毯,黑色金属桌脚,磨砂玻璃隔断
【气氛】安静、空旷、略有压迫感
【固定要求】保持门、窗、长桌和写字板的相对位置一致
5.3 道具设定
与剧情有关的道具不能每镜重新设计。给它单独做正面、侧面、手持比例和细节特写。
道具:银灰色老式录音笔
长度:约 11 cm
特征:顶部红色指示灯,正面有一块蓝绿色小屏幕,左侧有一道擦痕
剧情规则:指示灯亮起代表播放未来录音
六、分镜:把剧本转换成镜头任务
6.1 先做声音预演
在画精细分镜前,用临时配音将全部台词和旁白读一遍,放进时间线。不需要好听,只需要得到真实的说话时长和停顿。
声音预演会提前暴露三类问题:
- 台词过长,画面只能被迫停住。
- 情绪转折没有停顿,观众来不及理解。
- 本来以为 90 秒的剧本,实际需要 130 秒。
6.2 标准分镜表
| 字段 | 要写什么 |
|---|---|
| 镜号 | EP01_S001 这类唯一编号 |
| 入点 / 出点 | 该镜头在成片时间线的位置 |
| 时长 | 预计秒数 |
| 场景 / 时间 | 地点、日夜、内外景 |
| 角色 | 镜头内出现的人 |
| 景别 | 大远景、全景、中景、近景、特写 |
| 机位 | 平视、俯拍、仰拍、过肩、主观 |
| 构图 | 人物位置、视线、前后景 |
| 动作 | 起始状态、主动作、结束状态 |
| 运镜 | 固定、推、拉、摇、移、跟、手持 |
| 台词 / 旁白 | 对应话语 |
| 音效 / 音乐 | 什么时候出现什么声音 |
| 转场 | 硬切、叠化、切黑、声音先行、动作匹配 |
| 生成方式 | 静帧动效、图生视频、口型、手工动画 |
| 难度 | A 简单 / B 中等 / C 高风险 |
6.3 景别的任务
- 大远景 / 远景:建立地点、时间和人物处境。
- 全景:展示身体动作、距离和走位。
- 中景:表现对话、关系和手势。
- 近景:承载情绪变化。
- 特写:强调线索、眼神、按钮、手指等关键细节。
特写不应该只用于“显得高级”。特写一出现,就是在告诉观众“这个东西很重要”。
6.4 连续性的五条底线
- 180 度轴线:对话时不随意跳到人物连线另一侧。
- 视线匹配:A 朝画右看,B 的反打通常应朝画左看。
- 运动方向:上一镜从左向右跑,下一镜不要无理由变成从右向左。
- 动作接点:在“抬手”中切镜,下一镜应从相近的抬手进度接上。
- 物件连续:衣服、伤口、杯中水量、手持道具和桌面物体位置要一致。
6.5 一个镜头只安排一个主任务
高风险描述:
她推门跑进来,环顾四周,找到录音笔,突然震惊,一边说话一边摔倒,镜头同时环绕她。
更稳定的拆分:
S001:她推门进入,镜头小幅后退。
S002:她停下,视线移向画外。
S003:录音笔特写,红灯闪烁。
S004:她的近景,眼睛微微睁大。
S005:文件夹从手中滑落。
6.6 先做动态预演
用草图、简单推拉和临时配音做一版低成本视频,用来检查:
- 信息是否看得懂。
- 景别是否过于重复。
- 反应镜头是否够。
- 有没有连续几十秒只看一个人说话。
- 反转前是否给了观众足够的理解时间。
动态预演通过后才锁分镜。
七、分镜图:先求可控,再求精美
7.1 两轮出图法
第一轮:构图草图
- 可以是手绘棒人、简单 3D 截图或低精度 AI 图。
- 只检查人物位置、景别、视线、动作和留白。
- 这一轮不修手指、发丝和装饰细节。
第二轮:正式关键帧
- 引用已锁定的角色、服装、场景和道具参考。
- 确定光线、线稿、上色和景深。
- 修正手、脸、道具和空间关系。
- 只在这一轮进行高成本精修。
7.2 图像提示词的九段结构
1. 固定角色特征
2. 固定服装与道具
3. 场景和时间
4. 角色所在位置
5. 单一主动作
6. 表情及强度
7. 景别、机位、镜头焦段感
8. 光线、色彩和风格
9. 构图限制和排除项
完整示例:
林夏,25岁东亚女性,鹅蛋脸,灰绿色眼睛,
深棕色齐肩直发,右侧银色细发夹,
白衬衫、墨绿色齐腰短外套、黑色直筒裤。
深夜的现代公司会议室,她站在画面左侧的门口,
右手刚离开门把,左手文件夹正在滑落,
她看向画面右下方桌上的录音笔,轻度震惊,情绪克制。
腰部以上近景,平视机位,近似50mm镜头感,
冷白顶灯,窗外微弱蓝色雨夜反光,
现代悬疑国漫,干净线稿,克制低饱和上色,竖屏9:16。
为底部字幕保留安全空间;
保持角色五官、发型、发夹、外套和会议室布局一致;
不增加人物,不改变服装,不出现文字、水印、额外手指或变形道具。
7.3 姿势参考与风格参考要分工
- 角色参考:管人物是谁。
- 姿势参考:管身体在做什么。
- 构图参考:管人物和空间如何安排。
- 风格参考:管线条、材质、上色和光感。
一张参考图同时承担所有任务,容易把不需要的服装、脸型或背景也带进来。
7.4 分镜图检查顺序
不要一上来就检查手指。按影响从大到小检查:
- 镜头是否讲对了内容。
- 角色、场景和道具是否正确。
- 构图、景别和视线是否正确。
- 与前后镜的空间和动作是否连续。
- 角色脸、发型和服装是否一致。
- 手、眼、嘴、道具等局部是否有错。
- 是否给字幕和平台 UI 留了安全区。
7.5 修图而不是重抽的情况
如果构图、角色和光线已经正确,只有手指、发夹、衣领、屏幕等局部小错,应该局部修复,不要整张重新生成。重新生成会同时改变已经正确的内容。
八、视频:让每个镜头只完成一次清晰变化
8.1 三种主要制作方式
| 方式 | 适用镜头 | 优点 | 风险 |
|---|---|---|---|
| 静帧分层动效 | 对话、氛围、特写、慢推 | 稳定、便宜、可精确控制 | 动作上限较低 |
| 图生视频 | 微表情、转头、行走、环境动态 | 生动、生产速度快 | 变脸、变形、背景漂移 |
| 手工 / 骨骼动画 | 固定角色口播、大量反复动作 | 长期稳定、可复用 | 前期拆分和绑定成本高 |
实际项目建议混合使用:对话和悬疑氛围镜头以分层动效保稳定,需要明显角色动作时再使用图生视频。
8.2 图生视频指令的六段结构
起始状态
→ 主体的唯一主动作
→ 次要微动
→ 镜头运动
→ 结束状态
→ 保持不变的内容
示例:
开始时,林夏站在会议室门口,左手握着文件夹,
目光停在桌上的录音笔。
她的手指逐渐放松,文件夹自然滑落出画面;
她的眼睛轻微睁大,呼吸短暂停顿;
头发和外套只有极轻微的自然摆动。
镜头用稳定、缓慢的速度向前推近,从腰部近景推到胸像近景。
结束时,她仍看向录音笔,震惊但克制。
保持她的脸、发型、发夹、服装、手指数量和会议室布局不变;
不增加人物,不切换机位,不让镜头环绕,不产生大幅头部摆动。
8.3 动作幅度预算
将镜头运动强度分为三档:
- 1 档,微动:眼神、眨眼、呼吸、衣摆、雨、灯光、慢推。
- 2 档,中等:转头、抬手、坐下、起身、走两三步。
- 3 档,高风险:奔跑、打斗、摔倒、多人接触、绕拍、剧烈变焦。
同一镜头尽量不同时安排两个 2 档动作,也不要让 3 档人物动作和 3 档运镜同时发生。
8.4 复杂动作的拆分法
例如“角色被撞倒后看见凶手”,不要强求一镜完成:
镜头 A:中景,对方的肩膀突然进入画面,主角身体失去平衡。
镜头 B:特写,主角手中物品落地。
镜头 C:低机位近景,主角已在地上,抬头看向画外。
镜头 D:主观镜头,凶手的身影站在逆光门口。
这样既提高稳定性,又能通过剪辑增强力量感。
8.5 首尾帧控制
如果工具支持首帧和尾帧,先准备:
- 首帧:动作开始前的清晰状态。
- 尾帧:动作完成后的清晰状态。
首尾帧之间不要同时变更服装、背景、机位和姿势。变化越多,中间过程越难稳定。
8.6 口型处理
对白镜头有三种选择:
- 不做精确口型:使用侧脸、过肩、远景或画外音。
- 简化口型:只匹配开口、闭口和重音,适合风格化漫剧。
- 精确口型:先锁定正式配音,再对口型,适合长时间正面近景。
口型不稳时,优先修改分镜,而不是让每个角色都正面对镜说完所有台词。
8.7 单镜头验收
- 主体身份、脸和服装不变。
- 手指、眼睛、牙齿和道具不明显畸变。
- 背景的门窗、桌椅不漂移或融化。
- 主动作在镜头结束前完成。
- 运镜方向和速度符合分镜。
- 开头和结尾都有可剪辑的 4~8 帧稳定画面。
- 没有额外人物、文字、水印或意外镜头切换。
九、配音、音效和音乐:声音决定成片是否“像戏”
9.1 先建立声音角色卡
| 字段 | 示例:林夏 |
|---|---|
| 声音年龄 | 25~30 岁 |
| 音色 | 清冷、中性偏低 |
| 语速 | 平时偏快,质问时反而变慢 |
| 咬字 | 清晰,不拖尾音 |
| 情绪上限 | 很少大喊,紧张时主要表现为呼吸变短 |
| 标志性停顿 | 在说出结论前停 0.3~0.5 秒 |
同一角色的声音模型、发音人、语速和音色不要在不同集数中随意更换。
9.2 配音文件的处理顺序
- 按场或台词句录制,保留原始文件。
- 选取最佳条次,去除明显噪声和爆音。
- 修剪过长空白,但保留情绪停顿。
- 做轻度均衡、压缩和齿音处理。
- 统一不同句子的听感音量。
- 导出无音乐、无环境音的干声。
文件命名示例:
EP01_SC01_LINXIA_001_take03.wav
EP01_SC01_ZHOUMING_002_take02.wav
9.3 声音的四层结构
- 人声:对白、旁白、内心独白。
- 动作音效:脚步、门、衣物、碰撞、手机、杯子。
- 环境音:雨、空调、街道、办公室底噪。
- 音乐:建立情绪和结构,不负责替代剧情。
音效要有选择。不是画面中每个动作都需要响,而是用声音强调观众应该注意的动作。
9.4 声音进出点要服务叙事
- 下一场的声音可以提前进入,带动画面转场。
- 关键台词前突然降低音乐,可以提高注意力。
- 反转时不一定要加重音,短暂静默往往更有力量。
- 环境音不要每个切镜都重置,同一空间应保持连续。
9.5 混音参考
- 对白始终是优先级最高的声音。
- 有人说话时,音乐通常比人声的听感低 12~20 dB。
- 成片可以参考 -14~-16 LUFS-I,真峰值不高于 -1 dBTP,再根据平台和已有标准调整。
- 用普通手机外放和耳机各听一遍,不要只依赖棚内音箱。
十、剪辑合成:先讲清楚,再做精致
10.1 标准合成顺序
- 新建工程,锁定分辨率和帧率。
- 导入正式配音,建立声音主时间线。
- 按分镜表放入镜头,完成画面粗剪。
- 调整镜头入点、出点、反应时间和动作接点。
- 加入环境音和关键动作音效。
- 加入音乐,处理进出和避让。
- 加字幕,校对台词、断句和时间。
- 统一镜头色彩、对比度、线条和噪点。
- 添加必要的转场、屏幕信息和特效。
- 完成混音、导出和质检。
10.2 轨道组织建议
V6 平台标识 / 片尾
V5 字幕 / 屏幕文字
V4 特效 / 光效 / 遮罩
V3 前景 / 粒子 / 雨雪
V2 主镜头 / 角色
V1 背景 / 备用镜头
A6 音乐
A5 环境音
A4 动作音效
A3 配角人声
A2 主角人声
A1 旁白
10.3 漫剧节奏不等于疯狂切镜
判断是否需要切镜,看三个信号:
- 新信息出现。
- 情绪权力发生变化。
- 观众需要看见新的视觉对象。
如果三者都没发生,只是为了“不无聊”而切镜,往往会打断表演。
10.4 字幕规范
- 一行尽量不超过 14~18 个中文字,根据字号和画幅实测。
- 优先按意群断句,不要把名词和修饰语拆开。
- 常规对白使用固定字体、字号、颜色、描边和位置。
- 角色区分尽量不要只依赖花哨的不同颜色。
- 避开人物嘴部、关键道具和平台互动区。
- 屏幕内文字和字幕同时出现时,要分开层级。
10.5 转场的优先级
- 硬切。
- 动作匹配切。
- 视线匹配切。
- 声音先行或声音延后。
- 短暂切黑。
- 叠化或风格化转场。
前五种已能解决大部分叙事需求。复杂转场只在它能表达时间、空间或心理变化时使用。
10.6 分层动效的实用做法
将静帧拆为:
前景遮挡层
角色前层(手、头发等)
角色主体层
角色后层(外套后摆等)
桌面 / 中景层
远景层
光影 / 雨 / 尘埃层
通过不同速度的微小位移制造视差。位移幅度要小,否则会露出原图边缘或让空间像纸片。
10.7 调色和风格统一
先做一个“基准镜头”,再让其他镜头靠近它。主要统一:
- 肤色和发色。
- 黑位、白位和对比度。
- 主色温。
- 线条深浅和锐度。
- 颗粒、模糊和景深。
不要用一个重度滤镜遮掩不同来源镜头的风格差异,因为它往往会一起损失肤色和线稿层次。
10.8 导出参考
封装:MP4
视频编码:H.264
分辨率:1080 × 1920
帧率:与工程一致,25 fps 或 30 fps
码率:10~20 Mbps
音频:AAC,48 kHz,256 或 320 kbps
色彩:Rec.709
如果平台有明确规格,以平台规格为准。导出后要播放导出文件本身,不能只在剪辑工程中预览。
十一、贯穿全流程的 60 秒实战案例
11.1 故事目标
剧名:《明天的录音》
集数:EP01
时长:60 秒
本集目标:林夏想证明桌上的录音是伪造的
冲突:录音中不断出现只有现场才能知道的声音
反转:录音文件的创建时间是明天
结尾钩子:录音预告周明将在十秒后敲门
11.2 锁定后的台词
录音中的林夏:“别让周明进来。”
林夏:“这不是我录的。”
周明:“音色检测是你,设备也是你的。”
林夏:“那就看创建时间。”
林夏:“明天……23点40分?”
录音中的林夏:“十秒后,周明会敲门。不要开。”
11.3 完整分镜表
| 镜号 | 时间 | 景别 / 机位 | 画面与动作 | 声音 | 生产方式 |
|---|---|---|---|---|---|
| S001 | 0:00~0:03 | 特写 / 平视 | 录音笔红灯闪烁,屏幕波形跳动 | 录音:“别让周明进来” | 分层动效 |
| S002 | 0:03~0:07 | 近景 / 慢推 | 林夏停在门口,文件夹滑落 | 纸张落地 | 图生视频 |
| S003 | 0:07~0:11 | 中景 / 过肩 | 周明在桌对面,按下暂停 | 林夏:“这不是我录的” | 简化口型 |
| S004 | 0:11~0:16 | 反打近景 | 周明将平板转向她 | 周明:“音色检测是你……” | 分层+屏幕替换 |
| S005 | 0:16~0:20 | 屏幕特写 | 波形匹配率 99.7%,设备名为林夏 | 周明画外音:“设备也是你的” | 静帧动效 |
| S006 | 0:20~0:25 | 近景 / 微仰 | 林夏俯身拿起录音笔 | “那就看创建时间” | 图生视频 |
| S007 | 0:25~0:30 | 手部特写 | 她按下菜单,指尖短暂停住 | 按键声,音乐降低 | 手工屏幕合成 |
| S008 | 0:30~0:35 | 极特写 | 屏幕显示“创建:明天 23:40” | 心跳声 | 静帧动效 |
| S009 | 0:35~0:40 | 近景 / 固定 | 林夏抬眼,脸上第一次出现明显惊慌 | “明天……23点40分?” | 微表情视频 |
| S010 | 0:40~0:47 | 两人中景 | 两人都没说话,录音笔自动继续播放 | 录音:“十秒后,周明会敲门” | 分层动效 |
| S011 | 0:47~0:53 | 过肩近景 | 林夏缓慢看向周明;周明却也在室内 | 录音:“不要开” | 图生视频 |
| S012 | 0:53~0:57 | 门把特写 | 门外影子停下,门把轻微振动 | 第一声敲门 | 分层动效 |
| S013 | 0:57~1:00 | 林夏极近景 | 她的视线从周明移向门,立即切黑 | 第二声敲门,音乐停止 | 微表情+切黑 |
11.4 为什么这个分镜可执行
- 开场 3 秒直接给异常台词。
- 两个人、一个场景、一个核心道具,连续性成本低。
- 高风险手部操作用特写和后期屏幕替换解决。
- 大部分镜头只有微表情、慢推或小幅动作。
- 结尾先给予“录音确实能预测未来”的小回报,再提出“门外的周明是谁”的新问题。
十二、失败时怎么判断该返回哪一步
| 症状 | 真正原因 | 返回阶段 |
|---|---|---|
| 成片拖沓 | 台词过长、场景没有变化 | 剧本 / 声音预演 |
| 一直需要增加转场 | 镜头之间缺少逻辑或动作接点 | 分镜 |
| 角色反复变脸 | 角色规格不具体、参考图不完整 | 角色设定 |
| 场景忽然换位 | 没有空间布局和固定视角 | 场景设定 |
| 生成视频畸变 | 一镜中的动作和运镜过多 | 分镜 / 视频指令 |
| 对白不像在交流 | 没有反应镜头和视线匹配 | 分镜 |
| 音乐很满但不紧张 | 没有声音层次和留白 | 音频设计 |
| 字幕总遮住脸 | 出图时没有预留安全区 | 分镜图 |
原则是:在问题最早发生的阶段修复。后期很少能低成本地救回前期结构错误。
十三、生产管理:让项目可以连续更新
13.1 目录结构
项目名/
├── 00_项目管理/
│ ├── 项目规格卡
│ ├── 版本记录
│ └── 制作排期
├── 01_故事与剧本/
│ ├── 季度大纲
│ ├── 角色关系
│ └── 分集剧本
├── 02_角色设定/
├── 03_场景与道具/
├── 04_分镜表与预演/
├── 05_分镜图/
│ ├── rough
│ ├── approved
│ └── rejected
├── 06_视频镜头/
│ ├── generated
│ ├── approved
│ └── rejected
├── 07_配音/
├── 08_音乐音效/
├── 09_剪辑工程/
├── 10_导出质检/
└── 11_发布与数据/
13.2 命名规则
EP01_S005_keyframe_v03.png
EP01_S005_video_v02.mp4
EP01_SC02_LINXIA_line004_take03.wav
EP01_master_v07_1080x1920.mp4
名称必须体现集数、镜号、内容类型和版本。不使用“最终版”“最终版2”“真最终版”。
13.3 镜头状态表
| 镜号 | 分镜 | 关键帧 | 视频 | 声音 | 合成 | 负责人 | 问题 |
|---|---|---|---|---|---|---|---|
| S001 | 通过 | 通过 | 通过 | 通过 | 待合成 | A | - |
| S002 | 通过 | 通过 | 修改中 | 通过 | 未开始 | B | 文件夹落地时手指畸变 |
只有一个人可以把状态改为“通过”,否则容易出现每个人都以为别人验收过的情况。
13.4 返工优先级
- P0:必修:剧情错误、角色串人、台词错误、违规风险、文件损坏。
- P1:发布前修:明显变脸、手部畸变、声画不同步、字幕错字。
- P2:有时间修:背景轻微漂移、运镜不够流畅、不影响理解的细节差异。
- P3:不建议修:只是个人审美偏好,无法说明对叙事和一致性的影响。
13.5 一集的建议生产节奏
第1天:剧本、读稿、锁台词
第2天:文字分镜、临时配音、动态预演
第3天:分镜草图、构图审核
第4天:正式关键帧、局部修复
第5天:图生视频和分层动效
第6天:正式配音、剪辑、音效、字幕
第7天:质检、修改、导出、发布
批量更新时可以流水线运作:EP02 在做视频时,EP03 已经做分镜,EP04 正在写剧本。
13.6 不要忽略权利和平台合规
- 确认剧本、角色、图像、字体、音乐和音效的商用授权。
- 不直接复制现有知名 IP 的角色形象、标志物和剧情。
- 使用真人形象或声音时,取得明确授权。
- 保留生成记录、素材来源、许可证和修改记录。
- 发布前检查平台对 AI 生成内容、敏感题材和广告内容的当前要求。
十四、最终质检:三遍观看法
第一遍:静音看
检查不听声音时,是否仍然能理解:
- 谁是主角。
- 人物在哪里。
- 人物想要什么。
- 发生了什么改变。
- 最后的新问题是什么。
第二遍:闭眼听
检查:
- 每个人是否容易区分。
- 台词是否清楚,有没有被音乐遮住。
- 空间环境是否连续。
- 音效是否太多或太少。
- 情绪反转前后是否有呼吸。
第三遍:用发布设备正常看
在手机竖屏、普通外放和接近真实刷视频的环境中检查:
- 前 3 秒是否足够清楚。
- 字幕大小、停留时间和位置是否合适。
- 画面是否太暗、过饱和或过度锐化。
- 平台 UI 是否遮挡人脸、道具或字幕。
- 结尾是否在正确的信息点停下。
发布前勾选表
□ 剧名、集数和文件名正确
□ 角色没有串脸、变装或年龄跳变
□ 伤口、道具、空间方向连续
□ 没有多手指、双瞳异常、口腔畸变
□ 台词、字幕和口型无明显冲突
□ 字幕无错字、漏字和错误断句
□ 人声清晰,音乐不压台词
□ 镜头无黑帧、冻结、跳帧和意外水印
□ 封面与正片的角色和画风一致
□ 所有素材授权和平台合规已检查
□ 已在手机上播放实际导出文件
十五、可直接复用的工作模板
15.1 单集开工单
集数:
标题:
目标时长:
一句话剧情:
本集主角目标:
本集核心阻碍:
本集情绪走向:
本集反转:
本集结尾钩子:
出场角色:
场景:
关键道具:
高风险镜头:
需要新建的资产:
可以复用的资产:
剧本锁定日期:
分镜锁定日期:
成片截止日期:
15.2 单镜头任务卡
镜号:
时长:
镜头任务:观众看完这镜应该知道 / 感受到什么?
场景版本:
角色版本:
服装版本:
道具版本:
起始构图:
结束构图:
主动作:
次要微动:
运镜:
台词:
音效:
转场:
生成方式:
难度:
验收标准:
15.3 视频生成负面限制模板
保持人物身份、脸型、五官比例、发型、服装和配饰不变;
保持手指数量和道具结构正确;
保持背景布局、门窗位置和光线方向不变;
不增加或减少人物,不换脸,不换装,不突然切换机位;
不使用剧烈环绕、大幅变焦或无指令的镜头抖动;
不出现文字、字幕、标志、水印或新的物体。
结语:把漫剧从“生成结果”变成“生产系统”
一部漫剧能否稳定更新,不取决于某一次生成是否惊艳,而取决于以下几件事是否被标准化:
- 剧本能否按时长和镜头语言写作。
- 角色、场景和道具是否有可引用的规格。
- 分镜是否在高成本生产前完成了验证。
- 每个镜头是否只承担一次可控的变化。
- 问题是否回到最早发生的阶段修复。
- 每个交付物是否有明确的“通过标准”。
先做完一集可复制的样片,再扩大产量。样片的真正价值不只是发布,而是为后续每一集留下角色、场景、分镜、音频和质检的可复用资产。