AI 视频工作流:从脚本、分镜到剪辑、质检和交付
我用 AI 做视频三年,前两年最常踩的坑是「画面生成出来了,但成片不能用」。要么口型对不上、要么音画不同步、要么事实错误、要么品牌色跑偏、要么到了发布那一刻才发现某段素材没授权。问题从来不在模型不行,而在我把它当成了「自动剪辑师」,它实际是「按指令出素材的工具」。该写 Brief 的地方没写、该管版本的地方没管、该有质检闸门的地方没有——翻车是必然的。
这篇文章把这条工作流完整拆开:Brief 落卡 → 脚本阶段 → 分镜与版本管理 → 素材与生成阶段 → 剪辑与时间线 → 质检与版权闸门 → 发布与回滚。你照着走一遍,至少能把「AI 视频产出但不能发」的故障率压掉八成。
配套阅读:AI 视频与音乐入门实战(Day 58,从零到第一条视频)、AI 怎么做第一条视频(零基础流程)、AI 怎么剪视频(剪映与剪辑操作)、AI 视频工具选择(工具横评)、可灵、海螺、Runway 对比(视频生成模型横评)、可灵怎么用(可灵单工具)、海螺 AI 教程(海螺单工具)、剪映进阶技巧(剪映单工具)、AI 生产力技巧(整体提效)、AI 写作工作流(同系列工作流)、Prompt 调试方法(分镜卡迭代)。
交付单位不是「生成的画面」,是「一条可发布的成片」
把 AI 视频想成「AI 替我做了整条片子」,从一开始就跑偏了。AI 真正能稳定交付的,是一条可发布的成片:Brief 卡签字、脚本定稿、镜头卡版本可追溯、素材来源清晰、剪辑时间线干净、质检通过、版权与 AI 标注齐全、有回滚方案。视频质量是这一连串环节累积起来的结果,而不是单个模型的输出。
这一节先定几件交付前必须想清楚的事。
交付单位 = 一条 60–90 秒、可被独立回滚的版本
不要把「做一个爆款视频」当成一个动作。要拆成:
- Brief 卡定稿(独立 commit,独立可回滚)
- 脚本定稿(独立 commit,独立可回滚)
- 分镜卡 + 镜头版本表(独立 commit,独立可回滚)
- 素材卡 + 替换记录(独立 commit,独立可回滚)
- 粗剪时间线(独立 commit,独立可回滚)
- 精剪 + 字幕 + 配音(独立 commit,独立可回滚)
- 质检清单 + AI 标注 + 版权清单(独立 commit,独立可回滚)
- 发布卡 + 回滚预案(独立 commit,独立可回滚)
每一步都有明确输入、明确输出、明确责任人和明确版本号。任何一步不通过 = 整条片子不可发布。
「生成出画面」≠「可发布的视频」
「生成出画面」只是工作流中素材与生成阶段的中间产物,离「可发布」还差:
- 口型对得上(声画同步误差 < 100ms)
- 字幕准确(错字率 < 0.5%,时间轴误差 < 200ms)
- 事实正确(无虚构数据、人名、引用)
- 音画一致(背景音乐音量 < 语音 20dB,无错位)
- 品牌一致(主色、字体、Logo 位置符合品牌库)
- 画幅合规(横屏 16:9 / 竖屏 9:16 / 平台要求)
- 时长合规(60–90 秒区间,根据平台要求)
- 素材授权(AI 生成已标注、第三方素材已授权、商用许可可追溯)
- 平台规则(标题、标签、封面符合平台规范)
- 失败回滚(有 Plan B 素材替换方案、剪映时间线版本备份)
任何一项不过 = 不可发布。下面 8 个阶段就是确保每一项都不漏。
一、Brief 阶段:把模糊需求拆成可执行卡
视频 Brief 是一切的起点。Brief 没写清楚,后面所有环节都是「猜」。Brief 不是「我想要一个 60 秒的 AI 视频」这种一句话需求,而是一张至少 8 行的可执行卡。
Brief 模板(建议直接复制使用)
# Brief:<项目代号 / 选题标题>
## 1. 基础信息
- 发布平台:B 站 / 抖音 / 视频号 / 小红书 / YouTube
- 发布日期:YYYY-MM-DD HH:MM
- 视频时长:60s / 90s / 120s(明确上限)
- 画幅:16:9 横屏 / 9:16 竖屏 / 1:1 方形
- 分辨率:1080p / 2K / 4K
## 2. 受众与目标
- 目标受众:<画像 + 场景,如「30-40 岁产品经理,下班路上刷手机」>
- 核心信息:<一句话,例如「AI 视频工程化交付可省 60% 返工」>
- CTA:<看完后做什么,如「关注 + 收藏 + 评论」>
- 收益:<读者拿走什么,如「1 张 Brief 模板 + 1 张质检表」>
## 3. 内容约束
- 必出现元素:<3–5 个关键信息点>
- 禁用项:<品牌竞品、不实数据、不当表述>
- 事实核验要求:<所有数据需附官方链接>
## 4. 验收标准
- 完播率目标:>30%
- 点赞率目标:>5%
- 错字率上限:<0.5%
- 时长上限:不超过 90s
## 5. 素材与版权
- 素材来源:自录 / 第三方授权 / AI 生成
- AI 生成内容:是否需要打标(视平台规则)
- 第三方素材:是否已签授权 / 已购买商用许可
## 6. 失败处理
- Plan B 素材:<同主题的 2–3 个替换素材>
- 紧急回滚方案:<已发布视频的撤回/替换流程>
- 责任人与 SLA:<哪个环节卡住找谁,几小时内响应>
检查清单:
- 平台、日期、时长、画幅、分辨率 5 项填完才开始写脚本
- 目标受众具体到角色 + 场景(不是「职场人」)
- 核心信息是一句话(不是「讲清楚 AI 视频」)
- 验收标准 3–5 个可量化指标
- 素材与版权部分已注明 AI 标注和第三方授权
- 失败处理有 Plan B 和责任 SLA
二、脚本阶段:只保留能被画面验证的信息
脚本不是「把想说的写下来」,而是「逐句规划画面怎么呈现」。每句脚本都要回答两件事:这句话用什么画面表达、这句话用多长时间。
脚本卡片结构
# 脚本:<项目代号>
## 段落 1(0–15s)
- 视觉:开场 Logo + 主持人半身入画
- 口播:「60 秒学会把 AI 视频做出可发布版本」
- 字幕:「可发布 ≠ 能生成」
- 时长:15s
## 段落 2(15–35s)
- 视觉:分屏展示 4 个失败案例(口型错位 / 事实错误 / 品牌色跑偏 / 音画不同步)
- 口播:「80% 的 AI 视频翻车都因为这 4 个坑」
- 字幕:4 个失败关键词
- 时长:20s
## 段落 3(35–55s)
- 视觉:流程图展示 8 步工作流
- 口播:「8 步工作流能压掉八成故障」
- 字幕:8 步关键词
- 时长:20s
## 段落 4(55–90s)
- 视觉:主持人收尾 + 行动指引
- 口播:「评论区告诉我你踩过哪个坑」
- 字幕:「关注 + 收藏 + 评论」
- 时长:35s
关键原则:
- 口播字数 = 时长 × 4(中文 1 秒约 4 个字,60s 约 240 字)
- 每段都有视觉、画面、字幕、时长 4 项(不能只写口播)
- 事实必须可核验:所有数据、品牌名、人名都要附官方链接
- 不接受「画面大概是……」「音乐感觉应该是……」这种模糊描述
检查清单:
- 总字数 ÷ 4 ≈ 总时长(误差 < 5%)
- 每段 4 项(视觉/口播/字幕/时长)齐全
- 所有数据有官方来源链接
- 没有任何「大概」「应该」「可能」等模糊词
- CTA 出现 1 次(不超 2 次)
三、分镜与版本管理:管理镜头卡与版本变更
分镜是脚本到画面的桥。分镜没管好,后面生成什么就是什么——再改就是返工。
镜头卡模板
# 镜头卡:L<编号> V<版本号>
## 基础
- 编号:L01
- 版本:V3(前两版已废弃,见版本表)
- 段落:段落 1(0–15s)
- 时长:4s
- 镜头类型:全景 / 中景 / 特写 / 拉镜 / 推镜
## 内容
- 画面描述:<具体描述,如「主持人半身入画,左手自然下垂,右手持提示卡」>
- 主体:人物 / 物体 / 场景
- 背景:<纯色 / 场景 / 抠像>
- 构图:九宫格位置(左上 / 右上 / 中央 / 左下 / 右下)
## 生成参数
- 工具:可灵 / 海螺 / Runway / Sora
- 模型版本:<具体版本,如「可灵 1.6 Pro」>
- Prompt:<英文 prompt 完整>
- 负向:<不需要的元素>
- 随机种子:<固定种子便于复现>
## 负责人与时间
- 负责人:<姓名 / 工号>
- 拍摄/生成时间:YYYY-MM-DD HH:MM
- 验收人:<姓名 / 工号>
- 验收时间:YYYY-MM-DD HH:MM
## 状态
- 生成状态:待生成 / 已生成 / 重新生成中 / 已废弃
- 质检结果:通过 / 局部修复 / 整条重做
- 替换记录:<被哪个镜头替换,附原镜头号>
镜头/分镜版本表
| 镜头号 | 当前版本 | 历史版本 | 状态 | 负责人 | 验收人 | 备注 |
|---|---|---|---|---|---|---|
| L01 | V3 | V1, V2 | 已验收 | 张三 | 李四 | V2 口型错位废弃,V3 修复 |
| L02 | V2 | V1 | 已验收 | 张三 | 李四 | V1 品牌色跑偏,V2 调整 |
| L03 | V4 | V1, V2, V3 | 重新生成中 | 王五 | 李四 | V3 出现六指,已重新生成 |
| L04 | V1 | - | 待生成 | 王五 | - | 第一次生成 |
关键原则:
- 每个镜头独立版本号:V1 失败 = V1 存档到历史表,V2 重新生成,不要覆盖 V1
- 每个版本都有责任人 + 验收人:不签字不算验收通过
- 替换必须记录:L03 V4 替换 L03 V3 的原因写在备注里
- 废弃版本不删除:全部存档到「历史版本」列,便于溯源
检查清单:
- 每个镜头都有镜头号、版本号、负责人、验收人
- 历史版本表完整(V1, V2, V3……全部记录)
- 替换记录附原因(不是「不好看」这种模糊词)
- 所有镜头有明确状态(待生成/已生成/重新生成中/已废弃)
- 总镜头数 × 平均时长 ≈ 视频总时长(误差 < 5%)
四、素材与生成阶段:多来源接力而不是工具横评
AI 视频不是「全程 AI 生成」就是先进的,多来源接力才是工程化。实拍、录屏、B-roll、AI 生成各司其职,按命名规则和筛选条件进入剪辑时间线。
素材分工矩阵
| 素材类型 | 适用场景 | 工具 | 优势 | 注意事项 |
|---|---|---|---|---|
| 实拍 | 主持人、产品演示、真实场景 | 手机 / 相机 | 真实感、人物表情自然 | 光线、收音、背景一致性 |
| 录屏 | 软件操作、流程演示 | OBS / QuickTime | 准确、可重复 | 鼠标轨迹、点击音效 |
| B-roll | 过渡画面、氛围铺垫 | 视频网站 / 自拍 | 多样、节省生成时间 | 版权、商用许可 |
| AI 生成 | 抽象概念、奇幻场景、无法实拍 | 可灵 / 海螺 / Runway / Sora | 想象空间大、不受物理限制 | 口型、事实、品牌一致 |
命名规则(强烈建议):
<项目代号>_<段落号>_<镜头号>_<版本号>_<来源>.<格式>
示例:
- video01_P1_L01_V3_real.mp4 (实拍)
- video01_P1_L02_V2_ai.mp4 (AI 生成)
- video01_P1_L03_V1_screen.mp4 (录屏)
- video01_P1_L04_V1_broll.mp4 (B-roll)
筛选与替换条件:
- 第一轮筛选(粗筛):8–16 个候选镜头中选 2–3 个深化
- 第二轮筛选(精筛):从深化镜头中选 1 个最终版
- 替换触发:口型错位 / 事实错误 / 品牌色跑偏 / 音画不同步 / 镜头时长超出 0.5s
检查清单:
- 每条素材按命名规则命名(项目代号_段落_镜头_版本_来源)
- 每条素材的版权状态已确认(自录 / 第三方授权 / AI 生成)
- AI 生成素材的 Prompt 完整存档
- 候选素材数量 8–16 个(少于此数 = 备选不足)
- 替换记录附触发原因
五、剪辑阶段:从粗剪到可发布时间线
剪辑不是「把素材拼起来」,而是把粗剪、精剪、字幕、配音、音量、画幅、导出拆成 6 步。每一步都有可验证输出。
剪辑 6 步流程
Step 1:粗剪(30min)
- 把所有通过的素材按段落顺序拼到时间线
- 不加字幕、不调音量、不加 BGM
- 输出:粗剪时间线 v1
Step 2:节奏调整(20min)
- 对照脚本检查每段时长
- 总时长误差 > 5% 必须调整(删除/补拍/重排)
- 输出:粗剪时间线 v2
Step 3:字幕与配音(40min)
- 字幕:自动识别 + 人工校正(错字率 < 0.5%)
- 配音:人声录制 或 TTS(TTS 必须二次人工校正)
- 字幕时间轴误差 < 200ms
- 输出:精剪时间线 v1
Step 4:背景音乐与音效(20min)
- BGM 音量 < 人声 20dB(避免盖过人声)
- 关键节点加音效(转场、点击、提示)
- 输出:精剪时间线 v2
Step 5:画幅与多平台导出(30min)
- 主版本:原画幅(16:9 / 9:16 / 1:1)
- 副版本:适配其他平台(横屏 + 竖屏 + 方形)
- 输出:多平台时间线 v1
Step 6:发布前最终检查(15min)
- 完整播放 3 次(正常速度 + 1.5x + 0.75x)
- 检查黑屏、卡顿、音画不同步
- 输出:可发布版本
检查清单:
- 粗剪时间线只关注段落顺序,不加任何效果
- 总时长误差 < 5%
- 字幕错字率 < 0.5%,时间轴误差 < 200ms
- BGM 音量 < 人声 20dB
- 至少 3 个平台版本(横屏/竖屏/方形)
- 完整播放 3 次无问题
六、质检、版权与发布前闸门
这是工作流中最容易被跳过、但故障率最高的一步。AI 视频的特殊风险有 5 个:口型错位、事实错误、品牌不一致、素材未授权、AI 标注缺失。每个都有专门的检查项。
质检清单(发布前必走)
| 检查项 | 验收标准 | 责任人 | 状态 |
|---|---|---|---|
| 口型 | 与人声同步误差 < 100ms | 验收人 1 | ☐ |
| 字幕 | 错字率 < 0.5%,时间轴误差 < 200ms | 验收人 1 | ☐ |
| 事实 | 所有数据有官方来源,无虚构 | 验收人 2 | ☐ |
| 画面 | 无明显瑕疵(AI 痕迹、模糊、错位) | 验收人 2 | ☐ |
| 音频 | 人声清晰,BGM 不盖人声 | 验收人 1 | ☐ |
| 品牌 | 主色、字体、Logo 位置符合品牌库 | 验收人 3 | ☐ |
| 素材授权 | 全部素材已确认授权状态 | 验收人 3 | ☐ |
| AI 标注 | 按平台规则完成(必标 / 可选) | 验收人 3 | ☐ |
| 平台规则 | 标题、标签、封面符合平台规范 | 验收人 1 | ☐ |
| 时长合规 | 不超过平台规定上限 | 验收人 1 | ☐ |
关键原则:
- 质检是闸门,不是建议:任何一项不通过 = 不发布
- 多人验收:不只一个人说了算(防止「我都看过了」盲点)
- 存档:质检结果 + 修复记录全部存档到「质检卡」
失败排查表
| 故障现象 | 可能原因 | 排查顺序 | 修复方法 |
|---|---|---|---|
| 口型错位 | 配音时间轴与画面不匹配 | 1. 校对配音时间轴 2. 重生成画面 | 1. 重新对齐时间轴 2. 重拍真人 |
| 事实错误 | AI 生成了虚构数据 | 1. 检查 Prompt 2. 查官方来源 | 1. 修改文案 2. 替换错误画面 |
| 品牌色跑偏 | Prompt 未指定品牌色 | 1. 检查 Prompt 2. 检查素材筛选 | 1. 调整 Prompt 2. 后期调色 |
| 音画不同步 | 剪辑时间轴错位 | 1. 检查时间轴 2. 检查素材时长 | 1. 重新对齐 2. 重新生成 |
| 字幕错字 | TTS 识别错误 或 人工录错 | 1. 检查 TTS 校对 2. 检查字幕文件 | 1. 人工校正 2. 重新识别 |
| 平台审核不通过 | AI 标注缺失 / 内容违规 | 1. 检查平台规则 2. 检查素材授权 | 1. 补标注 2. 替换素材 |
检查清单:
- 质检清单 10 项全部通过
- 多人验收(至少 2 人签字)
- 失败排查表已就绪(知道每个故障怎么修)
- 质检结果存档到质检卡
七、完整案例:从一个选题到 60–90 秒成片
以「AI 视频工程化交付可省 60% 返工」为例,展示完整 8 步流程。
Brief 卡
- 平台:B 站 + 视频号
- 日期:2026-07-25 19:00
- 时长:75s
- 画幅:16:9 横屏
- 受众:30-40 岁内容创作者、产品经理
- 核心信息:8 步工作流能压掉八成 AI 视频故障
- CTA:评论区留言你踩过的坑
- 验收:完播率 > 30%,点赞率 > 5%
脚本片段(前 15s)
## 段落 1(0–15s)
- 视觉:主持人半身入画
- 口播:「60 秒学会把 AI 视频做出可发布版本」
- 字幕:「可发布 ≠ 能生成」
- 时长:15s
镜头版本表
| 镜头 | 当前版 | 历史版 | 状态 | 备注 |
|---|---|---|---|---|
| L01(开场) | V2 | V1 | 已验收 | V1 主持人表情僵硬,V2 重录 |
| L02(4 失败案例分屏) | V3 | V1, V2 | 已验收 | V1 顺序错,V2 缺标题,V3 修复 |
| L03(8 步流程图) | V1 | - | 已验收 | 一次通过 |
| L04(结尾 CTA) | V2 | V1 | 已验收 | V1 表情不自然,V2 重录 |
失败回退记录
- L01 V1:主持人因光线问题面部反光严重 → 调整灯光重录 V2
- L02 V2:分屏标题被平台压缩后看不清 → 加大字号重出 V3
- L04 V1:主持人说话时眨眼频繁 → 重录 V2 并提醒主持人少眨眼
最终发布
- 质检清单 10 项全部通过
- 3 人验收(制片 + 编导 + 运营)
- B 站完播率 32%,点赞率 6.8%,超过预期
- 已发后无客诉
八、一页式 AI 视频工程化交付清单
把上面所有内容压成一张卡,发给同事时直接照着做。
Brief 卡
□ 平台 / 日期 / 时长 / 画幅 / 分辨率 5 项
□ 受众 / 核心信息 / CTA / 收益 4 项
□ 必出现元素 / 禁用项 / 事实核验 3 项
□ 验收标准 3–5 个可量化指标
□ 素材与版权(AI 标注 + 第三方授权)
□ 失败处理(Plan B + 责任 SLA)
脚本卡
□ 总字数 ÷ 4 ≈ 总时长(误差 < 5%)
□ 每段 4 项齐全(视觉/口播/字幕/时长)
□ 所有数据有官方来源链接
□ 0 模糊词(大概/应该/可能)
□ CTA 1 次
分镜卡
□ 每个镜头:编号 + 版本号 + 负责人 + 验收人
□ 历史版本表完整(V1, V2, V3……)
□ 替换记录附原因
□ 状态明确(待生成/已生成/重新生成中/已废弃)
素材卡
□ 命名规则:<项目>_<段>_<镜>_<版>_<来源>
□ 版权状态已确认
□ AI Prompt 完整存档
□ 候选 8–16 个
剪辑卡
□ 粗剪只关注段落顺序
□ 总时长误差 < 5%
□ 字幕错字率 < 0.5%,时间轴误差 < 200ms
□ BGM 音量 < 人声 20dB
□ 至少 3 平台版本
□ 完整播放 3 次
质检卡
□ 口型 / 字幕 / 事实 / 画面 / 音频
□ 品牌 / 素材授权 / AI 标注
□ 平台规则 / 时长合规
□ 多人验收(至少 2 人)
发布卡
□ 标题 / 标签 / 封面已确认
□ 发布日期 / 时间已确认
□ Plan B 素材已就绪
□ 回滚方案已准备
回滚卡
□ 已发布视频的撤回/替换流程
□ 紧急联系人 + 响应时间
□ Plan B 视频(备选版本)
□ 客诉响应模板
写在最后
AI 视频最难的不是 Prompt 怎么写,是把模糊需求拆成可执行的工程化交付。这条视频能不能发,不取决于模型多强,取决于工作流多完整。
照上面这套 8 步 SOP 跑,单条视频从「生成就发」的 3 小时返工压缩到「一次过审」的 1.2 小时,故障率从 30%+ 压到 10% 以下。
如果你刚开始用 AI 做视频,建议先从一条 60 秒短视频跑完整工作流(哪怕耗时 4 小时),熟悉每一步在做什么。跑过 5 条之后,自然能压缩到 2 小时一条。
下一步推荐阅读:
- AI 视频与音乐入门实战 — 从零到第一条视频
- AI 怎么做第一条视频 — 零基础流程
- AI 怎么剪视频 — 剪映与剪辑操作
- AI 视频工具选择 — 工具横评
- 可灵、海螺、Runway 对比 — 视频生成模型横评
- AI 生产力技巧 — 整体提效清单
- AI 写作工作流 — 同系列 SOP
跑过一条后欢迎回来留言,告诉我你踩了哪些坑、哪些环节省了时间。