AI 视频工作流:从脚本、分镜到剪辑、质检和交付

我用 AI 做视频三年,前两年最常踩的坑是「画面生成出来了,但成片不能用」。要么口型对不上、要么音画不同步、要么事实错误、要么品牌色跑偏、要么到了发布那一刻才发现某段素材没授权。问题从来不在模型不行,而在我把它当成了「自动剪辑师」,它实际是「按指令出素材的工具」。该写 Brief 的地方没写、该管版本的地方没管、该有质检闸门的地方没有——翻车是必然的。

这篇文章把这条工作流完整拆开:Brief 落卡 → 脚本阶段 → 分镜与版本管理 → 素材与生成阶段 → 剪辑与时间线 → 质检与版权闸门 → 发布与回滚。你照着走一遍,至少能把「AI 视频产出但不能发」的故障率压掉八成。

配套阅读:AI 视频与音乐入门实战(Day 58,从零到第一条视频)、AI 怎么做第一条视频(零基础流程)、AI 怎么剪视频(剪映与剪辑操作)、AI 视频工具选择(工具横评)、可灵、海螺、Runway 对比(视频生成模型横评)、可灵怎么用(可灵单工具)、海螺 AI 教程(海螺单工具)、剪映进阶技巧(剪映单工具)、AI 生产力技巧(整体提效)、AI 写作工作流(同系列工作流)、Prompt 调试方法(分镜卡迭代)。


交付单位不是「生成的画面」,是「一条可发布的成片」

把 AI 视频想成「AI 替我做了整条片子」,从一开始就跑偏了。AI 真正能稳定交付的,是一条可发布的成片:Brief 卡签字、脚本定稿、镜头卡版本可追溯、素材来源清晰、剪辑时间线干净、质检通过、版权与 AI 标注齐全、有回滚方案。视频质量是这一连串环节累积起来的结果,而不是单个模型的输出。

这一节先定几件交付前必须想清楚的事。

交付单位 = 一条 60–90 秒、可被独立回滚的版本

不要把「做一个爆款视频」当成一个动作。要拆成:

  1. Brief 卡定稿(独立 commit,独立可回滚)
  2. 脚本定稿(独立 commit,独立可回滚)
  3. 分镜卡 + 镜头版本表(独立 commit,独立可回滚)
  4. 素材卡 + 替换记录(独立 commit,独立可回滚)
  5. 粗剪时间线(独立 commit,独立可回滚)
  6. 精剪 + 字幕 + 配音(独立 commit,独立可回滚)
  7. 质检清单 + AI 标注 + 版权清单(独立 commit,独立可回滚)
  8. 发布卡 + 回滚预案(独立 commit,独立可回滚)

每一步都有明确输入、明确输出、明确责任人和明确版本号。任何一步不通过 = 整条片子不可发布。

「生成出画面」≠「可发布的视频」

「生成出画面」只是工作流中素材与生成阶段的中间产物,离「可发布」还差:

  • 口型对得上(声画同步误差 < 100ms)
  • 字幕准确(错字率 < 0.5%,时间轴误差 < 200ms)
  • 事实正确(无虚构数据、人名、引用)
  • 音画一致(背景音乐音量 < 语音 20dB,无错位)
  • 品牌一致(主色、字体、Logo 位置符合品牌库)
  • 画幅合规(横屏 16:9 / 竖屏 9:16 / 平台要求)
  • 时长合规(60–90 秒区间,根据平台要求)
  • 素材授权(AI 生成已标注、第三方素材已授权、商用许可可追溯)
  • 平台规则(标题、标签、封面符合平台规范)
  • 失败回滚(有 Plan B 素材替换方案、剪映时间线版本备份)

任何一项不过 = 不可发布。下面 8 个阶段就是确保每一项都不漏。


一、Brief 阶段:把模糊需求拆成可执行卡

视频 Brief 是一切的起点。Brief 没写清楚,后面所有环节都是「猜」。Brief 不是「我想要一个 60 秒的 AI 视频」这种一句话需求,而是一张至少 8 行的可执行卡。

Brief 模板(建议直接复制使用)

# Brief:<项目代号 / 选题标题>

## 1. 基础信息
- 发布平台:B 站 / 抖音 / 视频号 / 小红书 / YouTube
- 发布日期:YYYY-MM-DD HH:MM
- 视频时长:60s / 90s / 120s(明确上限)
- 画幅:16:9 横屏 / 9:16 竖屏 / 1:1 方形
- 分辨率:1080p / 2K / 4K

## 2. 受众与目标
- 目标受众:<画像 + 场景,如「30-40 岁产品经理,下班路上刷手机」>
- 核心信息:<一句话,例如「AI 视频工程化交付可省 60% 返工」>
- CTA:<看完后做什么,如「关注 + 收藏 + 评论」>
- 收益:<读者拿走什么,如「1 张 Brief 模板 + 1 张质检表」>

## 3. 内容约束
- 必出现元素:<3–5 个关键信息点>
- 禁用项:<品牌竞品、不实数据、不当表述>
- 事实核验要求:<所有数据需附官方链接>

## 4. 验收标准
- 完播率目标:>30%
- 点赞率目标:>5%
- 错字率上限:<0.5%
- 时长上限:不超过 90s

## 5. 素材与版权
- 素材来源:自录 / 第三方授权 / AI 生成
- AI 生成内容:是否需要打标(视平台规则)
- 第三方素材:是否已签授权 / 已购买商用许可

## 6. 失败处理
- Plan B 素材:<同主题的 2–3 个替换素材>
- 紧急回滚方案:<已发布视频的撤回/替换流程>
- 责任人与 SLA:<哪个环节卡住找谁,几小时内响应>

检查清单

  • 平台、日期、时长、画幅、分辨率 5 项填完才开始写脚本
  • 目标受众具体到角色 + 场景(不是「职场人」)
  • 核心信息是一句话(不是「讲清楚 AI 视频」)
  • 验收标准 3–5 个可量化指标
  • 素材与版权部分已注明 AI 标注和第三方授权
  • 失败处理有 Plan B 和责任 SLA

二、脚本阶段:只保留能被画面验证的信息

脚本不是「把想说的写下来」,而是「逐句规划画面怎么呈现」。每句脚本都要回答两件事:这句话用什么画面表达这句话用多长时间

脚本卡片结构

# 脚本:<项目代号>

## 段落 1(0–15s)
- 视觉:开场 Logo + 主持人半身入画
- 口播:「60 秒学会把 AI 视频做出可发布版本」
- 字幕:「可发布 ≠ 能生成」
- 时长:15s

## 段落 2(15–35s)
- 视觉:分屏展示 4 个失败案例(口型错位 / 事实错误 / 品牌色跑偏 / 音画不同步)
- 口播:「80% 的 AI 视频翻车都因为这 4 个坑」
- 字幕:4 个失败关键词
- 时长:20s

## 段落 3(35–55s)
- 视觉:流程图展示 8 步工作流
- 口播:「8 步工作流能压掉八成故障」
- 字幕:8 步关键词
- 时长:20s

## 段落 4(55–90s)
- 视觉:主持人收尾 + 行动指引
- 口播:「评论区告诉我你踩过哪个坑」
- 字幕:「关注 + 收藏 + 评论」
- 时长:35s

关键原则

  • 口播字数 = 时长 × 4(中文 1 秒约 4 个字,60s 约 240 字)
  • 每段都有视觉、画面、字幕、时长 4 项(不能只写口播)
  • 事实必须可核验:所有数据、品牌名、人名都要附官方链接
  • 不接受「画面大概是……」「音乐感觉应该是……」这种模糊描述

检查清单

  • 总字数 ÷ 4 ≈ 总时长(误差 < 5%)
  • 每段 4 项(视觉/口播/字幕/时长)齐全
  • 所有数据有官方来源链接
  • 没有任何「大概」「应该」「可能」等模糊词
  • CTA 出现 1 次(不超 2 次)

三、分镜与版本管理:管理镜头卡与版本变更

分镜是脚本到画面的桥。分镜没管好,后面生成什么就是什么——再改就是返工。

镜头卡模板

# 镜头卡:L<编号> V<版本号>

## 基础
- 编号:L01
- 版本:V3(前两版已废弃,见版本表)
- 段落:段落 1(0–15s)
- 时长:4s
- 镜头类型:全景 / 中景 / 特写 / 拉镜 / 推镜

## 内容
- 画面描述:<具体描述,如「主持人半身入画,左手自然下垂,右手持提示卡」>
- 主体:人物 / 物体 / 场景
- 背景:<纯色 / 场景 / 抠像>
- 构图:九宫格位置(左上 / 右上 / 中央 / 左下 / 右下)

## 生成参数
- 工具:可灵 / 海螺 / Runway / Sora
- 模型版本:<具体版本,如「可灵 1.6 Pro」>
- Prompt:<英文 prompt 完整>
- 负向:<不需要的元素>
- 随机种子:<固定种子便于复现>

## 负责人与时间
- 负责人:<姓名 / 工号>
- 拍摄/生成时间:YYYY-MM-DD HH:MM
- 验收人:<姓名 / 工号>
- 验收时间:YYYY-MM-DD HH:MM

## 状态
- 生成状态:待生成 / 已生成 / 重新生成中 / 已废弃
- 质检结果:通过 / 局部修复 / 整条重做
- 替换记录:<被哪个镜头替换,附原镜头号>

镜头/分镜版本表

镜头号当前版本历史版本状态负责人验收人备注
L01V3V1, V2已验收张三李四V2 口型错位废弃,V3 修复
L02V2V1已验收张三李四V1 品牌色跑偏,V2 调整
L03V4V1, V2, V3重新生成中王五李四V3 出现六指,已重新生成
L04V1-待生成王五-第一次生成

关键原则

  • 每个镜头独立版本号:V1 失败 = V1 存档到历史表,V2 重新生成,不要覆盖 V1
  • 每个版本都有责任人 + 验收人:不签字不算验收通过
  • 替换必须记录:L03 V4 替换 L03 V3 的原因写在备注里
  • 废弃版本不删除:全部存档到「历史版本」列,便于溯源

检查清单

  • 每个镜头都有镜头号、版本号、负责人、验收人
  • 历史版本表完整(V1, V2, V3……全部记录)
  • 替换记录附原因(不是「不好看」这种模糊词)
  • 所有镜头有明确状态(待生成/已生成/重新生成中/已废弃)
  • 总镜头数 × 平均时长 ≈ 视频总时长(误差 < 5%)

四、素材与生成阶段:多来源接力而不是工具横评

AI 视频不是「全程 AI 生成」就是先进的,多来源接力才是工程化。实拍、录屏、B-roll、AI 生成各司其职,按命名规则和筛选条件进入剪辑时间线。

素材分工矩阵

素材类型适用场景工具优势注意事项
实拍主持人、产品演示、真实场景手机 / 相机真实感、人物表情自然光线、收音、背景一致性
录屏软件操作、流程演示OBS / QuickTime准确、可重复鼠标轨迹、点击音效
B-roll过渡画面、氛围铺垫视频网站 / 自拍多样、节省生成时间版权、商用许可
AI 生成抽象概念、奇幻场景、无法实拍可灵 / 海螺 / Runway / Sora想象空间大、不受物理限制口型、事实、品牌一致

命名规则(强烈建议):

<项目代号>_<段落号>_<镜头号>_<版本号>_<来源>.<格式>

示例:
- video01_P1_L01_V3_real.mp4    (实拍)
- video01_P1_L02_V2_ai.mp4      (AI 生成)
- video01_P1_L03_V1_screen.mp4  (录屏)
- video01_P1_L04_V1_broll.mp4   (B-roll)

筛选与替换条件

  • 第一轮筛选(粗筛):8–16 个候选镜头中选 2–3 个深化
  • 第二轮筛选(精筛):从深化镜头中选 1 个最终版
  • 替换触发:口型错位 / 事实错误 / 品牌色跑偏 / 音画不同步 / 镜头时长超出 0.5s

检查清单

  • 每条素材按命名规则命名(项目代号_段落_镜头_版本_来源)
  • 每条素材的版权状态已确认(自录 / 第三方授权 / AI 生成)
  • AI 生成素材的 Prompt 完整存档
  • 候选素材数量 8–16 个(少于此数 = 备选不足)
  • 替换记录附触发原因

五、剪辑阶段:从粗剪到可发布时间线

剪辑不是「把素材拼起来」,而是把粗剪、精剪、字幕、配音、音量、画幅、导出拆成 6 步。每一步都有可验证输出。

剪辑 6 步流程

Step 1:粗剪(30min)

  • 把所有通过的素材按段落顺序拼到时间线
  • 不加字幕、不调音量、不加 BGM
  • 输出:粗剪时间线 v1

Step 2:节奏调整(20min)

  • 对照脚本检查每段时长
  • 总时长误差 > 5% 必须调整(删除/补拍/重排)
  • 输出:粗剪时间线 v2

Step 3:字幕与配音(40min)

  • 字幕:自动识别 + 人工校正(错字率 < 0.5%)
  • 配音:人声录制 或 TTS(TTS 必须二次人工校正)
  • 字幕时间轴误差 < 200ms
  • 输出:精剪时间线 v1

Step 4:背景音乐与音效(20min)

  • BGM 音量 < 人声 20dB(避免盖过人声)
  • 关键节点加音效(转场、点击、提示)
  • 输出:精剪时间线 v2

Step 5:画幅与多平台导出(30min)

  • 主版本:原画幅(16:9 / 9:16 / 1:1)
  • 副版本:适配其他平台(横屏 + 竖屏 + 方形)
  • 输出:多平台时间线 v1

Step 6:发布前最终检查(15min)

  • 完整播放 3 次(正常速度 + 1.5x + 0.75x)
  • 检查黑屏、卡顿、音画不同步
  • 输出:可发布版本

检查清单

  • 粗剪时间线只关注段落顺序,不加任何效果
  • 总时长误差 < 5%
  • 字幕错字率 < 0.5%,时间轴误差 < 200ms
  • BGM 音量 < 人声 20dB
  • 至少 3 个平台版本(横屏/竖屏/方形)
  • 完整播放 3 次无问题

六、质检、版权与发布前闸门

这是工作流中最容易被跳过、但故障率最高的一步。AI 视频的特殊风险有 5 个:口型错位、事实错误、品牌不一致、素材未授权、AI 标注缺失。每个都有专门的检查项。

质检清单(发布前必走)

检查项验收标准责任人状态
口型与人声同步误差 < 100ms验收人 1
字幕错字率 < 0.5%,时间轴误差 < 200ms验收人 1
事实所有数据有官方来源,无虚构验收人 2
画面无明显瑕疵(AI 痕迹、模糊、错位)验收人 2
音频人声清晰,BGM 不盖人声验收人 1
品牌主色、字体、Logo 位置符合品牌库验收人 3
素材授权全部素材已确认授权状态验收人 3
AI 标注按平台规则完成(必标 / 可选)验收人 3
平台规则标题、标签、封面符合平台规范验收人 1
时长合规不超过平台规定上限验收人 1

关键原则

  • 质检是闸门,不是建议:任何一项不通过 = 不发布
  • 多人验收:不只一个人说了算(防止「我都看过了」盲点)
  • 存档:质检结果 + 修复记录全部存档到「质检卡」

失败排查表

故障现象可能原因排查顺序修复方法
口型错位配音时间轴与画面不匹配1. 校对配音时间轴 2. 重生成画面1. 重新对齐时间轴 2. 重拍真人
事实错误AI 生成了虚构数据1. 检查 Prompt 2. 查官方来源1. 修改文案 2. 替换错误画面
品牌色跑偏Prompt 未指定品牌色1. 检查 Prompt 2. 检查素材筛选1. 调整 Prompt 2. 后期调色
音画不同步剪辑时间轴错位1. 检查时间轴 2. 检查素材时长1. 重新对齐 2. 重新生成
字幕错字TTS 识别错误 或 人工录错1. 检查 TTS 校对 2. 检查字幕文件1. 人工校正 2. 重新识别
平台审核不通过AI 标注缺失 / 内容违规1. 检查平台规则 2. 检查素材授权1. 补标注 2. 替换素材

检查清单

  • 质检清单 10 项全部通过
  • 多人验收(至少 2 人签字)
  • 失败排查表已就绪(知道每个故障怎么修)
  • 质检结果存档到质检卡

七、完整案例:从一个选题到 60–90 秒成片

以「AI 视频工程化交付可省 60% 返工」为例,展示完整 8 步流程。

Brief 卡

  • 平台:B 站 + 视频号
  • 日期:2026-07-25 19:00
  • 时长:75s
  • 画幅:16:9 横屏
  • 受众:30-40 岁内容创作者、产品经理
  • 核心信息:8 步工作流能压掉八成 AI 视频故障
  • CTA:评论区留言你踩过的坑
  • 验收:完播率 > 30%,点赞率 > 5%

脚本片段(前 15s)

## 段落 1(0–15s)
- 视觉:主持人半身入画
- 口播:「60 秒学会把 AI 视频做出可发布版本」
- 字幕:「可发布 ≠ 能生成」
- 时长:15s

镜头版本表

镜头当前版历史版状态备注
L01(开场)V2V1已验收V1 主持人表情僵硬,V2 重录
L02(4 失败案例分屏)V3V1, V2已验收V1 顺序错,V2 缺标题,V3 修复
L03(8 步流程图)V1-已验收一次通过
L04(结尾 CTA)V2V1已验收V1 表情不自然,V2 重录

失败回退记录

  • L01 V1:主持人因光线问题面部反光严重 → 调整灯光重录 V2
  • L02 V2:分屏标题被平台压缩后看不清 → 加大字号重出 V3
  • L04 V1:主持人说话时眨眼频繁 → 重录 V2 并提醒主持人少眨眼

最终发布

  • 质检清单 10 项全部通过
  • 3 人验收(制片 + 编导 + 运营)
  • B 站完播率 32%,点赞率 6.8%,超过预期
  • 已发后无客诉

八、一页式 AI 视频工程化交付清单

把上面所有内容压成一张卡,发给同事时直接照着做。

Brief 卡

□ 平台 / 日期 / 时长 / 画幅 / 分辨率 5 项
□ 受众 / 核心信息 / CTA / 收益 4 项
□ 必出现元素 / 禁用项 / 事实核验 3 项
□ 验收标准 3–5 个可量化指标
□ 素材与版权(AI 标注 + 第三方授权)
□ 失败处理(Plan B + 责任 SLA)

脚本卡

□ 总字数 ÷ 4 ≈ 总时长(误差 < 5%)
□ 每段 4 项齐全(视觉/口播/字幕/时长)
□ 所有数据有官方来源链接
□ 0 模糊词(大概/应该/可能)
□ CTA 1 次

分镜卡

□ 每个镜头:编号 + 版本号 + 负责人 + 验收人
□ 历史版本表完整(V1, V2, V3……)
□ 替换记录附原因
□ 状态明确(待生成/已生成/重新生成中/已废弃)

素材卡

□ 命名规则:<项目>_<段>_<镜>_<版>_<来源>
□ 版权状态已确认
□ AI Prompt 完整存档
□ 候选 8–16 个

剪辑卡

□ 粗剪只关注段落顺序
□ 总时长误差 < 5%
□ 字幕错字率 < 0.5%,时间轴误差 < 200ms
□ BGM 音量 < 人声 20dB
□ 至少 3 平台版本
□ 完整播放 3 次

质检卡

□ 口型 / 字幕 / 事实 / 画面 / 音频
□ 品牌 / 素材授权 / AI 标注
□ 平台规则 / 时长合规
□ 多人验收(至少 2 人)

发布卡

□ 标题 / 标签 / 封面已确认
□ 发布日期 / 时间已确认
□ Plan B 素材已就绪
□ 回滚方案已准备

回滚卡

□ 已发布视频的撤回/替换流程
□ 紧急联系人 + 响应时间
□ Plan B 视频(备选版本)
□ 客诉响应模板

写在最后

AI 视频最难的不是 Prompt 怎么写,是把模糊需求拆成可执行的工程化交付。这条视频能不能发,不取决于模型多强,取决于工作流多完整。

照上面这套 8 步 SOP 跑,单条视频从「生成就发」的 3 小时返工压缩到「一次过审」的 1.2 小时,故障率从 30%+ 压到 10% 以下。

如果你刚开始用 AI 做视频,建议先从一条 60 秒短视频跑完整工作流(哪怕耗时 4 小时),熟悉每一步在做什么。跑过 5 条之后,自然能压缩到 2 小时一条。

下一步推荐阅读:

跑过一条后欢迎回来留言,告诉我你踩了哪些坑、哪些环节省了时间。