AI 绘画工作流:从需求拆解到可交付图片

我用 AI 出图三年,前两年最常踩的坑是「图生出来了,但不能用」。要么是尺寸不对,要么是品牌色跑偏,要么是六根手指、塑料皮肤、AI 模板脸。问题从来不在模型,而在缺一套从 brief 到交付的 SOP。

这篇文章把这条工作流完整拆开:需求拆解 → brief 落表 → 路径选型 → Prompt 转写 → 批量出图 → 筛选与迭代 → 去 AI 感质检 → 后期与导出。你照着走一遍,至少能避免八成的「图能看不能用」问题。

配套阅读:AI 绘画入门实战(Day 56,零基础到第一张图)、Prompt 工程基础(Day 54,Prompt 怎么写)、Prompt 调试方法(Day 60,答非所问怎么定位)。


什么才算「可交付图片」

可交付不是「画得好看」,是符合下列所有条件:

项目验收标准
尺寸与比例与渠道精确匹配(如小红书 3:4、公众号头图 2.35:1、电商主图 1:1)
分辨率渠道要求的最小分辨率之上;长边建议 ≥2 倍
清晰度主体边缘锐利、无明显糊化、无过度锐化导致的描边
文字安全区渠道裁切不留主体;标题区不被覆盖;底部不被信息流遮挡
品牌一致性主色、字体风格、Logo 位置、视觉语言与品牌库一致
文件格式渠道要求(PNG 透明 / JPG 高质量 / WebP 压缩)
来源与授权商用许可范围、底库训练数据可追溯、第三方素材已授权

任何一项不过 = 不可交付。下面的工作流就是确保每一项都不漏。


第一步:把模糊需求拆成可执行 brief

接到「帮我出一张图」的请求时,第一步不是打开 Midjourney,而是写一份 brief 表。把模糊的「我想要好看的」拆成下面 8 项:

# AI 出图 brief 表

1. 用途:公众号头图 / 小红书封面 / 电商主图 / 海报 / 内文配图 / 私域社群
2. 受众:25-35 岁都市女性 / B 端技术决策者 / Z 世代学生 / 中老年用户
3. 主体:谁/什么在画面里(人物描述、物品、场景)
4. 风格:插画 / 写实 / 国潮 / 赛博 / 极简 / 复古 / 3D
5. 渠道尺寸:3:4 / 1:1 / 16:9 / 2.35:1 / 9:16
6. 禁用元素:不出现儿童 / 不出现 Logo / 不用红色 / 不出现西方宗教元素
7. 验收标准:主色饱和度 <70% / 人物无六指 / 无文字乱码 / 版权可商用
8. 截止时间:交付时间(决定走快出图还是精细打磨)

brief 没填完 = 不开始出图。填完这 8 项只需要 5 分钟,但能省下后面 5 小时的返工

我见过最常见的失败:客户说「想要一张高级感的头图」,出图师直接开工 → 三轮返工后才发现「高级感」指的是 ins 风极简而不是商业赛博朋克。brief 就是把这个「高级感」具体化的工具。


第二步:选择生成路径和参考素材

brief 写完后,选路径。下面这张决策树覆盖了 90% 的场景:

需求类型推荐路径理由
中文海报、中文文字嵌入即梦 / 通义万相 / 文心一格中文渲染准确
快速概念图、内部沟通Midjourney / DALL·E 3出图快、美感高
艺术视觉、品牌主视觉Midjourney v6+风格控制力强
精细可控、批量出图Stable Diffusion + ControlNet可复现、可微调
电商主图、模特替换Stable Diffusion + IP-Adapter + LoRA角色一致性 + 商品保真
抽象插画、信息图辅助Midjourney / DALL·E 3不需要写实

参考素材的准备顺序:

  1. 风格参考图:3-5 张符合品牌或客户期望的图,用于锚定风格
  2. 构图参考图:1-2 张构图符合渠道要求的图(特别是人物位置、文字区)
  3. 色板参考:HEX 色值或截图,用于控制主色
  4. 禁用参考:3-5 张明确不能出效果的图(避免同质化)

参考图不是越多越好。3-5 张风格参考 + 1-2 张构图参考 = 最优解。再多 Prompt 会冲突,模型不知道听谁的。

参考阅读:Midjourney 操作与参数(Midjourney 完整参数表)、可控生成路径(SD + ControlNet 入门)、中文生图路径(即梦中文海报实战)。


第三步:把 brief 转成 Prompt 与风格约束

Prompt 不是「一段话描述画面」,是固定项 + 可变项 + 参考 + 约束四段式结构。

Prompt 卡片模板

【固定项】主体描述 + 风格 + 构图 + 主色 + 光线
【可变项】背景 + 道具 + 视角(保留 2-3 个变量用于迭代)
【参考图】3-5 张风格参考 + 1 张构图参考(--sref / --cref)
【负面约束】--no 列表(手指畸形、文字乱码、特定元素)
【版本号】v1 / v2 / v3 / ...(每次只改一项,记录改了什么)

实战 Prompt 示例(公众号头图)

【固定项】一位 30 岁亚洲女性坐在咖啡馆窗边,温暖午后光线,
主体居中偏左,头部上方留 30% 空白用于标题,
主色暖橙+米白,浅景深,电影感构图。
【可变项】穿米色风衣,桌上有拿铁咖啡和一本翻开的书。
【参考图】--sref https://...风格参考图链接 --cref https://...人物参考
【负面约束】--no 文字 水印 Logo 卡通风格 西方人
【版本号】v1(基线版本)

Midjourney 写法:

A 30-year-old Asian woman sitting by a cafe window in warm afternoon
light, centered-left composition, top 30% empty for headline,
warm orange and cream palette, shallow depth of field, cinematic.
She wears a beige trench coat, with a latte and an open book on the table.
--sref https://... --cref https://... --ar 2.35:1 --v 6.1 --style raw
--no text watermark logo cartoon style western people

通义万相 / 即梦的写法略有不同(中文友好),但结构一致:主体 + 风格 + 构图 + 约束。

Prompt 转换铁律

  1. 一次只改一个变量:v1 → v2 只改背景;v2 → v3 只改光线;v3 → v4 只改构图
  2. 每次迭代保留 Prompt 副本:用 Excel / Notion 记录「v1 出了什么效果 → 哪里不达标 → v2 改了什么」
  3. 负面约束要具体:不要写「--no 难看」,要写「--no 六指 塑料皮肤 文字乱码」
  4. Prompt 长度适中:Midjourney 50-150 词最佳,过长模型会忽略后段

参考:Prompt 工程基础(系统讲 Prompt 怎么写)、Prompt 调试方法(Prompt 答非所问时怎么定位)。


第四步:批量生成、筛选和迭代

出图策略:一轮出 8-16 张候选,从中选 2-3 张深化。一轮只出 4 张 = 选择面太窄;一轮出 32 张 = 时间浪费。

候选图评分表

编号大关系主体清晰构图合规AI 感颜色合规综合分决策
v1-01879487.2候选
v1-02798697.8首选
v1-03657375.6淘汰

评分维度(每项 1-10):

  • 大关系:整体氛围是否符合 brief
  • 主体清晰:主体是否一眼可识别、不被背景淹没
  • 构图合规:是否给文字安全区、是否符合渠道比例
  • AI 感:是否一眼像 AI(1=像、10=不像)
  • 颜色合规:主色饱和度、品牌色一致性

综合分 = 加权平均(大关系 20% + 主体清晰 25% + 构图合规 20% + AI 感 20% + 颜色 15%)。

综合分 < 6 的一律淘汰,6-7 的作为候选,>7 的进入下一轮深化。

文件命名规范

ai-painting-workflow_v1-batch_2026-07-18_candidate-01.png
ai-painting-workflow_v1-batch_2026-07-18_candidate-02.png
...
ai-painting-workflow_v2-batch_2026-07-18_refined-01.png  # v2 是基于 v1-candidate-02 深化

命名包含 slug + 版本 + 批次 + 日期 + 角色,半年后再看也不会混。

迭代记录

每次迭代必须记录:

## v2 迭代 (基于 v1-candidate-02)
- 改动:把背景从咖啡馆改成街角(v1 客户反馈「太温馨,不够都市」)
- Prompt 差异:... 街角 cafe → street corner ...
- 出图数:12 张
- 首选:v2-candidate-03(综合分 8.1)
- 备注:v2-candidate-05 手指仍有问题,进入 v3 用局部重绘修复

坚持「一次只改一个变量」+ 详细记录,迭代效率能提升 3 倍。


第五步:为什么画面总像 AI:按质检顺序排查

这是整条工作流里最容易被跳过的一步,也是客户最在意的一步。「像 AI」往往不是单一原因,是多个问题叠加。下面这张表帮你按顺序定位:

现象原因修复方法复验
模板化审美(所有人长得像)训练数据偏差 + Prompt 撞车加「真实摄影」「纪录片风格」「特定摄影师风格」+ 换种子重出 + 比对参考图
塑料皮肤模型过度平滑 + 美颜滤镜加「皮肤纹理」「毛孔可见」「自然瑕疵」+ 降 --stylize100% 放大看皮肤
过度光滑(家具/食物)商业图训练数据偏差加「手工感」「自然光」「不规则纹理」与真实照片并排看
光影矛盾模型不理解物理加「单一光源方向」「阴影方向一致」+ 删冲突光源描述阴影方向三角验证
人体错误(六指/三腿/透视错)数据稀疏 + 复杂姿态改简单姿态 + 用 SD + ControlNet 锁定骨架 + 局部重绘修复数手指 + 看透视
随机文字/乱码模型不理解字符不用 AI 生成文字,文字用后期软件加OCR 检测
背景细节失真模型分辨率不足后期裁切 + 重绘背景 + 模糊处理100% 放大看四角
系列风格不一致没固定参考图统一 --sref + --cref + 固定 Prompt 模板拼图对比

复验铁律

  1. 100% 放大看主体:尤其看手、眼睛、皮肤纹理、衣物边缘
  2. 缩到渠道实际尺寸看:客户看的是小红书 3:4 缩略图,不是 4K 大图
  3. 拿真实照片并排对比:一眼能看出 AI 感的,往往对比后才暴露
  4. 换不同人看不:自己看麻木了,让同事/朋友第一眼判断

局部重绘(inpainting)挽救策略

发现局部问题(手部错误、文字乱码、背景穿帮),不要整张重出。用 inpainting:

  • Midjourney:Vary (Region) 选中问题区域,重新 Prompt
  • SD:用 ControlNet inpaint + 重绘蒙版 + 与原图风格匹配的 Prompt
  • 即梦 / 通义万相:局部重绘工具,选中区域重生成

局部重绘省 80% 时间,且能保留构图其他部分。

参考:把 AI 创作串成工作流(Day 59,工作流思维的整体应用)、Midjourney 风格与参数进阶(Midjourney 高级风格控制)。


第六步:后期处理、导出与交付

AI 出图不是终点,后期处理才能交付。后期工作流:

1. 基础后期

  • 裁切:按渠道精确比例裁切;保留文字安全区
  • 调色:用 Lightroom / 醒图统一色调;不要让每张图色温不同
  • 锐化:轻度锐化主体;背景可降锐

2. 文字与排版

  • 不要用 AI 生成文字——AI 文字 90% 是乱码
  • 用 Figma / 稿定设计 / Canva / PS 人工排版
  • 字体选择与品牌库一致;标题字号按渠道规范

3. 多渠道裁切

一张主图出多渠道版本:

主图 1:1 (1080×1080)
  ├─ 公众号头图 2.35:1 (1080×460)
  ├─ 小红书 3:4 (1080×1440)
  ├─ 视频号封面 1:1 (1080×1080)
  └─ 朋友圈 4:3 (1280×960)

裁切时注意:主体不要被裁掉;文字安全区重新规划。

4. 文件交付包

最终交付必须包含:

deliverable_2026-07-18_ai-painting-workflow/
├── 01-final/
│   ├── main-1x1.png
│   ├── wechat-header-2.35x1.png
│   └── xiaohongshu-3x4.png
├── 02-source/
│   ├── main-original-4k.png  # AI 出图原图
│   └── main-edited.psd        # 后期源文件
├── 03-license/
│   └── license-summary.md     # 商用许可说明
└── 04-brief/
    └── brief-v1.md            # 原始需求 brief

交付包结构 = 客户验收 + 你后续维护都省心。客户问「这图能商用吗」,直接给 license-summary.md。

参考:海报交付场景(海报特有的后期要点)、电商图交付场景(电商主图后期规范)。


完整案例:一份从 brief 到交付包的实录

下面是一个真实案例的精简版,让你看完整工作流跑一遍是什么样。

需求

客户:某新消费茶品牌,要 8 张「春日茶饮」小红书系列图。

Step 1 brief(节选)

1. 用途:小红书 3:4 系列封面(共 8 张)
2. 受众:25-32 岁都市女性
3. 主体:茶饮 + 春日元素(樱花、绿叶、竹)
4. 风格:日式侘寂 + 国潮淡彩
5. 渠道尺寸:3:4(1080×1440)
6. 禁用元素:无文字、无 Logo、无西方元素
7. 验收标准:主色饱和度 <60%、无 AI 感、可商用

Step 2 路径选择

Midjourney v6.1(日式侘寂风格)+ 后期调色 + 文字后期加。

Step 3 Prompt 基线

A traditional Chinese tea set with light green tea,
surrounded by cherry blossoms and bamboo leaves,
Japanese wabi-sabi aesthetic with subtle Chinese painting influence,
3:4 vertical composition, top 20% empty for title,
soft natural lighting, muted color palette.
--ar 3:4 --v 6.1 --style raw --sref <侘寂风格参考>
--no text watermark logo cartoon style bright colors

Step 4 批量与筛选

v1 出 16 张,选 3 张候选(综合分 7.5/7.8/7.2)。

v2 基于首选深化(v1-02),出 12 张,选 2 张最终候选。

v3 用 inpainting 修复 v2-01 的茶具边缘瑕疵。

Step 5 质检

  • ✅ 100% 放大:茶具纹理清晰、樱花花瓣自然
  • ✅ 缩到 3:4 缩略图:主体居中、文字区干净
  • ✅ 并排对比:与品牌历史图风格一致
  • ✅ 换人验证:3 个同事第一眼不判断为 AI

Step 6 后期与交付

  • 裁切到 1080×1440
  • 调色(统一偏暖、降低饱和度到 55%)
  • 8 张全部加系列标题文字(后期软件)
  • 交付包:8 张 PNG + PSD 源文件 + 商用许可说明

总耗时:6 小时(brief 30min + 出图 2h + 筛选迭代 1h + 后期 2h + 交付打包 30min)。


可复制的一页式 SOP

最后给你一页式清单,贴在工位旁边:

# AI 绘画工作流 SOP(v1.0)

## Step 1: 写 brief(5min)
□ 用途 / 受众 / 主体 / 风格 / 尺寸 / 禁用 / 验收 / 截止
□ 8 项填完才开始出图

## Step 2: 选路径 + 备参考图(10min)
□ 中文中文字 → 即梦 / 通义万相
□ 快速概念 → Midjourney / DALL·E 3
□ 精细可控 → SD + ControlNet
□ 3-5 张风格参考 + 1-2 张构图参考

## Step 3: 转 Prompt(10min)
□ 固定项 + 可变项 + 参考 + 负面约束 + 版本号
□ 一次只改一个变量
□ 记录每次迭代差异

## Step 4: 批量 + 筛选(30min)
□ 一轮 8-16 张,选 2-3 张深化
□ 评分表:大关系 20% + 主体 25% + 构图 20% + AI 感 20% + 颜色 15%
□ <6 淘汰 / 6-7 候选 / >7 深化

## Step 5: 去 AI 感质检(30min)
□ 100% 放大看手/眼/皮肤/边缘
□ 缩到渠道实际尺寸看
□ 拿真实照片并排对比
□ 局部问题用 inpainting 修复

## Step 6: 后期 + 交付包(30min)
□ 裁切 + 调色 + 锐化
□ 文字后期加(不用 AI 生成)
□ 多渠道版本
□ 交付包 = final + source + license + brief

照这个 SOP 跑,8 张系列图稳定 6 小时交付,可用率从「30% 出 8 张」提升到「80% 出 8 张」。


写在最后

AI 出图最难的不是 Prompt 怎么写,是把模糊需求拆成可执行 SOP。这张图能不能用,不取决于模型多强,取决于工作流多完整。

如果你刚开始用 AI 出图,建议先从一张图跑完整工作流(哪怕耗时 3 小时),熟悉每一步在做什么。跑过 5 张之后,自然能压缩到 30 分钟一张。

下一步推荐阅读:

跑过一遍后欢迎回来留言,告诉我你踩了哪些坑、哪些环节省了时间。