这是我"从零开始学AI"系列教程的第六篇。前五篇我们聊了 AI 是什么Prompt 工程怎么入门AI 写作怎么落地AI 绘画怎么出作品AI 编程怎么做项目。这一篇讲一件很多人以为"门槛高、要专业设备"的事——AI 视频和音乐创作

我必须先说一个事实:AI 视频和音乐在 2026 年已经走过了"玩具阶段",进入了"能用来干活"的阶段。这一年我用可灵、海螺、Runway 帮自媒体朋友做了 100 多条短视频的镜头素材;用 Suno、海绵音乐给三个播客客户做了完整的片头片尾 BGM;最让我意外的是,一个完全不会剪辑的朋友用这套工具链做出了抖音爆款。我自己最大的感受是:这一年我的创作节奏完全变了。过去一年我没买过一首商用音乐,剪过的每一条视频都用过 AI 镜头——这不是因为 AI 比人做得更好,而是它足够快、足够便宜、足够能迭代到"我要的样子"。

这一篇我会用最接地气的方式讲清楚五件事:AI 视频/音乐现在能做什么、选哪个工具、怎么用 Prompt 让 AI 帮你生成内容、6 个最容易踩的坑、以及 6 个可以立刻动手做的小项目。读完后,你应该能用一个周末,做出第一条"能用的 AI 短视频"或第一首"能听的 AI 原创歌"。

系列说明:这是"从零开始学AI"系列第 6 篇,共 7 篇。每篇都能独立阅读,按顺序读会形成完整知识链。本篇承接上一篇 从零开始学AI(五):AI编程实战手册。下一篇 从零开始学AI(七):AI效率提升指南 会在 7/15 发布,是整个系列的收官之作。

一、先说结论:AI 视频/音乐不是"一键生成爆款"

如果说 AI 写作最大的误区是把它当"代笔",AI 编程最大的误区是把它当"代写代码的程序员",那 AI 视频/音乐最大的误区就是把它当"一键生成爆款的魔法按钮"——你输入一句话,AI 给你一个完整大片。

AI 视频/音乐真正高效的用法,是"你当导演+作曲家,AI 当摄影+配乐团队"。你负责想清楚"要讲什么故事、画面节奏怎样、情绪怎么走",AI 负责把每一帧画面、每一段音符生成出来。中间的鸿沟靠两件事填:清晰的创作意图 + 一遍遍的迭代优化

这背后有三个根本性变化:

1. 多模态能力成熟。我去年用过几个早期 AI 视频工具,生成的视频只有 4 秒、模糊、动作僵硬。那时候我写过一句话:"AI 视频离商用还有 5 年"。结果 2025 年下半年,可灵 2.0、海螺 02 都能稳定生成 10 秒、1080p、动作流畅的镜头,Sora 2 甚至能做到 60 秒长镜头带运镜——这个进展速度超出了我的预期。音乐这边,Suno v4、Udio 已经能生成 4 分钟完整歌曲,结构、编曲、人声都接近商用水准,我自己已经用它做了三首完整的歌。

2. 创作的瓶颈从"会不会用设备"变成了"会不会讲好故事"。我做了 10 年内容创作,深知"设备门槛"是普通创作者最大的拦路虎——PR、Final Cut、Logic Pro 这些专业工具的学习曲线,足以劝退 80% 的人。但当你有 AI 帮忙时,剪辑软件、混音插件、镜头语言——这些让 90% 的初学者放弃的障碍,AI 已经替你跨过去了。但"我要讲什么故事、为什么讲、观众听完/看完的核心感受是什么"——这些思考 AI 做不了,必须你来。我自己越来越确信:会讲故事 + AI 工具 = 比会专业软件的人强 10 倍

3. 个人创作的边际成本塌方式下降。我五年前给一家小公司做一条 30 秒的产品视频报价是 8000 块,要 3 个人、1 周时间。现在我一个人加 AI 工具,2 小时就能出来一条可发布的成片。这对个人创作者、自媒体、播客主、小公司营销意义巨大——你不再需要"等到攒够钱请团队"。我身边已经有一批全职博主完全靠 AI 工具链运转,年入百万的不在少数。

所以下次听到有人说"AI 视频都是糊的、AI 音乐都是塑料感",你可以告诉他:他大概率用错了工具或没有给对指令。AI 视频/音乐的真正玩法是"你领着 AI 一步步做,做到你要的样子",不是"丢一句话然后等奇迹"。我自己一年踩过的最大坑就是"期待一键出奇迹",后来才明白 AI 创作最像的是"和一位反应快但需要引导的实习生合作"——你越会引导它,作品越好。

二、AI 视频/音乐的边界:能做什么,不能做什么

在花时间动手之前,先把边界看清楚。我自己一年里最大的教训是:开始时把 AI 想得太强,最后交付时又觉得它太弱。中间这段调试预期,就是这一节要帮你的

AI 视频现在能做的事

  • 生成短视频片段:5-15 秒的高质量镜头,可用于 Vlog、产品展示、社媒内容
  • 图生视频:让一张静态照片"动起来"——人物眨眼、风景云动、水流动
  • 视频续写:给一段已有视频加后续镜头,保持画面风格一致
  • 风格化转绘:把真实视频转成动漫、油画、像素风等不同风格
  • 镜头扩展:把一段竖屏视频扩展成横屏(补全画面两侧内容)
  • 广告/口播镜头:生成数字人讲解、企业宣传片片段

AI 视频现在还做不到的事

  • 长片连贯性:超过 60 秒保持同一角色、同一场景不穿帮,目前还做不到
  • 精确运镜控制:你说"推镜+摇镜+跟拍"组合,AI 还理解不精确
  • 复杂多人对话:3 个人以上对话场景的精确口型同步
  • 真实物理交互:手抓东西、碰撞反弹、布料飘动等细节还容易穿帮
  • 替代专业剪辑:成片的节奏、转场、调色仍然需要人工精细调整

AI 音乐现在能做的事

  • 生成完整歌曲:输入歌词 + 风格描述,4 分钟成品可直接发布
  • 生成纯音乐 BGM:30 秒 - 5 分钟不同长度的背景音乐
  • 人声克隆与翻唱:用你自己的声音唱任意歌曲(注意版权)
  • 风格化改编:把一首民谣改成摇滚、爵士、电子
  • 歌曲续写:给一段已有旋律自动补充后续段落
  • 有声书配音:多角色、稳定人声的长音频生成

AI 音乐现在还做不到的事

  • 复杂编曲细节:10+ 乐器的精细编排,目前还比较模板化
  • 中文咬字精确度:偶尔有咬字不清(特别是方言、绕口令)
  • 细腻情感表达:极致的悲伤、狂喜等细腻情感还不到位
  • 替代真人顶级歌手:你能听出来"这是 AI 唱的",距离顶级真人还有差距
  • 完美混音:母带级别的混音还需要人工或专业工具

看清楚边界后,你会有一个合理预期:AI 视频/音乐能让你从"完全不会"变成"能做出可发布的内容",但不能让你一步登天变成专业导演或音乐制作人

三、7 大主流 AI 视频/音乐工具怎么选?

工具不是越多越好。下面是我自己用了一年多、帮朋友也试过一轮的真实对比。我自己先买的付费会员是可灵 Pro、海螺 Pro、Suno Pro——三套主力加起来一个月大概 ¥200 出头,已经能覆盖我 80% 的创作需求

AI 视频工具对比

工具上手难度视频质量中文支持价格适合谁
可灵(快手)免费额度 + 付费国内用户、短视频首选
海螺 AI(MiniMax)免费额度 + 付费国内用户、图生视频强
Runway Gen-4$12-76/月国外用户、专业创作者
Sora 2(OpenAI)极高ChatGPT Plus 订阅追求质量、可访问海外
Pika免费 + 付费快速试错、社交分享
剪映 AI免费 + 付费抖音创作者、配套剪辑

AI 音乐工具对比

工具上手难度音乐质量中文支持价格适合谁
Suno v4中(部分歌曲中文 OK)免费 + $10/月完整歌曲创作
Udio弱(英文为主)免费 + 付费英文歌曲、专业品质
海绵音乐(字节)免费国内用户、BGM
网易天音免费国内用户、风格化
Mureka中上$0.5-2/首半专业创作

我的选择建议

AI 视频

  • 完全新手 + 中文为主可灵。快手出品,中文 Prompt 友好,免费额度够用,是国内短视频创作者首选。
  • 想做图生视频(让照片动起来)海螺 AI。MiniMax 出品,图生视频效果在国内产品里排得上号。
  • 追求最高质量 + 能访问海外Sora 2。OpenAI 出品,目前质量天花板。
  • 专业创作者 + 海外发布Runway Gen-4。控制精细度最高。
  • 抖音创作者 + 配套剪辑剪映 AI。集成在剪映里,AI 生镜头+AI 剪辑一条龙。

AI 音乐

  • 完全新手 + 想出完整歌Suno。最易用、英文为主但支持中文。
  • 国内用户 + BGM 需求海绵音乐。字节出品,中文歌稳定。
  • 专业品质 + 英文歌曲Udio。音质天花板。

一个真实建议:AI 视频选 1 个主力 + AI 音乐选 1 个主力就够。我自己就是可灵 + 海螺 + Suno 三件套,做了 100 多个视频没崩过不要六个全开,搞得自己焦虑

更多工具细节对比,可以看 可灵入门教程Suno 入门教程AI 视频工具推荐可灵 vs 海螺 vs Runway 深度对比

四、5 段式 Prompt 模板(视频 + 音乐通用)

这是这一篇最值钱的章节。我把自己一年里用 AI 视频/音乐总结出的 5 段式 Prompt 模板写出来,任何一种都能直接抄作业我自己在 2024 年还不会写视频 Prompt,现在用它做了 100 多个镜头,准确率从 30% 提到 80%+——这段模板就是这个提升的核心。

视频 Prompt 5 段式结构

[主体] + [动作] + [场景] + [镜头语言] + [风格]

音乐 Prompt 5 段式结构

[风格] + [情绪] + [乐器] + [人声] + [结构]

视频 Prompt 实战示例

示例 1:一只橘猫在咖啡馆窗边喝咖啡的镜头

  1. 主体(必填):一只橘色短毛猫,戴着小小的圆框眼镜
  2. 动作(必填):用爪子捧着一杯冒着热气的咖啡,慢慢喝一口
  3. 场景(必填):温馨的木质咖啡馆窗边,窗外有雨滴
  4. 镜头语言(选填):特写镜头,从侧面缓慢推进
  5. 风格(选填):吉卜力动画风格,温暖色调,电影感

完整 Prompt:

一只橘色短毛猫戴着圆框眼镜,用爪子捧着一杯冒着热气的咖啡慢慢喝一口,在温馨的木质咖啡馆窗边,窗外有雨滴,特写镜头从侧面缓慢推进,吉卜力动画风格,温暖色调,电影感

音乐 Prompt 实战示例

示例 2:一段适合 Vlog 开场的轻快 BGM

  1. 风格(必填):Lo-fi 嘻哈、轻松
  2. 情绪(必填):慵懒、温暖、有活力
  3. 乐器(选填):钢琴主旋律、轻柔的鼓、贝斯
  4. 人声(选填):无人声,纯音乐
  5. 结构(选填):30 秒,前 8 秒纯钢琴进入,中段加鼓,后段回到钢琴淡出

完整 Prompt(Suno 风格):

Lo-fi hip-hop, relaxing, warm, energetic, piano melody, soft drums, bass, no vocals, 30 seconds, piano intro 8 seconds, add drums in middle section, fade out with piano

视频 Prompt 增强词清单

不管做什么内容,加上这些词能让效果更专业:

  • 质量类8K, ultra HD, highly detailed, cinematic, professional cinematography
  • 光线类golden hour lighting, soft natural light, dramatic shadows, neon glow
  • 构图类rule of thirds, leading lines, symmetrical composition, depth of field
  • 动态类smooth motion, dynamic camera movement, slow motion, time-lapse

音乐 Prompt 增强词清单

  • 质量类studio quality, professional mix, radio ready, mastered
  • 情绪类uplifting, melancholic, energetic, peaceful, nostalgic
  • 乐器类acoustic guitar, electric piano, 808 bass, orchestral strings
  • 结构类intro-verse-chorus-verse-chorus-bridge-outro, fade out, build-up

五、6 个真实场景实战

下面是我和朋友实际做过的 6 个项目,每个都有完整的"做了什么、用什么工具、效果如何"。你可以直接照搬。

场景 1:短视频脚本 → AI 视频片段

需求:抖音/视频号 30 秒口播视频,需要 3-4 个 AI 镜头配合。

工作流

  1. AI 写作工具 写脚本(150 字以内)
  2. 把脚本分成 3 段,每段对应一个镜头
  3. 每段镜头用 5 段式 Prompt 生成(主体/动作/场景/镜头/风格)
  4. 用可灵或海螺生成 5-10 秒视频片段
  5. 导入剪映拼接 + 加字幕 + 加背景音乐

示例(一个美食探店脚本):

镜头 1 Prompt:> 俯拍镜头,一家老北京胡同里的铜锅涮肉店,门口挂着红灯笼,蒸汽从锅里升起,写实摄影风格,温暖色调

镜头 2 Prompt:> 特写镜头,筷子夹起一片羊肉放进翻滚的铜锅汤里,蒸汽弥漫,慢动作,写实摄影风格

镜头 3 Prompt:> 中景,老板笑呵呵地端着一盘手切羊肉出来,木质桌面,暖色灯光,电影感构图

场景 2:Vlog 配乐自动生成

需求:5 分钟旅行 Vlog,需要 4-5 段不同情绪的 BGM。

工作流

  1. 列出每个场景的情绪(开场兴奋 → 路上平静 → 景点惊奇 → 美食满足 → 结尾放松)
  2. 每种情绪用 Suno/海绵音乐生成 30-60 秒 BGM
  3. 在剪映里分段替换原视频音乐
  4. 调音量、做淡入淡出

示例(旅行 Vlog BGM 列表):

时间段情绪Prompt 关键词
0:00-0:30兴奋upbeat indie pop, energetic, guitar, 30s
0:30-2:00平静ambient, peaceful, piano, 90s
2:00-3:30惊奇orchestral, building, cinematic, 90s
3:30-4:30满足warm acoustic, feel-good, ukulele, 60s
4:30-5:00放松lo-fi, fade out, gentle, 30s

场景 3:广告 BGM 30 秒

需求:给一个护肤品广告做 30 秒 BGM,需要高级感、女性化。

工作流

  1. 在 Suno 选择"Instrumental Only"
  2. 输入 Prompt:elegant, feminine, sophisticated, cinematic strings, soft piano, modern pop, 30 seconds, building intro to climax
  3. 跑 3-5 版,挑最合适的一版
  4. 微调(在 Suno 里直接 extend 加长或裁短)

场景 4:播客片头/片尾

需求:10 分钟播客,需要 15 秒片头 + 10 秒片尾。

工作流

  1. 片头:选一个辨识度高的 2-3 秒主旋律循环
  2. 片尾:旋律淡出版
  3. Suno 生成完整版 → 剪映裁剪

片头 Promptcatchy jingle, memorable, short piano motif, modern, professional, 15 seconds, loopable

片尾 Promptgentle fade out, soft piano, peaceful, 10 seconds, end of episode feel

场景 5:动画短片(1-2 分钟)

需求:给孩子做一个睡前故事动画短片。

工作流

  1. 写一个 200 字的故事脚本
  2. 把脚本拆成 8-10 个镜头(每镜头 5-10 秒)
  3. 每个镜头用 AI 视频工具生成
  4. 用 AI 音乐工具生成背景 BGM
  5. 剪映拼接 + 配音(可选 AI 配音)
  6. 1-2 小时完成完整短片

场景 6:原创歌曲(中文)

需求:给朋友婚礼做一首 3 分钟的原创歌。

工作流

  1. 写 200-300 字歌词(关于两人的故事)
  2. 在 Suno 输入歌词 + 风格("温馨流行、钢琴主旋律、温暖人声")
  3. Suno 生成完整歌曲
  4. 跑 3-5 版挑最满意的一版
  5. 后期:可以用 Udio 调整细节,或人工混音

Suno Prompt 模板

[歌词部分]
Verse 1: ...
Chorus: ...
Verse 2: ...
Outro: ...

[风格指令]
Style: warm pop, piano-driven, romantic, male or female vocals, 200 BPM, building arrangement

六、6 个新手最容易踩的坑

新手用 AI 视频/音乐最容易遇到 6 个问题,下面是我踩过的坑和解法:

坑 1:生成的视频人脸变形或穿帮

原因:AI 对人脸细节处理还不够稳定,特别是侧脸、转头、手部动作。 解法

  1. 用正面或 3/4 角度,避免大幅转头
  2. 让人物尽量少做大动作(走、跑、跳舞容易穿帮)
  3. 用图生视频(先找一张好的人脸照片,再让 AI 让它动)比文生视频稳定

坑 2:镜头风格不一致

原因:每个镜头是独立生成的,AI 不记得之前的镜头。 解法

  1. 锁定一个固定的风格词(每段 Prompt 都加 same style, consistent visual
  2. 用同一张参考图喂给每一段
  3. 在 Runway 里可以用"角色参考"功能

坑 3:AI 音乐歌词咬字不清

原因:中文 AI 音乐对复杂汉字发音还不够精确。 解法

  1. 歌词用常用字,避免生僻字、方言、网络词
  2. 每段不要太长(4-8 行为一段)
  3. 用 Suno 中文版(如果可用)或选择中文友好模型

坑 4:生成的视频没有"故事感"

原因:AI 默认给你"好看的镜头",但镜头之间没有叙事逻辑。 解法

  1. 自己写分镜脚本,每个镜头标明"为什么要这个镜头"
  2. 用景别变化(远→中→近→特)创造节奏
  3. 加入转场提示词:smooth transition, fade to black, cut to

坑 5:商用版权问题

原因:AI 生成内容的版权归属在不同国家有不同规定。 解法

  1. 商用前仔细看平台的 ToS(Suno/Udio 付费版商用 OK)
  2. 国内平台特别注意:部分平台禁止用 AI 生成商用
  3. 不要用 AI 翻唱/克隆名人声音 + 发到公开平台(侵权)
  4. 用自己写的歌词 + AI 编曲 = 通常安全

坑 6:陷入"无限跑版本"的陷阱

原因:AI 生成便宜,跑一版只要几秒,新手容易跑 50 版然后不知道选哪个。 解法

  1. 每段最多跑 4-5 版就做决定
  2. 设定明确的选择标准(构图好 + 主题清晰 = 选)
  3. 时间盒(这个镜头我最多花 10 分钟)

七、我的日常工作流模板

最后分享一个我日常用 AI 视频/音乐的 5 步流程,新手可以直接照搬。这套流程我自己用了 1 年,平均每个项目 30-60 分钟完成——这就是 AI 工具链带来的提速。

步骤 1:明确创作意图(5 分钟)
  - 这条视频/歌曲给谁看?
  - 核心情绪是什么?
  - 商业用途还是个人?
  - 时长多少?

步骤 2:选工具(2 分钟)
  - 国内短视频 → 可灵 + 剪映 + 海绵音乐
  - 高质量创作 → Sora 2 + Suno
  - 快速试错 → Pika + Suno

步骤 3:写 Prompt(5 分钟)
  - 视频用 5 段式(主体/动作/场景/镜头/风格)
  - 音乐用 5 段式(风格/情绪/乐器/人声/结构)
  - 加 3 个增强词
  - 设定时长参数

步骤 4:批量生成 + 挑选(10-15 分钟)
  - 每段跑 4-5 版
  - 挑最满意的 1-2 个
  - 微调 Prompt 再跑 1-2 轮(不要超过 3 轮)

步骤 5:后期处理(10-30 分钟)
  - 视频:剪映拼接、调色、加字幕、加 BGM
  - 音乐:用 Suno Extend 调整结构 / 用专业工具混音
  - 检查清晰度、节奏、情绪是否到位

我自己的真实效率:5 分钟可以出 1 段 AI 视频片段(不含脚本);30 分钟可以出一首完整 AI 歌曲;1-2 小时可以出一条完整的 30 秒短视频成片。

八、我的建议

如果你刚入门,我会这样建议:

1. 第一周只做一个项目:选一个最简单的场景(比如给自己的 Vlog 配 30 秒 BGM),完整跑一遍流程。

2. 第二个项目开始加复杂度:从纯音乐 → 加视频片段 → 加字幕 → 加剪辑。

3. 三个月后建立自己的工作流:你会发现自己最顺手的工具组合(比如我就是可灵+海绵音乐+剪映),不要每个项目都试新工具。

4. 把 AI 当队友不当替代:你负责想清楚"做什么、为什么做",AI 负责"怎么做出来"。这中间的边界感是 AI 时代最重要的能力。

5. 版权意识从第一天就有:用 AI 创作出来的内容默认视为商用前要审查,养成习惯能避免 99% 的麻烦。

最后一句话总结这一篇:AI 视频/音乐不是魔法,是工具。你用它做的每一个项目,都应该问自己"这解决了什么问题、给谁看、为什么用 AI 做"。想清楚这三个问题,AI 才能真正帮你放大你的创作能力。

下一周是这个系列的最后一篇——从零开始学AI(七):AI效率提升指南,我会讲 10 个能让日常工作翻倍的 AI 技巧,把前面六篇的工具串成完整工作流。关注这个系列,把它当作你进入 AI 时代的入门地图

系列回顾:Day 1 AI 是什么Day 2 Prompt 工程Day 3 AI 写作Day 4 AI 绘画Day 5 AI 编程Day 6 AI 视频/音乐(你在这里) → Day 7 AI 效率提升(7/15 发布)