这是我"从零开始学AI"系列教程的第六篇。前五篇我们聊了 AI 是什么、Prompt 工程怎么入门、AI 写作怎么落地、AI 绘画怎么出作品、AI 编程怎么做项目。这一篇讲一件很多人以为"门槛高、要专业设备"的事——AI 视频和音乐创作。
我必须先说一个事实:AI 视频和音乐在 2026 年已经走过了"玩具阶段",进入了"能用来干活"的阶段。这一年我用可灵、海螺、Runway 帮自媒体朋友做了 100 多条短视频的镜头素材;用 Suno、海绵音乐给三个播客客户做了完整的片头片尾 BGM;最让我意外的是,一个完全不会剪辑的朋友用这套工具链做出了抖音爆款。我自己最大的感受是:这一年我的创作节奏完全变了。过去一年我没买过一首商用音乐,剪过的每一条视频都用过 AI 镜头——这不是因为 AI 比人做得更好,而是它足够快、足够便宜、足够能迭代到"我要的样子"。
这一篇我会用最接地气的方式讲清楚五件事:AI 视频/音乐现在能做什么、选哪个工具、怎么用 Prompt 让 AI 帮你生成内容、6 个最容易踩的坑、以及 6 个可以立刻动手做的小项目。读完后,你应该能用一个周末,做出第一条"能用的 AI 短视频"或第一首"能听的 AI 原创歌"。
系列说明:这是"从零开始学AI"系列第 6 篇,共 7 篇。每篇都能独立阅读,按顺序读会形成完整知识链。本篇承接上一篇 从零开始学AI(五):AI编程实战手册。下一篇 从零开始学AI(七):AI效率提升指南 会在 7/15 发布,是整个系列的收官之作。
一、先说结论:AI 视频/音乐不是"一键生成爆款"
如果说 AI 写作最大的误区是把它当"代笔",AI 编程最大的误区是把它当"代写代码的程序员",那 AI 视频/音乐最大的误区就是把它当"一键生成爆款的魔法按钮"——你输入一句话,AI 给你一个完整大片。
AI 视频/音乐真正高效的用法,是"你当导演+作曲家,AI 当摄影+配乐团队"。你负责想清楚"要讲什么故事、画面节奏怎样、情绪怎么走",AI 负责把每一帧画面、每一段音符生成出来。中间的鸿沟靠两件事填:清晰的创作意图 + 一遍遍的迭代优化。
这背后有三个根本性变化:
1. 多模态能力成熟。我去年用过几个早期 AI 视频工具,生成的视频只有 4 秒、模糊、动作僵硬。那时候我写过一句话:"AI 视频离商用还有 5 年"。结果 2025 年下半年,可灵 2.0、海螺 02 都能稳定生成 10 秒、1080p、动作流畅的镜头,Sora 2 甚至能做到 60 秒长镜头带运镜——这个进展速度超出了我的预期。音乐这边,Suno v4、Udio 已经能生成 4 分钟完整歌曲,结构、编曲、人声都接近商用水准,我自己已经用它做了三首完整的歌。
2. 创作的瓶颈从"会不会用设备"变成了"会不会讲好故事"。我做了 10 年内容创作,深知"设备门槛"是普通创作者最大的拦路虎——PR、Final Cut、Logic Pro 这些专业工具的学习曲线,足以劝退 80% 的人。但当你有 AI 帮忙时,剪辑软件、混音插件、镜头语言——这些让 90% 的初学者放弃的障碍,AI 已经替你跨过去了。但"我要讲什么故事、为什么讲、观众听完/看完的核心感受是什么"——这些思考 AI 做不了,必须你来。我自己越来越确信:会讲故事 + AI 工具 = 比会专业软件的人强 10 倍。
3. 个人创作的边际成本塌方式下降。我五年前给一家小公司做一条 30 秒的产品视频报价是 8000 块,要 3 个人、1 周时间。现在我一个人加 AI 工具,2 小时就能出来一条可发布的成片。这对个人创作者、自媒体、播客主、小公司营销意义巨大——你不再需要"等到攒够钱请团队"。我身边已经有一批全职博主完全靠 AI 工具链运转,年入百万的不在少数。
所以下次听到有人说"AI 视频都是糊的、AI 音乐都是塑料感",你可以告诉他:他大概率用错了工具或没有给对指令。AI 视频/音乐的真正玩法是"你领着 AI 一步步做,做到你要的样子",不是"丢一句话然后等奇迹"。我自己一年踩过的最大坑就是"期待一键出奇迹",后来才明白 AI 创作最像的是"和一位反应快但需要引导的实习生合作"——你越会引导它,作品越好。
二、AI 视频/音乐的边界:能做什么,不能做什么
在花时间动手之前,先把边界看清楚。我自己一年里最大的教训是:开始时把 AI 想得太强,最后交付时又觉得它太弱。中间这段调试预期,就是这一节要帮你的。
AI 视频现在能做的事
- 生成短视频片段:5-15 秒的高质量镜头,可用于 Vlog、产品展示、社媒内容
- 图生视频:让一张静态照片"动起来"——人物眨眼、风景云动、水流动
- 视频续写:给一段已有视频加后续镜头,保持画面风格一致
- 风格化转绘:把真实视频转成动漫、油画、像素风等不同风格
- 镜头扩展:把一段竖屏视频扩展成横屏(补全画面两侧内容)
- 广告/口播镜头:生成数字人讲解、企业宣传片片段
AI 视频现在还做不到的事
- 长片连贯性:超过 60 秒保持同一角色、同一场景不穿帮,目前还做不到
- 精确运镜控制:你说"推镜+摇镜+跟拍"组合,AI 还理解不精确
- 复杂多人对话:3 个人以上对话场景的精确口型同步
- 真实物理交互:手抓东西、碰撞反弹、布料飘动等细节还容易穿帮
- 替代专业剪辑:成片的节奏、转场、调色仍然需要人工精细调整
AI 音乐现在能做的事
- 生成完整歌曲:输入歌词 + 风格描述,4 分钟成品可直接发布
- 生成纯音乐 BGM:30 秒 - 5 分钟不同长度的背景音乐
- 人声克隆与翻唱:用你自己的声音唱任意歌曲(注意版权)
- 风格化改编:把一首民谣改成摇滚、爵士、电子
- 歌曲续写:给一段已有旋律自动补充后续段落
- 有声书配音:多角色、稳定人声的长音频生成
AI 音乐现在还做不到的事
- 复杂编曲细节:10+ 乐器的精细编排,目前还比较模板化
- 中文咬字精确度:偶尔有咬字不清(特别是方言、绕口令)
- 细腻情感表达:极致的悲伤、狂喜等细腻情感还不到位
- 替代真人顶级歌手:你能听出来"这是 AI 唱的",距离顶级真人还有差距
- 完美混音:母带级别的混音还需要人工或专业工具
看清楚边界后,你会有一个合理预期:AI 视频/音乐能让你从"完全不会"变成"能做出可发布的内容",但不能让你一步登天变成专业导演或音乐制作人。
三、7 大主流 AI 视频/音乐工具怎么选?
工具不是越多越好。下面是我自己用了一年多、帮朋友也试过一轮的真实对比。我自己先买的付费会员是可灵 Pro、海螺 Pro、Suno Pro——三套主力加起来一个月大概 ¥200 出头,已经能覆盖我 80% 的创作需求。
AI 视频工具对比
| 工具 | 上手难度 | 视频质量 | 中文支持 | 价格 | 适合谁 |
|---|---|---|---|---|---|
| 可灵(快手) | 低 | 高 | 强 | 免费额度 + 付费 | 国内用户、短视频首选 |
| 海螺 AI(MiniMax) | 低 | 高 | 强 | 免费额度 + 付费 | 国内用户、图生视频强 |
| Runway Gen-4 | 中 | 高 | 弱 | $12-76/月 | 国外用户、专业创作者 |
| Sora 2(OpenAI) | 中 | 极高 | 中 | ChatGPT Plus 订阅 | 追求质量、可访问海外 |
| Pika | 低 | 中 | 中 | 免费 + 付费 | 快速试错、社交分享 |
| 剪映 AI | 低 | 中 | 强 | 免费 + 付费 | 抖音创作者、配套剪辑 |
AI 音乐工具对比
| 工具 | 上手难度 | 音乐质量 | 中文支持 | 价格 | 适合谁 |
|---|---|---|---|---|---|
| Suno v4 | 低 | 高 | 中(部分歌曲中文 OK) | 免费 + $10/月 | 完整歌曲创作 |
| Udio | 低 | 高 | 弱(英文为主) | 免费 + 付费 | 英文歌曲、专业品质 |
| 海绵音乐(字节) | 低 | 中 | 强 | 免费 | 国内用户、BGM |
| 网易天音 | 低 | 中 | 强 | 免费 | 国内用户、风格化 |
| Mureka | 中 | 中上 | 中 | $0.5-2/首 | 半专业创作 |
我的选择建议
AI 视频:
- 完全新手 + 中文为主 → 可灵。快手出品,中文 Prompt 友好,免费额度够用,是国内短视频创作者首选。
- 想做图生视频(让照片动起来) → 海螺 AI。MiniMax 出品,图生视频效果在国内产品里排得上号。
- 追求最高质量 + 能访问海外 → Sora 2。OpenAI 出品,目前质量天花板。
- 专业创作者 + 海外发布 → Runway Gen-4。控制精细度最高。
- 抖音创作者 + 配套剪辑 → 剪映 AI。集成在剪映里,AI 生镜头+AI 剪辑一条龙。
AI 音乐:
- 完全新手 + 想出完整歌 → Suno。最易用、英文为主但支持中文。
- 国内用户 + BGM 需求 → 海绵音乐。字节出品,中文歌稳定。
- 专业品质 + 英文歌曲 → Udio。音质天花板。
一个真实建议:AI 视频选 1 个主力 + AI 音乐选 1 个主力就够。我自己就是可灵 + 海螺 + Suno 三件套,做了 100 多个视频没崩过。不要六个全开,搞得自己焦虑。
更多工具细节对比,可以看 可灵入门教程、Suno 入门教程、AI 视频工具推荐、可灵 vs 海螺 vs Runway 深度对比。
四、5 段式 Prompt 模板(视频 + 音乐通用)
这是这一篇最值钱的章节。我把自己一年里用 AI 视频/音乐总结出的 5 段式 Prompt 模板写出来,任何一种都能直接抄作业。我自己在 2024 年还不会写视频 Prompt,现在用它做了 100 多个镜头,准确率从 30% 提到 80%+——这段模板就是这个提升的核心。
视频 Prompt 5 段式结构
[主体] + [动作] + [场景] + [镜头语言] + [风格]
音乐 Prompt 5 段式结构
[风格] + [情绪] + [乐器] + [人声] + [结构]
视频 Prompt 实战示例
示例 1:一只橘猫在咖啡馆窗边喝咖啡的镜头
- 主体(必填):一只橘色短毛猫,戴着小小的圆框眼镜
- 动作(必填):用爪子捧着一杯冒着热气的咖啡,慢慢喝一口
- 场景(必填):温馨的木质咖啡馆窗边,窗外有雨滴
- 镜头语言(选填):特写镜头,从侧面缓慢推进
- 风格(选填):吉卜力动画风格,温暖色调,电影感
完整 Prompt:
一只橘色短毛猫戴着圆框眼镜,用爪子捧着一杯冒着热气的咖啡慢慢喝一口,在温馨的木质咖啡馆窗边,窗外有雨滴,特写镜头从侧面缓慢推进,吉卜力动画风格,温暖色调,电影感
音乐 Prompt 实战示例
示例 2:一段适合 Vlog 开场的轻快 BGM
- 风格(必填):Lo-fi 嘻哈、轻松
- 情绪(必填):慵懒、温暖、有活力
- 乐器(选填):钢琴主旋律、轻柔的鼓、贝斯
- 人声(选填):无人声,纯音乐
- 结构(选填):30 秒,前 8 秒纯钢琴进入,中段加鼓,后段回到钢琴淡出
完整 Prompt(Suno 风格):
Lo-fi hip-hop, relaxing, warm, energetic, piano melody, soft drums, bass, no vocals, 30 seconds, piano intro 8 seconds, add drums in middle section, fade out with piano
视频 Prompt 增强词清单
不管做什么内容,加上这些词能让效果更专业:
- 质量类:
8K, ultra HD, highly detailed, cinematic, professional cinematography - 光线类:
golden hour lighting, soft natural light, dramatic shadows, neon glow - 构图类:
rule of thirds, leading lines, symmetrical composition, depth of field - 动态类:
smooth motion, dynamic camera movement, slow motion, time-lapse
音乐 Prompt 增强词清单
- 质量类:
studio quality, professional mix, radio ready, mastered - 情绪类:
uplifting, melancholic, energetic, peaceful, nostalgic - 乐器类:
acoustic guitar, electric piano, 808 bass, orchestral strings - 结构类:
intro-verse-chorus-verse-chorus-bridge-outro, fade out, build-up
五、6 个真实场景实战
下面是我和朋友实际做过的 6 个项目,每个都有完整的"做了什么、用什么工具、效果如何"。你可以直接照搬。
场景 1:短视频脚本 → AI 视频片段
需求:抖音/视频号 30 秒口播视频,需要 3-4 个 AI 镜头配合。
工作流:
- 用 AI 写作工具 写脚本(150 字以内)
- 把脚本分成 3 段,每段对应一个镜头
- 每段镜头用 5 段式 Prompt 生成(主体/动作/场景/镜头/风格)
- 用可灵或海螺生成 5-10 秒视频片段
- 导入剪映拼接 + 加字幕 + 加背景音乐
示例(一个美食探店脚本):
镜头 1 Prompt:> 俯拍镜头,一家老北京胡同里的铜锅涮肉店,门口挂着红灯笼,蒸汽从锅里升起,写实摄影风格,温暖色调
镜头 2 Prompt:> 特写镜头,筷子夹起一片羊肉放进翻滚的铜锅汤里,蒸汽弥漫,慢动作,写实摄影风格
镜头 3 Prompt:> 中景,老板笑呵呵地端着一盘手切羊肉出来,木质桌面,暖色灯光,电影感构图
场景 2:Vlog 配乐自动生成
需求:5 分钟旅行 Vlog,需要 4-5 段不同情绪的 BGM。
工作流:
- 列出每个场景的情绪(开场兴奋 → 路上平静 → 景点惊奇 → 美食满足 → 结尾放松)
- 每种情绪用 Suno/海绵音乐生成 30-60 秒 BGM
- 在剪映里分段替换原视频音乐
- 调音量、做淡入淡出
示例(旅行 Vlog BGM 列表):
| 时间段 | 情绪 | Prompt 关键词 |
|---|---|---|
| 0:00-0:30 | 兴奋 | upbeat indie pop, energetic, guitar, 30s |
| 0:30-2:00 | 平静 | ambient, peaceful, piano, 90s |
| 2:00-3:30 | 惊奇 | orchestral, building, cinematic, 90s |
| 3:30-4:30 | 满足 | warm acoustic, feel-good, ukulele, 60s |
| 4:30-5:00 | 放松 | lo-fi, fade out, gentle, 30s |
场景 3:广告 BGM 30 秒
需求:给一个护肤品广告做 30 秒 BGM,需要高级感、女性化。
工作流:
- 在 Suno 选择"Instrumental Only"
- 输入 Prompt:
elegant, feminine, sophisticated, cinematic strings, soft piano, modern pop, 30 seconds, building intro to climax - 跑 3-5 版,挑最合适的一版
- 微调(在 Suno 里直接 extend 加长或裁短)
场景 4:播客片头/片尾
需求:10 分钟播客,需要 15 秒片头 + 10 秒片尾。
工作流:
- 片头:选一个辨识度高的 2-3 秒主旋律循环
- 片尾:旋律淡出版
- Suno 生成完整版 → 剪映裁剪
片头 Prompt:catchy jingle, memorable, short piano motif, modern, professional, 15 seconds, loopable
片尾 Prompt:gentle fade out, soft piano, peaceful, 10 seconds, end of episode feel
场景 5:动画短片(1-2 分钟)
需求:给孩子做一个睡前故事动画短片。
工作流:
- 写一个 200 字的故事脚本
- 把脚本拆成 8-10 个镜头(每镜头 5-10 秒)
- 每个镜头用 AI 视频工具生成
- 用 AI 音乐工具生成背景 BGM
- 剪映拼接 + 配音(可选 AI 配音)
- 1-2 小时完成完整短片
场景 6:原创歌曲(中文)
需求:给朋友婚礼做一首 3 分钟的原创歌。
工作流:
- 写 200-300 字歌词(关于两人的故事)
- 在 Suno 输入歌词 + 风格("温馨流行、钢琴主旋律、温暖人声")
- Suno 生成完整歌曲
- 跑 3-5 版挑最满意的一版
- 后期:可以用 Udio 调整细节,或人工混音
Suno Prompt 模板:
[歌词部分]
Verse 1: ...
Chorus: ...
Verse 2: ...
Outro: ...
[风格指令]
Style: warm pop, piano-driven, romantic, male or female vocals, 200 BPM, building arrangement
六、6 个新手最容易踩的坑
新手用 AI 视频/音乐最容易遇到 6 个问题,下面是我踩过的坑和解法:
坑 1:生成的视频人脸变形或穿帮
原因:AI 对人脸细节处理还不够稳定,特别是侧脸、转头、手部动作。 解法:
- 用正面或 3/4 角度,避免大幅转头
- 让人物尽量少做大动作(走、跑、跳舞容易穿帮)
- 用图生视频(先找一张好的人脸照片,再让 AI 让它动)比文生视频稳定
坑 2:镜头风格不一致
原因:每个镜头是独立生成的,AI 不记得之前的镜头。 解法:
- 锁定一个固定的风格词(每段 Prompt 都加
same style, consistent visual) - 用同一张参考图喂给每一段
- 在 Runway 里可以用"角色参考"功能
坑 3:AI 音乐歌词咬字不清
原因:中文 AI 音乐对复杂汉字发音还不够精确。 解法:
- 歌词用常用字,避免生僻字、方言、网络词
- 每段不要太长(4-8 行为一段)
- 用 Suno 中文版(如果可用)或选择中文友好模型
坑 4:生成的视频没有"故事感"
原因:AI 默认给你"好看的镜头",但镜头之间没有叙事逻辑。 解法:
- 自己写分镜脚本,每个镜头标明"为什么要这个镜头"
- 用景别变化(远→中→近→特)创造节奏
- 加入转场提示词:
smooth transition, fade to black, cut to
坑 5:商用版权问题
原因:AI 生成内容的版权归属在不同国家有不同规定。 解法:
- 商用前仔细看平台的 ToS(Suno/Udio 付费版商用 OK)
- 国内平台特别注意:部分平台禁止用 AI 生成商用
- 不要用 AI 翻唱/克隆名人声音 + 发到公开平台(侵权)
- 用自己写的歌词 + AI 编曲 = 通常安全
坑 6:陷入"无限跑版本"的陷阱
原因:AI 生成便宜,跑一版只要几秒,新手容易跑 50 版然后不知道选哪个。 解法:
- 每段最多跑 4-5 版就做决定
- 设定明确的选择标准(构图好 + 主题清晰 = 选)
- 时间盒(这个镜头我最多花 10 分钟)
七、我的日常工作流模板
最后分享一个我日常用 AI 视频/音乐的 5 步流程,新手可以直接照搬。这套流程我自己用了 1 年,平均每个项目 30-60 分钟完成——这就是 AI 工具链带来的提速。
步骤 1:明确创作意图(5 分钟)
- 这条视频/歌曲给谁看?
- 核心情绪是什么?
- 商业用途还是个人?
- 时长多少?
步骤 2:选工具(2 分钟)
- 国内短视频 → 可灵 + 剪映 + 海绵音乐
- 高质量创作 → Sora 2 + Suno
- 快速试错 → Pika + Suno
步骤 3:写 Prompt(5 分钟)
- 视频用 5 段式(主体/动作/场景/镜头/风格)
- 音乐用 5 段式(风格/情绪/乐器/人声/结构)
- 加 3 个增强词
- 设定时长参数
步骤 4:批量生成 + 挑选(10-15 分钟)
- 每段跑 4-5 版
- 挑最满意的 1-2 个
- 微调 Prompt 再跑 1-2 轮(不要超过 3 轮)
步骤 5:后期处理(10-30 分钟)
- 视频:剪映拼接、调色、加字幕、加 BGM
- 音乐:用 Suno Extend 调整结构 / 用专业工具混音
- 检查清晰度、节奏、情绪是否到位
我自己的真实效率:5 分钟可以出 1 段 AI 视频片段(不含脚本);30 分钟可以出一首完整 AI 歌曲;1-2 小时可以出一条完整的 30 秒短视频成片。
八、我的建议
如果你刚入门,我会这样建议:
1. 第一周只做一个项目:选一个最简单的场景(比如给自己的 Vlog 配 30 秒 BGM),完整跑一遍流程。
2. 第二个项目开始加复杂度:从纯音乐 → 加视频片段 → 加字幕 → 加剪辑。
3. 三个月后建立自己的工作流:你会发现自己最顺手的工具组合(比如我就是可灵+海绵音乐+剪映),不要每个项目都试新工具。
4. 把 AI 当队友不当替代:你负责想清楚"做什么、为什么做",AI 负责"怎么做出来"。这中间的边界感是 AI 时代最重要的能力。
5. 版权意识从第一天就有:用 AI 创作出来的内容默认视为商用前要审查,养成习惯能避免 99% 的麻烦。
最后一句话总结这一篇:AI 视频/音乐不是魔法,是工具。你用它做的每一个项目,都应该问自己"这解决了什么问题、给谁看、为什么用 AI 做"。想清楚这三个问题,AI 才能真正帮你放大你的创作能力。
下一周是这个系列的最后一篇——从零开始学AI(七):AI效率提升指南,我会讲 10 个能让日常工作翻倍的 AI 技巧,把前面六篇的工具串成完整工作流。关注这个系列,把它当作你进入 AI 时代的入门地图。
系列回顾:Day 1 AI 是什么 → Day 2 Prompt 工程 → Day 3 AI 写作 → Day 4 AI 绘画 → Day 5 AI 编程 → Day 6 AI 视频/音乐(你在这里) → Day 7 AI 效率提升(7/15 发布)