AI 短片提示词方法论:从零做出被好莱坞导演认可的 AI 视频
拆解《丧尸清道夫》作者 Mx-Shell 的 5 段式提示词框架,教你用结构化思维写出能让 AI 生成高质量短片的提示词。含完整工具链、前置条件和最低启动方案。
项目地址:https://github.com/jnMetaCode/ai-shortfilm-prompts | MIT 开源协议 | ⭐ 92 Stars
背景:一条让好莱坞导演炸了的 AI 短片
2026 年 5 月,云南玉溪的 Mx-Shell(29 岁,中专学历,摄影副业)用约 10 天做出 3 分钟 AI 短片《丧尸清道夫》——原子朋克机器人在末日丧尸危机后的海边别墅,和一只呆鸵鸟跳 1980 年代风格的霹雳舞,顺便踢飞丧尸头颅。
好莱坞导演 PJ Ace 在推特上盛赞:"这是我近年来看过最好的短片之一。很快,我们将不再称其为'AI 电影',而直接称其为电影。"
这条推文拿到 1340 万浏览、82K 点赞、7.4K 转发。
Mx-Shell 事后在粉丝群分享了提示词文档,又在抖音直播完整讲解了他的方法论。ai-shortfilm-prompts 仓库就是对这些原始材料的结构化整理——不是教你复刻这部片子,而是教你写出能做出自己作品的提示词。
核心框架:5 段式提示词结构
这套框架的底层思想只有一句话:像写分镜脚本一样写提示词,而不是像写文学描述。
把场景按时间切片,每一秒分别交代「动作 / 镜头 / 特效 / 声音」这四件事。所有 Mx-Shell 的视频提示词都遵循同 5 段骨架,顺序不能乱:
段 1 · 核心主题
一行风格标签,用 | 分隔。给 AI 一个总体审美锚点,3-6 个标签,从画面类型到题材到美学风格层层递进。
核心主题:原子朋克 | 末日丧尸 | 电影级质感 | 超写实 | 杜绝游戏 CG 感
标签可以这样选:
| 类型 | 举例 |
|---|---|
| 真实感锚点 | 电影级质感、超写实、真人实景拍摄、变形宽荧幕电影质感 |
| 美学定调 | 暗黑写实、原子朋克、蒸汽朋克、赛博朋克、废土工业 |
| 题材 | 特摄剧、末日生存、孤胆英雄、机械武侠、重型机甲 |
| 情绪 | 破碎肉身、战损变身、肃杀、磅礴史诗、压抑沉重 |
段 2 · 人物与基础设定
三行交代:面部 / 服装 / 场景。
【人物与基础设定】
面部:五官、脸型百分百还原,保留轻微面部瑕疵,表情全程阴郁。
服装:哑光黑色皮质长风衣,金属腰带为哑光质地,腰带核心为暗红色水晶。
场景:末日战场,微风,硝烟弥漫,阴天荒野,灰蓝色调天空。天空中划过带有火焰与浓烟的陨石。
Mx-Shell 反复强调的要点:
- "杜绝美化" — 真实感来自瑕疵,明确写"保留轻微面部瑕疵"比模糊说"高质量"管用得多
- 服装写质地 — "哑光黑色皮质"比"黑色皮衣"信息量大三倍
- 场景写动态环境 — 微风、硝烟、陨石,静态背景出不了氛围
段 3 · 氛围与画质
模拟「真实摄影机 + 镜头」的写法。这一段是 Mx-Shell 最核心的技巧。
【氛围与画质】
视觉基调:变形宽荧幕电影质感。模拟 IMAX 胶片摄影机,
搭配 Panavision C 系列镜头(焦段 35mm,光圈 f4)。
色彩与影调:低饱和灰蓝主调。暗部信息压缩,保留细节。
边缘添加轻微柔焦与适度的胶片颗粒感。
为什么有效:AI 训练数据里大量电影摄影描述都和真实摄影机型号绑定。"IMAX + Panavision C 35mm f4"对应一组具体的视觉风格样本;"电影感"三个字对应几千种风格,锚不住。具体摄影机型号 = 明确的视觉风格锚点。
Mx-Shell 常用的摄影机组合:
| 风格 | 摄影机 + 镜头 |
|---|---|
| 史诗感 / 大场面 | IMAX 胶片 + Panavision C 系列(35mm,f4) |
| 暗调赛博 / 写实硬核 | 索尼威尼斯电影机 + 佳能 K-35 系列 |
| 港片 / 武侠 | 柯达 35mm 复古胶片,跳过漂白胶片质感 |
| 商业人像 | Canon EF 85mm f/1.2 |
段 4 · 运镜规则
三行定义镜头怎么动:单镜头 / 角度 / 呼吸感。
【运镜规则】
单镜头:一镜到底,无剪辑。
角度:开场仰拍,人物半身左侧面 30 度,聚焦腰部以上部位。
呼吸感:手持拍摄,全程保持极其轻微的、如呼吸般的镜头浮动,增强临场感。
"呼吸感"这一行 —— Mx-Shell 几乎每个视频都写。原因:让 AI 加入轻微抖动,避免出 CG 感僵直镜头。
描述镜头运动时可以挑的概念词:
- 景别:极近距离特写 / 特写 / 近景 / 中景 / 全景 / 大全景
- 角度:仰拍 / 俯拍 / 平视 / 过肩镜头 / 高空垂直俯拍
- 运动:极缓向前推进 / 环绕 / 跟随运动拍摄 / 固定机位 / FPV 模式
- 节奏:极缓 / 匀速 / 突然 / 应激性 0.1 秒微颤
段 5 · 分镜时间轴
整套方法论最关键、也最容易被忽略的部分。按秒切片,每一段拆成「动作 + 镜头 + 特效」三件套,加可选的「声音」「面部」等子项。
0-3秒 · 凝视
动作:主角略微低头,目光锁定腰带,脊背紧绷。右手缓慢抬起。
镜头:极缓向前推进,捕捉身体因呼吸产生的微幅起伏。
特效:整颗眼球骤然亮起白金色光芒,眼眶周围皲裂。
3-6秒 · 启动
声音:低语:「HENSHIN」。
动作:手掌用力按压腰带核心,水晶核心本体被挤压而开裂。
镜头:镜头随低频嗡鸣产生应激性的 0.1 秒微颤。
6-9秒 · 撤裂
[再按需细分:核心 / 身体 / 衣物 / 甲壳 / 面部 / 镜头]
这套方法到底改了什么
同一个想法:女机甲战士在暴雨雷暴中开启能量护盾。
大多数人写的:
史诗级电影感镜头,一个漂亮的女机甲战士在雨中开启震撼的能量护盾。
高细节,4K,照片级真实,电影质感,戏剧化灯光。
"史诗 / 震撼 / 4K / 电影质感"这种空泛词,AI 抓不到任何具体锚点。
用 5 段式写法(节选):
核心主题:写实硬核机甲 | 雷雨码头 | 战损美学 | 能量护盾 | 末日真人演绎
氛围画质:模拟 IMAX 胶片摄影机 + Panavision C 系列(35mm,f/4)。
运镜:手持,全程极其轻微、如呼吸般的浮动。
9-12秒:六边形能量单元逐格亮起,部分如故障般闪烁;雨水沿 2 米伞状能量场绕开。
结尾:没有台词、没有炫光 —— 只有雨水打在护盾上汽化,远处一道闪电照亮码头。
真实摄影机型号 + 物理反馈 + 战损细节 + 留白结尾 = 那种"真"的质感。
对人的启发 vs 对 AI 的加持
对 AI 的加持:立竿见影
框架里的几乎每个技巧,都在针对 AI 视频生成的弱点打补丁:
| AI 的弱点 | 框架的对策 |
|---|---|
| 形容词锚不住风格 | 用具体摄影机型号替代"电影感" |
| 生成画面像游戏 CG | 写"杜绝游戏 CG 感" + 胶片颗粒 + 暗部压缩 |
| 镜头僵直不动 | 每条都加"呼吸感"轻抖动 |
| 不知道哪一秒该画什么 | 按秒切片,每段明确动作+镜头+特效 |
| 默认美化人脸 | 明确写"保留瑕疵""拒绝美化" |
这些技巧一用,生成质量确实能跳一个台阶。本质上是在做提示词工程——针对特定模型的能力边界做优化。
对人的启发:润物无声
一个认真用这套框架写过 3-5 条提示词的人,脑子里会发生变化:
- 学会了用导演/摄影的视角想问题。 不再是"我想做一个酷炫的东西",而是"第一秒我需要一个低角度仰拍"——这是实打实的影视语言。
- 建立了「物理细节 > 情绪形容词」的直觉。 这个习惯对所有创意表达都有用——写剧本、做分镜、给人讲一个画面感强的故事。
- 理解了「约束激发创意」。 5 段式看起来是限制,但正是这些限制逼你把模糊灵感打磨成可执行方案。
框架的「术」层面(具体技巧、措辞、摄影机型号选择)主要是给 AI 的加持——换个模型可能就不灵了。
框架的「道」层面(结构化思维、分镜意识、物理化描述)主要是给人的启发——不依赖任何特定工具,是创作者自己的底层能力升级。
Mx-Shell 本人的话已经点透了:
"对于创作来说,设备不是重要的。想法才是最重要的。"
普通人如何上手:完整链路
完整工作流
写提示词 → 生成图像(可选)→ 生成视频 → 剪辑拼接 → 加配乐 → 成片
第一步:写提示词(文本工作,零成本)
- 读完仓库的
methodology.md,理解 5 段式结构 - 脑子里先有一个具体的画面——不用完整故事,一个场景就够
- 按 5 段式把画面翻译成提示词
可以先用仓库里 templates/ 目录的骨架填自己的设定,不用从零开始:
| 模板 | 用途 |
|---|---|
15s-transformation.md | 15 秒变身类短片 |
multi-shot-narrative.md | 多分镜叙事 |
atmosphere-prefabs.md | 8 个可复用的氛围/画质骨架 |
关键心法:别写"史诗级战斗场面",写"3 秒内,右臂金属甲片沿裂缝逐片弹开,露出下面充血的皮肤组织,镜头从肘部特写缓慢推向肩部"。
第二步:生成视频素材
需要一个 AI 视频生成工具:
| 工具 | 特点 | 费用 | 备注 |
|---|---|---|---|
| Seedance 2.0(小云雀内) | Mx-Shell 主力工具,效果最稳定 | 需要小云雀账号 | 不用 Fast 版,效果差距大 |
| 可灵(Kling) | 国内可直用,效果不错 | 有免费额度 | 提示词可能需要微调 |
| 即梦(Jimeng) | 字节系,中文提示词友好 | 有免费额度 | 同上 |
| Sora | OpenAI 出品 | 需要 ChatGPT Plus | 提示词风格偏英文 |
| Veo | Google 出品 | 通过 Google AI Studio | 较新,迭代中 |
实际操作:把提示词粘进去,生成,看结果,微调提示词,再生成。Mx-Shell 自己说"同样提示词生成两次都会差很多",所以同一个提示词至少生成 3-5 次,挑最好的。这是抽卡,不是打印。
第三步:图像素材(可选但推荐)
很多场景需要先生成一张关键帧图像,再用「图生视频」模式生成,更可控。
| 工具 | 说明 |
|---|---|
| GPT Image(ChatGPT) | Mx-Shell 主力,占 ~80% |
| Midjourney | 风格化图像辅助 |
| Flux Max | 材质细节优化(金属、皮肤) |
对普通人来说,ChatGPT 的图像功能或可灵的图像功能够用了。
第四步:剪辑拼接
AI 生成的视频片段通常是 5-15 秒,需要把多段拼起来。
| 工具 | 难度 | 说明 |
|---|---|---|
| 剪映 | 低 | Mx-Shell 本人用的,手机/电脑都能用,免费,零基础可上手 |
| CapCut | 低 | 剪映国际版 |
| DaVinci Resolve | 中 | 免费且专业,学习曲线陡 |
第五步:配乐
Mx-Shell 用 Artlist.io(付费版权音乐库)。免费替代:
- YouTube Audio Library(免费商用)
- Pixabay Music(免费)
- 剪映自带音乐库(够用但选择少)
前置条件清单
必须有
| 条件 | 说明 |
|---|---|
| 一个想做的画面/场景 | 不需要完整剧本,一个具体画面就够起步 |
| AI 视频生成工具 | 至少一个:可灵 / 即梦 / Sora / Seedance |
| 提示词写作能力 | 读完 methodology.md 就能上手 |
| 剪映或类似剪辑工具 | 拼接片段 + 加音乐 |
| 耐心 | 同一提示词要反复生成、挑选、迭代 |
有更好
| 条例 | 说明 |
|---|---|
| ChatGPT Plus | 用 GPT Image 生成关键帧图像,图生视频更可控 |
| 小云雀 + Seedance 2.0 | 当前最好的视频生成效果 |
| Claude Code | 用仓库自带的 Skill 交互式生成提示词 |
| 一点影视审美 | 不需要科班,但看过好电影、理解基本镜头语言有帮助 |
不需要
- 编程能力
- 专业摄影设备
- 昂贵的软件
- 影视专业背景
最低启动方案:今晚就能开始
如果你想今晚就开始,最小可行路径:
- 打开仓库的
methodology.md,花 10 分钟读完 - 脑子里想一个画面(比如"赛博朋克雨夜,戴面具的人站在霓虹灯招牌下回头看")
- 去仓库
templates/atmosphere-prefabs.md里抄一个氛围骨架 - 把骨架填上你的场景描述,凑成完整的 5 段式提示词
- 打开可灵或即梦,粘进去,生成
- 重复 3-5 次,挑最好的那个
不需要花一分钱(可灵和即梦都有免费额度),不需要任何专业工具,一两个小时内就能看到你的第一个 AI 视频片段。
Claude Code 用户:一键生成提示词
仓库自带了一个 Claude Code Skill。安装后输入 /shortfilm-prompt,它会问你几个问题然后自动生成完整的 5 段式提示词。
安装方式:
/plugin marketplace add jnMetaCode/ai-shortfilm-prompts
/plugin install ai-shortfilm-prompts@ai-shortfilm-prompts
或手动复制:
git clone https://github.com/jnMetaCode/ai-shortfilm-prompts.git
cp -r ai-shortfilm-prompts/.claude/skills/shortfilm-prompt ~/.claude/skills/
仓库里的宝藏资源
| 路径 | 内容 |
|---|---|
methodology.md | 核心文档,5 段式方法论完整讲解 |
prompts/ | 6 份 Mx-Shell 公开的完整原始提示词(丧尸清道夫、假面骑士、LOL 卡莎、环太平洋、赛博武侠、武器充能) |
templates/ | 去掉 IP 的通用骨架模板(中英双语),可直接填写自己的设定 |
faq.md | 17 条常见问题 + 直播 Q&A 整合 |
.claude/skills/ | Claude Code Skill,交互式生成提示词 |
推荐阅读顺序:methodology.md → 挑一个 prompts/ 里的样本对照理解 → 用 templates/ 写自己的第一条提示词。
工具栈速查
Mx-Shell 自述的工具栈(数据来自直播 + 文档):
| 用途 | 工具 |
|---|---|
| 视频生成 | 小云雀里的 Seedance 2.0(不用 Fast 版) |
| 图像生成 | GPT Image(占 80%)+ Midjourney + Krea |
| 材质优化 | Flux Max(金属、瓷砖、皮肤细节单独过一遍) |
| 三视图 | Nanobanana |
| 文案辅助 | 豆包 + ChatGPT(打斗戏让豆包写后自己改) |
| 剪辑 | 剪映 |
| 配乐 | Artlist.io(版权音乐) |