AI 短片提示词方法论:从零做出被好莱坞导演认可的 AI 视频

拆解《丧尸清道夫》作者 Mx-Shell 的 5 段式提示词框架,教你用结构化思维写出能让 AI 生成高质量短片的提示词。含完整工具链、前置条件和最低启动方案。

项目地址:https://github.com/jnMetaCode/ai-shortfilm-prompts | MIT 开源协议 | ⭐ 92 Stars

背景:一条让好莱坞导演炸了的 AI 短片

2026 年 5 月,云南玉溪的 Mx-Shell(29 岁,中专学历,摄影副业)用约 10 天做出 3 分钟 AI 短片《丧尸清道夫》——原子朋克机器人在末日丧尸危机后的海边别墅,和一只呆鸵鸟跳 1980 年代风格的霹雳舞,顺便踢飞丧尸头颅。

好莱坞导演 PJ Ace 在推特上盛赞:"这是我近年来看过最好的短片之一。很快,我们将不再称其为'AI 电影',而直接称其为电影。"

这条推文拿到 1340 万浏览、82K 点赞、7.4K 转发。

Mx-Shell 事后在粉丝群分享了提示词文档,又在抖音直播完整讲解了他的方法论。ai-shortfilm-prompts 仓库就是对这些原始材料的结构化整理——不是教你复刻这部片子,而是教你写出能做出自己作品的提示词。


核心框架:5 段式提示词结构

这套框架的底层思想只有一句话:像写分镜脚本一样写提示词,而不是像写文学描述。

把场景按时间切片,每一秒分别交代「动作 / 镜头 / 特效 / 声音」这四件事。所有 Mx-Shell 的视频提示词都遵循同 5 段骨架,顺序不能乱:

段 1 · 核心主题

一行风格标签,用 | 分隔。给 AI 一个总体审美锚点,3-6 个标签,从画面类型到题材到美学风格层层递进。

核心主题:原子朋克 | 末日丧尸 | 电影级质感 | 超写实 | 杜绝游戏 CG 感

标签可以这样选:

类型举例
真实感锚点电影级质感、超写实、真人实景拍摄、变形宽荧幕电影质感
美学定调暗黑写实、原子朋克、蒸汽朋克、赛博朋克、废土工业
题材特摄剧、末日生存、孤胆英雄、机械武侠、重型机甲
情绪破碎肉身、战损变身、肃杀、磅礴史诗、压抑沉重

段 2 · 人物与基础设定

三行交代:面部 / 服装 / 场景。

【人物与基础设定】
面部:五官、脸型百分百还原,保留轻微面部瑕疵,表情全程阴郁。
服装:哑光黑色皮质长风衣,金属腰带为哑光质地,腰带核心为暗红色水晶。
场景:末日战场,微风,硝烟弥漫,阴天荒野,灰蓝色调天空。天空中划过带有火焰与浓烟的陨石。

Mx-Shell 反复强调的要点:

  • "杜绝美化" — 真实感来自瑕疵,明确写"保留轻微面部瑕疵"比模糊说"高质量"管用得多
  • 服装写质地 — "哑光黑色皮质"比"黑色皮衣"信息量大三倍
  • 场景写动态环境 — 微风、硝烟、陨石,静态背景出不了氛围

段 3 · 氛围与画质

模拟「真实摄影机 + 镜头」的写法。这一段是 Mx-Shell 最核心的技巧。

【氛围与画质】
视觉基调:变形宽荧幕电影质感。模拟 IMAX 胶片摄影机,
        搭配 Panavision C 系列镜头(焦段 35mm,光圈 f4)。
色彩与影调:低饱和灰蓝主调。暗部信息压缩,保留细节。
          边缘添加轻微柔焦与适度的胶片颗粒感。

为什么有效:AI 训练数据里大量电影摄影描述都和真实摄影机型号绑定。"IMAX + Panavision C 35mm f4"对应一组具体的视觉风格样本;"电影感"三个字对应几千种风格,锚不住。具体摄影机型号 = 明确的视觉风格锚点。

Mx-Shell 常用的摄影机组合:

风格摄影机 + 镜头
史诗感 / 大场面IMAX 胶片 + Panavision C 系列(35mm,f4)
暗调赛博 / 写实硬核索尼威尼斯电影机 + 佳能 K-35 系列
港片 / 武侠柯达 35mm 复古胶片,跳过漂白胶片质感
商业人像Canon EF 85mm f/1.2

段 4 · 运镜规则

三行定义镜头怎么动:单镜头 / 角度 / 呼吸感。

【运镜规则】
单镜头:一镜到底,无剪辑。
角度:开场仰拍,人物半身左侧面 30 度,聚焦腰部以上部位。
呼吸感:手持拍摄,全程保持极其轻微的、如呼吸般的镜头浮动,增强临场感。

"呼吸感"这一行 —— Mx-Shell 几乎每个视频都写。原因:让 AI 加入轻微抖动,避免出 CG 感僵直镜头。

描述镜头运动时可以挑的概念词:

  • 景别:极近距离特写 / 特写 / 近景 / 中景 / 全景 / 大全景
  • 角度:仰拍 / 俯拍 / 平视 / 过肩镜头 / 高空垂直俯拍
  • 运动:极缓向前推进 / 环绕 / 跟随运动拍摄 / 固定机位 / FPV 模式
  • 节奏:极缓 / 匀速 / 突然 / 应激性 0.1 秒微颤

段 5 · 分镜时间轴

整套方法论最关键、也最容易被忽略的部分。按秒切片,每一段拆成「动作 + 镜头 + 特效」三件套,加可选的「声音」「面部」等子项。

0-3秒 · 凝视
动作:主角略微低头,目光锁定腰带,脊背紧绷。右手缓慢抬起。
镜头:极缓向前推进,捕捉身体因呼吸产生的微幅起伏。
特效:整颗眼球骤然亮起白金色光芒,眼眶周围皲裂。

3-6秒 · 启动
声音:低语:「HENSHIN」。
动作:手掌用力按压腰带核心,水晶核心本体被挤压而开裂。
镜头:镜头随低频嗡鸣产生应激性的 0.1 秒微颤。

6-9秒 · 撤裂
[再按需细分:核心 / 身体 / 衣物 / 甲壳 / 面部 / 镜头]

这套方法到底改了什么

同一个想法:女机甲战士在暴雨雷暴中开启能量护盾。

大多数人写的:

史诗级电影感镜头,一个漂亮的女机甲战士在雨中开启震撼的能量护盾。
高细节,4K,照片级真实,电影质感,戏剧化灯光。

"史诗 / 震撼 / 4K / 电影质感"这种空泛词,AI 抓不到任何具体锚点。

用 5 段式写法(节选):

核心主题:写实硬核机甲 | 雷雨码头 | 战损美学 | 能量护盾 | 末日真人演绎
氛围画质:模拟 IMAX 胶片摄影机 + Panavision C 系列(35mm,f/4)。
运镜:手持,全程极其轻微、如呼吸般的浮动。
9-12秒:六边形能量单元逐格亮起,部分如故障般闪烁;雨水沿 2 米伞状能量场绕开。
结尾:没有台词、没有炫光 —— 只有雨水打在护盾上汽化,远处一道闪电照亮码头。

真实摄影机型号 + 物理反馈 + 战损细节 + 留白结尾 = 那种"真"的质感。


对人的启发 vs 对 AI 的加持

对 AI 的加持:立竿见影

框架里的几乎每个技巧,都在针对 AI 视频生成的弱点打补丁:

AI 的弱点框架的对策
形容词锚不住风格用具体摄影机型号替代"电影感"
生成画面像游戏 CG写"杜绝游戏 CG 感" + 胶片颗粒 + 暗部压缩
镜头僵直不动每条都加"呼吸感"轻抖动
不知道哪一秒该画什么按秒切片,每段明确动作+镜头+特效
默认美化人脸明确写"保留瑕疵""拒绝美化"

这些技巧一用,生成质量确实能跳一个台阶。本质上是在做提示词工程——针对特定模型的能力边界做优化。

对人的启发:润物无声

一个认真用这套框架写过 3-5 条提示词的人,脑子里会发生变化:

  1. 学会了用导演/摄影的视角想问题。 不再是"我想做一个酷炫的东西",而是"第一秒我需要一个低角度仰拍"——这是实打实的影视语言。
  2. 建立了「物理细节 > 情绪形容词」的直觉。 这个习惯对所有创意表达都有用——写剧本、做分镜、给人讲一个画面感强的故事。
  3. 理解了「约束激发创意」。 5 段式看起来是限制,但正是这些限制逼你把模糊灵感打磨成可执行方案。

框架的「术」层面(具体技巧、措辞、摄影机型号选择)主要是给 AI 的加持——换个模型可能就不灵了。

框架的「道」层面(结构化思维、分镜意识、物理化描述)主要是给人的启发——不依赖任何特定工具,是创作者自己的底层能力升级。

Mx-Shell 本人的话已经点透了:

"对于创作来说,设备不是重要的。想法才是最重要的。"


普通人如何上手:完整链路

完整工作流

写提示词 → 生成图像(可选)→ 生成视频 → 剪辑拼接 → 加配乐 → 成片

第一步:写提示词(文本工作,零成本)

  1. 读完仓库的 methodology.md,理解 5 段式结构
  2. 脑子里先有一个具体的画面——不用完整故事,一个场景就够
  3. 按 5 段式把画面翻译成提示词

可以先用仓库里 templates/ 目录的骨架填自己的设定,不用从零开始:

模板用途
15s-transformation.md15 秒变身类短片
multi-shot-narrative.md多分镜叙事
atmosphere-prefabs.md8 个可复用的氛围/画质骨架

关键心法:别写"史诗级战斗场面",写"3 秒内,右臂金属甲片沿裂缝逐片弹开,露出下面充血的皮肤组织,镜头从肘部特写缓慢推向肩部"。

第二步:生成视频素材

需要一个 AI 视频生成工具:

工具特点费用备注
Seedance 2.0(小云雀内)Mx-Shell 主力工具,效果最稳定需要小云雀账号不用 Fast 版,效果差距大
可灵(Kling)国内可直用,效果不错有免费额度提示词可能需要微调
即梦(Jimeng)字节系,中文提示词友好有免费额度同上
SoraOpenAI 出品需要 ChatGPT Plus提示词风格偏英文
VeoGoogle 出品通过 Google AI Studio较新,迭代中

实际操作:把提示词粘进去,生成,看结果,微调提示词,再生成。Mx-Shell 自己说"同样提示词生成两次都会差很多",所以同一个提示词至少生成 3-5 次,挑最好的。这是抽卡,不是打印。

第三步:图像素材(可选但推荐)

很多场景需要先生成一张关键帧图像,再用「图生视频」模式生成,更可控。

工具说明
GPT Image(ChatGPT)Mx-Shell 主力,占 ~80%
Midjourney风格化图像辅助
Flux Max材质细节优化(金属、皮肤)

对普通人来说,ChatGPT 的图像功能或可灵的图像功能够用了。

第四步:剪辑拼接

AI 生成的视频片段通常是 5-15 秒,需要把多段拼起来。

工具难度说明
剪映低Mx-Shell 本人用的,手机/电脑都能用,免费,零基础可上手
CapCut低剪映国际版
DaVinci Resolve中免费且专业,学习曲线陡

第五步:配乐

Mx-Shell 用 Artlist.io(付费版权音乐库)。免费替代:

  • YouTube Audio Library(免费商用)
  • Pixabay Music(免费)
  • 剪映自带音乐库(够用但选择少)

前置条件清单

必须有

条件说明
一个想做的画面/场景不需要完整剧本,一个具体画面就够起步
AI 视频生成工具至少一个:可灵 / 即梦 / Sora / Seedance
提示词写作能力读完 methodology.md 就能上手
剪映或类似剪辑工具拼接片段 + 加音乐
耐心同一提示词要反复生成、挑选、迭代

有更好

条例说明
ChatGPT Plus用 GPT Image 生成关键帧图像,图生视频更可控
小云雀 + Seedance 2.0当前最好的视频生成效果
Claude Code用仓库自带的 Skill 交互式生成提示词
一点影视审美不需要科班,但看过好电影、理解基本镜头语言有帮助

不需要

  • 编程能力
  • 专业摄影设备
  • 昂贵的软件
  • 影视专业背景

最低启动方案:今晚就能开始

如果你想今晚就开始,最小可行路径:

  1. 打开仓库的 methodology.md,花 10 分钟读完
  2. 脑子里想一个画面(比如"赛博朋克雨夜,戴面具的人站在霓虹灯招牌下回头看")
  3. 去仓库 templates/atmosphere-prefabs.md 里抄一个氛围骨架
  4. 把骨架填上你的场景描述,凑成完整的 5 段式提示词
  5. 打开可灵或即梦,粘进去,生成
  6. 重复 3-5 次,挑最好的那个

不需要花一分钱(可灵和即梦都有免费额度),不需要任何专业工具,一两个小时内就能看到你的第一个 AI 视频片段。


Claude Code 用户:一键生成提示词

仓库自带了一个 Claude Code Skill。安装后输入 /shortfilm-prompt,它会问你几个问题然后自动生成完整的 5 段式提示词。

安装方式:

/plugin marketplace add jnMetaCode/ai-shortfilm-prompts
/plugin install ai-shortfilm-prompts@ai-shortfilm-prompts

或手动复制:

git clone https://github.com/jnMetaCode/ai-shortfilm-prompts.git
cp -r ai-shortfilm-prompts/.claude/skills/shortfilm-prompt ~/.claude/skills/

仓库里的宝藏资源

路径内容
methodology.md核心文档,5 段式方法论完整讲解
prompts/6 份 Mx-Shell 公开的完整原始提示词(丧尸清道夫、假面骑士、LOL 卡莎、环太平洋、赛博武侠、武器充能)
templates/去掉 IP 的通用骨架模板(中英双语),可直接填写自己的设定
faq.md17 条常见问题 + 直播 Q&A 整合
.claude/skills/Claude Code Skill,交互式生成提示词

推荐阅读顺序:methodology.md → 挑一个 prompts/ 里的样本对照理解 → 用 templates/ 写自己的第一条提示词。


工具栈速查

Mx-Shell 自述的工具栈(数据来自直播 + 文档):

用途工具
视频生成小云雀里的 Seedance 2.0(不用 Fast 版)
图像生成GPT Image(占 80%)+ Midjourney + Krea
材质优化Flux Max(金属、瓷砖、皮肤细节单独过一遍)
三视图Nanobanana
文案辅助豆包 + ChatGPT(打斗戏让豆包写后自己改)
剪辑剪映
配乐Artlist.io(版权音乐)