AI视频平台 Higgsfield 做了一件非常夸张的事。
他们不但公开了一部95分钟的AI电影《HELL GRIND》,
还把这部电影背后的工程文件一起公开了。
约11.5万次生成记录,按场次建立文件夹,每一笔记录都可以查看参考图、完整提示词、模型、分辨率、生成日期,并下载结果。
里面能看到角色素材、道具、环境参考,也包括大量失败版本和重新生成记录。

今天邹叔帮你讲这个工程文件拆解开,变成一份AI电影工业流程完全教程,这份教材不是"赏析"这部片子,而是把它的制作流程拆成可以照着做的步骤。
每一步都有 Hell Grind 项目的真实做法作为案例支撑,每一步都有可以直接复用的模板。
读完这篇教程,你将掌握:
步骤一:如何搭建 Elements 资产库,让角色/服装/武器/场景变成可重复调用的固定资产
步骤二:如何把一场戏拆成"机器可执行的分镜脚本"(含8秒动作镜头完整拆解案例)
步骤三:如何组织批量生成、筛选和版本管理
步骤四:如何完成从 Prompt 到成片的后半程,剪辑、声音、后期
步骤五:如何做预算规划和团队协作
在 Hell Grind 的制作过程中,仅前25分钟的内容,团队就:
生成了16,181段视频
最终采用了253个镜头
可用率不到2%
筛选比约为64 : 1
也就是说,每64次生成中,只有1次能达到导演的及格线。整个项目累计约11.5万次生成记录,按场次建立文件夹,包含角色、场景、道具、测试素材、失败版本和重新生成的全部历史。


导演 Aitore Zholdaskali,前作《Sicko》入选鹿特丹电影节 Bright Future 单元、SXSW 伦敦 2026。
联合编剧 Adilkhan Yerzhanov 曾两次入选戛纳电影节官方单元。
团队核心具有传统电影工业经验,而非纯技术背景。
在深入每一个步骤之前,先建立一个全局视角。

关键提示:这个管线不是线性的,Phase 3 中的失败镜头会回退到 Phase 2 调整资产,Phase 4 发现的问题也可能触发 Phase 3 的重新生成。它是一个迭代循环,不是流水线。第二部分:步骤一搭建 Elements 资产库核心理念:AI电影需要"固定资产"
传统影视制作中,一部电影的服装、道具、场景都是实物。
拍完一场戏,第二天还能拉出来继续用。
但在AI视频领域,每次生成都是 "从零画一张新图"。
如果不做任何资产锁定,同一角色在下一场戏里就会变成另一个人。
Hell Grind 团队的解法是:先把角色、服装、武器和场景制作成可以重复调用的 Elements。
写提示词时,不再反复描述人物,而是直接引用这些固定资产。

以主角ROKO为例,团队为其创建的资产包括:


在开始生成任何视频之前,确认以下资产已就绪:
每位常驻角色:20+参考图已入库,Soul ID已训练
角色状态矩阵(正常/受伤/战斗/情绪)已完成
每个状态的文字描述(精确到伤口位置和服装破损程度)
每个核心场景:主图 + 多角度参考已生成
剧情版本变体(至少初始版/破坏版/情绪版)已完成
复杂场景的低模已完成
每个关键道具:多角度参考图 + 状态变化已记录
全局视觉规范:色彩方案、光照方案、运镜风格已确定
关键原则:生成一帧视频之前,先花足够时间把资产做扎实。
Hell Grind 团队的一个重要教训是,如果生成到一半才发现角色不一致,回头重建的成本远高于前期投入。

这是本教程最核心的一章。
Hell Grind 项目最颠覆认知的地方,不是生成了多少视频,而是他们的提示词已经进化成了一种机器可执行的分镜脚本。
传统的AI视频提示词通常是这样写的:
"A cinematic shot of a warrior in a dark museum, dramatic lighting, 4K, photorealistic."
而 Hell Grind 团队的同类型提示词约为后者的12倍长度,但它不是废话填充。
每一个词的增加,都是在缩小AI模型的自由发挥空间,从而提升可控性。
从 Hell Grind 的4万多条公开提示词中,小互团队统计出了一个在所有长提示词中一致存在的结构。
这个结构相当于一份微型拍摄通告:

下面以 Hell Grind 中一个典型特效动作镜头为例,展示从分镜意图到完整提示词的最终形态——单条提示词组装完成后约 2,500-3,500 英文词。
分镜意图(人读)
场景:野蛮主义圆形混凝土博物馆大厅。镜头:3.6 米高的怪物背贴炸弹,挣扎后引爆,蘑菇云升腾。时长:8 秒。景别:广角→超广角(手持拉远)。情绪:挣扎→爆炸→烟尘弥漫。

完整提示词(组装后可直接使用的最终输出,中英对照)
连续手持长镜头——8秒·21:9·8K IMAX·单镜到底从第0帧到最后一帧·无硬切·24fps平滑运动·180°快门运动模糊·物理电影镜头。
写实电影感——无3D渲染、无游戏引擎、无游戏过场动画感。仅真实片场摄影质感。
摄影风格:艾曼努尔·卢贝兹基 × 罗杰·狄金斯。
灯光:仅自然光——博物馆天窗上方逆光,摄影机置于怪物阴影一侧,全场大气雾霾。无人工电影灯、无主辅光系统、无反光板、无额外光源,仅场景内固有光源(琥珀色展柜灯光)。
场景: 一座巨型野兽派圆形混凝土博物馆大厅。尺寸:圆形平面直径约22-24米,层高约10-12米。宽阔灰色混凝土地面,高耸混凝土墙面,上方约8-10米处排列一列狭窄竖条窗。摄影机左侧一根混凝土柱(约80cm见方)。四座八角形立式展柜(约2.5米宽、1.0-1.2米高)散落在宽环中——每座分为厚重的混凝土金属底座(固定不可动,内置琥珀色灯光)和较轻的玻璃顶盖(拍摄前已碎裂)。两座普通矩形展柜嵌于对侧深色墙面壁柱中。2-3棵深叶室内树木置于厚重混凝土花盆中,散布于周边。二层环形阳台环绕上方。中心空地——怪物站立之处。
角色——怪物: 高3.6米。粉红皮革质感肌肉人形体,沧桑皱纹皮肤,裸露上身,腰间缠破旧深色缠腰布。骨刺(20-30cm,淡黄风化骨色)从肩部和脊柱呈扇形外展。骷髅面孔——下半张脸血肉剥离至骨骼,裸露泛黄牙列形成永恒咧嘴;上半张脸为蜡黄人类皮肤,深陷的黄绿色湿润活眼。长而凌乱的深黑色头发垂至上背。不对称双臂:左臂——正常肌肉人形手臂,五指带锋利黑色爪尖。右臂——骨生物变异臂——一柄长弯骨刃(50-60cm,骨质角蛋白)从肘部融合延伸。1500-2000kg体型重量压入混凝土地面。
道具——炸弹(仅一枚): 哑光灰色陶土球体——直径恰好30厘米(约人头大小,约怪物3.6m身高的1/12)。粗糙多孔无光灰陶表面——哑光、矿物质感、灰白色。球体顶部有短窄柱状颈口(约4-5cm高,如小烟囱,边缘参差不齐)。整个表面布满重度裂纹网络,裂缝深而宽。活跃内部辉光——第0帧起即从每一道裂缝中脉冲出明亮的橙白熔岩光,前三秒持续增强。第0帧时,炸弹已粘着/融合于怪物上背两枚脊柱骨刺之间。
配色规则 60:30:10: 60%冷灰混凝土(地面、墙面、柱体、天花)。30%暖琥珀来自场景内展柜辉光 + 粉红怪物皮肤 + 深灰绿树叶。10%橙红爆炸光在第3-4秒 + 深黑烟云在第4-8秒。
灯光——逆光+阴影侧: 摄影机位置使天窗日光朝镜头倾泻。怪物处于逆光——头部/肩部/骨刺/背部形成明亮轮廓光,面向摄影机的正面处于深阴影中。主光仅来自天空和窗户。无反光板、无补光灯。大气雾霾——可见的冷光柱从天窗切下穿过尘雾空间。
动作——连续不间断时间线:
0.0-1.5秒——广角镜头:摄影机位于怪物南侧约10米,成人眼高度(约1.6米),微仰拍摄。怪物3.6米全高完整可见,立于圆心正中。他剧烈扭身试图够到自己的后背——右侧骨生物变异臂从头顶弯向炸弹,左侧正常手从另一肩翻上抓向球体。他通过裸露颌骨牙齿大声咆哮,嘴极度张开,深陷的双眼饱含警觉与暴怒。炸弹明显处于激活状态——明亮的橙白熔光从裂缝中脉动射出,肉眼可见已经灼热、已进入待爆状态。
1.5-3.0秒——剧烈挣扎+摄影机拉远:怪物猛烈扑腾——骨爪从一肩上抓刮球体,正常手从另一肩抓握。咆哮的音量和音高持续攀升。橙光增强。摄影机向南从约10米拉至约13-14米——怪物在画面中明显缩小,更多博物馆建筑进入画框。约2.5秒时摄影机滑入二层阳台挑檐下方——深色挑檐底面进入画面上方框。
3.0-4.0秒——引爆:炸弹在怪物上背原位引爆——极大规模、迅猛、瞬时。首帧(约0.05-0.15秒,180°快门模糊下):硬脆开裂的橙白闪光以肩胛骨间位置为中心绽开,火球在前0.2秒内达到5-6米直径。怪物在前0.3秒内完全被爆炸吞没——在火球后不可见。摄影机剧烈反应:硬镜头震动冲击,猛烈8-10°倾斜构图,5-7次强烈阻尼抖动,被冲击波推开约1-2米。冲击波物理席卷全馆:八角展柜的玻璃顶盖炸飞(底座锚定不动),地面上碎玻璃向外飞散,树木猛烈摇摆树叶四散,墙面展柜玻璃开裂部分碎裂,阳台挑檐抖落混凝土粉尘。
4.0-7.0秒——黑色蘑菇云:厚重黑烟从怪物位置翻涌升腾。蘑菇云总高度:6-8米(约怪物身高的1.7-2.2倍)。可辨识的垂直烟柱+翻涌冠顶。烟云吞没怪物——前约0.5秒内可见其暗影轮廓,随即消失。摄影机持续抖动并重新稳住。
7.0-8.0秒——最终帧:6-8米蘑菇云占据画面正中心。冠顶缓慢涡旋翻涌,烟柱底部展宽,浓烟在混凝土地面上翻滚。极微弱的内部橙光在烟柱底部深处脉动。怪物在云后不可见。一些博物馆元素在浓雾中于画面边缘隐约可辨。摄影机稳住,沉淀。镜头于8.0秒结束。 ?摄影机:全手持——不平滑、不稳定。真人掌机——呼吸抖动、身体漂移、微倾斜。绝不滑顺、绝无轨道。无稳定器顺滑、无摇臂。镜头在掌机手中是活的。全程180°快门运动模糊。画面:第0帧广角(约10米)→第8帧超广角(约15-18米),摄影机朝北拍摄逆着天窗逆光日光。
风格:8K IMAX。写实——无3D渲染、无游戏引擎、无游戏过场动画感。
摄影:卢贝兹基 × 狄金斯。
皮肤:毛孔级真实——汗毛、不对称痣、毛细血管透红、毛孔阴影匹配现场光源。
表演:好莱坞级——反应前微停顿、精准视线、湿润活眼带反光点、可见呼吸和胸口起伏。
物理:重力和惯性贯穿——质量有真实重量、接触阴影正确。无漂浮道具。
构图:三分法+黄金比例。每个人从第一帧就在动。
连续性:角色、道具、环境贯通全镜完全一致。无身份漂移。
技术:24fps平滑运动。8K细节。除刻意手持外无抖动。
音频:仅环境音效——天窗缝隙冷风微啸、混凝土空间低沉环境嗡鸣、利爪脚掌在混凝土上刮蹭、怪物的响亮咆哮怒吼、引爆瞬间炸裂的惊雷爆响、沸腾浓烟、碎屑裂响。无配乐。无字幕。
从41,083条提示词中高频提取出的通用底座。它不是"建议",而是每条提示词末尾的固定组件:

Hell Grind 团队采用的不是"精心打磨一条提示词然后生成3次挑最好的",而是高频低期待策略:
每次生成长度以8-15秒为单位,
每20次生成中挑选3-4个最优片段(约5:1到7:1的组内筛选比),
全局约64次生成产出1个可用镜头,
多个导演同时在不同场次并行生成共用资产库,
失败版本不直接删除而保留在工程文件中作为"禁区参考"。
8-15秒是因为当前主流AI视频模型在超过30秒后,
角色身份和光照一致性会显著下降;
短片段在后期剪辑中更容易衔接;
可以用"首尾帧匹配"策略串联;
坏了一小段只需重新生成这一段。

Hell Grind 公开的工程文件采用了以下结构:
00_MASTER_ASSETS/Characters / Environments / Props(最终确认的资产)
01_SCENE_01_MUSEUM_HEIST/storyboard + shot_001~shot_N(每镜独立文件夹)
shot_001/内含:prompt_v1.txt + gen_001~064.mp4 + SELECTED_gen_041.mp4 + shot_notes.md
99_POST_PRODUCTION/ edit_timeline / color_grade / audio_mix / fix_log.md
关键管理原则:失败版本保留不删(标注FAILED_前缀用于分析模型行为);每镜维护shot_notes.md(记录为什么选这版、其他版本的问题、可重用参数);资产与场次分离;只有剪辑导演有权将素材移入后期。
目前AI视频模型的能力边界在于"局部15秒",而不在于"全局95分钟"。
剪辑、声音设计、色彩匹配、AI痕迹柔化、连续性修复这五项工作AI目前无法可靠完成。

AI 的工作是"大量生成",人的工作是"精准选择"。11.5万次生成不是AI能力的证明,是人筛选能力的证明。
对比:传统同等规格CGI动作片$5,000万 - 1.5亿,成本差约100倍。
14天冲刺时间表(参考 Hell Grind 实际排期)

第一层:Soul ID 训练,20+多角度参考图,一次性训练,每次生成必须附加该ID。
第二层:资产描述一致性,所有镜头使用统一的角色描述模板,从主资产文档复制粘贴。
第三层:提示词中的面部分解指令,Skin段(汗毛、痣、毛细血管、毛孔阴影)+ Acting段(微停顿、视线、湿润眼睛、呼吸)。
第四层:后期修正,DaVinci Resolve色彩匹配拉近面部色调,极端情况重新生成。
排名1:脚不沾地/漂浮(预防:提示词写"boot sole compression against floor")。
排名2:道具悬浮(预防:技术底座Physics行"No floating props")。
排名3:接触阴影缺失(预防:写"correct contact shadows under every object")。
排名4:质量感缺失(预防:写"mass has real weight" + 物体落地要有反弹/碎裂)。
排名5:人物比例异常(预防:站位段写明身高距离)。
提示词层:Style行禁3D渲染和游戏引擎,Skin行写毛孔级真实感,Lighting行自然光优先。
生成策略层:优先选择有轻微瑕疵的版本(面部不对称、衣服皱褶、灰尘颗粒)。
后期处理层:DaVinci Resolve添加Film Grain(15-25%) + Vignette + Soft Glow + Micro Contrast。
Style: 8K IMAX. Photorealistic — no 3D render, no game engine, ? no game-cutscene aesthetic. Cinematography: Emmanuel Lubezki × Roger Deakins. Camera: Physical cine lens. 180° shutter motion blur. Lighting: Natural light only — contre-jour backlight, camera on ? shadow side, atmospheric haze throughout. Color: 60:30:10 — dominant / secondary / accent. Skin: Pore-level realism — vellus hair, asymmetric moles, ? capillary flush, pore-shadow matching on-set light. Physics: Gravity and inertia respected — mass has real weight, ? correct contact shadows. No floating props. Acting: Hollywood — micro-pauses before reactions, precise ? eye-line, wet living eyes with catch-lights, visible breath. Composition: Rule of thirds + golden ratio. Every person moving ? from frame one. Continuity: Characters, props, environment identical across ? every cut. No identity drift. Technical: 24fps smooth motion. 8K detail. No jitter. Audio: Environmental SFX only. No music. No subtitles.
无背景音乐(指定 Scene 需要配乐的情况除外)
无自动字幕
无随机路人
无角色重复(同一人不能出现两次)
无漂浮(所有物体接地,有接触阴影)
无游戏CG感
无塑料/光滑表面
无镜头光晕(需要的情况除外)
无慢动作(需要的情况除外)
对话严格按指定内容(不能自由发挥)
这份教程很重。
11.5 万次生成、15 人 14 天、64:1 的筛选比、16,501 字符的中位数提示词——如果你是从头读到这里的,你应该已经感受到了:AI 电影这件事,和大部分人想象的不一样。
那不是"AI 能不能做电影"的问题。那是一个根本不成立的问题。真正的问题藏在那些工程文件里
Hell Grind 的提示词最震撼的地方,不是它有多长。是它把"导演脑子里想的东西"用一套可执行的语法写了出来。
角色此刻身上什么伤、衣服破在哪一镜造成的、汗从哪个部位往下流、呼吸节奏是快是慢、视线先看哪里后看哪里、灯光是双光源还是单光源、色温多少K,这些不是"AI 需要的",是导演需要想清楚的。
AI 做的事情,是把你想清楚了的东西变成画面。
你没想清楚的东西,AI 帮你变成一堆随机画面。那 64 次生成里被淘汰的 63 次,不是 AI 不够好,是你没跟它说清楚。
那些写得像微型拍摄通告一样的提示词,本质上是一个导演的思维外化,你把脑子里的画面拆成动作节拍、灯光参数、站位坐标、禁令清单,AI 才能把你脑子里的画面还原出来。
这件事告诉我们:AI 时代最稀缺的能力,不是会用哪个模型,是能把自己的想法拆成可执行的指令。
这门手艺,叫"导演",不叫"提示词工程师"。
这个项目最值钱的开源内容,不是某一条提示词,不是某一个模型参数,是那 108 个按场次编号的文件夹。
00_MASTER_ASSETS/?→?01_SCENE_01/?→?shot_001/?→?prompt.txt + gen_001~064.mp4 + SELECTED_ + shot_notes.md
这个文件夹结构,就是一部 AI 电影的骨架。
它回答了所有"怎么做"的问题:
角色怎么做——先建资产库再调用;
分镜怎么做——七段骨架填进去;
生成怎么管——每镜一个文件夹,64 次生成全保留;
筛选怎么判——P0 一票否决 / P1 一票否决 / P2 降级使用 / P3 标注修复;
后期怎么接——fix_log.md 记下 40 个修复点。
那些一个人拿 AI 工具三天做出一个短片的 demo,炫是很炫。
但如果你要的是"稳定地、可重复地、团队协作地"做出 95 分钟的东西,你需要的不是更快的模型,是更稳的流程。
15 个人的团队。
导演、DP、剪辑导演、资产设计师、场次导演。没有人被 AI 替代,但每个人的工作内容变了。
导演不再事必躬亲地画每一帧,而是把"脑子里想要的画面"翻译成 AI 能执行的指令。
DP 不再扛着摄影机在片场跑,而是在提示词里写"35mm 镜头、180° 快门、推轨速度匹配转身速度"。
剪辑导演不再从几十个小时的素材里翻找,而是从 11.5 万次生成里挑选那 253 个能用的镜头。
角色变了,但人没消失。
Hell Grind 团队的核心,导演 Aitore Zholdaskali,前作入选过鹿特丹电影节。联合编剧入选过两次戛纳。他们不是"被 AI 赋能的外行",是本来就懂电影的人,学会了用 AI 做电影。
这对所有创作者的意义是:AI 不会让外行一夜之间变成导演。但它会让真正懂行的人,一个人拥有过去一个团队的生产力。
这份教程的目的不是让你复制一部 Hell Grind。
是你下一次打开一个 AI 视频工具的时候,脑子里不再只有"写一句提示词,看它生成什么"。
而是你开始想:这个角色我有没有建资产库?这场戏我有没有拆成分镜节拍?这条提示词里我写没写站位几何和灯光色温?我有没有给模型写禁令?
从"让它生成"到"让它执行",这一个字的差别,就是玩 AI 和用 AI 的分界线。
11.5 万次生成换 95 分钟成片。
64 次生成里只有 1 次能用。
这个比例放在任何一个传统行业都是不可接受的,除了电影。
因为在电影里,一条能用的镜头,值剩下的 63 条废片。在
电影里,精雕细琢不叫"效率低",叫"创作"。
所以当有人再问你"AI 能不能做电影"的时候,你已经知道了答案。
不是能不能。是你会不会。是你的流程硬不硬。
是你的资产库有没有搭。
是你的提示词里写没写那些看起来啰嗦、但每一条都在缩小 AI 自由发挥空间的东西。
AI 不会替你做一个好导演。但一个好导演,值得用 AI 放大自己。

