第一次看到《Hell Grind》这个项目时,很多人会先问一个问题:一部差不多九十五分钟的 AI 电影,能不能进院线?

这个问题不算错,但它把注意力放在了最后一步。更值得看的,是一群人到底怎样把模型偶尔生成的好镜头,拼成一部能从头看到尾的片子。

Higgsfield 在官方项目页和公开帖文里,把这部动作奇幻长片的制作资料摊开了一部分:完整影片、提示词、角色与场景资产、分镜表、表演和系统说明,还有一份记录失败案例的制作手册。官方称项目由大约 15 人完成,预算低于 50 万美元;“14 天”说的是资产准备之后的生成阶段,不是从写故事到交片只用了两周。页面还提到,项目中有部分资产或工作文件已经遗失。

这些数字和描述,首先是项目方的自述。我们可以确认它们被公开说过,但不能把它们当成经过独立审计的成本表,也不能据此推导出每分钟影片的通用价格。媒体报道提到,《Hell Grind》曾在戛纳的 Marché du Film 亮相。那是电影市场,不等于戛纳电影节正式竞赛或展映单元。项目页公开了大量内容,也没有给出一个清楚的、允许读者自由商用的开源许可证。

把边界说清楚以后,项目真正有意思的地方就出来了:它更像一条小型制片生产线,而不是一条超长提示词。

模型没有上一镜记忆,制作组只好自己记

传统片场里,摄影、服化、场记和导演组会共同维护连续性。演员今天穿什么,伤口在哪一侧,人物站在门的左边还是右边,上一镜头的视线落到哪里,这些信息不会因为换了一个机位就凭空消失。

生成模型没有这份片场记忆。你不把条件重新写进去,它就可能把同一个角色换一张脸,把雨夜变成晴天,把两个人的左右关系倒过来。于是《Hell Grind》公开的制作经验里,最先出现的不是“怎么写得更有电影感”,而是怎么做资产。

角色要有文字描述和参考图,还要准备脸部近景、正面全身、背面全身。为了避免模型把一张模糊的脸硬贴到全身图上,甚至要准备没有头部的正面全身服装图。白天、夜晚、下雨,衣服干湿和受伤状态,也要分开管理。每个资产先反复压力测试,确认它在十次生成里还能认得出来,再进入镜头。

这和很多中国小团队做短剧、广告片时遇到的问题很像。你用同一个虚拟演员做十个镜头,最怕的不是某一镜不够漂亮,而是第七镜突然换了发型和脸型,观众不知道是换人了,还是剧情跳了三天。解决办法不是在最后一句提示词里加“保持一致”,而是先做一张资产表:角色、服装、道具、状态、可用参考图、已验证的镜头类型,都列出来。没有通过测试的资产,不进正式拍摄表。

真正的提示词,是一张镜头工作单

项目公开资料里还有几条很朴素的做法。

第一,每个镜头都重复完整约束。角色标签、服装、动作、镜头、环境和声音不能指望模型自己从上一镜补回来。提示词可以很长,但每个动作段落要短,先说清这一拍要完成什么,不要同时要求人物打斗、转身、说话、翻越障碍和改变光线。

第二,给场景画空间地图。门、柱子、楼梯、桌子和人物的左右位置,镜头离谁多远,视线往哪边走,180 度轴线怎么守,都先标出来。下一镜不是重新想一个“很酷的角度”,而是在同一张地图上换位置。这样做不浪漫,却能少掉很多观众看不懂的跳轴和空间错乱。

第三,把表演写成身体动作,而不是情绪形容词。“他很悲伤”对模型帮助有限;眼睛看哪里、下颌是否收紧、手指有没有停顿、重心落在哪条腿上,才更接近可执行的指令。固定声音的描述,音乐则放到后期处理,不要让生成模型一次包办所有事情。

第四,一次只改一个变量并留下记录。如果这次改了镜头角度,下次就不要顺便换服装、灯光和动作。连续十到十五次失败时,通常不是再加一段形容词,而是把镜头拆开、减少动作,或者换一个更容易控制的起始姿势。复杂动作从中途开始,往往比要求模型从站立到翻滚再落地更可靠。

成本没有消失,只是换了位置

“14 天生成完成”很容易被读成 AI 把电影压缩成了两周。实际上,前面的资产准备、故事设计、镜头拆分,后面的剪辑、修复和声音,都没有消失。

更准确的说法是:成本从摄影棚、演员档期和实体场景,部分转移到了资产库、版本数、人工筛选和后期时间。模型每次生成很快,但一条不合格的镜头会把连续性、剪辑节奏和后面几镜一起拖坏。片子越长,返工的利息越高。

剪辑师因此不能等“所有镜头都生成完”再上场。公开经验里,编辑和生成是并行的:剪辑先发现缺一个反打、一个全景或一个过渡动作,再把具体缺口发回制作组。镜头定剪后,才统一修手指、纹理和画面里的假文字;生成的对白音频也要默认清理。还有一个很小但实用的经验:很多生成片段的头尾不稳,剪辑时可以先各削掉约半秒,再看节奏是否干净。

这就是为什么我不太愿意把《Hell Grind》总结成“AI 自动当导演”。它更像是在展示一种新的制片基础设施:把原来由片场人员共同维护的东西,拆成可复制的资产、镜头卡、空间关系和验收记录。导演的判断没有被拿走,只是被迫写得更具体。

如果你要自己试,先验收一组镜头

不管你做的是短剧、品牌片还是一条连续的知识视频,可以先用下面这份小清单,不用一上来就做九十五分钟。

  1. 先选一个三到五镜头的场景,写清主线任务:人物要完成什么,观众必须看懂什么。
  2. 建立资产表,给每个角色和道具准备至少两种状态,并先做十次一致性测试。
  3. 画一张俯视空间图,标出人物、出入口、视线和镜头位置,下一镜沿用它。
  4. 每个镜头只安排一个主要动作,先保证关系和节奏,再增加运动和特效。
  5. 用版本号记录每次只改了什么;十次失败后先改任务拆分,不要无限加词。
  6. 让剪辑尽早介入,用“缺一个全景”“需要一个反打”这种可执行的缺口回传,而不是笼统说“再电影一点”。

验收时只问三个问题:角色还是不是同一个人,空间关系有没有变,剪在前后镜头之间是否成立。三个问题中有一个答不上来,就先别扩展到下一场。

所以,《Hell Grind》最值得普通创作者学的,不是某个具体模型或某条长提示词。它提醒我们,画面生成只是生产链的入口。真正昂贵的工夫,是让一百个看起来不错的镜头,愿意在同一部片子里互相承认。