AI的长会话叙事共创里,缺了三维空间这个东西
---
*本文是继 [《你写的不是故事,是景别标签堆砌》](网页链接) 之后的第二篇。第一篇聊了我脑子里那条 Previs 时间线怎么变成文字。这篇得告诉各位,模型的脑子里没有什么。*
---
在长会话叙事创作里,"控场"这件事情,可以简单的理解为控制剧情走向,保证角色不跑偏。这件事 AI 也能做,做得还挺好对吧。模型会埋钩子、维持人设、收线、追问等等,在合适的时候推进节奏。那我现在开这篇文章,重新说的"控场",到底在控什么。
控的是目前暂时只有人类能做的事情,**空间**。
---
AI 只有概率,没有空间
要理解这个区别,那就得先说清楚,AI 的文字是怎么生成的。
**概率**。所有的 AI 大佬都会告诉你们,模型读取你的上文,然后计算下一个 token 最有可能是什么。模型推演"接下来她大概会说什么""接下来剧情大概往哪个方向走",所有判断的依据是统计关联。"前面提到过左肩伤"和"现在是时候让它疼了"之间的关联,是模型在海量文本里学到的模式。它不会真的看见一道伤疤,更不需要知道左肩在身体的哪个位置。它只需要知道这两个词在你之前的文字里面经常一起出现。
这意味着空间信息对 AI 来说,跟"语气词""转折词"这种东西其实一样,这些东西只是文本序列里的一个 token。对模型来说,它才不会去区分"她站在田埂上",以及"她流了一滴泪"这两个输入哪里不同。这些玩意儿,在模型的眼里仅仅只是文字,与三维坐标是产生不了关联的。
所以当你跑一场长会话,场景里有三个人:
> 幽谷捂着左肩站在麦田里,沈蕴背靠树干,刺客的匕首被夕阳反射出一道寒光。
AI 接收到的东西仅仅只是文字而已。第一轮对话,这些文字还在上下文的表层里面随时可见。第五轮、第十轮,你的上下文越叠越厚,那些曾经你脑海里精确的空间坐标,在模型的概率拟合里面,渐渐被磨成了几个模糊的关键词:"田埂""刺客""伤"。
当然了,好的模型不会轻易忘记。但是模型从一开始就没有"记住"过你所描写或者它所描写的空间,它只不过是把那些词,当成词在处理。
你脑海里的空间信息,在大语言模型的纯文字流里会融化。对语言模型来说,概率文字生成这个机制,从一开始就不是为三维空间设计的。
---
空间会退化,而且每轮都在退化
各位会认为,模型记住的上下文不会忘。但实际上这个退化在长会话叙事创作里是累积性的。
我打个比方,假设你写一篇短文,也就几百一千字左右。那么你可以在动笔之前一次性搭完整个场景:这个房间的面积有多大,窗户在哪堵墙上,两个角色之间有多少距离,这些东西是可以是固定的。毕竟这是你写的嘛对吧,你脑子里的空间,在这几百一千字的整个写作过程中不会被稀释。
但你和模型一起进行长会话创作就不一样了。几十上百轮的连续对话,场景在每一轮之间持续存在。你上一轮刚写了他捂着左肩站在田埂上,过了二十轮,模型搞不好还在写"他站在田埂上"。但是,此时的"田埂"已经不是二十轮前,那个具体的有麦浪、有夕阳、有三个人的精确位置的田埂了。对话轮数多了,它就退化成了一团模糊的背景色。在这个场景里,模型还在用这个词,但它几乎忘了这个词携带的空间关系。
你认得那是"田埂",因为你作为人类可以推演并且建立清晰的空间坐标。但对模型来说,早就搞不明白三个人站在什么位置、光从哪个方向来了。
---
用关联技巧给出画面
你要是对模型说,"记住啊,我们在田埂上,我的位置是……巴拉巴拉",没用。模型没有空间记忆这么个东西。无论你怎么跟它解释空间关系,下一轮还是从概率出发然后重新推演。
所以,你能做的是:
**用一个具体的物理动作,把空间坐标硬塞进模型的上下文里。**
比如你说,主角捂了一下左肩,眉头紧皱。接下来 AI 就收到了信号。为啥,因为主角疼了啊。"疼"这个信息进入到了模型的上下文里。接下来它开始顺着"疼"往前追溯,发现哦原来十轮对话前,上文里有一个"左肩箭伤",一场"田埂激战",还有一名"刺客"。这些词和信息,就因为你说"疼",被重新激活了。模型的概率权重变了,之前的场景从上下文的背景噪音里就重新浮到了表面上。
兄弟们,你只是说了这么一个动作,但它代表了一帧画面。你不需要重复告诉模型原来那个空间是啥样的,只需要做一个只有在这个空间里才会发生的动作,模型就会从那个动作往回倒,在上文里找,然后自然就被找回了正确的坐标(严格地说是上下文)。
这就是我说的"控场"。你在这里控场,控的是三个人的相对位置、是光的来源、以及那道伤到底在左肩还是右肩(或者说是通过一个词重新激活回溯的上下文)。这一点 AI 做得不好,因为空间坐标在文字层面,根本就不在它的设计维度里。它能控叙事,但是没法控空间关系。
---
两个维度,各干各的
我之前写过一篇文章不知道各位看过没,叫 [《你以为你在引导 AI,其实 AI 在引导你》](网页链接)。那篇讲了 AI 根据人设,给你埋钩子、在概率里回收钩子、根据你给出的走向推进叙事节奏、追问重要的对话场景。这种纯文字的概率拟合它比你可擅长得多。
不过那篇文章里,我没讲清楚一个边界。AI 能给你的故事缝钩子是时间上的叙事能力,但它缺失了知道三个人站在田埂上的相对位置是什么的空间能力。
空间是一个物理事实。
AI 能主动的判断"这个伏笔埋了十轮了,应该收了","这个叙事节奏太慢了,加一个冲突进来吧",这些判断来自概率。模型的参数量那么大,它读过无数的故事,它来说怎么埋钩子怎么收不是问题,模仿就行。你让它十几轮对话下来,还能知道谁站在哪儿,谁的位置变了,那你就是在难为它。
AI 的创作引导机制,是一个精确的分工协议。它会在叙事层面引导你,你就得在空间层面控全场,把每一帧画面的物理坐标锁死,不让它在概率流里融化成模糊的关键词。
这两个维度,在目前的创作过程里,只能各管各的。你能干的它不行,它能干的你再干,累不死你。
---
为什么这件事对影视创作是要命的
第一篇文章里我讲过,我的故事被叙事转译 Skill 诊断为不适合短剧,适合电影或剧集。是因为我的故事吃空间关系。
而空间关系之所以重要,本质上是因为文字并不是影视创作的终点。
你和模型通过长会话的模式,把脑子里的画面翻译成了文字。文字再交到导演、摄影、美术手里,被重新翻译回一个可以布光、可以走位、可以架机器的物理空间。
这就是两次翻译:**人脑→文字→可拍摄空间。**
AI 能帮助你的位置,刚好就是中间文字这部分。它能在文字的层面推进叙事,但是它看不到你脑子里的 Previs,也就帮不了第一重翻译。它也同样帮不了第二重翻译,因为它不知道自己的文字该如何重建为三维空间。就像提示词反推和文生图,空间理解能力依然是现在视觉和图像模型正在突破的东西。
如果你产出的文字不携带空间信息,只是情绪浓度的堆砌,以及景别标签的拼贴,那么第二重翻译就会失败。文字到了现场,没人知道她应该站哪儿,没人知道光从哪个方向来。那种堆砌式的文字本身就缺乏可重建的物理数据。好比剧本化阶段,单纯的情绪氛围也一定要翻译成具体的可操作的动作和表情一样。
俺的职业病让我会下意识地关注这些东西。每一场戏,站位在哪,动线怎么样,如何调度,这些我必须在文字里把它们都"钉"死。你要是到了拍摄现场,什么都不管,想直接从文字里挖出那个空间来,那就只能依赖影视化训练的成果了。
---
到这里就收一下
第一篇讲的是人的脑子里,应该有什么。这篇讲的是 AI 的脑子里没有什么。AI 重叙事,但轻空间。把叙事的任务交给了 AI,人类就要控住空间这个场。分工不重叠,也不可互换。
那么下一篇,我会聊聊长会话角色扮演叙事法里一个更隐蔽的问题:为什么你演的角色,永远比 AI 演的角色薄,以及如何解决这个问题。这和你的写作水平没有关系,是媒介通道的问题,所以是有解的。
---
*《一名 DIT 的 AI 故事剧本创作方法论》第二篇*
