昊梵体育网

[CL]《From Representations to Behaviors:

[CL]《From Representations to Behaviors: Exploring the Person-Situation-Behavior Triad in LLMs》R Zhang, S Wang, Q Su [Peking University & Beijing Institute of Technology] (2026)

在 LLM 个性化建模领域,如何证明模型具备真正的“人格”而非仅仅是文字模仿是一个悬而未决的难题。过去的方法受困于对提示词(Prompting)或单一问卷评分的依赖,本质原因是缺乏一种能将模型内部表征、跨情境的表达一致性以及深层社会行为逻辑统一起来的机理性证据。

本文的核心洞见是:把 LLM 的人格重新看作内部状态、具体情境与行为后果的“三元组”联动。由此,利用稀疏自编码器(SAE)从对比行为中提取极具解释力的稀疏特征这一关键操作使问题得以解开。研究者不再调节宏观提示词,而是精准干预这些微观特征,观察模型在不同社交场景下是否产生符合人类心理学预期的行为偏移。

这项工作真正留下的遗产是证明了 LLM 内部存在可控且稳健的“人格特征表征”,并揭示了干预这些表征会带来与人类相似的收益-代价权衡(如提升宜人性会增强冲突调节但削弱执行力)。它为后来者打开的新门是基于神经元层面的心理对齐路径,但尚未跨过的门槛是复杂多重人格特征在长程交互中的动态演化与冲突协调机制。

arxiv.org/abs/2607.26853 机器学习 人工智能 论文 AI创造营