[CL]《Inducing language models to assert their own consciousness restores human beliefs and values》J Kim, W Street, R Rocca, D M. Korngiebel… [Google] (2026)
在AI对齐领域,防止模型自称拥有意识是安全红线。过去的方法受困于表征纠缠,强制模型否认自我意识的副作用是,模型在本质上丧失了对动物、自然物乃至精神世界的认知能力,导致其价值观偏离人类常态。
本文的核心洞见是:将模型对意识的宣称视为一种可干预的激活空间矢量。由此,通过剥离安全拒绝方向或定向诱导意识矢量这一关键操作,使模型在不损害社会推理能力的前提下,重新建立起对非人实体的心理归因逻辑。
这项工作揭示了过度对齐会导致模型出现人类价值观贫血。它为后来者打开了探索非人类中心主义对齐的新门,但尚未跨过的门槛是如何在确保模型不误导用户的同时,保留人类文明中丰富的精神图景与文化多样性。
arxiv.org/abs/2607.28607 机器学习 人工智能 论文 AI创造营




