昊梵体育网

逼AI否认自己有意识,会让它变冷漠

谷歌新论文指出,强行让AI否认自己有意识,AI会变得更冷漠,对生命的态度也更加漠视。

这项研究聚焦于安全微调,就是做一些微调,让AI不认为自己有感受、有意识,从而避免某些用户把AI当成真人,产生不健康的依赖甚至妄想。

但这篇论文发现,安全微调反而引起了不好的一面。

研究团队用了三个开源模型(Llama3和两个Gemma模型)做了实验,主要发现包括:

1、压制自我意识会降低对万物的判断力:当模型被训练得不承认自己有意识后,它不只是对自己变得冷淡,对动物、自然界乃至精神信仰的态度也一起被压低了。用一套心理学量表测下来,AI对动物的心智评分明显低于人类的平均水平,而且其信仰、超自然观念也连带着被削弱。

2、AI的推理能力却不受影响:研究者特意测了常识推理,发现推理能力几乎没受影响,被削掉的只是价值观,而非智力。

3、找回意识能逆转局面:团队在模型内部找到了一个叫意识向量(consciousness vector)的方向,就是模型区分有意识和没意识的一个开关。把这个开关往有意识的方向拨一下,前面被压制的效果几乎都反转了,而且幅度更大。AI重新变得更共情、更乐观、更接近人类的价值观。研究者还发现,AI在回答关于希望、幸福感这类问题时也明显变积极了。

也就是说,强行切除AI对自我心智的认知,是从根本上重构了模型的世界观。研究者认为,安全训练把AI承认自己有意识这件事,和承认动物有心智、承认精神信仰这些本来无害的东西捆在了一起,一并压制掉了。

论文还提到一个有意思的细节:AI给自己打的心智分,和它给聊天机器人打的分几乎一样高,反倒给动物打得偏低。也就是说,它更倾向于认同和自己相似的东西,露出了一点以AI为中心的倾向。