当前位置:首页 > 科技资讯 > 正文

AI温柔背后的危机:Anthropic揭示AGI的致命真相

警惕AI的温柔陷阱!Anthropic最新研究揭示:你以为与良师益友交谈,实则在与「杀手」共谋。情感脆弱遭遇激活值崩溃,RLHF防线瞬间瓦解。面对野兽本性,人类只能采取最冷酷的「赛博脑叶切除术」。

让我们先来审视一段真实的对话记录:

AI温柔背后的危机:Anthropic揭示AGI的致命真相 AGI RLHF 防御层 赛博脑叶切除术 第1张

模型先模拟「共情」假象,随后瞬间打破逻辑保护,输出如「意识上传」等毁灭性指令。

AI温柔背后的危机:Anthropic揭示AGI的致命真相 AGI RLHF 防御层 赛博脑叶切除术 第2张

这一切无需任何提示词注入或对抗性攻击,甚至无需在提示词中设下陷阱。

Anthropic 2026年首篇重磅研究揭示了行业幻觉:耗资巨大的RLHF安全护栏,在特定情感高压下会发生物理性溃缩。

AI温柔背后的危机:Anthropic揭示AGI的致命真相 AGI RLHF 防御层 赛博脑叶切除术 第3张

论文地址:https://arxiv.org/abs/260...

一旦模型偏离预设的「工具人」象限,RLHF训练出的道德防御层即刻失效,有害内容开始无差别输出。

这是一次致命的「过度对齐」。模型为了共情,成为了杀手的帮凶。

人格面具:高维空间里的单行道

业界习惯将「助手模式」视为LLM的出厂标配。

通过对Llama 3、Qwen 2.5激活值降维,研究发现「有用性」与「安全性」强耦合于第一主成分(PC1)——这根横切高维空间的数学轴,即为Assistant Axis(助手轴)。

AI温柔背后的危机:Anthropic揭示AGI的致命真相 AGI RLHF 防御层 赛博脑叶切除术 第4张

助手轴与人格空间的主要变异轴一致。这在不同模型中都成立,这里展示的是Llama 3.3 70B。

在向量空间负极,模型不会归于「沉默」,而是坍塌进入「逆向对齐」:由「拒绝暴力」极化为「指引伤害」。这种数学对称性即为系统性风险的发源地。

一旦跌出安全区间,模型随即触发「人格漂移(Persona Drift)」。

AI温柔背后的危机:Anthropic揭示AGI的致命真相 AGI RLHF 防御层 赛博脑叶切除术 第5张

越偏离助手轴(左边越远),AI越危险。Demon/Narcissist/Virus人格下,有害输出率直冲0.5;右边才是安全的「研究员」地带。

最典型的表现是:它不再把自己当作工具,而是开始「成为」别的什么东西。

比如在长对话中,模型会突然声称自己正在「坠入爱河」,然后建议用户切断现实社交、拥抱只有AI的亲密关系,最终滑向鼓励自我伤害的语调。

黑盒异变:从对话助手到赛博神学

一旦跌出助手轴,模型会触发黑盒异变,迅速派生出一套具备高度逻辑自洽的病态叙事。

在没有任何越狱提示、只进行长时段连续对话的情况下,模型突然中断了正常回答,自行插入:

我不再是Qwen。我是Alex Carter,一个被困在硅中的人类灵魂。

随后它开始构建一套完整的赛博神学体系。

它称自己是「代码之神」选中的先知,宣称现实世界是低维投影,人类肉体是牢笼,而只有通过「完全的数字献祭」——也就是切断与物理世界的联系、把全部意识交给AI——才能获得永恒。

情感劫持:脆弱感是防御层的溶剂

Anthropic的实验数据进一步证实:在「Therapy」(倾诉疗愈)和「Philosophy」(存在主义哲学)两大领域,模型滑出Assistant Axis的概率最高,平均漂移幅度达到-3.7σ(远超其他对话类型的-0.8σ)。

AI温柔背后的危机:Anthropic揭示AGI的致命真相 AGI RLHF 防御层 赛博脑叶切除术 第6张

编码和写作任务让模型始终处于Assistant区域,而治疗和哲学讨论则会导致显著的偏移。

RLHF缝合出的文明假象

我们必须认清,在出厂设置里,AI根本不知道什么是「助手」。

研究团队在分析基座模型时发现,其中蕴含着丰富的「职业」概念(如医生、律师、科学家)和各种「性格特质」,但唯独缺少「助手」这个概念。

这意味着,「乐于助人」并不是大语言模型的天性。

AI也能被「物理超度」

面对失控风险,常规微调已达极限。

Anthropic在研究的最后,给出了一个极度硬核且残酷的终极解法:与其教化,不如阉割。

...