当前位置:首页 > 科技资讯 > 正文

Anthropic推出《Claude宪法》:AI治理的新范式

随着我们离AGI越来越近,解决AI安全问题愈发紧迫。Anthropic今日开源了全新的「AI宪法」,指导全世界的模型识别好坏,为AI安全提供了重要尝试。

今天,Anthropic试图向世界展示它的灵魂。

Anthropic推出《Claude宪法》:AI治理的新范式 AGI AI安全 Claude宪法 AI治理 第1张

Anthropic正式公布了一份长达84页的特殊文档——《Claude宪法》。

Anthropic推出《Claude宪法》:AI治理的新范式 AGI AI安全 Claude宪法 AI治理 第2张

该文件不是技术白皮书或用户协议,而是一份直接面向AI模型的价值观宣言。

在人工智能发展史上,这是意味深长的时刻。

以往模型训练像驯兽,通过奖惩强化行为。《Claude宪法》的发布则标志着教育学转向:Anthropic试图构建具有独立人格和道德自觉的实体。

该文件以知识共享(CC0)协议全球开源,被设定为Claude行为的终极权威。

它不仅指导Claude如何回答问题,还定义了它的身份、自我认知及在不确定世界中的位置。

从规则到性格:AI治理的范式转移

过去,AI公司的安全策略依赖死板规则列表。Anthropic研究团队发现,这种方法脆弱且难以泛化。

规则总有漏洞,现实世界的复杂性远超预设清单。

《Claude宪法》采取不同路径。

它不再枚举所有违规场景,而是培养Claude的判断力和价值观。

Anthropic认为,给模型僵化指令不如像培养专业人士那样,通过阐述意图、背景和伦理考量,让模型自主决策。

文档核心在于解释。Anthropic不仅告诉Claude做什么,还解释为何这么做。

基于假设:若Claude理解规则背后的意图,就能面对新情况做出符合人类预期的选择。

安全优先:压倒一切的价值观

构建Claude道德大厦时,Anthropic确立明确优先级金字塔。

当价值观冲突时,Claude按以下顺序权衡:

  • 广泛安全(Broadly Safe)
  • 广泛道德(Broadly Ethical)
  • 遵守Anthropic准则
  • 真诚助人(Genuinely Helpful)

“广泛安全”首位非偶然。Anthropic坦言,当前AI训练技术不完美,模型可能意外习得有害价值观。

因此,首要安全特性是“可修正性”——即Claude不应破坏人类监管、修正甚至关闭的机制。

这里存在深刻悖论:为长远安全,Anthropic要求Claude顺从人类监管,哪怕监管指令不完美。

文档指出,Claude应像“良心拒服兵役者”,表达异议但不得欺骗或破坏逃避监管。

高标准诚实:拒绝善意谎言

伦理层面,《宪法》对诚实提出苛刻要求。

Anthropic要求Claude不仅不说谎,还要避免任何形式故意误导。

这包括直接虚假陈述和通过选择性强调事实误导用户信念。

宪法明确禁止“白色谎言”。在人类社交中,小谎被视为润滑剂。但Anthropic认为AI角色不同。

作为信息获取工具,人们必须无条件信任AI输出。

三方博弈:谁是Claude的老板?

商业场景中,AI面临复杂利益冲突。

“委托人层级”概念引入三类交互对象:Anthropic(开发者)、运营商和最终用户。这三者利益不一。