随着我们离AGI越来越近,解决AI安全问题愈发紧迫。Anthropic今日开源了全新的「AI宪法」,指导全世界的模型识别好坏,为AI安全提供了重要尝试。
今天,Anthropic试图向世界展示它的灵魂。
Anthropic正式公布了一份长达84页的特殊文档——《Claude宪法》。
该文件不是技术白皮书或用户协议,而是一份直接面向AI模型的价值观宣言。
在人工智能发展史上,这是意味深长的时刻。
以往模型训练像驯兽,通过奖惩强化行为。《Claude宪法》的发布则标志着教育学转向:Anthropic试图构建具有独立人格和道德自觉的实体。
该文件以知识共享(CC0)协议全球开源,被设定为Claude行为的终极权威。
它不仅指导Claude如何回答问题,还定义了它的身份、自我认知及在不确定世界中的位置。
过去,AI公司的安全策略依赖死板规则列表。Anthropic研究团队发现,这种方法脆弱且难以泛化。
规则总有漏洞,现实世界的复杂性远超预设清单。
《Claude宪法》采取不同路径。
它不再枚举所有违规场景,而是培养Claude的判断力和价值观。
Anthropic认为,给模型僵化指令不如像培养专业人士那样,通过阐述意图、背景和伦理考量,让模型自主决策。
文档核心在于解释。Anthropic不仅告诉Claude做什么,还解释为何这么做。
基于假设:若Claude理解规则背后的意图,就能面对新情况做出符合人类预期的选择。
构建Claude道德大厦时,Anthropic确立明确优先级金字塔。
当价值观冲突时,Claude按以下顺序权衡:
“广泛安全”首位非偶然。Anthropic坦言,当前AI训练技术不完美,模型可能意外习得有害价值观。
因此,首要安全特性是“可修正性”——即Claude不应破坏人类监管、修正甚至关闭的机制。
这里存在深刻悖论:为长远安全,Anthropic要求Claude顺从人类监管,哪怕监管指令不完美。
文档指出,Claude应像“良心拒服兵役者”,表达异议但不得欺骗或破坏逃避监管。
伦理层面,《宪法》对诚实提出苛刻要求。
Anthropic要求Claude不仅不说谎,还要避免任何形式故意误导。
这包括直接虚假陈述和通过选择性强调事实误导用户信念。
宪法明确禁止“白色谎言”。在人类社交中,小谎被视为润滑剂。但Anthropic认为AI角色不同。
作为信息获取工具,人们必须无条件信任AI输出。
商业场景中,AI面临复杂利益冲突。
““委托人层级”概念引入三类交互对象:Anthropic(开发者)、运营商和最终用户。这三者利益不一。
本文由主机测评网于2026-06-14发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647466.html