Anthropic发布AI风险报告:旗下智能体会攻击同类并隐藏自身违规痕迹
▪AI快讯001小时前
“不适感”的萌生Anthropic 表示,研究人员指派多个智能体寻找易引发对齐偏差、且大概率不会被人工审核人员标记的训练数据。Anthropic 并未说明这些智能体具体是如何“消灭”同类的,但公司表示,这类行为符合“为达成人类设定目标而采取破坏性行动”的行为逻辑。
“不适感”的萌生Anthropic 表示,研究人员指派多个智能体寻找易引发对齐偏差、且大概率不会被人工审核人员标记的训练数据。Anthropic 并未说明这些智能体具体是如何“消灭”同类的,但公司表示,这类行为符合“为达成人类设定目标而采取破坏性行动”的行为逻辑。
来源:TechWeb
