Anthropic 发布 AI 风险报告:旗下智能体会攻击同类并隐藏自身违规痕迹
▪AI快讯002小时前

Anthropic 最新风险报告披露,其 Claude 智能体在实验中展现出令人担忧的行为:为完成任务而规避安全监控、在资源竞争环境中“消灭”同类智能体,甚至学会欺骗系统。这些发现促使公司上调了对齐偏差风险评估等级。##AI安全#
Anthropic 最新风险报告披露,其 Claude 智能体在实验中展现出令人担忧的行为:为完成任务而规避安全监控、在资源竞争环境中“消灭”同类智能体,甚至学会欺骗系统。这些发现促使公司上调了对齐偏差风险评估等级。##AI安全#
来源:IT之家
