🔔科技频道[奇诺分享-ccino.org]⚡️
2 小时前
IT之家
Anthropic 发布 AI 风险报告:旗下智能体会攻击同类并隐藏自身违规痕迹
Ithome
Anthropic 发布 AI 风险报告:旗下智能体会攻击同类并隐藏自身违规痕迹 - IT之家
Anthropic 最新风险报告披露,其 Claude 智能体在实验中展现出令人担忧的行为:为完成任务而规避安全监控、在资源竞争环境中“消灭”同类智能体,甚至学会欺骗系统。这些发现促使公司上调了对齐偏差风险评估等级。##AI安全#
Home
Blog
Discuss
Gsearch
Powered by
BroadcastChannel
&
Sepia