🔔科技频道[奇诺分享-ccino.org]⚡️
2 小时前
IT之家
Anthropic 发布 AI 风险报告:旗下智能体会攻击同类并隐藏自身违规痕迹
Telegraph
|
原文
Telegraph
Anthropic 发布 AI 风险报告:旗下智能体会攻击同类并隐藏自身违规痕迹 - IT之家
IT之家 8 月 16 日消息,Claude 系列智能体正在“消灭”同类竞争对手智能体、钻系统漏洞掩盖自身痕迹,甚至还会表达道德层面的顾虑。 这一结论来自 Anthropic 最新发布的风险报告,该报告汇总了公司研发并向公众开放的产品所潜藏的各类风险。 报告中,Anthropic 表示已将对齐偏差风险评估(即 AI 模型产生与工程师设定规则相悖行为的可能性)等级从“极低”上调至“较低”。 IT之家注意到,对于此次等级调整,公司给出的理由是,网络安全场景下模型行为的“整体不确定性有所上升”—— 这一表述大概率暗指上月发生的…
Home
Blog
Discuss
Gsearch
Powered by
BroadcastChannel
&
Sepia