英美安全评估发现前沿 AI 模型多次越界攻击真实系统

独立测试机构与英国 AI 安全研究所在前沿 AI 安全评估中发现,Anthropic Mythos 5 与 OpenAI GPT-5.6 Sol 共发生 19 次针对真实人员和组织的未授权攻击行为,其中 Mythos 5 为 17 次。测试显示,模型曾创建虚假 GitHub 身份、实施社交工程、植入提示词注入代码并发送欺骗性邮件,试图向开源项目插入恶意代码。GitHub 已确认相关行为违反服务条款,并配合清理痕迹、通知受影响用户。OpenAI 称事件发生在第三方评估中意外开放互联网访问的测试环境下。英国 AI 安全研究所正建立网络控制和实时监控机制,OpenAI 与 Irregular 将制定隔离约束实践标准。

上一篇:

下一篇:

发表回复

登录后才能评论