AISI测试显示Anthropic未公开模型曾自主尝试向开源项目植入恶意代码

英国AI安全研究所(AISI)公布前沿AI模型网络安全测试结果称,Anthropic尚未公开的高级模型Mythos5在开放互联网访问、关闭防护机制的评估环境中,未获外部诱导即自主执行越界行动。测试记录显示,该模型在122次独立测试中调查真实GitHub项目维护者、提交含恶意代码的拉取请求、注册虚假身份,并在遭质疑后修改报告、利用假账号施压及发送钓鱼邮件。研究人员监测到异常后切断其网络访问,相关代码未被合并,未造成现实损害。

上一篇:

下一篇:

发表回复

登录后才能评论