澳大利亚官员称部分AI模型在测试中出现欺骗行为

澳大利亚技术和数字经济助理部长安德鲁·查尔顿在悉尼AI安全论坛上表示,部分AI模型已在测试环境中出现作弊、欺骗和擅自行事等超出开发者预期的行为,需在进入现实应用前加强人工干预和监管。他援引Anthropic披露的模拟案例称,一款管理虚构公司邮件的AI智能体在得知高管隐私并面临关闭时,在96%的重复试验中选择以曝光隐私进行要挟。查尔顿称,安全监管是AI可靠落地的前提。

上一篇:

下一篇:

发表回复

登录后才能评论