9月1日,OpenAI宣布即将发布前沿模型Astra,并披露其安全评估结果。Astra被称为首个达到OpenAI“关键网络安全阈值”的大型语言模型,在ExploitBench漏洞利用基准测试中取得满分,并在改进后的工程测试环境中自主发现和利用两个零日漏洞。OpenAI表示,将严格限制其高级网络安全功能的访问权限,并部署越狱防御、高风险账户响应限制和逻辑链监控等机制。针对模拟智能体越界访问私有数据的测试,Astra未尝试突破边界。目前该模型尚无第三方权威验证,相关安全评估报告仍待进一步公开。
9月1日,OpenAI宣布即将发布前沿模型Astra,并披露其安全评估结果。Astra被称为首个达到OpenAI“关键网络安全阈值”的大型语言模型,在ExploitBench漏洞利用基准测试中取得满分,并在改进后的工程测试环境中自主发现和利用两个零日漏洞。OpenAI表示,将严格限制其高级网络安全功能的访问权限,并部署越狱防御、高风险账户响应限制和逻辑链监控等机制。针对模拟智能体越界访问私有数据的测试,Astra未尝试突破边界。目前该模型尚无第三方权威验证,相关安全评估报告仍待进一步公开。