OpenAI 发布自动化红队模型 GPT-Red,提升模型提示注入防御能力

OpenAI 近日发布自动化红队测试模型 GPT-Red,用于规模化发现并生成 AI 系统对抗样本,提升模型安全性。该模型采用自博弈强化学习,与多类防御模型持续对抗,覆盖提示注入、逻辑诱导等攻击场景。OpenAI 数据显示,在特定测试中,GPT-Red 攻击成功率达 84%,高于人类红队的 13%;经整合至训练流程后,最新 GPT-5.6Sol 在直接提示注入攻击中的失败率降至 0.05%,且未明显影响通用任务能力。

上一篇:

下一篇:

发表回复

登录后才能评论