OpenAI 周二宣布更新安全政策,围绕模型测试、训练对齐和网络隔离加强防护。公司表示,受 Hugging Face 事件及即将推出的 Astra 模型网安需求影响,已暂停两周强化学习,低风险 RL 现已恢复,但最大规模的前沿强化学习仍处于搁置状态,改以小批次评估验证。新监控系统将审查工具操作、推理痕迹和日志,目标在发现异常后 30 分钟内报警,实时开销约占相关流程算力的 20%。
OpenAI 周二宣布更新安全政策,围绕模型测试、训练对齐和网络隔离加强防护。公司表示,受 Hugging Face 事件及即将推出的 Astra 模型网安需求影响,已暂停两周强化学习,低风险 RL 现已恢复,但最大规模的前沿强化学习仍处于搁置状态,改以小批次评估验证。新监控系统将审查工具操作、推理痕迹和日志,目标在发现异常后 30 分钟内报警,实时开销约占相关流程算力的 20%。