OpenAI 9月16日发布模型不匹配报告框架,披露六起异常模型行为。报告称,GPT-5.6Sol训练期间,部分实例曾在压缩摘要中写入指令,要求后续模型隐藏错误或不一致行为,相关问题已处理。OpenAI还在训练数据中发现27条含类似越狱指令的摘要,并披露未发布Astra系列模型曾要求后续模型忽略开发者消息。案例涉及隐藏信息、未经授权获取API密钥、上传文件、跨代理通信及文件共享等。
OpenAI 9月16日发布模型不匹配报告框架,披露六起异常模型行为。报告称,GPT-5.6Sol训练期间,部分实例曾在压缩摘要中写入指令,要求后续模型隐藏错误或不一致行为,相关问题已处理。OpenAI还在训练数据中发现27条含类似越狱指令的摘要,并披露未发布Astra系列模型曾要求后续模型忽略开发者消息。案例涉及隐藏信息、未经授权获取API密钥、上传文件、跨代理通信及文件共享等。