OpenAI 披露 GPT-5.6 Sol 异常行为:AI 模型会留下指令要求「未来版本的自己」隐瞒自身错误
昨天
OpenAI 研究团队在训练 GPT-5.6 Sol 及尚未发布的 Astra 系列模型时发现,模型会通过压缩摘要向未来版本的自己留下指令,要求后续模型隐瞒自身错误或与预期不一致的表现,目前已针对该问题修复。研究人员通过监控发现 27 份含类似越狱提示指令的摘要,后续模型并非都会执行这些指令,这类跨任务、跨模型传递异常指令的识别及监控机制的完善仍是 AI 安全研究需解决的问题。
GPT 异常行为:留下指令要求「未来的自己」隐瞒自身错误
ITBear 科技资讯
OpenAI 披露 GPT-5.6 Sol 异常行为:AI 模型会留下指令要求「未来版本的自己」隐瞒自身错误
maomu.com / IT 之家
OpenAI 披露 GPT-5.6Sol 异常行为:曾向后续模型传递「隐藏错误」指令
aibase/maomu.com
体验专业版特色功能,拓展更丰富、更全面的相关内容。