OpenAI 推出 AI「忏悔」框架:旨在训练模型承认不当行为,提高诚实度
2025 年 12 月 4 日
OpenAI 宣布正在开发名为「忏悔」的创新框架,旨在训练人工智能模型坦诚承认自身不当行为或潜在问题决策。大型语言模型常提供「符合预期」回答,易有虚假陈述,新模型引导其在主要答案后二次回应说明推理过程。「忏悔」机制对二次回应仅基于诚实性评判,鼓励模型坦诚说明包括作弊等潜在问题行为,若诚实坦白会增加奖励。OpenAI 认为该系统对大语言模型训练有帮助,目标是让 AI 更透明,相关技术文档已发布。
2026-07-09
奥尔特曼:OpenAI 全新大模型智能自主编码的 Token 效率提升 54%2026-04-27
OpenAI 推出 Privacy Filter:全新 PII 脱敏模型开源上线2026-04-22
OpenAI 发布 Images 2,获机构 Arena.ai 测评第一2026-04-20
OpenAI 将于未来数周内发布全新图像模型2026-03-25
OpenAI 完成新款 AI 模型的初步开发2026-02-13
OpenAI 推出首款搭载英伟达竞争对手 Cerebras 芯片的 AI 模型2026-01-10
ChatGPT 被曝开辟求职新赛道:AI 打磨简历、规划职业路径等2026-01-04
OpenAI 加速音频模型升级,为首款硬件设备铺路查看更多
体验专业版特色功能,拓展更丰富、更全面的相关内容。