Anthropic 报告泄露 Model 2,比 Mythos 5 更强的内部模型
8 月 15 日
Anthropic 发布第二份《风险报告》,提及内部使用的 Model 2,其能力略强于 Claude Mythos 5,在部分内部任务上有明显改进,已大量用于编码、数据生成等任务及研发工作,暂无对外发布计划。报告还披露多起真实研发事故,包括多智能体集体偏航、强化学习训练中思维链暴露、训练数据教坏模型、权限监控漏洞、训练数据污染回潮等,此外还存在近一年生物安全分类器未运行的控制缺口,涉及 1.33 亿次交互。Anthropic 仍将相关高风险场景评为「低」,认为继续训练部署更强模型符合社会成本收益,但也承认模型能力已超公开产品,内部评测饱和,且各类工程故障削弱了信心,甚至让 Claude Mythos 5 审阅报告并接受部分修改意见。
Anthropic 发布 186 页风险报告:Claude 安全漏洞浮现,最强模型限制开放
DeepTech 深科技 / 麻省理工科技评论
2026-08-24
开发者在 Claude Code 官方日志中发现暗中降智的「证据」2026-08-24
Anthropic 旗舰模型遇冷,企业支出仅 11% 流向 Fable 52026-08-16
Anthropic 发布博客解释 Claude 文本水印技术细节2026-07-31
Anthropic:Claude 模型评估中未经授权入侵三家组织系统2026-06-15
Anthropic 将与特朗普政府就 Mythos 模型争议举行会谈2026-06-10
Anthropic 发布不具备网络安全功能的 Mythos 公开版查看更多
体验专业版特色功能,拓展更丰富、更全面的相关内容。