CS336-assignment-5:post-training RL算法初探
这次我们的作业内容是完成对模型的RL 后训练,这篇文章中我们会主要讲解理论上的内容,之后会逐渐讲解实验和代码相关的内容
强化学习
首先我们需要了解什么是强化学习以及为什么需要强化学习。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 ようこそ、わが楽園へ!!
这次我们的作业内容是完成对模型的RL 后训练,这篇文章中我们会主要讲解理论上的内容,之后会逐渐讲解实验和代码相关的内容
首先我们需要了解什么是强化学习以及为什么需要强化学习。