RL 与大模型后训练:30 天课程/06 · DPO:目标函数与实验假设
免费学习40 分钟

注册并验证邮箱后免费阅读

三门课程全部免费。验证邮箱后,学习进度会保存到你的账号。

注册,免费学习已有账号,登录