☰
RL 与大模型后训练:30 天课程
/
06 · DPO:目标函数与实验假设
免费学习
40 分钟
注册并验证邮箱后免费阅读
三门课程全部免费。验证邮箱后,学习进度会保存到你的账号。
注册,免费学习
已有账号,登录