Tag: RLHF
All the articles with the tag "RLHF".
-
从零训练大模型(十三):奖励模型与 Bradley-Terry 推导
奖励模型的完整推导:成对偏好数据、标量奖励头,以及 Bradley-Terry 损失——如何把“人类更喜欢哪个回答”变成一个可训练的打分器。
All the articles with the tag "RLHF".
奖励模型的完整推导:成对偏好数据、标量奖励头,以及 Bradley-Terry 损失——如何把“人类更喜欢哪个回答”变成一个可训练的打分器。