GEOZ

Entity

RLHF(GRPO)

基于人类反馈的强化学习,NanoChat采用GRPO(一种RLHF变体)在GSM8K数学数据集上对模型进行微调,以提升对话质量和任务完成能力。

相关文章