基于人类反馈的强化学习(RLHF)
TRL
在 GPT-2 上进行 RLHF
使用 PPO 训练模型生成更多正面情感(Positive Sentiment)的文本
Colab Notebook — 在 GPT-2 上使用 PPO 实现 RLHF 正面情感生成colab.research.google.com
通过在输入中指定前缀(Prefix),训练模型生成正面、中性或负面的文本(Controlled Sentiment)
Colab Notebook — 在 GPT-2 上实现 RLHF 可控情感生成colab.research.google.com