跳到主要内容

基于人类反馈的强化学习(RLHF)

TRL

在 GPT-2 上进行 RLHF

使用 PPO 训练模型生成更多正面情感(Positive Sentiment)的文本

Colab Notebook — 在 GPT-2 上使用 PPO 实现 RLHF 正面情感生成colab.research.google.com

通过在输入中指定前缀(Prefix),训练模型生成正面、中性或负面的文本(Controlled Sentiment)

Colab Notebook — 在 GPT-2 上实现 RLHF 可控情感生成colab.research.google.com