arXiv · 2023 · Preprint

COPR: Continual Learning Human Preference through Optimal Policy Regularization

Han Zhang, Lin Gui, Yuan-Zhao Zhai, Hui Wang, Yu Lei, Ruifeng Xu

Date
2023-10-24
Citations
2
arXiv
2310.15694
Cite
@misc{zhang2023copr,
  title = {COPR: Continual Learning Human Preference through Optimal Policy Regularization},
  author = {Han Zhang and Lin Gui and Yuan-Zhao Zhai and Hui Wang and Yu Lei and Ruifeng Xu},
  year = {2023},
  eprint = {2310.15694},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2310.15694},
}