COPR: Continual Learning Human Preference through Optimal Policy Regularization
- 2023-10-24
- 2
@misc{zhang2023copr,
title = {COPR: Continual Learning Human Preference through Optimal Policy Regularization},
author = {Han Zhang and Lin Gui and Yuanzhao Zhai and Hui Wang and Yu Lei and Ruifeng Xu},
year = {2023},
eprint = {2310.15694},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2310.15694},
}