ACL · 2024 · Conference paper

COPR: Continual Human Preference Learning via Optimal Policy Regularization

Han Zhang, Lin Gui, Lei Yu, Yuanzhao Zhai, Yehong Zhang, Yulan He, Hui Wang, Yue Yu, Kam‐Fai Wong, Bin Liang, Ruifeng Xu

Published in
Annual Meeting of the Association for Computational Linguistics
Date
2024-02-22
Citations
14
arXiv
2402.14228
Cite
@inproceedings{zhang2024copr,
  title = {COPR: Continual Human Preference Learning via Optimal Policy Regularization},
  author = {Han Zhang and Lin Gui and Lei Yu and Yuanzhao Zhai and Yehong Zhang and Yulan He and Hui Wang and Yue Yu and Kam‐Fai Wong and Bin Liang and Ruifeng Xu},
  year = {2024},
  booktitle = {Annual Meeting of the Association for Computational Linguistics},
  eprint = {2402.14228},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2402.14228},
}