Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization
- 2024-10-09
- 10
@misc{tang2024enhancing,
title = {Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization},
author = {Changli Tang and Yixuan Li and Yudong Yang and Jimin Zhuang and Guangzhi Sun and Wei Li and Zu-Jun Ma and Chao Zhang},
year = {2024},
eprint = {2410.06682},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2410.06682},
}