arXiv · 2024 · Preprint

Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization

Changli Tang, Yixuan Li, Yudong Yang, Jimin Zhuang, Guangzhi Sun, Wei Li, Zu-Jun Ma, Chao Zhang

Date
2024-10-09
Citations
10
arXiv
2410.06682
Cite
@misc{tang2024enhancing,
  title = {Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization},
  author = {Changli Tang and Yixuan Li and Yudong Yang and Jimin Zhuang and Guangzhi Sun and Wei Li and Zu-Jun Ma and Chao Zhang},
  year = {2024},
  eprint = {2410.06682},
  archivePrefix = {arXiv},
  url = {https://arxiv.org/abs/2410.06682},
}