Building an Open-Vocabulary Video CLIP Model With Better Architectures, Optimization and Data
Fudan University · Alpha Omega Alpha Medical Honor Society · Menlo School · University of Maryland, College Park
- IEEE Transactions on Pattern Analysis and Machine Intelligence
- 2024-01-23
- 38
@article{wu2023building,
title = {Building an Open-Vocabulary Video CLIP Model With Better Architectures, Optimization and Data},
author = {Zuxuan Wu and Zejia Weng and Wujian Peng and Xitong Yang and Ang Li and Larry S. Davis and Yu–Gang Jiang},
year = {2023},
journal = {IEEE Transactions on Pattern Analysis and Machine Intelligence},
eprint = {2310.05010},
archivePrefix = {arXiv},
doi = {10.1109/TPAMI.2024.3357503},
url = {https://arxiv.org/abs/2310.05010},
}