@inproceedings{wang2023samclip,
title = {SAM-CLIP: Merging Vision Foundation Models towards Semantic and Spatial Understanding},
author = {Haoxiang Wang and Pavan Kumar Anasosalu Vasu and Fartash Faghri and Raviteja Vemulapalli and Mehrdad Farajtabar and Sachin Mehta and Mohammad Rastegari and Oncel Tuzel and Hadi Pouransari},
year = {2023},
booktitle = {2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)},
eprint = {2310.15308},
archivePrefix = {arXiv},
doi = {10.1109/CVPRW63382.2024.00367},
url = {https://arxiv.org/abs/2310.15308},
}