DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model With Self-Generated Cross-Modal Alignment
National Taiwan University · National Taipei University · Nvidia (United States) · University of Southern California
- IEEE Transactions on Audio Speech and Language Processing
- 2026-01-01
- 64
@article{lu2026destaaudio,
title = {DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model With Self-Generated Cross-Modal Alignment},
author = {K C Lu and Zhehuai Chen and Szu‐Wei Fu and Chao-Han Huck Yang and Sung-Feng Huang and C. C. Yang and Chia-Mu Yu and Chun‐Wei Chen and Weiyou Chen and Chien-yu Huang and Yi‐Cheng Lin and Yuxiang Lin and Chi-An Fu and Chun-Yi Kuan and Wenze Ren and Xuanjun Chen and Wei-Ping Huang and En-Pei Hu and T. W. Lin and Yuan-Kuei Wu and Kuan-Po Huang and Hsiao-Ying Huang and Huang-Cheng Chou and Kai-Wei Chang and Cheng-Han Chiang and Boris Ginsburg and Yu-Chiang Frank Wang and Hung-yi Lee},
year = {2026},
journal = {IEEE Transactions on Audio Speech and Language Processing},
eprint = {2507.02768},
archivePrefix = {arXiv},
doi = {10.1109/TASLPRO.2026.3675792},
url = {https://arxiv.org/abs/2507.02768},
}