IEEE Transactions · 2026 · Journal article · Author with a top-venue record

DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model With Self-Generated Cross-Modal Alignment

K C Lu, Zhehuai Chen, Szu‐Wei Fu, Chao-Han Huck Yang, Sung-Feng Huang, C. C. Yang, Chia-Mu Yu, Chun‐Wei Chen, Weiyou Chen, Chien-yu Huang, Yi‐Cheng Lin, Yuxiang Lin, Chi-An Fu, Chun-Yi Kuan, Wenze Ren, Xuanjun Chen, Wei-Ping Huang, En-Pei Hu, T. W. Lin, Yuan-Kuei Wu, Kuan-Po Huang, Hsiao-Ying Huang, Huang-Cheng Chou, Kai-Wei Chang, Cheng-Han Chiang, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee

National Taiwan University · National Taipei University · Nvidia (United States) · University of Southern California

Published in
IEEE Transactions on Audio Speech and Language Processing
Date
2026-01-01
Citations
64
arXiv
2507.02768
Cite
@article{lu2026destaaudio,
  title = {DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model With Self-Generated Cross-Modal Alignment},
  author = {K C Lu and Zhehuai Chen and Szu‐Wei Fu and Chao-Han Huck Yang and Sung-Feng Huang and C. C. Yang and Chia-Mu Yu and Chun‐Wei Chen and Weiyou Chen and Chien-yu Huang and Yi‐Cheng Lin and Yuxiang Lin and Chi-An Fu and Chun-Yi Kuan and Wenze Ren and Xuanjun Chen and Wei-Ping Huang and En-Pei Hu and T. W. Lin and Yuan-Kuei Wu and Kuan-Po Huang and Hsiao-Ying Huang and Huang-Cheng Chou and Kai-Wei Chang and Cheng-Han Chiang and Boris Ginsburg and Yu-Chiang Frank Wang and Hung-yi Lee},
  year = {2026},
  journal = {IEEE Transactions on Audio Speech and Language Processing},
  eprint = {2507.02768},
  archivePrefix = {arXiv},
  doi = {10.1109/TASLPRO.2026.3675792},
  url = {https://arxiv.org/abs/2507.02768},
}