Zijian, S., Haoran, L., Yaqian, L., Haibin, L., Wenming, Z., Tao, S. (2026). FMII: a unified intra- and inter-modal interaction framework for robust audio-visual emotion recognition. Journal of King Saud University - Computer and Information Sciences. https://doi.org/10.1007/s44443-026-00610-z