A multimodal vision–language framework using contrastive language-image pre-training for robust facial expression analysis in realistic classroom environments
Nighat, A., Fakhre, A., Asad, U., Jamil, A., Haleem, F., Walid, E. S., Ahmad, S. (2026). A multimodal vision–language framework using contrastive language-image pre-training for robust facial expression analysis in realistic classroom environments. Journal of King Saud University - Computer and Information Sciences. https://doi.org/10.1007/s44443-026-00905-1