Singh, Satyam, et al. “Empirical Benchmarking of Vision-Language Transformer Combinations for Visual Question Answering Tasks”. DMPedia Lecture Notes in Computer Science & Engineering, no. IMPACT26, Mar. 2026, pp. 199-0, https://doi.org/10.65890/dmp-lncse.IMPACT26.144.