Singh, Satyam, Aditya Sharma, and Smita Tiwari. 2026. “Empirical Benchmarking of Vision-Language Transformer Combinations for Visual Question Answering Tasks”. DMPedia Lecture Notes in Computer Science & Engineering, no. IMPACT26 (March): 199-209. https://doi.org/10.65890/dmp-lncse.IMPACT26.144.