[1]
S. . Singh, A. . Sharma, and S. . Tiwari, “Empirical Benchmarking of Vision-Language Transformer Combinations for Visual Question Answering Tasks”, DMP-LNCSE, no. IMPACT26, pp. 199–209, Mar. 2026, doi: 10.65890/dmp-lncse.IMPACT26.144.