V, D., M, B., M G, J., & I S, S. (2026). A Hybrid Vision–Language Framework For Unified Image–Video Captioning And Semantic Visual Question Answering. International Journal of Artificial Intelligence and Machine Learning, 6(7s), 790–807. https://doi.org/10.51483/IJAIML.6.7s.2026.790-807