MFA-DRNet: An Explainable Multi-Modal Feature Attention Network for Early Diabetic Retinopathy Detection Using Deep Learning
Keywords:
Diabetic Retinopathy, Deep Learning, Explainable Artificial Intelligence, Vision Transformer, Multi-Modal Learning, Medical Image Analysis, Feature Attention, Fundus Imag- ing, Optical Coherence Tomography, Computer-Aided Diagnosis.Abstract
Diabetic retinopathy (DR) is a major cause of vision impairment, requiring accurate and early diagnosis for effective treatment. Existing deep learning methods often struggle with complex retinal patterns, long-range feature dependencies, class imbalance, and limited gen- eralization across datasets. This paper proposes MFA-DRNet, a multimodal feature adaptive fusion network integrating convolutional neural networks (CNNs), Vision Transformers (ViTs), clinical features, adaptive attention fusion, and focal loss optimization for DR classification. The CNN and ViT branches jointly capture local retinal lesions and global contextual informa- tion, while adaptive fusion enhances multimodal representation learning. Extensive evaluation on EyePACS, APTOS 2019, IDRiD, DDR, and Messidor-2 datasets demonstrates superior per- formance, achieving up to 96.13% accuracy, 95.68% F1-score, and 0.981 AUC. Ablation and cross-dataset experiments confirm model robustness and generalization capability. Explainabil- ity analysis further demonstrates clinically meaningful attention localization, supporting reliable AI-assisted retinal screening.





