MaxGRNet: A multi-axis vision transformer with improved generalization for eye disease classification using explainable AI with insertion-deletion operations on fundus images

bracu.type.groupResearch Publications
datacite.rightsOpen Access
dc.contributor.authorSanto, Md Mehedi Hasan
dc.contributor.authorBhoyan, Fuyad Hasan
dc.contributor.authorFarhad, Fuad Ibne Jashim
dc.contributor.authorFarid, Fahmid Al
dc.contributor.authorChakraborty, Sovon
dc.contributor.authorMehedi, Md Humaion Kabir
dc.contributor.authorUddin, Jia
dc.contributor.authorKarim, Hezerul bin Abdul
dc.contributor.departmentDepartment of Computer Science and Engineering
dc.date.accessioned2026-08-23T09:25:11Z
dc.date.available2026-08-23T09:25:11Z
dc.date.issued2026-04-01
dc.description.abstractEye diseases, including diabetic retinopathy (DR), glaucoma, and cataracts, represent a major global health concern and can lead to severe visual impairment or blindness if not identified in a timely manner. This study proposes a novel eye disease classification framework based on a multi-axis vision transformer (MaxViT) applied to color fundus images with Explainable Artificial Intelligence (XAI) techniques to enhance model transparency. The proposed architecture integrates transformer-based attention mechanisms with Global Response Normalization (GRN)-based multi-layer perceptron (MLP) layers to capture complex spatial and contextual relationships within fundus images effectively. The model was evaluated on a publicly available eye disease classification dataset using a five-fold cross-validation strategy to assess its robustness and generalization. The experimental results show that the proposed approach consistently outperforms conventional Convolutional Neural Networks (CNNs) and Vision Transformer (ViT) variants, including ResNet50, Swin-T, MaxViT-T, and ViT-B16. The model achieved a macro-averaged test accuracy, precision, and recall values of 96.75%, 96.70%, and 96.80%, respectively, with paired statistical t-tests confirming that these improvements were statistically significant. Rigorous preprocessing techniques were employed to improve data consistency, and XAI-based visual explanations provided insights into the model’s decision-making process, supporting interpretability in ophthalmic image analysis. Overall, the proposed MaxViT-based framework is robust and computationally feasible for research-oriented evaluation approaches for automated fundus image classification, highlighting the potential of advanced transformer architectures for future decision-support and research-oriented ophthalmic applications. © 2026 Santo et al. This is an open access article distributed under the terms of the Creative Commons Attribution License, which permits unrestricted use, distribution, and reproduction in any medium, provided the original author and source are credited.
dc.description.versionPublished
dc.format.extent13 pages
dc.identifier.citationSanto MMH, Bhoyan FH, Farhad FIJ, Farid FA, Chakraborty S, Mehedi MHK, et al. (2026) MaxGRNet: A multi-axis vision transformer with improved generalization for eye disease classification using explainable AI with insertion-deletion operations on fundus images. PLoS One 21(4): e0346329. https://doi.org/10.1371/journal.pone.0346329
dc.identifier.doi10.1371/journal.pone.0346329
dc.identifier.issn19326203
dc.identifier.other2-s2.0-105035232915
dc.identifier.urihttps://hdl.handle.net/10361/29462
dc.language.isoen_US
dc.publisherPublic Library of Science
dc.relation.hasversion10.1371/journal.pone.0346329
dc.relation.ispartofPlos One
dc.relation.ispartofseriesPlos One
dc.relation.journalPLOS ONE
dc.relation.urihttps://journals.plos.org/plosone/article?id=10.1371/journal.pone.0346329
dc.rightstrue
dc.subjectAlgorithms
dc.subjectArtificial Intelligence
dc.subjectDiabetic retinopathy
dc.subjectEye diseases
dc.subjectFundus Oculi
dc.subjectHumans
dc.subjectNeural networks
dc.subjectComputer
dc.subject.lcshEye--Diseases--Diagnosis.
dc.subject.lcshEye--Data processing.
dc.subject.lcshFundus oculi--Diseases--Diagnosis.
dc.subject.lcshArtificial intelligence--Medical applications.
dc.subject.lcshDiagnostic imaging--Digital techniques.
dc.titleMaxGRNet: A multi-axis vision transformer with improved generalization for eye disease classification using explainable AI with insertion-deletion operations on fundus images
dc.typeArticle
oaire.citation.issue4 April
oaire.citation.volume21
person.affiliation.nameCQUniversity Australia
person.affiliation.nameUniversity of Liberal Arts Bangladesh
person.affiliation.nameCQUniversity Australia
person.affiliation.nameMultimedia University
person.affiliation.nameDepartment of Computer Science
person.affiliation.nameBRAC University
person.affiliation.nameWoosong University
person.affiliation.nameMultimedia University
person.identifier.orcid0000-0002-5759-022X
person.identifier.orcid0000-0002-3403-4095
person.identifier.scopus-author-id59963729200
person.identifier.scopus-author-id59750832400
person.identifier.scopus-author-id59963954300
person.identifier.scopus-author-id57288993100
person.identifier.scopus-author-id57219316890
person.identifier.scopus-author-id57422283000
person.identifier.scopus-author-id54994936900
person.identifier.scopus-author-id24492028400

Files

Original bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
MaxGRNet A multi-axis vision transformer with improved generalization for eye disease classification using explainable AI with insertion-deletion operations on fundus images.pdf
Size:
2.93 MB
Format:
Adobe Portable Document Format

License bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
license.txt
Size:
1.71 KB
Format:
Item-specific license agreed upon to submission
Description: