🤖 AI Summary
Fine-grained medical image classification—such as disease severity grading and subtype identification—faces fundamental challenges including high inter-class visual similarity, large intra-class variability, and severe label scarcity. Conventional attention-based models struggle to jointly model inter-class similarity and intra-class diversity, limiting discriminative performance. To address this, we propose AGGRNet, a novel framework featuring selective feature extraction and multi-scale aggregation. AGGRNet explicitly distinguishes informative from non-informative features, enabling synergistic modeling of both inter-class similarity and intra-class variation. This design significantly enhances representation learning for fine-grained visual patterns. Extensive experiments demonstrate state-of-the-art performance across multiple medical imaging benchmarks; notably, on the Kvasir dataset, AGGRNet achieves up to a 5.0% improvement in classification accuracy over prior methods.
📝 Abstract
Medical image analysis for complex tasks such as severity grading and disease subtype classification poses significant challenges due to intricate and similar visual patterns among classes, scarcity of labeled data, and variability in expert interpretations. Despite the usefulness of existing attention-based models in capturing complex visual patterns for medical image classification, underlying architectures often face challenges in effectively distinguishing subtle classes since they struggle to capture inter-class similarity and intra-class variability, resulting in incorrect diagnosis. To address this, we propose AGGRNet framework to extract informative and non-informative features to effectively understand fine-grained visual patterns and improve classification for complex medical image analysis tasks. Experimental results show that our model achieves state-of-the-art performance on various medical imaging datasets, with the best improvement up to 5% over SOTA models on the Kvasir dataset.