What Makes Deep Learning Work for Traditional Chinese Medicine Tongue Diagnosis? A Comprehensive Ablation Study

📅 2026-07-30
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
This study addresses the lack of clear design principles for multi-label imbalanced medical image classification in automated tongue diagnosis in Traditional Chinese Medicine. Through systematic ablation experiments on two large-scale tongue image datasets (976 and 11,101 samples), it evaluates combinations of six backbone networks, four loss functions, five augmentation strategies, and six training protocols. The work establishes six generalizable design principles: ConvNeXt-Tiny offers superior parameter efficiency; binary cross-entropy loss outperforms asymmetric loss; color-based augmentations should be used sparingly; weak group ensembling surpasses probability averaging; larger data scale substantially boosts performance; and expanding label dimensions risks performance collapse. Under rigorous five-fold cross-validation, the models achieve weighted F1 scores of 0.6625 and 0.7761, respectively, providing reproducible best practices for multi-label imbalanced medical image classification.
📝 Abstract
Deep learning has shown promise for automated tongue diagnosis in traditional Chinese medicine (TCM), yet the design space remains underexplored. We conducted a systematic ablation study spanning 20+ model versions under rigorous 5-fold cross-validation on TongueDx2 (5,109 images, 976 expert-annotated) and a merged dataset of 11,101 samples. We compared six backbone architectures, four loss functions, five augmentation strategies, and six training strategies. The best 976-sample model achieved weighted-F1 of 0.6625 using ConvNeXt-Tiny with restrained augmentation and weak-group ensemble, while the best 11,101-sample model reached weighted-F1 of 0.7761. Six key design principles emerged: (1) ConvNeXt-Tiny offers optimal parameter efficiency; (2) BCE substantially outperforms Asymmetric Loss (+2.7%); (3) restrained color augmentation is critical; (4) weak-group ensemble replacement (+2.1%) outperforms probability averaging; (5) data scaling yielded +20.6% improvement; (6) expanding from 13 to 45 label dimensions caused catastrophic collapse (0.78 to 0.22). These principles are generalizable to multi-label medical image classification with class imbalance.
Problem

Research questions and friction points this paper is trying to address.

tongue diagnosis
traditional Chinese medicine
deep learning
ablation study
medical image classification
Innovation

Methods, ideas, or system contributions that make the work stand out.

ablation study
ConvNeXt-Tiny
multi-label classification
class imbalance
ensemble strategy
🔎 Similar Papers
No similar papers found.
L
Longxia Gao
College of Traditional Chinese Medicine, Hebei University, Baoding, Hebei, China
L
Linan Wang
College of Traditional Chinese Medicine, Hebei University, Baoding, Hebei, China
Y
Yuhe Han
College of Traditional Chinese Medicine, Hebei University, Baoding, Hebei, China
J
Junze Geng
College of Traditional Chinese Medicine, Hebei University, Baoding, Hebei, China
M
Meng Zhang
College of Traditional Chinese Medicine, Hebei University, Baoding, Hebei, China
Hanqing Zhao
Hanqing Zhao
Research Fellow, Nanyang Technological University
Computer VisionDeep Learning