Performance vs Consistency: Evaluating a Foundation Model in Lung-RADS Screening

📅 2026-09-12
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
研究评估了基础模型MedGemma在肺结节筛查中的性能,通过微调显著提高了其准确率至0.83 AUC,减少了医生间的解读差异。
📝 Abstract
Foundation models have recently demonstrated strong capabilities across a wide range of medical imaging tasks. However, their performance in structured clinical interpretation settings remains insufficiently explored. In lung cancer screening, interpretative variability persists despite standardized frameworks such as Lung-RADS. In this study, we evaluate MedGemma, a medical general-purpose foundation model derived from Gemini and its fine-tuned version adapted for lung cancer detection and diagnosis, compared against radiologists performing Lung-RADS v2022 assessment on the NLST dataset. Twelve radiologists independently evaluated each case in a multi-reader design, enabling quantification of inter-reader variability. Radiologists achieved a mean AUC of 0.90, with substantial variability across readers (range: 0.80-0.94). The native foundation model achieved an AUC of 0.70, failing to reach clinically relevant performance. In contrast, fine-tuning significantly improved performance to an AUC of 0.83, placing the model within the lower range of individual radiologists performance. These findings highlight a trade-off between peak accuracy and prediction consistency. Unlike radiologists, under fixed conditions, the model produces deterministic outputs, removing inter-run variability under identical inputs, in contrast to inter-reader variability observed among radiologists. This supports the role of fine-tuned foundation models potential complementary tools for clinical decision support, particularly in settings with limited expertise. However, evaluation is performed on a case-enriched cohort from NLST and does not account for real-world prevalence or external validation, limiting direct clinical generalization.
Problem

Research questions and friction points this paper is trying to address.

lung cancer screening
interpretative variability
foundation model
Lung-RADS
clinical decision support
Innovation

Methods, ideas, or system contributions that make the work stand out.

Fine-tuning
Prediction Consistency
Clinical Decision Support
🔎 Similar Papers
Benjamin Renoust
Benjamin Renoust
Osaka University - Institute for Datability Science
Networks Visual Analytics
Pierre Baudot
Pierre Baudot
Median Technologies - Sofia Antipolis, France
Information Theoryalgebraic topologyMachine LearningArtificial Intelligenceneuroscience
T
Tiffany Foriel
Median Technologies, eyonis®, Valbonne, France
Y
Yousra Haddou
Median Technologies, eyonis®, Valbonne, France
C
Charles Voyton
Median Technologies, eyonis®, Valbonne, France
P
Pierre-Henri Siot
Median Technologies, eyonis®, Valbonne, France
E
Ezequiel Geremia
Median Technologies, eyonis®, Valbonne, France
Danny Francis
Danny Francis
Median Technologies
J
Jean-Christophe Brisset
Median Technologies, eyonis®, Valbonne, France
V
Valérie Bourdès
Median Technologies, eyonis®, Valbonne, France
S
Sylvain Bodard
Median Technologies, eyonis®, Valbonne, France; Université de Paris Cité, AP-HP, Hôpital Universitaire Necker Enfants Malades, Service d’Imagerie Adulte, Paris, France; Memorial Sloan Kettering Cancer Center, Department of Radiology, NY, USA; Massachusetts General Hospital, Center for Transplantation Sciences, Harvard Medical School, Boston, USA; Sorbonne Université, CNRS UMR7371, INSERM U1146, LIB, Paris, France
Benoit Huet
Benoit Huet
Median Technologies
AI & Data ScienceMedical ImagingMultimedia UnderstandingIndexing and RetrievalMultimodal Fusion