RareDx: Controlled Knowledge Integration and Graph-Grounded Policy Optimization for Rare-Disease Diagnosis

πŸ“… 2026-09-28
πŸ“ˆ Citations: 0
✨ Influential: 0
πŸ“„ PDF
πŸ€– AI Summary
This study addresses the long-tail reasoning challenges in rare disease diagnosis, including incomplete phenotypes, fragmented evidence, and model bias toward common diseases. We propose KGPO, a framework built upon Qwen3.5 that unifies heterogeneous records through controlled evidence integration and maps predictions onto a disease knowledge graph. By incorporating an optimization strategy combining ontological proximity with phenotypic consistency rewards, alongside adaptive tool invocation and structured reasoning, the method effectively mitigates diagnostic hallucinations. Experiments demonstrate that KGPO achieves a Hit@10 of 38.34 across eight benchmarks, surpassing GPT-5.5. Furthermore, significant routing gains on validation sets confirm that structured knowledge injection substantially enhances the competitiveness of compact models in rare disease diagnosis.
πŸ“ Abstract
Rare-disease diagnosis is a long-tail reasoning problem: phenotypes are incomplete, individual disorders are sparsely documented, and relevant evidence is distributed across ontologies, gene annotations, and biomedical text. Language models consequently favor common conditions, miss rare candidates, or produce plausible but invalid names. We introduce RareDx, which couples controlled evidence use with knowledge-graph-grounded policy optimization. RareDx-Harness normalizes heterogeneous records into one ranked-diagnosis task and compares direct inference, static retrieval, adaptive tools, and structured phenotype-gene-disease reasoning over a shared knowledge layer. The training pipeline combines Top-10 post-training with RareDx-KGPO, our knowledge-graph-grounded policy optimization method. Its reward projects predictions into a canonical disease graph and integrates curated graded relevance, ontology proximity, biomedical similarity, and phenotype consistency. Vocabulary and output-budget constraints prevent dense partial credit from rewarding fabricated or overlong differentials. Across eight benchmarks, the complete RareDx system centered on Qwen3.5-9B reaches 38.34 macro Hit@10, 1.60 points above GPT-5.5 under the archived protocol; a disjoint validation-selection audit retains a 6.80-point routing gain over Direct on held-out cases. The 27B system reaches 23.53/36.56/40.76 at Hit@1/5/10. Controlled ablations show that retrieval is not uniformly helpful and that controlled routing is central to the gain. These results indicate that structured medical knowledge can turn a compact model into a competitive diagnostic ranker across heterogeneous long-tail settings in clinical practice.
Problem

Research questions and friction points this paper is trying to address.

rare-disease diagnosis
long-tail reasoning
language models
phenotype
knowledge graph
Innovation

Methods, ideas, or system contributions that make the work stand out.

Rare-Disease Diagnosis
Knowledge Graph-Grounded Policy Optimization
Controlled Knowledge Integration
Long-Tail Reasoning
Structured Phenotype-Gene-Disease Reasoning
πŸ”Ž Similar Papers
No similar papers found.
πŸ’Ό Related Jobs
No related jobs found.
B
Bo Zhang
Xi’an Jiaotong University
Y
Yuchen Wang
UIUC
D
Dongbai Li
Tsinghua University
M
Matthew Yu Heng Wong
University of Cambridge
Qingkai Zeng
Qingkai Zeng
Assistant Professor, Nankai University; University of Notre Dame
data miningnatural language processingknowledge graphlarge language models
Lijun Wang
Lijun Wang
Zhejiang University
Statistical LearningBioinformaticsAstrophysics
T
Tien-Yin Wong
Tsinghua University
P
Peng Cui
Tsinghua University
T
Tianyu Liu
Tsinghua University