Causal Representation Learning under Informative Missingness for Clinical Multimodal Prediction and Offline Decision-Making Open Access

Liang, Zihan (Spring 2026)

Permanent URL: https://etd.library.emory.edu/concern/etds/zk51vj64z?locale=en
Published

Abstract

Electronic health record (EHR) data are collected through clinical decision processes, so missingness and measurement frequency are informative signals rather than nuisance artifacts. This thesis develops a causal representation learning framework for clinical multimodal learning under missing-not-at-random (MNAR) observation mechanisms across two complementary scales: (i) patient-level modality assignment (which modalities are recorded for a patient) and (ii) step-level monitoring intensity (how frequently and recently variables and notes are observed within a trajectory). We formalize these mechanisms as explicit causal variables in a unified structural causal model, separating the confounded pathway from latent health to outcomes via observation patterns from the possible direct effect of observation itself on outcomes, and derive design implications for both prediction and decision-making.

Instantiation I addresses static, episode-level outcome prediction with patient-level modality missingness. We propose a two-stage MMNAR pipeline that embeds modality patterns, performs missingness-aware gating and attention-based fusion over observed modality encoders, and learns representations via cross-modal reconstruction and contrastive alignment. To mitigate MNAR-induced calibration drift, we introduce a lightweight cross-fitted, pattern-wise rectifier that estimates residual bias on held-out folds and selectively corrects predictions at inference time. On MIMIC-IV, the approach improves AUROC by 4.6-13.0% over thirteen baselines across readmission, ICU admission, and mortality, and yields 0.5-13.7% gains on eICU, with robustness under severe missingness distribution shift.

Instantiation II addresses dynamic state learning for offline control under step-level monitoring intensity variation in sepsis trajectories. We learn decision-step patient states by encoding irregular structured data with GRU-D plus explicit MNAR features, fusing sparse clinical text with a process-aware documentation factor capturing availability, recency, and density, and learning action-conditioned latent dynamics to enable multi-step credit assignment. Using these states, we perform mortality prediction and offline policy optimization with Implicit Q-Learning. The resulting policies improve estimated value over clinician behavior by 21.7% on MIMIC-IV and 13.1% on eICU, outperforming the AI Clinician and CQL, and deliver the largest gains for high-acuity patients. Finally, we introduce an MNAR error taxonomy and diagnostic atlas that maps observable diagnostics to targeted interventions for reliable deployment.

Table of Contents

1 Introduction (p.1)

1.1 Clinical Multimodal Learning under Informative Missingness (p.2)

1.2 Prediction versus Decision-Making (p.5)

1.3 Unified Thesis Question and Scope (p.7)

1.4 Summary of Contributions (p.9)

1.5 Thesis Organization (p.11)

2 Related Work (p.13)

2.1 Multimodal Representation Learning with Missing Modalities (p.13)

2.2 Clinical Multimodal Fusion and Healthcare Applications (p.15)

2.3 Missing Data in Clinical Time Series (p.17)

2.4 Clinical Reinforcement Learning (p.18)

2.5 Offline Reinforcement Learning (p.19)

2.6 Causal Inference and Handling MNAR Data (p.21)

2.7 Auxiliary Topics: Multitask Learning, World Models, and Clinical NLP (p.22)

2.8 Positioning Our Contributions (p.26)

3 Approach (p.27)

3.1 Unified Formulation: Cross-Scale MNAR as an Explicit Modeling Object (p.27)

3.2 Unified Causal Graph and Assumptions (p.29)

3.2.1 Causal Structure (p.29)

3.2.2 Key Assumptions (p.31)

3.2.3 Implications for Method Design (p.32)

3.3 Instantiation I: Static MMNAR Learning (p.34)

3.3.1 Modality Encoders and Missingness Embedding (p.34)

3.3.2 Missingness-Aware Fusion (p.35)

3.3.3 Self-Supervision: Reconstruction and Contrastive Sufficiency (p.37)

3.3.4 Supervised Heads and Post-Hoc Rectification (p.38)

3.3.5 Training Procedure and Complexity (p.40)

3.4 Instantiation II: Dynamic MNAR State Learning for Offline Control (p.42)

3.4.1 Observation Encoding with Explicit MNAR Features (p.42)

3.4.2 Latent Belief State and Action-Conditioned Dynamics (p.45)

3.4.3 Offline Policy Optimization Objective (p.47)

3.4.4 Auxiliary Losses and Multi-Stage Training (p.49)

3.5 MNAR Error Taxonomy and Diagnostic Atlas (p.50)

3.5.1 Error Decomposition Axes (p.51)

3.5.2 Diagnostic Signals and Tests (p.53)

3.5.3 Atlas Construction: Regime Discovery and Summary (p.55)

3.5.4 Actionable Guidance Mapping (p.56)

4 Experiments (p.58)

4.1 Datasets, Cohorts, and Tasks (p.59)

4.1.1 MIMIC-IV Database (p.59)

4.1.2 eICU Collaborative Research Database (p.60)

4.1.3 Clinical Tasks (p.61)

4.2 Preprocessing and MNAR Variable Construction (p.62)

4.2.1 Patient-Level Modality Assignment (Static Setting) (p.62)

4.2.2 Step-Level Monitoring Intensity (Dynamic Setting) (p.63)

4.2.3 Text Alignment and Temporal Filtering (p.64)

4.2.4 Structured Data Processing (p.64)

4.2.5 Image and Text Encoding (p.65)

4.3 Baselines and Comparisons (p.65)

4.3.1 Static Prediction Baselines (Instantiation I) (p.66)

4.3.2 Dynamic Decision-Making Baselines (Instantiation II) (p.67)

4.4 Evaluation Metrics (p.68)

4.4.1 Prediction Metrics (Static and Auxiliary Tasks) (p.69)

4.4.2 Policy Evaluation Metrics (Dynamic Setting) (p.69)

4.5 Main Results I: Static Prediction under MMNAR (p.71)

4.5.1 Overall Performance (p.71)

4.5.2 Modality Input Ablation (p.72)

4.6 Main Results II: Offline Decision-Making under Dynamic MNAR (p.73)

4.6.1 Mortality Prediction from Learned States (p.73)

4.6.2 Policy Evaluation Results (p.73)

4.6.3 Subgroup Analysis by Severity (p.76)

4.6.4 Text Regime Analysis: High-Frequency vs. Low-Frequency Documentation (p.76)

4.7 Ablation Studies Aligned with the Taxonomy (p.77)

4.7.1 Overview of Ablation Design (p.77)

4.7.2 Static Setting Ablations (Instantiation I) (p.78)

4.7.3 Dynamic Setting Ablations (Instantiation II) (p.79)

4.7.4 Taxonomy Validation: Diagnostic Signal Analysis (p.81)

4.8 Robustness and Distribution Shift Tests (p.82)

4.8.1 Missingness Pattern Shift (Static Setting) (p.82)

4.8.2 Monitoring Intensity Shift (Dynamic Setting) (p.83)

4.8.3 Cross-Institutional Generalization (p.83)

4.9 Efficiency and Reproducibility (p.84)

4.9.1 Computational Requirements (p.84)

4.9.2 Hyperparameter Sensitivity (p.85)

4.9.3 Reproducibility (p.85)

5 Analysis (p.88)

5.1 Taxonomy Validation: Regime Signatures in Practice (p.88)

5.2 Diagnostic Atlas: Prospective Regime Identification (p.90)

5.3 Mechanistic Interpretation of the Two Correction Mechanisms (p.92)

5.3.1 The Rectifier as a Bias Correction via Cross-Fitting (p.92)

5.3.2 Action-Conditioned Dynamics as a Credit Assignment Bridge (p.92)

5.3.3 Complementarity and Non-Overlap (p.93)

5.4 Representation Quality and Geometry (p.94)

5.5 Training Dynamics and Staged Optimization (p.94)

5.6 Threats to Validity and Limitations (p.95)

5.7 Broader Implications for Clinical AI (p.97)

6 Conclusion (p.100)

6.1 Summary of Contributions (p.100)

6.2 Key Findings (p.102)

6.3 Practical Takeaways for Clinical Multimodal AI (p.102)

6.4 Future Directions (p.103)

6.5 Closing Remarks (p.104)

About this Honors Thesis

Rights statement
  • Permission granted by the author to include this thesis or dissertation in this repository. All rights reserved by the author. Please contact the author for information regarding the reproduction and use of this thesis or dissertation.
School
Department
Degree
Submission
Language
  • English
Research Field
Keyword
Committee Chair / Thesis Advisor
Committee Members
Last modified

Primary PDF

Supplemental Files