NCI Data Jamboree (Project Abstract Submission): Submission #41

Submission information
Submission Number: 41
Submission ID: 189073
Submission UUID: dc82e8cf-23ac-4b7f-acde-b30f534cd5a3

Created: Mon, 07/27/2026 - 09:52
Completed: Mon, 07/27/2026 - 10:01
Changed: Mon, 07/27/2026 - 10:01

Remote IP address: 10.208.24.192
Submitted by: Anonymous
Language: English

Is draft: No
Presenter Information
---------------------
First Name: Xuelu (Jeff)
Middle Initial: {Empty}
Last Name: Liu
Degree(s): MS
Position/Title/Career Status: Director, Data Management and Strategy
Organization: Dana-Farber Cancer Institute
Organization Address:
Boston

Email: J_Liu@dfci.harvard.edu

Additional Authors
------------------
List of Additional Authors:
- First Name: David 
  Last Name: Yang
  Post-nominal letters: MD
  Affiliation: Dana-Farber Cancer Institute
- First Name: Alexander
  Last Name: Haas
  Post-nominal letters: MD
  Affiliation: Dana-Farber Cancer Institute
- First Name: Mark
  Last Name: Apinis
  Post-nominal letters: MS
  Affiliation: Dana-Farber Cancer Institute
- First Name: Yantong
  Last Name: Cui
  Post-nominal letters: MS
  Affiliation: Dana-Farber Cander Institute
- First Name: Chloe
  Last Name: Flamm
  Affiliation: Dana-Farber Cancer Institute
- First Name: Ittai
  Last Name: Dayan
  Post-nominal letters: MD
  Affiliation: Rhino Federated Computing
- First Name: Adrish
  Last Name: Sannyasi
  Affiliation: Rhino Federated Computing


Abstract Information
--------------------
Abstract Category: Developing, refining, or validating tools, methods, algorithms, and pipelines
Abstract Keywords: Digital Pathology; batch effects; federated learning; biomarker prediction; feature-space harmonization
Abstract Title: Mitigating Batch Effects in Digital Pathology via Feature-Space Harmonization of H&E Foundation Model Embeddings in A Federated Learning Scenario
Abstract:
Scientific/Technical Question
Batch effects caused by variability in staining, tissue processing, slide scanning, and institutional workflow reduce generalizability in digital pathology. We propose a study to evaluate harmonization strategies in a federated learning scenario and determine whether feature-space normalization of H&E foundation model embeddings can mitigate batch effects more effectively than standard stain normalization methods and improve slide-level biomarker prediction across heterogeneous datasets and institutions. We will benchmark conventional stain normalization and data augmentation methods and, as a stretch goal, benchmark feature-space harmonization methods for pathology embeddings.

Why This Matters
This project is relevant to the broader community because it addresses a major barrier to deploying robust AI across cohorts and clinical sites. Expected deliverables include a benchmark of conventional stain normalization versus feature-space denoising, a reproducible pathology AI workflow spanning NCI-accessible and federated institutional data, preliminary evidence on cross-institutional robustness, and a framework for future NCI–academic–industry collaboration in privacy-preserving computational pathology.

Data Types / Datasets
With support from the NCI Office of Data Sharing, we will use datasets available through NCI data commons and ecosystems, including TCGA and possible extensions to the CCDI Data Hub, prioritizing cohorts with H&E whole-slide images, linked molecular biomarker annotations, relevant clinical metadata, and source/site metadata when available. Initial biomarker tasks include NSCLC EGFR, colorectal cancer MSI, and breast cancer BRCA1/2-related status.

Methods / Environment
Whole-slide images will undergo quality control, tissue detection, and tile extraction. Baseline benchmarking will compare no normalization, Macenko, Reinhard, and Vahadane; tile embeddings will be extracted using ResNet50, UNI, UNIv2, and Virchowv2; and slide-level prediction will use ABMIL. Rhino’s Federated Computing platform will enable privacy-preserving external evaluation on DFCI-local pathology data without moving raw data.