科研学习札记

Research Notes

AI医学

Bilibili:BV1saLfz8Ev1

原文:Artificial Intelligence–Based Multimodal Risk Assessment Model for Surgical Site Infection

医疗报告可结合AI预测预后

病理报告(TCGA or 自己医院)

长文本,比较dirty,大语言模型(提取可判定信息,embedding成为一个统一大小的特征空间)。做预后,cox回归......

抛去之前的提取信息,直接LLM+文本,预测。

多模态预后预测流程

layer=MLP=多层感受器。后面得到一个risk score(作为biomarker,分组)。以及在cbioportal里面得到的生存信息/预后信息,构建一个cox,得到后续临床指标(AUC, KM)。

五折交叉验证:单中心的,1033个病人,拆分成5份,每次取4份训练,另1份测试。来回倒腾5次。得到c-index,取个平均值,体现方法有效性。

五折交叉验证示意

什么叫embedding

比如计算机中,要表示颜色(one-hot编码)。数组中的不同位置代表不同颜色,数据量极大。

如果要数据压缩,如RGB表示方法,参数空间小很多。

但是embedding过程中是可以学到语义的,在向量上的距离可比较。有点像聚类的过程。

UMAP和单细胞是个无监督的过程。

Embedding 示意

作者锐论:

病理科不配合的情况下,就拉病理报告,pseudo pathology information branch

影像科不配合,拉影像报告,pseudo radiology information branch

你不能说这部分不是病理或者影像的特征,它只是用报告来存的

优选评论:

有位老师说自己在2020年发表的JMIR文章,也使用这个思路,直接把报告文本转成embedding加上结构化的检验结果预测术后感染。我找到原文开始拜读:

AMRAMS 论文页面

标题:Artificial Intelligence–Based Multimodal Risk Assessment Model for Surgical Site Infection (AMRAMS): Development and Validation Study

一、结论先行

原文输入是术前病程/手术计划类自由文本;

使用 fastText、CNN 和自注意力网络,而不是现代大语言模型;

结局是住院期间是否发生手术部位感染(SSI)的二分类,而不是带随访时间和删失的生存结局。

二、文章做了什么

2.1 数据与预测目标

  • 单中心:RJ。

  • 数据时间:2014-01-01 至 2019-06-30。

  • 共纳入 21,611 份住院手术记录,其中 SSI 244 例,发生率 1.13%。

  • 2018-07-01 以前的 17,597 例作为开发集,之后的 4,014 例作为时间留出测试集。

  • 目标是在术前预测患者住院期间是否发生浅表切口、深部切口或器官/腔隙 SSI。

  • 阳性标签由医院感染防控部门在出院后通过病历审查确定。

需要注意:原文把后期时间留出集称作“external validation”,但数据仍来自同一家医院。按当前预测模型术语,它更准确地属于时间验证(temporal validation),而不是独立地域/机构外部验证。

2.2 输入变量

结构化变量包括人口学信息、术前住院日、血常规、凝血、肝肾功能、电解质、吸烟、婚姻、急诊手术和麻醉类型等。论文称模型使用了 47 个客观变量。

非结构化输入是术****前记录的自由文本部分,通常包含术前诊断、拟行手术名称、手术指征、并发症及预防措施。因此,把它概括成“报告文本”尚可。

2.3 文本如何变成固定长度向量

  1. 以中文维基百科约 4.1 GB 文本和一个中文医学百科约 96.9 MB 文本训练 fastText。(2020年的常见方案,现在技术上已经落后。)

现在重新训练 fastText 没多少意义。做TCGA可直接用embedding API;做本院病历,优先部署本地医学/中文embedding模型。

  1. 用 Jieba 和医学词典分词,得到每个词 128 维的 embedding。

Jieba分词:中文没有天然空格,把“结肠恶性肿瘤切除术”切成“结肠 / 恶性肿瘤 / 切除术”。医学词典用于防止把专业术语切碎。

查词向量:把每个词转换成128个数字。例如一份报告有200个词,就得到一个 200 × 128 的矩阵。

现在调用现代embedding模型时,分词和向量生成已由模型内部自动完成,通常不需要自己用Jieba。手动Jieba是fastText时代的必要步骤,不是当前LLM embedding方案的必需步骤。

  1. 对传统机器学习模型,将一份记录中所有词向量按每个维度做最大池化,得到统一的 128 维文档向量

  2. 将该文档向量与结构化变量直接拼接,再输入 LASSO Logistic、随机森林或 GBDT。

它们都是拿“文本 embedding+检验指标”预测是否感染的分类模型:

  • LASSO Logistic:带自动筛选变量的逻辑回归。简单、可解释,适合做基线。

  • 随机森林:许多决策树投票。能处理非线性,但容易学到数据中的捷径。

  • GBDT:一棵树接一棵树纠错。表格数据上通常比随机森林更强。

Embedding模型:只负责把报告转换成一串数字,例如768维向量。

LASSO Logistic、随机森林、GBDT:负责根据这些数字预测“会不会感染”。

Cox模型:负责根据这些数字预测生存或复发风险

  1. 深度学习方案则让 CNN 或 Bi-LSTM + 自注意力对词向量序列进行端到端编码,再与结构化变量融合。

LASSO/RF/GBDT:先人为压缩文本,再预测。

CNN/Bi-LSTM:一边学习怎样理解文本,一边学习怎样预测。

细说:

CNN:从词序列中抓局部短语,例如“恶性肿瘤”“结肠切除”。

Bi-LSTM+自注意力:结合上下文和词序,重点关注与风险相关的内容。

LASSO Logistic、随机森林、GBDT:不能直接理解词序列,必须先把整份报告压缩成固定的128维向量,再进行预测。

2.4 主要结果

在内部验证中,LASSO、随机森林和 GBDT 加入文本 embedding 后的 AUROC 均高于不含文本的对应模型。

2.5 对今天研究设计仍有启发的地方

  • 设置“结构化变量模型”与“结构化变量 + 文本模型”的直接消融比较;

  • 仅使用预测时点以前已经存在的数据;

  • 对高度不平衡结局采用合适的损失权重并报告不只一种性能指标;

  • 分析文本贡献,而不仅把神经网络当作不可解释黑箱;

  • 使用日常病历自动抽取,减少人工整理负担。

2.6 原文的重要局限

  • 只有单中心时间验证,没有真正的跨医院外部验证;

  • SSI 随访仅限住院期,出院后感染可能被漏标;

  • 变量缺失率最高超过 70%,且“是否缺失”本身成为重要预测信号,模型可能学习到医生检查行为;

  • SSI 事件只有 244 个,深度模型的稳定性和校准仍需谨慎评价;

  • 文本中的手术名称、部位等可能是强代理变量,不能据此认为模型发现了新的生物学机制;

  • 主要报告 AUROC,未充分回答概率校准、决策效益及跨机构泛化问题。

三 TCGA + 病理报告 embedding + 生存模型

HONeYBEE 已在 11,400 余名 TCGA 患者、33 个癌种上,将结构化/非结构化临床数据、病理报告、影像和分子数据转换为基础模型 embedding,并用 CoxPH、随机生存森林和 DeepSurv 等评估总生存预测。它与“统一大小特征空间 + 多模态融合 + 生存预测”高度重合。

Tripathi A, et al. HONeYBEE: enabling scalable multimodal AI in oncology through foundation model-driven embeddings. npj Digital Medicine. 2025;8. DOI: 10.1038/s41746-025-02003-4. PMID: 41131352.

四 LLM 直接阅读 TCGA 病理报告并做 Cox

2026 年 SCRIPT 研究使用开源 LLaMA 3.3 70B 直接阅读 TCGA 的结直肠癌、胃癌和肝癌完整病理报告,输出高/低风险及理由,并使用 Kaplan–Meier 和多变量 Cox 分析 OS、PFS、DSS。结直肠癌中,LLM 风险分组与 OS、PFS 和 DSS 均显著相关;但其输出主要是二元风险分组,而不是保留全部连续 embedding。

Loeffler CML, et al. SCRIPT: Stratified clinical risk prediction from pathology reports using large language models. Journal of Pathology Informatics. 2026;22:100673. DOI: 10.1016/j.jpi.2026.100673. PMID: 42281755.

科研怪谈

1 不会讲文献怎么办?

科学问题是啥,用了什么数据,多大规模,当前方法是啥,结果怎么样,局限在哪?

--陈老师(复旦大学眼耳鼻喉医院)

讲文献讲究一个避重就轻。

--胡老师(中南大学湘雅二医院)

2 吃饭太快会导致肥胖吗?

Codex给我推荐了这篇文献:Eating quickly is positively associated with excess body weight.

Ohkuma, T., Hirakawa, Y., Nakamura, U. et al. Association between eating rate and obesity: a systematic review and meta-analysis. Int J Obes 39, 1589–1596 (2015). https://doi\.org/10\.1038/ijo\.2015\.96

所以最好的解决方法:在食堂边吃饭边玩手机以降低进食速度。

21年之前,小模型–人脸识别,虹膜识别(专业场景,用自己科室数据,做诊断?数据?AI算法?)

21年之后,GPT出现,foundation model,基座模型

纯做医学影像(分割任务),算医工交叉吗?我觉得不算。因为常规的医学影像,现在有很多做计算机的人做。而我们做医学,尽量往分子层面做。

搞工科的那些人,方法学or设计问题的切入点和医学人士不一样。工科是把已有的问题拔高(90-91%,显著提升!!!)。医学在于提出问题,用AI在这样一种场景解决问题(83% vs 86%差不多)。

机器学习,用一些数据,建立预测模型。

1人工智能历史以及多模态数据运用

图灵测试:同时和2个界面聊天,1个人,1个model,但是分不出来,把人骗了。说明model有一定的智能性。

大子刊,不同资历医生,判别AI做的是不是比人更好,是否通过图灵测试,差异在哪里?也不一定好,只要有结果,就是有意义。

机器学习:搞数学的,理论算法。

BP算法:反向传播,通过误差,反向迭代,校正,使得误差越来越小。(我这边自己写过反向传播,让工科人士震惊)。

卷积神经网络+硬件+BP算法=深度学习(2010年)

Transformer处理时序性信息,Bert处理双向信息。

大模型能力(归纳、推理)

2AI医疗多科室场景解释

做多模态,要先做好多个单模态。

先:AI辅助个性化治疗方案的制定与决策,诊断,预后

后:AI助力多组学数据融合和精准诊断

最后:AI赋能疾病本质探索与机制解析—-AI加速新药靶点发现、设计、开发

img-1.png

穿刺的样本,预测免疫治疗(放化疗)敏感性。

更底层一些:病理切片,送个空间转录组测序,看某些特定的细胞特异性分布在某个特定的区域。

当然,现在空间转录组已经做到单细胞分辨率,你可以看到组织某一部位,某个细胞的基因表达。

EHR数据:直接embedding提特征//map成结构化数据。

医学人工智能,实现的三要素:-算力,-大数据(有创,无创,基于组织试验),-算法

img-2.png

算法:我们现在做的多的,其实还是监督学习。

监督学习需要标注(打标签,用机器学习算法,Lasso,XGBoost,Random Forest),无监督学习不需要标注(用深度学习提特征,用了黄仁勋的GPU,比如单细胞,分出不同cluster)。

img-3.png

图像的数据一般用卷积神经网络(CNN),不是很吃GPU,提特征,分类,分割,做预测。

Transformer也可以,但是Transformer吃GPU。如果样本量少,经典CNN效果更好。

img-4.png

EHR模态

组学模态

大语言模型

3AI医疗新玩法—基于生信的可解释性

计算生物学(个人分为两类:AI生信)。用生信解释(底层模型)挖掘的分子,从遗传的角度解释。

在医学中,artificial intelligence和machine learning没有分的很开。

很多文章,写自己做AI,其实只有一个机器学习(lasso回归)。

我们现在做的AI,主要指的是大模型深度学习

如何把现在深度学习这一块东西和生信结合到一块?

img-5.png4如何规划AI医疗课题

大模型vs医生。

AI预测药物副作用(免疫治疗,预测心脑血管风险),预后预测(存活时间,补牙材料时间)

健康管理(胰岛素管理)

辅助临床诊断,所见即所得(骨科x线诊断)

跨模态预测分类(大模态—病理预测基因,小模态—普通CT预测增强CT),用更简单的数据结合AI,达到以往需要复杂数据才能得到的结论。

img-6.png

日志

项目:GSE261170 单细胞 RNA-seq 分析

- 数据集: 心脏组织,Early AF (4 samples) vs Permanent AF (5 samples)

- 细胞数: 66,434 cells (QC后), 26,627 genes

- 21 clusters (resolution 0.5), annotated to 12 broad cell types

---

已完成的任务

1. Part 1: 数据预处理 + 聚类 (01b_rebuild_object.R)

  • QC: nFeature_RNA 300-4500, percent.mt < 10%

  • NormalizeData → FindVariableFeatures → CellCycleScoring → ScaleData (regress percent.mt, S.Score, G2M.Score)

  • PCA → Harmony batch correction (by sample) → FindNeighbors → FindClusters (res=0.5)

  • UMAP + t-SNE

  • FindAllMarkers (all 21 clusters)

- 保存: `seurat_final.rdata` (1.5G)

2. Part 2: 细胞注释 + DE + 富集 (02_annotation_and_DE.R) ✅

- 21 cluster → 21 cell type → 12 broad type 映射:

  • T_cells (CD4+ 15201, CD8+ 6603)

  • Myeloid (Macrophages_M2 6458, Monocytes 4536, Myeloid_other 1359, Neutrophils 1663)

  • Fibroblasts (3 subclusters: 5774+4188+2410 = 12372)

  • NK_cells (5325), Cardiomyocytes (2564+1652=4216), DCs (2576+147=2723)

  • B_cells (2538+128=2666), Endothelial (1393), Pericytes (599)

  • Mast_cells (506), Plasma_cells (447), Cycling_cells (367)

- Per cell type DE: 全部11个 broad type 完成 EarlyAF vs PermanentAF 对比

- Overall DE: 1035 genes up in EarlyAF, 822 down

- GO enrichment: cytoplasmic translation, oxidative phosphorylation, aerobic respiration 等

- KEGG enrichment: Ribosome, Oxidative phosphorylation, Parkinson disease 等

- 保存: `seurat_final.rdata` (含 cell_type, cell_type_broad, celltype_condition 列)

生成的图片: 01-19 (19张)

生成的数据: 17个 CSV 文件

3. 软件安装

- monocle3 ✅ — 已从 GitHub (cole-trapnell-lab) 安装成功

- CellChat ✅ — 已从 GitHub (sqjin/CellChat) 安装成功

---

未完成 / 失败的任务

1. T/NK Subcluster 分析 (03_TNK_subcluster.R) ❌ 失败

- 错误: `Error in RunHarmony(tnk, ...): could not find function “RunHarmony”`

- 原因: 03 脚本没有 `library(harmony)` —— harmony 包是通过 Seurat 集成的,需要显式加载

- 修复方法: 在 03_TNK_subcluster.R 开头加 `library(harmony)`

- 注意: ScaleData 阶段 (对 ~26K genes 回归) 耗时约 40 分钟。如需加速可改为只 scale VariableFeatures

2. Pseudotime 分析 (monocle3)

  • monocle3 已安装,但脚本未写

3. Cell Communication 分析 (CellChat)

  • CellChat 已安装,但脚本未写

4. SCP 包的 Integration_SCP 功能

  • SCP 的 Integration_SCP() 因 Seurat v5 API 不兼容(as_matrix 版本问题)无法使用

  • 最终放弃了 SCP 的集成流程,改用标准 Seurat workflow + Harmony

  • SCP 源码已 patch (slot→layer, 移除 deprecated params),但 Integration_SCP 内部仍不兼容

---

解决的关键问题

1. seurat_final.rdata 未保存: Part 1 的 01_full_pipeline.R 在 Step 10 cell type annotation 处报错,没走到 save 步骤。用 01b_rebuild_object.R 重新跑 Step 1-8 并保存成功

2. **Seurat v5 `$<-` metadata 报错 “No cell overlap”**: 因为 RNA assay 被 `split()` 过,`seurat_object$cell_type <- ...` 会校验失败。修复: 改用 `seurat_object@meta.data$cell_type <- ...` 直接写入 meta.data slot

3. Color palette 不足: 21 cell types 但只有 20 colors,加了第 21 个颜色 “#ff69b4”

4. RunHarmony API: harmony 2.0.2 使用 `reduction.use` 和 `reduction.save` 参数(不是 `reduction`)

---

明天继续工作的步骤

Step 1: 修复并运行 T/NK Subcluster 分析

1
2
3
4
5
6
7
8
9
# 修复 03 脚本:在 library(Seurat) 后面加 library(harmony)
cd /root/autodl-tmp/scp_analysis
sed -i '/^library(patchwork)$/a library(harmony)' 03_TNK_subcluster.R

# 可选:加速 ScaleData —— 改为只 scale VariableFeatures
# 把 all_genes <- rownames(tnk) 改为 all_genes <- VariableFeatures(tnk)

# 运行
/root/miniconda3/envs/R44/bin/R --no-save < 03_TNK_subcluster.R 2>&1 | tee 03_run.log

Step 2: 写并运行 Pseudotime 分析 (monocle3)

  • 用 monocle3 对 T/NK cells 或 Myeloid cells 做 pseudotime

  • 需要从 Seurat 提取数据创建 cell_data_set 对象

  • 可参考标准 monocle3 + Seurat 整合流程

Step 3: 写并运行 Cell Communication 分析 (CellChat)

  • 需要先确定用 broad cell types (12 types) 还是 subclusters

  • CellChat 需要 normalized count matrix + cell type labels

  • 注意:EarlyAF vs PermanentAF 可能需要分别跑 CellChat 再对比

Step 4: Fibroblasts 或 Myeloid subcluster 分析(可选)

  • 这两类细胞数量大(Fibroblasts 12372, Myeloid 14016),适合做 subclustering

  • 可复用 03 脚本的模板

---

关键路径和文件

文件 说明
/root/autodl-tmp/scp_analysis/seurat_final.rdata 主 Seurat 对象 (1.5G, 含 cell_type 注释)
/root/autodl-tmp/scp_analysis/graph/ 19 张分析图片
/root/autodl-tmp/scp_analysis/data/ 17 个 CSV (DE results, markers, enrichment)
/root/autodl-tmp/single_cell_data/GSE261170_data.rdata 原始数据 (282M)
/root/autodl-tmp/R_libs/ R 自定义包路径
/root/miniconda3/envs/R44/ R 4.4.3 conda 环境
/root/.Rprofile reticulate conda + SCP 配置
/root/SCP/ SCP 源码 (已 patch for Seurat v5)

R 环境

1
2
.libPaths(c("/root/autodl-tmp/R_libs", .libPaths()))
options(repos = "https://mirrors.tuna.tsinghua.edu.cn/CRAN/")

GSE261170 单细胞 RNA-seq 分析结果

项目概述

- 数据集: GSE261170 (GEO)

- 组织: 人类心脏组织 (心房)

- 疾病: 心房颤动 (Atrial Fibrillation, AF)

- 分组: Early AF (4 samples: GSM8136885, GSM8136888, GSM8136889, GSM8136890) vs Permanent AF (5 samples: GSM8136886, GSM8136887, GSM8136897, GSM8136898, GSM8136899)

- 分析平台: Seurat v5 + Harmony, R 4.4.3

- 质控: nFeature_RNA 300–4500, percent.mt < 10%

- 分析后细胞数: 66,434 cells, 26,627 genes

- 批次校正: Harmony (按 sample)

---

一、细胞聚类与注释

1.1 聚类结果

使用 Harmony 校正批次效应后,在 resolution = 0.5 下共识别 21 个 cluster,基于 top markers 注释为 21 种细分 cell type,归并为 12 大类 (broad cell type)

Broad Cell Type 细分亚型 细胞数 EarlyAF PermanentAF
T_cells CD4_T_cells (Cluster 0), CD8_T_cells (Cluster 1) 21,804 15,831 5,973
Myeloid Macrophages_M2 (C2), Monocytes (C5), Myeloid_other (C14), Neutrophils (C11) 14,016 8,303 5,713
Fibroblasts Fibroblasts (C3), Fibroblasts_2 (C6), Fibroblasts_3 (C10) 12,372 5,959 6,413
NK_cells NK_cells (C4) 5,325 3,553 1,772
Cardiomyocytes Cardiomyocytes (C8), Cardiomyocytes_2 (C12) 4,216 3,575 641
DCs Dendritic_cells (C7), pDCs (C19) 2,723 2,216 507
B_cells B_cells (C9), B_cells_2 (C20) 2,666 2,538 128
Endothelial Endothelial (C13) 1,393 545 848
Pericytes Pericytes (C15) 599 238 361
Mast_cells Mast_cells (C16) 506 368 138
Plasma_cells Plasma_cells (C17) 447 289 158
Cycling_cells Cycling_cells (C18) 367 203 164

1.2 注释依据 (Top Markers per Cluster)

Cluster Top 5 Markers Annotation
0 CD40LG, IL7R, GZMK, CD27, CAMK4 CD4+ T cells
1 TRAV25, TRBV2, GZMH, LAIR2, CD8B CD8+ T cells
2 LILRB5, SCN9A, SIGLEC1, LYVE1, GFRA2 M2/Resident Macrophages
3 ABCA10, MEG3, ABCA8, NOVA1, ADH1B Fibroblasts (adipofibroblast-like)
4 SH2D1B, KLRF1, TRDC, TXK, NCR1 NK cells
5 EREG, CD300E, PTX3, FCN1, AC112496.1 Inflammatory Monocytes
6 CLDN1, CLEC9A, IGSF21, P3H2, AL136987.1 Fibroblasts (DC-like)
7 CD1E, CD1C, ENHO, AL138899.1, FCER1A Conventional Dendritic cells
8 S100A1, SMPX, EEF1A2, NMRK2, FABP3 Cardiomyocytes (atrial)
9 FCRL1, IGHD, VPREB3, FCRLA, CD79A Naive B cells
10 PLA2G2A, FMOD, MFAP4, FBLN2, LUM Fibroblasts (matrix-producing)
11 CMTM2, S100P, FCGR3B, TNFRSF10C, AC005050.3 Neutrophils
12 LINC02208, MYH7B, Z85996.3, AC010680.1, AL355596.1 Cardiomyocytes (ventricular)
13 BTNL9, SHANK3, PTPRB, EMCN, VWF Endothelial cells
14 LYPD2, AC104809.2, NEURL1, ADGRE1, CASP5 Myeloid (other)
15 TBX2, NOTCH3, RGS5, CARMN, MCAM Pericytes
16 CPA3, TPSAB1, TPSB2, RHEX, CTSG Mast cells
17 BHLHA15, SDC1, IGLC1, IGLC2, IGLV3-1 Plasma cells
18 UBE2C, SPC25, HJURP, HIST1H3G, PKMYT1 Cycling cells
19 AC097375.1, LRRC26, KRT5, CLEC4C, LILRA4 Plasmacytoid DCs
20 VPREB3, FAM30A, CXCR5, TCL1A, CD79A Follicular-like B cells

1.3 细胞组成差异 (EarlyAF vs PermanentAF)

免疫细胞偏向 EarlyAF 组:

- T_cells: EarlyAF 15,831 (72.6%) vs PermanentAF 5,973 (27.4%) — 2.65x

- B_cells: EarlyAF 2,538 (95.2%) vs PermanentAF 128 (4.8%) — 19.8x

- NK_cells: EarlyAF 3,553 (66.7%) vs PermanentAF 1,772 (33.3%) — 2.0x

- DCs: EarlyAF 2,216 (81.3%) vs PermanentAF 507 (18.6%) — 4.4x

间质/结构细胞偏向 PermanentAF 组:

  • Fibroblasts: PermanentAF 6,413 (51.8%) vs EarlyAF 5,959 (48.2%) — PermanentAF 稍多

- Endothelial: PermanentAF 848 (60.9%) vs EarlyAF 545 (39.1%) — 1.56x

- Pericytes: PermanentAF 361 (60.3%) vs EarlyAF 238 (39.7%) — 1.52x

心肌细胞严重偏向 EarlyAF 组:

- Cardiomyocytes: EarlyAF 3,575 (84.8%) vs PermanentAF 641 (15.2%) — 5.58x

> 解读: EarlyAF 组呈现显著的免疫浸润特征(T细胞、B细胞、NK细胞、DCs 大幅增多),而 PermanentAF 组间质细胞(成纤维细胞、内皮细胞、周细胞)比例相对增加,心肌细胞大幅减少。这提示从 EarlyAF 到 PermanentAF 的进展过程中,免疫浸润逐渐消退,同时伴随纤维化相关细胞的积累和心肌细胞的丢失。

---

二、差异表达分析 (Differential Expression)

2.1 总体 DE (Overall: EarlyAF vs PermanentAF)

| 方向 | DEG 数量 (p_adj < 0.05, |log2FC| > 0.5) |
|—|—|
| Up in EarlyAF | 1,035 |
| Up in PermanentAF | 822 |

EarlyAF 高表达 Top Genes:

Gene log2FC 功能
XIST 8.30 X染色体失活转录本 (反映样本性别差异)
RPS26, RPS4X, RPS20, RPS13 1.2–1.3 核糖体蛋白 / 蛋白质翻译
COX4I1, COX7C 0.9–1.0 氧化磷酸化 / 线粒体呼吸链
NPPA 2.54 心房钠尿肽 (心房特异性激素)
NPPB 2.51 B型钠尿肽 (心功能不全标志物)
ACTC1 2.36 心肌肌动蛋白
CSRP3 2.32 心肌LIM蛋白 (肌肉结构)
MYL4 2.30 肌球蛋白轻链4 (心房型)
MB 2.27 肌红蛋白 (心肌氧储存)
MYL7 2.25 肌球蛋白轻链7 (心房型)

PermanentAF 高表达 Top Genes:

Gene log2FC 功能
PAX8-AS1 -4.82 PAX8反义RNA (lncRNA)
DNM1 -3.58 Dynamin 1 (内吞作用)
C1S, C1R -3.35 / -3.13 补体C1亚基 (经典补体途径)
SIGLEC1 -3.30 唾液酸结合免疫球蛋白样凝集素1 (巨噬细胞活化标志)
ABCA10, ABCA9 -3.23 / -3.11 ATP结合盒转运蛋白 (成纤维细胞标志)
CFH -3.23 补体因子H (补体调节)
C7 -3.21 补体C7 (膜攻击复合物)
ABI3BP -3.16 ABI基因家族结合蛋白 (细胞外基质)

> 解读: EarlyAF 的差异基因以核糖体蛋白 (蛋白质合成) 和线粒体呼吸链基因 (氧化磷酸化) 为特征,同时心房特异性基因 (NPPA, NPPB, MYL4, MYL7) 高表达,提示心房肌细胞在 EarlyAF 中仍维持较活跃的代谢和收缩功能。PermanentAF 的差异基因则以补体系统 (C1S, C1R, C7, CFH)、细胞外基质 (ABI3BP, DCN) 和成纤维细胞标志 (ABCA10, ABCA9) 为主,提示 PermanentAF 阶段发生了显著的纤维化和补体介导的免疫重塑。

2.2 各细胞类型 DE 汇总

Cell Type Up in EarlyAF Up in PermanentAF 最显著变化
Fibroblasts 2,449 1,312 DEG 最多,PermanentAF 中 ABCA8/6, CFH, C7, PLA2G2A 显著上调
Myeloid 1,472 1,599 双向大量 DEG; EarlyAF: LYZ, CD300E, IGKC 上调; PermAF: CCDC141, CFH, FBLN1 上调
Cycling_cells 1,431 497 EarlyAF: 核糖体基因大量上调; PermAF: TNFAIP2, SIGLEC1 上调
Cardiomyocytes 230 864 PermAF 中 DEG 远多于 EarlyAF; PermAF: FOSB, FOS, EGR1 (即早基因) 下调
Endothelial 180 227 EarlyAF: 心肌基因 (NPPA, MYL7, TTN, ACTC1) 异常上调
NK_cells 41 310 EarlyAF: CD3E, TRDV2 上调; PermAF: CXCR4, FKBP5 上调
DCs 71 234 PermAF: TIMD4 (组织驻留巨噬/DC标志) 显著上调
T_cells 102 229 EarlyAF: TRBV2, TRAV38-1, CCL3 上调; PermAF: TCR γδ (TRGV2), FKBP5 上调
Mast_cells 83 21 EarlyAF: 核糖体基因上调; PermAF: ADAM8, CFD, AREG 上调
Pericytes 90 50 EarlyAF: 心肌基因 (NPPA, MYL7, TTN) 上调; PermAF: GJC1, LGI4 上调
B_cells 18 26 PermAF: Y染色体基因 (KDM5D, DDX3Y) 上调 — 性别差异
Plasma_cells 39 42 变化较小

2.3 关键细胞类型 DE 详情

成纤维细胞 (Fibroblasts) — DEG 最多 (3,761 genes)

EarlyAF 高表达 (Top):

- PADI2 (log2FC=4.72): 肽基精氨酸脱亚氨酶2,参与蛋白质瓜氨酸化,与自身免疫和纤维化相关

- CLDN1 (log2FC=4.09): 密封蛋白1,上皮紧密连接组分

- TLR10 (log2FC=4.07): Toll样受体10,先天免疫模式识别受体

- HLA-DQA2, HLA-DRB5, HLA-DQB2: MHC-II 分子,抗原呈递功能上调

- 氧化磷酸化基因: COX4I1, UQCRB, COX7C, ATP5F1E, NDUFA4 — 线粒体代谢活跃

PermanentAF 高表达 (Top):

- PLA2G2A (log2FC=5.47): 磷脂酶A2,促炎介质,与心肌纤维化和心房颤动相关

- ADAMTSL2 (log2FC=4.39): ADAMTS样蛋白2,细胞外基质组装

- CP (log2FC=4.22): 铜蓝蛋白,急性期反应蛋白

- SERPINA3 (log2FC=3.41): α1抗糜蛋白酶,炎症标志物

- ADAM33 (log2FC=3.36): ADAM金属蛋白酶33,与气道重塑和纤维化相关

- FGF7 (log2FC=3.10): 成纤维细胞生长因子7,上皮-间质互作

- 补体系统: CFH, C7, C1S — 补体激活

- ECM 基因: DCN, PRELP, FBLN1, ABI3BP — 细胞外基质沉积

> 解读: 成纤维细胞是 AF 进展中变化最剧烈的细胞类型。PermanentAF 成纤维细胞呈现典型的”活化成纤维细胞/肌成纤维细胞”转录特征:PLA2G2A、SERPINA3、补体基因高表达,ECM 基因大量上调。同时 EarlyAF 成纤维细胞保留 MHC-II 抗原呈递能力 (HLA-DQA2, HLA-DRB5) 和活跃的线粒体代谢,提示在 Early 阶段成纤维细胞可能参与免疫调节。

心肌细胞 (Cardiomyocytes)

EarlyAF 高表达:

- RGS5 (log2FC=2.89): G蛋白信号调节蛋白,通常为周细胞标志,此处可能反映样本中的 contamination

- FABP4 (log2FC=2.63): 脂肪酸结合蛋白4

- 核糖体蛋白: RPS11, RPS20, RPL27A — 蛋白质合成活跃

- 线粒体基因: NDUFA2 — 氧化磷酸化

PermanentAF 高表达:

- FOSB (log2FC=4.20): 即早基因/转录因子

- EGR1 (log2FC=3.18): 即早生长反应基因1

- FOS (log2FC=2.79): c-Fos,AP-1转录因子组分

- CCN1 (log2FC=2.86): 细胞通讯网络因子1 (CYR61),参与炎症和纤维化

- ADAM33 (log2FC=2.75): 与重塑相关的金属蛋白酶

- ABCA10 (log2FC=2.11): ATP结合盒转运蛋白

> 解读: PermanentAF 心肌细胞中即早基因 (FOS, FOSB, EGR1) 显著上调,通常提示细胞处于应激状态。同时 ADAM33 和 ABCA10 上调与组织重塑一致。EarlyAF 心肌细胞则维持较高的蛋白质合成和线粒体代谢水平。值得注意的是 PermanentAF 组心肌细胞仅 641 个 (vs EarlyAF 3,575),细胞数的大幅减少本身可能反映了心肌细胞的丢失或退化。

髓系细胞 (Myeloid)

EarlyAF 高表达:

- IGKC, IGHG1, IGLC2: 免疫球蛋白轻链/重链,可能反映 B细胞/plasma cell 污染或抗体产生

- HLA-DQA2, HLA-DRB5: MHC-II 抗原呈递

- LYZ: 溶菌酶,抗菌活性

- CD300E: 髓系细胞活化受体

- MT1E: 金属硫蛋白,氧化应激响应

PermanentAF 高表达:

- CCDC141 (log2FC=4.82): 卷曲螺旋结构域蛋白

- ABCA9 (log2FC=3.90): ATP结合盒转运蛋白 (成纤维/间质标志)

- DNM1 (log2FC=3.82): Dynamin 1

- 补体: CFH, C7 — 补体级联激活

- ECM: FBLN1, DCN — 细胞外基质

- SIGLEC1: 巨噬细胞活化标志

> 解读: EarlyAF 髓系细胞高表达 MHC-II 分子和溶菌酶,提示活跃的抗原呈递和先天免疫应答。PermanentAF 髓系细胞则转向补体产生和 ECM 沉积功能,呈现”促纤维化巨噬细胞”的转录特征。

T细胞 (T_cells)

EarlyAF 高表达:

- TRBV2, TRAV38-1, TRAV25: TCR α/β 可变区 — 多样化的 TCR 库

- LYZ, S100A9: 髓系标志 (可能为双阳性细胞或 contamination)

- CCL3: 趋化因子,免疫细胞招募

- MT1E: 氧化应激响应

PermanentAF 高表达:

- TRGV2 (log2FC=2.84): γδ T细胞受体 — γδ T细胞比例增加

- FKBP5 (log2FC=1.78): FK506结合蛋白,糖皮质激素响应

- Y染色体基因: DDX3Y, UTY, KDM5D, USP9Y — 性别差异驱动

> 解读: EarlyAF T细胞 TCR 库多样化程度高,且 CCL3 趋化因子表达增加,提示活跃的适应性免疫应答和免疫细胞招募。PermanentAF 中 γδ T细胞 (TRGV2) 相对增加和 FKBP5 上调值得进一步关注。

---

三、GO/KEGG 富集分析

3.1 GO 生物过程 (BP) 富集 — EarlyAF 上调基因 (1,035 genes)

GO Term 基因数 描述
cytoplasmic translation 92 胞质翻译 (核糖体蛋白主导)
oxidative phosphorylation 77 氧化磷酸化
aerobic respiration 87 有氧呼吸
cellular respiration 93 细胞呼吸
ATP synthesis coupled electron transport ATP合成偶联电子传递
mitochondrial ATP synthesis 线粒体ATP合成
generation of precursor metabolites and energy 前体代谢物和能量生成
electron transport chain 电子传递链

> 解读: EarlyAF 上调基因的核心功能是蛋白质翻译线粒体氧化磷酸化。这表明 EarlyAF 阶段的心脏细胞维持着活跃的蛋白质合成和有氧代谢能力。核糖体蛋白 (RPS/RPL 家族) 和线粒体呼吸链复合物 (COX, NDUFB, ATP5, UQCR 等) 的大量上调是主导因素。

3.2 KEGG 通路富集 — EarlyAF 上调基因

KEGG Pathway 基因数 描述
Ribosome 116 核糖体
Oxidative phosphorylation 74 氧化磷酸化
Parkinson disease 100 帕金森病 (富集线粒体/呼吸链基因)
Prion disease 99 朊病毒病 (同上)
Huntington disease 亨廷顿病 (同上)
Diabetic cardiomyopathy 糖尿病心肌病
Thermogenesis 产热作用
Coronavirus disease 新冠 (免疫相关)

> 解读: KEGG 富集与 GO 高度一致,核心是核糖体氧化磷酸化。神经退行性疾病通路的富集是因为这些疾病的核心基因与线粒体呼吸链高度重叠 (如 COX, NDUF 基因),并非真正的神经退行性信号。糖尿病心肌病通路的富集值得注意,可能与 AF 进展中的代谢重构有关。

---

四、主要发现总结

4.1 免疫微环境的动态变化

1. EarlyAF 以免疫浸润为特征: T细胞 (2.65x)、B细胞 (19.8x)、NK细胞 (2.0x)、DCs (4.4x) 在 EarlyAF 中大幅增多,形成强烈的免疫微环境

2. PermanentAF 免疫细胞大幅减少: B细胞几乎消失 (仅128 vs 2538),T细胞减少62%,提示免疫微环境在 AF 持续过程中发生显著改变

3. 免疫细胞功能转变: EarlyAF 髓系细胞高表达 MHC-II (抗原呈递);PermanentAF 髓系细胞转向补体产生和 ECM 沉积

4.2 纤维化与细胞外基质重塑

1. 成纤维细胞是变化最大的细胞类型: 3,761 个 DEG,是所有细胞类型中最多的

2. PermanentAF 成纤维细胞活化: PLA2G2A、SERPINA3、ADAM33、补体基因 (C7, CFH, C1S)、ECM 基因 (DCN, PRELP, FBLN1, ABI3BP) 大幅上调

3. 补体系统广泛激活: 在总体 DE 和多种细胞类型中均观察到补体基因上调 (C1S, C1R, C7, CFH),提示补体介导的组织损伤和纤维化

4.3 心肌细胞代谢与功能

1. 心肌细胞大幅减少: PermanentAF 仅有641个心肌细胞 (vs EarlyAF 3,575),减少82%

2. 代谢差异: EarlyAF 心肌细胞维持活跃的蛋白质合成 (核糖体) 和氧化磷酸化;PermanentAF 心肌细胞出现即早基因应激反应 (FOS, FOSB, EGR1)

3. 心房特异性基因: NPPA (ANP), NPPB (BNP), MYL4, MYL7 在 EarlyAF 中高表达,提示心房功能仍较活跃

4.4 性别偏差的考量

- XIST 在几乎所有细胞类型的 EarlyAF 组中为 top DEG (log2FC 6–12)

- Y染色体基因 (KDM5D, DDX3Y, USP9Y, UTY, EIF1AY) 在 PermanentAF 中高表达

- 这提示 EarlyAF 样本可能主要来自女性,PermanentAF 样本主要来自男性(需确认原始数据的性别信息)

  • 这一性别偏差可能混淆部分 DE 结果,特别是与性染色体相关的基因

---

五、分析局限与后续方向

局限

1. 样本性别偏差: XIST/Y染色体基因的显著差异提示组间存在性别混杂,需要确认或校正

2. 样本量不均衡: EarlyAF 4样本 (~33K cells) vs PermanentAF 5样本 (~33K cells),但部分细胞类型样本数差异巨大 (如 B_cells: 2538 vs 128)

3. 部分细胞类型可能包含 doublet: 如心肌细胞 cluster 中检出 RGS5 (周细胞标志) 和内皮 cluster 中检出 TTN (心肌标志)

4. XIST 作为 top DEG: 虽然反映了性别差异,但也可能掩盖了真正的疾病相关信号

后续分析方向

1. T/NK 细胞 subclustering: 进一步细分 CD4/CD8/NK/Treg 亚群,分析各亚群的差异

2. Myeloid subclustering: 细分巨噬细胞亚型 (M1/M2/resident/inflammatory)

3. Pseudotime 分析 (monocle3): 追踪 AF 进展过程中的细胞状态转变轨迹

4. 细胞通讯分析 (CellChat): 分析免疫细胞-成纤维细胞-心肌细胞间的信号通路变化

5. 性别校正: 需检查原始数据的性别信息,必要时进行性别分层分析

6. 轨迹/命运分析: 分析成纤维细胞的活化轨迹和肌成纤维细胞分化

---

六、输出文件清单

图片 (graph/)

文件 内容
01_QC_before/after QC 指标小提琴图 (过滤前后)
05_PCA_before_harmony PCA 散点图 (按样本着色)
06_Harmony Harmony 校正后 PCA
07_ElbowPlot Elbow plot
08_clustree Clustree 聚类树
09_UMAP_overview UMAP (clusters + sample + condition)
10_Marker_DotPlot 已知 marker 基因 Dot Plot
11_Marker_FeaturePlot Marker 基因 Feature Plot
12_Marker_VlnPlot Marker 基因小提琴图
13_CellTypes_UMAP 21 细胞类型 UMAP
14_BroadCellTypes_UMAP 12 大类细胞 UMAP
15_Condition_UMAP 按 EarlyAF/PermanentAF 着色
16_CellType_proportions 细胞组成比例条形图
17_Volcano_overall 总体 DE 火山图
18_GO_EarlyAF_up GO BP 富集 Dot Plot
19_KEGG_EarlyAF_up KEGG 富集 Dot Plot

数据 (data/)

文件 内容
all_cluster_markers.csv 所有 cluster 的 marker 基因
top10_cluster_markers.csv 每个 cluster top 10 markers
Overall_EarlyAF_vs_PermanentAF.csv 总体 DE 结果
{CellType}_EarlyAF_vs_PermanentAF.csv 各细胞类型 DE 结果 (12个文件)
GO_enrichment_EarlyAF_up.csv GO 富集结果
KEGG_enrichment_EarlyAF_up.csv KEGG 富集结果

Seurat 对象

  • seurat_final.rdata (1.5G): 含完整的 QC、归一化、Harmony、聚类、UMAP、细胞注释信息
0%