[AI書房] 9.1 單細胞轉錄體學(scRNA-Seq)與多體學流形對齊
人工智慧開啟的生命科學新時代
9.1 單細胞轉錄體學(scRNA-Seq)與多體學流形對齊
金京鎮
果汁店裡的果汁機正在旋轉。草莓、香蕉與菠菜被一同打碎成均勻的綠色飲品。無論你多麼細緻地分析這杯混合飲品,都無法還原單顆草莓原本純粹的風味。2010年代之前的轉錄體分析運作方式亦完全相同。在被稱為整體RNA定序(bulk RNA-seq)的技術中,研究人員將含有數百萬個異質細胞的整個組織檢體磨碎,提取總mRNA,並測量整個檢體平均下來的綜合輪廓。其缺點在於數學平均會抹去罕見的細胞亞群。在實體腫瘤中佔比不到1%的癌症幹細胞、罕見的耐藥性持久細胞,或是主導免疫抑制的調節性T細胞,全都被其餘99%細胞的表現訊號所淹沒。即使那1%才是驅動腫瘤復發的亞群,整體平均值卻掩蓋了它們的存在。疾病的生物學驅動因素,正存在於統計平均值之外。
單細胞RNA定序(scRNA-seq)淘汰了果汁機,實現了將細胞逐一分離與分析的能力。正如地鐵驗票閘門一次只允許一名通勤者通過,微流體裝置引導單個細胞排成單行。在比人類頭髮還細的微流體通道內,每個單細胞都被包裹在帶有油層外鞘的奈升水相液滴中。每個液滴都扮演著容納單一細胞的獨立反應室。液滴包裹的不只是細胞:每個液滴還會捕捉一顆微小的水凝膠微珠,微珠表面帶有數百萬條帶有條碼的短DNA寡核苷酸。當細胞在液滴內裂解時,這些寡核苷酸會捕獲具多聚腺苷酸尾的細胞mRNA轉錄本,並附加上兩個分子標籤:細胞條碼(cell barcode,由該微珠上的所有寡核苷酸共享,確保混合定序後能在計算上將轉錄本重新歸屬至其原始細胞)以及唯一分子識別碼(Unique Molecular Identifier, UMI)。UMI的運作機制如同圖書館分配給不同藏書的索書號。由於mRNA分子在定序前會經由PCR擴增,UMI可防止PCR複製出的複本被誤算為不同的生物轉錄本。此工作流程需要進行品質管制過濾:捕捉到兩個細胞的液滴會產生人為的雙細胞(doublets);裂解細胞釋放的環境RNA(ambient RNA)會污染鄰近液滴;瀕死細胞則表現出偏高的粒線體轉錄本比例。實驗室工作檯上一片安靜:當微流體晶片每秒產生數千個液滴時,技術人員只需轉移試劑管。
定序通量迅速擴增。2015年,Drop-seq同時分析了44,808個視網膜細胞,解析出39種不同的細胞類型[1]。在同一期期刊中,inDrop利用相關的液滴微流體技術分析了胚胎幹細胞[2]。九年後的2024年10月,10x Genomics推出了GEM-X架構,每次運行可處理高達256萬個單細胞,同時將每個細胞的文庫製備成本降至一美分以下[3]。在單個細胞中分析20,000個基因變得比一包口香糖還便宜,將實驗頻寬從數萬個細胞擴展至數百萬個。
所產生的資料集是一個以單一細胞為單位、包含 20,000 個基因維度的矩陣。人類的視覺感知無法解讀 20,000 維空間,這使得低維度嵌入成為單細胞資訊學的核心。嵌入將 20,000 個基因表現計數壓縮成數十個能捕捉細胞特性的潛在座標——好比將三維的地球儀投影到二維的世界地圖上。雖然投影造成的扭曲無法完全消除,但功能相關的細胞必須聚集在一起。在嵌入流形中,相似的細胞狀態會聚集成島嶼,而從幹細胞到成熟細胞的分化軌跡則如海岸線般浮現。在分析人員的螢幕上,散布圖中的每一個點都代表一顆單獨的細胞。預處理方法確保了這種空間投影能夠反映生物學的真實情況。
隨著資料集規模擴大,技術性的批次效應(Batch Effects)成為主要挑戰。批次效應是指在不同實驗批次之間引入的系統性、非生物學技術變異。跨不同試劑批號、定序儀器、臨床採集地點或處理日期來處理相同的血液樣本,都會改變名義上的表現計數。這就像透過不同的音響喇叭播放同一首錄音作品會產生不同的聲音特徵一樣:歌曲本身沒有改變,但聲音輸出卻產生了偏差。未經校正的批次效應會導致演算法將在首爾收集的 T 細胞與在釜山收集的 T 細胞歸類為不同的細胞類型,進而使嵌入流形依醫院地點而非細胞本體論發生分裂。互為最近鄰(Mutual Nearest Neighbors, MNN)透過識別跨批次間互認對方為最近鄰的細胞對,並計算它們之間的平移向量來修正此問題 [4]。Harmony 將細胞嵌入低維空間,在分群與混合模型線性校正之間反覆交替——在幾分鐘內即可於一般筆記型電腦上完成數十萬個細胞的對齊 [5]。scVI 則採用深度生成模型,利用以批次識別碼為條件的變分自編碼器,直接將生物學變異與技術雜訊解耦 [6]。批次校正需要嚴謹的取捨:消除技術人為干擾絕對不能抹去區分患病患者與健康對照組的真實生物學表現型。
多模態檢測的擴展帶來了多體學對齊的挑戰。各類檢測衡量不同的生物模態:scRNA-seq 描繪基因表現輪廓,scATAC-seq 測量開放染色質可及性,而 CITE-seq 則透過抗體衍生標籤計數細胞表面蛋白質表位 [7]——每一種都呈現出不同的尺度分佈與零值稀疏結構。這就像把三份用不同語言印製的地圖集疊加在一起。像 LIGER 這樣的矩陣分解工具將多模態資料分解為共享因子與資料集特定因子,以分離出共同座標 [8]。最優傳輸(Optimal Transport, OT)框架從數學上對此進行建模,計算出將一個單細胞經驗機率分佈轉移至另一個分佈時傳輸成本最小化的映射方案。動態最優傳輸模型則能跨越靜態的時間快照,重建連續的發育軌跡 [9]。
這些前處理架構促成了人類細胞圖譜(Human Cell Atlas, HCA)倡議。該國際聯盟成立於 2016 年,涵蓋了分布於約 100 個國家的 3,600 多位研究人員。截至 2026 年,該計畫已透過 450 篇已發表的研究,分析了來自約 10,000 名組織捐贈者的 1 億多個單細胞,組裝出涵蓋肺部、神經、心臟與免疫系統等 18 個生物網絡的初步參考草圖 [10]。後續的里程碑目標是跨越人口統計特徵多元的人類族群,分析數十億個單細胞,以建構完整的器官圖譜。將十年間由數百間實驗室產生的資料集整合至統一的參考座標系統,直接仰賴批次校正與多體學對齊演算法。曾經消失在總體組織均質物中的個別細胞,如今在人類參考地圖上被保留為離散的座標。
參考文獻
[1] Macosko, E. Z., Basu, A., Satija, R., et al. (2015). Highly parallel genome-wide expression profiling of individual cells using nanoliter droplets. Cell, 161(5), 1202-1214. https://doi.org/10.1016/j.cell.2015.05.002
[2] Klein, A. M., Mazutis, L., Akartuna, I., et al. (2015). Droplet barcoding for single-cell transcriptomics applied to embryonic stem cells. Cell, 161(5), 1187-1201. https://doi.org/10.1016/j.cell.2015.04.044
[3] 10x Genomics. (October 15, 2024). 10x Genomics Delivers 'Single Cell for a Single Cent' with New Chromium Launches. https://www.prnewswire.com/news-releases/10x-genomics-delivers-single-cell-for-a-single-cent-with-new-chromium-launches-302276878.html
[4] Haghverdi, L., Lun, A. T. L., Morgan, M. D., & Marioni, J. C. (2018). Batch effects in single-cell RNA-sequencing data are corrected by matching mutual nearest neighbours. Nature Biotechnology, 36(5), 421-427. https://doi.org/10.1038/nbt.4091
[5] Korsunsky, I., Millard, N., Fan, J., et al. (2019). Fast, sensitive and accurate integration of single-cell data with Harmony. Nature Methods, 16(12), 1289-1296. https://doi.org/10.1038/s41592-019-0619-0
[6] Lopez, R., Regier, J., Cole, M. B., Jordan, M. I., & Yosef, N. (2018). Deep generative modeling for single-cell transcriptomics. Nature Methods, 15(12), 1053-1058. https://doi.org/10.1038/s41592-018-0229-2
[7] Stoeckius, M., Hafemeister, C., Stephenson, W., et al. (2017). Simultaneous epitope and transcriptome measurement in single cells. Nature Methods, 14(9), 865-868. https://doi.org/10.1038/nmeth.4380
[8] Welch, J. D., Kozareva, V., Ferreira, A., et al. (2019). Single-cell multi-omic integration compares and contrasts features of brain cell identity. Cell, 177(7), 1873-1887. https://doi.org/10.1016/j.cell.2019.05.006
[9] Ling, Y., et al. (2025). CellStream: Dynamical Optimal Transport Informed Embeddings for Reconstructing Cellular Trajectories from Snapshots Data. arXiv preprint arXiv:2511.13786. https://arxiv.org/abs/2511.13786
[10] Human Cell Atlas. (Accessed August 18, 2026). About the Human Cell Atlas. https://www.humancellatlas.org/learn-more/about-the-human-cell-atlas/













