
一、文章介绍
癌症研究者使用细胞系(CCLs)、患者来源异种移植瘤(PDXs)、基因工程小鼠模型(GEMMs)和肿瘤类器官(tumoroids)作为模型来研究肿瘤生物学和发现治疗方法。模型的通用性和力量源于其代表所研究肿瘤类型的保真度------然而,这种保真度究竟有多高往往并不清楚。模型的丰富性和新模型易于生成的特点,催生了对能够测量癌症模型与天然肿瘤在多大程度上相似或偏离的工具的需求。此前虽然有多种方法被提出来评估CCLs与肿瘤的相似性(如Domcke等人的适合度评分、基于转录组或分子谱的相关性分析等),但它们通常针对特定肿瘤类型,且主要集中于CCLs,未能覆盖PDXs、GEMMs和肿瘤类器官等更广泛的模型类别。此外,这些方法也缺乏对新生成模型的快速评估能力。
为填补这一空白,Da Peng、Rachel Gleyzer及其合作者在Genome Medicine上发表了题为"Evaluating the transcriptional fidelity of cancer models"的研究论文,提出了一个名为**CancerCellNet(CCN)**的基于机器学习的计算工具。
CCN的核心创新在于利用"基因对(gene pair)"转换实现平台和物种无关的分类。具体而言,CCN使用TCGA中22种实体瘤类型的8,991个患者肿瘤RNA-seq表达矩阵作为训练数据。对每种肿瘤类型,CCN通过模板匹配(template matching)选择n个上调基因、n个下调基因和n个相对不变的基因。然后对这些基因进行"基因对转换"------比较样本中两个基因的表达量,若第一个基因表达高于第二个则编码为1,否则为0。这种二元转换使CCN能够兼容不同平台(RNA-seq与微阵列)和不同物种(人类与小鼠)的查询数据。CCN随后为每种肿瘤类型选择m个最具区分力的基因对作为随机森林分类器的特征,并加入一个"Unknown"类别(由随机打乱的基因对配置文件训练)来识别不匹配任何训练类别的样本。最终分类器包含1,979个特征,决策阈值设为0.25(最大化Macro F1)。
研究者应用CCN评估了657个CCLs、415个PDXs、26个GEMMs和131个肿瘤类器官,涵盖22种肿瘤类型和36种亚型。主要发现包括:(1)PDXs在三个(UCEC、PAAD、LUAD)有四种模型数据的肿瘤类型中达到最高CCN分数,具有最大的转录保真度潜力,但中位分数低于GEMMs和肿瘤类器官;(2)GEMMs和肿瘤类器官在四个肿瘤类型中具有最高的中位CCN分数,这可能得益于免疫完整的宿主环境和3D自组织培养的生理相关刺激;(3)食管癌(ESCA)没有任何模型达到转录保真度标准,提示需要新的模型开发;(4)许多CCLs未被分类为其标注的肿瘤类型,可能是由于高传代数、培养条件和遗传漂变导致的转录组偏离。此外,CCN还识别出如SK-OV-3(标注为卵巢癌但实际更接近子宫浆液性癌)和PC-3(标注为前列腺癌但具有膀胱癌特征)等标注错误的细胞系,并通过免疫荧光实验验证了预测。
二、算法原理介绍

CCN的算法设计围绕"基因对转换 → 模板匹配特征选择 → 随机森林分类"三个核心步骤展开。
(一)训练数据与基因选择。 输入为TCGA 22种实体瘤的8,991个RNA-seq表达矩阵(13,142个共有基因)。对每种肿瘤类型ccc,定义模板向量tct_ctc(该类型样本为1,其余为0),计算每个基因表达与tct_ctc的Pearson相关系数。选择相关系数最大的n个基因作为上调基因(n=30n=30n=30),最小的n个作为下调基因,绝对值最小的n个作为相对不变基因。这共90个基因进入下一步。
(二)基因对转换与特征选择。 对选出的90个基因生成所有两两组合。基因对转换定义为:对任意两个基因gi,gjg_i,g_jgi,gj,若样本中gig_igi表达>gjg_jgj表达则编码为1,否则编码为0。这一二元转换是CCN实现平台和物种无关性的关键------它不依赖于绝对表达值,仅比较相对表达次序,因此可兼容RNA-seq、微阵列及跨物种数据。对每种肿瘤类型,再次用模板匹配从所有基因对中选择m个与模板最相关的基因对(m=75m=75m=75),每个基因在所选基因对中出现不超过3次以避免单一基因主导。所有22种类型的基因对(共1,650对,去重后1,979个特征)合并为最终特征集。
(三)Unknown类别与随机森林分类。 将训练样本按特征集转换为二元矩阵(样本×基因对)。为识别不匹配任何已知类别的查询样本,CCN通过随机打乱每行和每列的二元值生成70个随机配置文件,标注为"Unknown"类别加入训练。用多类随机森林(2,000棵树,分层抽样60样本/类别)训练分类器。决策阈值通过50次2/3交叉验证最大化Macro F1确定(阈值=0.25)。查询时,每个样本获得22个肿瘤类型+Unknown的分数向量。分类标签规则:若标注类型分数>阈值且无其他类型>阈值→"correct";若标注类型和其他类型均>阈值→"mixed";若只有非标注类型>阈值→"other";若无任何类型>阈值或Unknown最高→"none"。
三、总结
CancerCellNet是一个基于基因对转换和随机森林的机器学习工具,用于评估癌症模型相对于22种天然肿瘤类型和36种亚型的转录保真度,通过二元相对表达比较实现平台和物种无关的跨模型模态比较。其核心创新在于:以基因对转换消除绝对表达值的平台依赖性,以Unknown类别处理不匹配样本,使CCN能统一评估CCLs、PDXs、GEMMs和肿瘤类器官的转录保真度 。CCN揭示了PDXs具有最高的潜在保真度但异质性大,GEMMs和肿瘤类器官中位保真度更高,食管癌缺乏合适模型,以及多种细胞系标注错误等问题。CCN以R包和Web应用形式开源,为癌症模型选择、新模型验证和模型模态比较提供了标准化、可扩展的计算框架。