
一、文章介绍
空间分辨单细胞技术通过在完整组织内提供数千个细胞的分子、表型和位置测量,正在变革组织架构研究。这些技术不仅能定量组织中有哪些细胞类型,还能揭示它们如何空间组织。一个核心分析任务是测量细胞类型间的空间共定位(colocalization),这可以作为细胞互作、独特微环境和协调组织组织的代理指标。例如,细胞毒性T细胞相对于肿瘤细胞的空间组织是肿瘤免疫微环境的临床相关特征,而涉及B细胞、T细胞和抗原呈递细胞的有组织淋巴聚集体是三级淋巴结构的特征,与良好预后和免疫治疗响应相关。
然而,跨样本比较共定位的严格统计推断仍面临巨大挑战。每个组织样本可视为高维随机空间过程的一个独立实现,数千个空间相关细胞嵌套在样本内,样本嵌套在患者内,患者按临床表型分组。将细胞视为独立实验单元会导致伪重复和膨胀的证据。在空间组学中,这一挑战还叠加了局部空间异质性------同一组织切片的不同区域可能呈现不同的细胞邻域、密度和空间关联模式。因此,差异共定位分析必须考虑多层次变异:样本内空间不确定性、样本间生物和技术异质性,以及同一患者的重复采样。
现有方法(如spicyR、SpaceANOVA)虽解决了部分问题,但据作者所知,尚无方法将空间自举估计的样本内不确定性与跨样本和跨患者的多层次随机效应合并显式结合。这一缺失在临床空间组学研究中尤为关键------这类研究通常涉及小样本队列、显著生物学异质性和每位患者多个组织区域或核心。
为填补这一空白,Jacob Chang、Almudena Espin Perez及其合作者在Bioinformatics 上发表了题为"PANORAMIC: Pooled Analysis Of Variance-Aware Modeling and Inference of Colocalization"的应用笔记,提出了一个名为PANORAMIC的分层框架。
PANORAMIC的核心设计围绕三个层次:(1)样本级共定位估计 ------使用边缘校正邻域富集统计量量化细胞类型对在指定空间半径内的共定位强度。对于有序对a→ba \rightarrow ba→b,计算每个bbb型锚点细胞周围aaa型细胞的实际比例与基于样本整体aaa型密度的边缘校正期望比例之差,以百分比点表示;(2)样本内不确定性量化 ------使用基于块的空间自举 (Loh式空间重采样)估计每个样本的共定位不确定性和方差。该方法通过重采样局部组织区域(而非单个细胞)来保持局部空间依赖性,同时量化样本内空间异质性;(3)多层次随机效应元分析------将样本级估计和方差通过限制最大似然(REML)拟合的多层次随机效应元分析模型传播,在建模患者间异质性和重复样本的同时合并共定位效应,并检验条件间差异。
研究者通过模拟验证了空间自举方差与经验方差的校准效果(均匀和聚类模式下中位相关系数0.88-0.91),以及在渐进式数据退化下对患者级异质性恢复的改进(PANORAMIC的RMSE显著低于朴素估计)。在结直肠癌TMA数据集(Schurch et al. 2020)中,PANORAMIC识别出13个在Crohn's样反应(CLR)与弥漫性炎症浸润(DII)间显著差异的细胞类型对,CLR中B细胞-CD8+ T细胞和B细胞-CD4+ T细胞共定位更强,与三级淋巴样结构一致。差异共定位网络进一步显示CLR相关的免疫/基质模块(B细胞、CD8+ T细胞、CD4+ T细胞、基质)更紧密组织(空间紧凑性检验p≈0.003p\approx0.003p≈0.003)。在头颈部鳞状细胞癌TMA数据中,该流程同样可移植应用。
二、算法原理介绍

PANORAMIC的算法设计围绕"边缘校正邻域富集 → 块空间自举 → 多层次元分析"三个核心步骤展开。
(一)边缘校正邻域富集统计量。 对每个样本kkk、有序细胞类型对a→ba\rightarrow ba→b和半径rrr,对每个bbb型锚点细胞iii,计算邻域内aaa型细胞的实际比例ρ^i,aobs(r)=ni,a(r)/ni,⋅(r)\hat{\rho}{i,a}^{\text{obs}}(r)=n{i,a}(r)/n_{i,\cdot}(r)ρ^i,aobs(r)=ni,a(r)/ni,⋅(r)。为校正组织边界截断,计算锚点iii处半径rrr圆盘落在组织窗口内的面积Ai(r)=∣B(xi,r)∩Wk∣A_i(r)=|B(x_i,r)\cap W_k|Ai(r)=∣B(xi,r)∩Wk∣,预期aaa型细胞数为Ei,a(r)=λ^aAi(r)E_{i,a}(r)=\hat{\lambda}a A_i(r)Ei,a(r)=λ^aAi(r),其中λ^a\hat{\lambda}aλ^a为样本内aaa型细胞密度。锚点级得分为Si,a→b(r)=100×ni,a(r)−Ei,a(r)/ni,⋅(r)S{i,a\rightarrow b}(r)=100\timesn_{i,a}(r)-E_{i,a}(r)/n{i,\cdot}(r)Si,a→b(r)=100×ni,a(r)−Ei,a(r)/ni,⋅(r)------正值表示aaa型细胞在bbb型细胞邻域中相对于样本密度富集。样本级估计Θ^k,a→b(r)\hat{\Theta}_{k,a\rightarrow b}(r)Θ^k,a→b(r)为所有有效锚点得分的均值。该统计量是有向 的------a→ba\rightarrow ba→b高并不必然意味着b→ab\rightarrow ab→a高。
(二)块空间自举估计样本内方差。 将组织窗口WkW_kWk覆盖规则网格,每个瓦片获得重叠权重wkq=∣tileq∩Wk∣/∣tileq∣w_{kq}=|\text{tile}q\cap W_k|/|\text{tile}q|wkq=∣tileq∩Wk∣/∣tileq∣(仅部分落在组织内的瓦片被降权)。以与重叠权重成比例的概率有放回抽样瓦片,每个自举复制Sik(b)(r)S{ik}^{(b)}(r)Sik(b)(r)通过对抽样瓦片内锚点级得分求均值获得。BBB次自举后,样本级估计μ^ik(r)=1B∑bSik(b)(r)\hat{\mu}{ik}(r)=\frac{1}{B}\sum_b S_{ik}^{(b)}(r)μ^ik(r)=B1∑bSik(b)(r),样本内方差σ^ik2(r)=1B∑bSik(b)(r)−μ\^ik(r)2\hat{\sigma}_{ik}^2(r)=\frac{1}{B}\sum_b S_{ik}\^{(b)}(r)-\\hat{\\mu}_{ik}(r)^2σ^ik2(r)=B1∑bSik(b)(r)−μ\^ik(r)2。这使空间异质性高或采样不稳定的样本在后续合并中贡献降低。
(三)多层次随机效应元分析。 对每个细胞类型对fff,模型yfk=∑c=1Cβfc1{c(k)=c}+uf,m(k)+ϵfky_{fk}=\sum_{c=1}^C \beta_{fc}\mathbf{1}\{c(k)=c\}+u_{f,m(k)}+\epsilon_{fk}yfk=∑c=1Cβfc1{c(k)=c}+uf,m(k)+ϵfk,其中βfc\beta_{fc}βfc为组ccc的预期共定位水平,uf,m(k)∼N(0,τf,c(k)2)u_{f,m(k)}\sim\mathcal{N}(0,\tau_{f,c(k)}^2)uf,m(k)∼N(0,τf,c(k)2)为患者级随机效应(捕获患者间异质性),ϵfk∼N(0,vfk)\epsilon_{fk}\sim\mathcal{N}(0,v_{fk})ϵfk∼N(0,vfk)为样本级残差(方差由自举估计)。参数通过REML 估计,组间差异通过Wald检验,PPP值经Benjamini-Hochberg校正。差异共定位Z-分数可构建加权网络,通过Leiden聚类识别高阶共定位子网络。
三、总结
PANORAMIC是一个用于空间组学共定位分析的分层不确定性传播框架,通过边缘校正邻域富集统计量量化样本级共定位,通过块空间自举估计样本内空间不确定性,并通过多层次随机效应元分析将两者传播到群组级推断中。其核心创新在于:将"样本级空间估计带有不确定性"而非误差为零的理念系统化,使空间异质性高的样本在合并中贡献降低,同时分离样本内噪声与患者间真实生物学异质性 。在结直肠癌和头颈癌TMAs中,PANORAMIC识别出与CLR相关的B/T细胞共定位增强和更紧凑的免疫/基质组织,而这些信号被标准方法遗漏,为临床空间组学中跨样本、跨患者的差异共定位分析提供了统计严谨且可解释的计算工具。