白豆杉单倍型基因组揭示紫杉醇生物合成演化--Nature Communications

Archipelago architecture and evolution of paclitaxel biosynthesis revealed by the Pseudotaxus chienii haplotype resolved genome

基于白豆杉单倍型解析基因组揭示紫杉醇生物合成的群岛式基因簇结构及其演化

白豆杉基因组--Nature Communications_analysis genome of pseudotaxus chienii reveals ins-CSDN博客

摘要

白豆杉(Pseudotaxus chienii )是白豆杉属的唯一物种,与红豆杉属(Taxus )亲缘关系很近。白豆杉是否能够合成紫杉醇,长期以来一直存在争议。本研究报道了白豆杉染色体水平、分单倍型解析的基因组,每套单倍型基因组大小约 15.4 Gb,具备较高的连续性与完整性。本研究鉴定出一个结构保守但物理位置分散的基因组区域,将其命名为紫杉烷生物合成群岛(Taxane Biosynthetic Archipelago, TBA) ,该区域包含 3 个生物合成基因簇以及紫杉烷生物合成所必需的共线性核心基因。

结合转录组、代谢物以及异源酶学综合分析表明:尽管白豆杉保留了与紫杉醇生物合成相关的大体保守基因组框架,但其末端合成通路发生了严重的功能退化,很大程度上丧失了合成紫杉醇的能力;与此同时,该物种体内大量积累紫杉宁 J(taxinine J)。本研究为解析长期存在的 "红豆杉属以外物种能否产生紫杉醇" 这一争议提供了进化视角,也为理解复杂特化代谢通路的进化衰退提供研究依据。

白豆杉(Pseudotaxus chienii )是一种珍稀的林下特有裸子植物,其种子被白色肉质假种皮包被,这一特征与红豆杉属典型的红色假种皮截然不同(附图 1)¹。该物种生长于海拔 6001500 m 的亚热带山地湿润岩石生境,呈片段化分布,仅见于我国东南地区的若干隔离种群。受生境破碎化影响,白豆杉被列入世界自然保护联盟(IUCN)易危濒危物种名录 ²,³。作为白豆杉属(红豆杉科)唯一物种⁴,它是研究红豆杉科物种进化分化的重要模式材料。

白豆杉与红豆杉属在系统发育与形态上高度相似,非常适合开展紫杉类代谢的比较研究。红豆杉属物种可合成紫杉醇(泰素),这是一种重要的二萜类化合物,用于癌症化疗,也是被研究最为广泛的植物特化代谢物之一⁵,⁶。紫杉醇的生物合成由成簇、共调控的酶参与完成,包括细胞色素 P450、酰基转移酶以及羟化酶。南方红豆杉、喜马拉雅红豆杉、云南红豆杉的基因组研究,已经鉴定出新的紫杉二烯合酶、保守的生物合成基因簇,并提供了相关进化见解⁷⁻⁹。尽管已有上述研究,但裸子植物普遍拥有极大且高度重复的基因组,给高分辨率解析基因组结构带来巨大挑战。因此,裸子植物复杂的多步特化代谢通路如何在维持基因组结构完整性的同时发生进化分化,目前仍知之甚少。由此,白豆杉是解析红豆杉科紫杉醇生物合成通路起源、基因组结构保守性与进化分化的理想研究材料。

尽管红豆杉属中紫杉醇生物合成通路的解析已取得诸多进展⁷⁻¹³,但白豆杉紫杉醇生物合成相关研究仍较为有限,且现有结果相互矛盾。已有报道中白豆杉紫杉醇含量结果不一致:Heinig 等人未检测到紫杉醇,而 Yu 等人却检测到大量积累 ¹⁴,¹⁵,说明亟需开展全面的基因组研究来厘清该争议。Wang 等人的研究进一步加剧了这一争论,该研究提出白豆杉仅拥有不完整的紫杉烷合成通路,通路在合成 10去乙酰巴卡亭 Ⅲ 之前就已终止 ¹⁶。然而,对于高杂合物种,传统一致性参考基因组组装得到的结论本身存在固有局限。解析复杂特化代谢通路,需要分单倍型解析的基因组 ,才能够全面解析等位变异、结构分化以及完整通路的组织形式 ¹⁷,¹⁸。此外,古老裸子植物谱系的代谢能力不一定在结构层面完全丢失,更多表现为显著的功能衰减;由此产生的代谢变异,可能受复杂的基因型环境互作(G×E)调控 ¹⁹,²⁰。综上,迫切需要结合分单倍型基因组分析与靶向代谢物定量,准确阐明白豆杉紫杉醇生物合成的进化地位与功能状态。

本研究报道了白豆杉染色体水平、分单倍型解析的基因组组装,并鉴定出紫杉醇生物合成对应的基因组结构,将其命名为紫杉烷生物合成群岛(Taxane Biosynthetic Archipelago, TBA) 。TBA 包含多个物理位置分散但共线性保守的生物合成基因群以及通路核心酶基因。结合该基因组框架、靶向代谢物定量、转录组分析与异源酶活实验,结果表明:尽管白豆杉保留了大体保守的紫杉醇生物合成相关基因组结构,但其通路末端发生严重的功能退化。该功能衰减表现为 PcTOT 催化效率下降,多个下游酶在本氏烟草中无法产生可检测的通路产物。仅在特定条件下能检测到痕量紫杉醇,而紫杉宁 J 与紫杉素在特定组织与种群中大量积累。本研究为理解红豆杉科复杂特化代谢通路的进化衰退与分化提供研究框架。同时,该分单倍型基因组组装为物种保护提供宝贵资源,也为后续高价值紫杉烷的代谢工程奠定基础。

结果

白豆杉分单倍型基因组的从头组装

为获得白豆杉高质量基因组,首先开展基因组调研。利用流式细胞术与 kmer 分析评估基因组大小。流式细胞术估算基因组约 15.64 Gb(附图 2ac、附表 1),与 kmer 分析结果 14.85 Gb 基本吻合(附图 2d)。kmer 分析同时显示明显的杂合峰(附图 2d),说明该物种基因组复杂度高、杂合度大。

采用多平台测序策略构建高质量基因组:99×BGI 短读长、47×Revio HiFi 长读长,以及 151.42×HiC 测序用于染色体挂载(附表 2)。最终得到两套分相的单倍型基因组(Hap1、Hap2),均锚定至 12 条假染色体,与红豆杉属高度保守的单倍体染色体数目(n=12)一致 ²¹,²²。组装得到的假染色体总长度与基因组大小估算结果、已发表白豆杉基因组相吻合 ¹⁶。Hap1 基因组大小 15.434 Gb(725 个 contig,contig N50 为 60.2 Mb);Hap2 基因组大小 15.430 Gb(817 个 contig,contig N50 为 55.9 Mb)(图 1a,附表 3)。HiC 互作热图呈现典型棋盘模式(附图 3、4);对角线强互作信号证实染色质空间连接正常,无异常互作,支持 scaffold 挂载准确性与组装结构完整性。组装总长度与流式细胞、kmer 估算高度一致,说明基因组覆盖完整(附表 3)。Merqury 评估显示,两套单倍型各自完整度约 87.6%,合并组装完整度 98.13%(附表 3)。两套单倍型的碱基质量值 QV 均大于 54,证明碱基准确度高(附表 3)。

从头结构基因注释

随后开展高质量基因组注释,包括重复序列注释、基因预测与功能注释。重复序列注释结果表明,重复序列是基因组最主要组分:Hap1 占比 88.43%,Hap2 占比 88.60%。其中 LTR 反转录转座子占主导(Hap1 为 53.65%,Hap2 为 54.05%),以 Gypsy 与 Copia 元件数量最多(图 1a,附表 4、5)。DNA 转座子在 Hap1、Hap2 中分别占 21.55%、21.12%,以 Tc1/IS630/Pogo 与 hoboActivator 超家族最为丰富(附表 4、5)。在 LTR 元件中,年轻 Gypsy 元件拷贝数更高、基因组分布更广,倾向于插入异染色质区域,可能参与基因组重塑与调控分化(附表 4)。对 Hap1 中 33605 条完整 LTR 反转录转座子进行插入时间分析,得到约 21.59 百万年前的单峰扩张事件(图 1b),替换速率采用 7.3×10⁻¹⁰替换 / 位点 / 年 ²³,说明白豆杉基因组历史上发生过一次转座爆发。与南方红豆杉相比,白豆杉基因组更大(15.6 Gb vs 10.2 Gb),但在 824 百万年区间内完整 LTR 插入比例更低(31% vs 40%)⁷。这表明白豆杉基因组扩张源于 LTR 元件的保留效率提升,其转座爆发时间早于南方红豆杉;而南方红豆杉发生时间更晚的转座爆发,同时对年轻元件清除效率更高⁷。上述结果说明白豆杉基因组经历剧烈的重复序列扩张与结构复杂化,是进化分化过程中转座子大量扩增的结果,该模式与其他裸子植物(如北美黄杉、南方红豆杉)一致⁷,²⁴。

基因预测整合从头预测、同源比对、转录组证据 多种策略。Hap1 预测得到 36488 个高置信蛋白编码基因,Hap2 为 36360 个。基于保守蛋白的 BUSCO 评估:两套单倍型完整度均为 95.0%,合并后完整度 95.6%(图 1a,附表 3,附图 5)。

利用 Nr、InterPro、Pfam、KEGG、GO、SwissProt、eggNOG 等公共数据库完成基因功能注释。Hap1 与 Hap2 中,分别有 34332/34136 个基因注释到 Nr;32976/32801 个注释到 InterPro;30145/30011 个注释到 eggNOG;26872/26654 个注释到 Pfam;24563/24383 个注释到 SwissProt(附表 6)。Hap1、Hap2 分别有 25971、25811 个基因获得 GO 注释;9744、9736 个基因获得 KEGG 通路注释。总体上 Hap1 有 96.13% 基因、Hap2 有 95.89% 基因得到功能注释(附表 6)。以上结果表明两套单倍型在基因结构注释与功能注释上均具备较高的完整性与准确度。

图 1|白豆杉的基因组特征与比较基因组分析

a 白豆杉 24 条组装完成的假染色体的基因组圈图。轨道 (I) 为各假染色体的长度(单位:Mb);轨道 (II)(VI) 依次分别代表重复序列密度、GC 含量、基因密度、Ty3/Gypsy、Ty1/Copia 以及未知长末端重复(LTR)元件的丰度。所有指标均采用 5 Mb 滑动窗口计算。中间配图为花期的白豆杉植株。

b 白豆杉基因组中 LTR 元件的扩张与分化特征。

c 白豆杉与代表性植物物种的基因家族演化动态。推断的最近共同祖先(MRCA)拥有 8146 个基因家族。Pca/b 分别代表白豆杉单倍型 Hap1 与 Hap2。

d 白豆杉扩张基因与物种特有基因的 KEGG 通路富集分析。颜色深浅代表校正后 P 值的显著性,横轴为富集倍数。采用双侧超几何检验计算 P 值,并通过错误发现率(FDR)进行多重检验校正。

系统发育分析揭示白豆杉谱系特异性适应

为解析白豆杉的演化历程与适应性特征,本研究基于 421 个单拷贝直系同源基因开展系统发育分析;而 Wang 等人近期的一项研究基于共识基因组组装仅使用了 184 个单拷贝基因。系统发育结果显示清晰的拓扑结构:3 个红豆杉科物种(白豆杉、南方红豆杉、东北红豆杉)形成单系类群,该类群约在 1.6901 亿年前与水杉发生分化(图 1c)。在红豆杉科分支内部,白豆杉与南方红豆杉互为姐妹类群,二者分化时间约 7131 万年前;这一姐妹分支随后约 1.349 亿年前与东北红豆杉发生分化。

本研究估算的分化时间与 Wang 等人报道的结果存在差异。该差异属于预期之内,很可能源于本研究采用的物种取样策略不同,且所使用的单拷贝直系同源基因数据集规模更大(421 个对比 184 个)。此外,基因家族聚类分析鉴定到白豆杉中 717 个显著扩张的基因家族,这些家族显著富集于转移酶活性、聚酮化合物合成蛋白以及异黄酮生物合成通路(图 1d,附图 6)。853 个谱系特有基因在蛋白酶体、缬氨酸 / 亮氨酸 / 异亮氨酸生物合成、丙酮酸代谢通路显著富集。将白豆杉与 3 个近缘针叶树(南方红豆杉、东北红豆杉、水杉)开展比较基因组分析,鉴定得到 3864 个白豆杉物种特有基因,它们显著富集于核糖体结构组分、泛素蛋白转移酶活性、糖酵解 / 糖异生、核糖体以及外泌体相关功能(附图 7)。

白豆杉紫杉醇合成基因座的基因组结构保守性

此前红豆杉属基因组研究表明,紫杉醇合成关键基因成簇分布于 9 号染色体末端(部分组装版本对应 10 号或 12 号染色体)。为探究该功能基因组结构在白豆杉中是否演化保守,本研究对南方红豆杉、东北红豆杉、水杉开展全基因组共线性分析。全局基因组共线性图谱揭示红豆杉属与白豆杉之间复杂的演化历史:2 号染色体共线性稳定、线性同源性高,其余绝大多数染色体经历了大规模的染色体重排(图 2a)。

在大规模染色体重排的背景下,本研究在白豆杉单倍型 1(hap1)的 8 号染色体末端鉴定出一段约 80.7 Mb 的保守共线性区块(Pca08:1 019 626 7361 100 348 071);该区块与单倍型 2(hap2)的同源区段(Pcb08:1 015 375 3981 095 531 480)具有共线性,同时与南方红豆杉 9 号染色体(Chr9:19 994 51591 811 351)存在良好宏观共线性(图 2a,附图 8、9)。与之相比,东北红豆杉与水杉的对应区域发生片段化,仅保留零散分布的紫杉醇合成基因直系同源拷贝(如水杉与东北红豆杉均保留 T5αH;水杉还保留 TS、T13αH)(图 2b)。上述结果说明:包含部分紫杉醇合成核心基因的大型宏观共线性区块,在红豆杉属与白豆杉属中特异保留,而在东北红豆杉、水杉中发生片段化甚至丢失。

白豆杉紫杉烷合成通路呈现 "基因群岛" 结构

以白豆杉两个单倍型间保守的 80.7 Mb 宏观共线性区块(对应南方红豆杉 9 号染色体同源区段)为锚点,对两套单倍型基因组开展全基因组扫描,解析其次生代谢全景,在 hap1(Pca)鉴定 21 个候选生物合成基因簇(BGC),hap2(Pcb)鉴定 25 个候选生物合成基因簇(附图 10,补充数据 1、2)。与裸子植物已有报道一致,这些基因簇规模巨大,平均约 4.5 Mb,约 65% 基因簇长度超过 2 Mb;该规模在被子植物中十分罕见。

在 8 号染色体紫杉醇富集的亚区段内,存在 3 个物理位置分散但功能关联的生物合成基因簇,分别命名为 TS1 簇(TS1C)、紫杉二烯合酶簇(TSC)、T9 簇(T9C),均位于 Pca08 保守区段内(图 2b)。尽管在 Pca08 的 80.7 Mb 区段内物理位置相互分隔,这 3 个基因簇,以及散布在基因簇边界之外的多个紫杉醇合成核心基因,富集细胞色素 P450、BAHD 酰基转移酶与萜类合酶;并且两套单倍型之间、以及和南方红豆杉同源区段之间维持共线性。

以 T9C 为例说明功能层面的基因簇定义:利用 antiSMASH 基于基因邻近关系初步划定白豆杉 Pca 的 T9C 约 1.3 Mb,而其在 Pcb 中的同源区段可达 7.7 Mb。整合 124 个白豆杉转录组数据集开展 WGCNA 共表达分析,证实 Pcb 整条 7.7 Mb 区段内代谢相关基因存在共表达,该模式在 Pca 的同源区段同样保守;据此将 Pca 的 T9C 边界从邻近关系划定的范围扩展至约 6.3 Mb(附图 11,补充数据 3)。

为定量验证这套分散排布的基因组 "基因群岛" 的功能整体性,本研究以 Pca 单倍型为代表,整合 HiC 染色质结构信息与 124 个样本转录组的皮尔逊相关系数分析。HiC 结果显示,整个紫杉烷合成群岛(TBA)区域处于转录活跃的 A 区室,为基因表达提供全局有利的染色质环境。3 个基因簇在空间上分属不同拓扑关联结构域(TAD),内部进一步划分出亚 TAD(附图 12a)。这种层级化的染色质分区与功能边界高度吻合;例如包含 TS1C 的 TAD 仅容纳核心代谢基因,其左侧边界将非代谢基因排除在外,清晰界定功能结构域。

尽管分属独立 TAD,3 个基因簇以及分散分布的核心酶基因构成高度协同的共表达网络,绝大多数基因对的皮尔逊相关系数 r≥0.9(附图 12b)。综上结果表明:紫杉烷合成群岛的功能完整性,依靠活跃染色质环境下的调控协同来维持,而非严格依赖基因在染色体上的线性邻近排布。这种功能关联但空间分散的基因簇 + 分散核心酶的群岛式排布,与微生物、被子植物中紧凑的生物合成基因簇形成鲜明对比(附图 13)。

因此本文提出 ** 紫杉烷生物合成群岛(Taxane Biosynthetic Archipelago,TBA)** 这一概念,描述白豆杉紫杉醇合成基因独特的排布模式,其近缘红豆杉属物种中也存在部分保守共线性元件。TBA 结构具有可塑性,整合保守核心模块与谱系特异性附属元件,是不对称演化的动态基因组区域;不同谱系发生大量基因扩增与染色体重排。例如 T9C(与南方红豆杉报道的 Group 9.1 共线性)就体现该可塑性(图 2b):TOT 基因在 Pca 有 3 个拷贝,Pcb 仅 1 个拷贝;在南方红豆杉中该基因发生易位,迁移至 TS1C 附近(图 2b、c)。

此外,相较于 Pca 中 TS2 仅 5 个拷贝,Pcb 单倍型拥有 9 个 TS2 拷贝,可增强萜类骨架生成能力。依据南方红豆杉已有分类,TS2 构成独立演化支,发生显著基因扩张,同时具备茉莉酸依赖的调控分化特征(图 2c)。为解析 TS2 扩张的调控基础,对白豆杉两套单倍型以及南方红豆杉开展启动子顺式元件分析,观察到明显的调控分化:TS2 启动子大量富集茉莉酸甲酯响应元件(CGTCA 基序、TGACG 基序、MYC 结合位点),而 TS1 几乎不存在上述元件(附图 14)。这种显著的结构分化提示二者功能分化:TS1 负责基础水平表达;发生扩张的 TS2 家族转录本可快速响应胁迫诱导。

紫杉醇合成通路起源与分化的系统基因组学解析

为判断白豆杉是否完整保留紫杉醇合成所需全部酶编码基因,本研究选取代表性陆地植物,对紫杉醇通路 28 个关键基因开展基因分布分析(附图 15、16)。结果表明白豆杉拥有目前已知全部紫杉醇合成基因拷贝,说明它保留了一套大体完整的紫杉醇合成相关基因组元件。上游前体合成基因包括牻牛儿牻牛儿焦磷酸合酶(GGPPS)、FoTO1,以及苯丙烷通路苯丙酰CoA 连接酶(PCL),从苔藓到被子植物的所有陆地植物谱系均高度保守,说明它们起源于有胚植物共同祖先。

与之不同,负责紫杉烷骨架合成的核心萜类合酶 TS1、TS2 不存在于苔藓、买麻藤类与被子植物,但存在于松科、大部分柏科以及红豆杉科。即便在针叶树内部,部分物种仍丢失 TS 同源基因,例如买麻藤、巨柏以及东北红豆杉。尤其在红豆杉科基部类群东北红豆杉中缺失该核心基因,同时对应基因组共线性区域高度片段化(图 2a,附图 8),更支持谱系分化之后发生二次丢失,而非不完全谱系分选。TS 的这种系统发育分布特征,源于萜类合酶家族内部基因复制与后续功能特化;喜马拉雅红豆杉 TS 同源基因功能分化、以及非柏目物种完全缺失该基因,也佐证该观点。

下游另一组通路基因,包括多种氧化酶、酰基转移酶、侧链组装酶(T5αH1、T13αH1、T9αH750C、T7dA、T9dA、TAX19、DBTNBT、PAM)广泛存在于多数针叶树(松科、红豆杉科、柏科),在买麻藤、苔藓、被子植物中缺失。最后一组通路基因(T10βH1、T2αH、T7βH1、TOT、T9αH、T7AT、紫杉烷 2αO苯甲酰转移酶 TBT1、BAPT)仅在已测序的两个红豆杉科基因组(南方红豆杉、白豆杉)中存在,每个基因 13 个拷贝,其余所有检测物种均无拷贝。

从广泛存在的前体基因,到针叶树富集的修饰基因,再到红豆杉科特有的氧化、酰化、侧链组装基因,该层级化的基因分布模式,支持紫杉醇通路基因组元件是逐步组装形成的,提示紫杉醇合成相关基因组结构,在红豆杉属与白豆杉属最近共同祖先中完成组装。此外,白豆杉与南方红豆杉的直系同源基因 Ka/Ks 比值较低(平均 Ka/Ks≈0.31;补充数据 4),说明编码序列持续受到纯化选择约束。

图 2|白豆杉中紫杉烷生物合成群岛(TBA)的基因组排布与结构特征

a 三种红豆杉科物种与柏科外类群水杉(M. glyptostroboides ,Mg)之间的宏观共线性分析,展示了一段保守基因组区域;该区域包含 3 个生物合成基因簇(BGC)以及共线性上游基因,包括TS、T5αH、T10βHT13αH 。Tg:加拿大红豆杉;Tm:南方红豆杉;Pca/b:白豆杉单倍型 1 / 单倍型 2。

b TBA 区域内紫杉醇生物合成基因的共线性排布。参与紫杉醇生物合成通路的基因标记为红色。

c 白豆杉 Pca08 号染色体上 3 个紫杉醇相关生物合成基因簇的基因排布。基因依据酶学功能进行颜色编码,包括萜类合酶、细胞色素 P450,以及参与紫杉烷修饰的下游修饰酶。

转录组以及时空靶向代谢物定量分析揭示紫杉醇积累水平极低

为解析紫杉醇生物合成基因的表达模式,本研究对白豆杉不同组织开展转录组分析(图 3a)。上游酶编码基因(GGPPSTS1/2FoTO1 )以及通路中绝大多数基因(包括大部分羟化酶与酰基转移酶基因),在树皮中的表达量显著高于叶片(图 3a)。与之相反,T9dAT7βH1 等部分基因呈现叶片偏好型表达,提示该现象可能源于分支通路的功能分化或是非经典紫杉烷代谢途径(图 3a)。

为验证转录组结果,并进一步厘清白豆杉是否能够合成紫杉醇这一尚存争议的科学问题,本研究采集白豆杉叶片样品(SQS001,2024 年 4 月)开展靶向代谢物初步定量;采用 SCIEX 5500 QTRAP 液质联用(LCMS/MS)系统,同时结合 Thermo Scientific TSQ 9000 三重四极杆质谱与 Trace 1310 气相色谱联用平台开展 GCMS/MS 检测。两套检测平台共鉴定出 41 种以上紫杉烷类代谢物(附图 17a、b),其中包含紫杉醇以及紫杉醇通路关键中间体紫杉素(taxusin)¹²。在鉴定到的代谢物中,紫杉宁 J(taxinine J)为主要组分,该化合物是一种潜在抗癌活性物质 ³⁵⁻³⁶,同时样品中还检测到大量结构相近的紫杉宁衍生物。该复杂代谢谱中可以检出紫杉醇与紫杉素,但下游中间体巴卡亭 Ⅲ(baccatin Ⅲ)未被检测到。因此选取 4 种代表性代谢物,利用 SCIEX 5500 LCMS/MS 平台对白豆杉与南方红豆杉开展靶向定量分析。重要的是,该份白豆杉个体的叶片与树皮组织中巴卡亭 Ⅲ 均低于检测限,因此比较分析仅纳入 3 种可准确定量的紫杉烷类化合物(图 3b)。三种化合物均可在白豆杉中检出,且树皮中含量显著高于叶片(图 3b)。此外,南方红豆杉叶片中紫杉醇、紫杉素的积累量远高于白豆杉任意组织;而白豆杉各组织中紫杉宁 J 的积累水平高于南方红豆杉。在该份白豆杉个体中,叶片内紫杉醇、紫杉素仅为痕量水平,而紫杉宁 J 积累量很高(图 3b)。

由于初始样品中紫杉醇仅为痕量,为明确该特征是该物种群体的普遍规律,还是仅为特定地域个体的特有现象,本研究对 6 株独立白豆杉个体设置两组采样批次,开展全面的时空靶向紫杉烷代谢物分析。样品采集自两个地理隔离、经纬度差异明显的生境:三清山(样品 SQS001、SQS006)与井冈山(样品 GLM51GLM54)(附图 18a、b)。为评估时间动态变化,分别在 2024 年春季(4 月)与 2026 年冬季(1 月)采集叶片与树皮,共计获得 18 份样品(覆盖不同季节可采集的组织材料)。全部 18 份时空样品采用高灵敏度 SCIEX Triple Quad 7500 LCMS/MS 平行检测;2024 年留存的 SQS001 样品已在 SCIEX Triple Quad 5500 LCMS/MS 平台完成交叉验证。

在所有检测组织、采样位点与时间点中,紫杉宁 J 在 4 种目标紫杉烷中丰度最高(附图 18a、b)。与之形成鲜明对比,所有检测样品均未检出巴卡亭 Ⅲ。仅在 2024 年 4 月三清山采集的一株白豆杉(SQS001)叶片中检测到痕量紫杉醇。有趣的是,井冈山群体中,紫杉宁 J 依然维持最高丰度,部分样品中紫杉素也大量积累,其最高浓度约为紫杉宁 J 的一半。此外,茉莉酸甲酯(MeJA)诱导处理后,3 株独立白豆杉枝条中,仅有 1 株处理 48 h 后的叶片检出痕量紫杉醇;96 h 处理组完全未检测到紫杉醇(附图 18a);2026 年采集的所有自然野生样品中均未检出紫杉醇。

功能实验证实紫杉醇生物合成存在严重下游通路瓶颈

为解析上述代谢瓶颈的生化基础,解释所有被测样品中巴卡亭 Ⅲ 普遍缺失的分子机制,利用本氏烟草异源瞬时共表达体系,系统解析紫杉醇生物合成通路各酶的催化能力。结合序列比对分析,优先筛选白豆杉与南方红豆杉序列一致性较低的候选基因开展功能验证(附表 4)。本研究克隆白豆杉紫杉烷 2α羟化酶(T2αOH )、紫杉烷 7β羟化酶(T7βOH )、紫杉烷 C7βO酰基转移酶(T7AT )、TBTTOT 基因,在本氏烟草中瞬时共表达,并以南方红豆杉同源基因作为对照(图 3c)。白豆杉来源 T2αH、T7βH、T7AT、TBT 可以高效催化底物紫杉素(1)生成紫杉二烯六乙酸酯(2),催化活性与南方红豆杉同源蛋白相当(图 3d、f)。异源表达结果表明,紫杉醇通路上游与中游反应在本氏烟草中具备完整催化活性,但下游步骤出现显著代谢瓶颈。相较于南方红豆杉 TOT,白豆杉 TOT 催化紫杉二烯六乙酸酯(2)生成 1去羟基巴卡亭 Ⅳ(3)的效率显著下降(图 3e、f)。

为初步解析 PcTOT 酶活性弱于 TmTOT 的分子原因,开展蛋白结构建模与分子对接分析。尽管二者整体结构高度相似,2766 个骨架原子的均方根偏差 RMSD 仅 1.67 Å(附图 19b),但 PcTOT 催化构象相对松散(2.7 Å /149.2°),而 TmTOT 的几何参数更适配催化反应(2.4 Å /157.7°)(附图 19a)。分子动力学模拟进一步揭示二者结构区域具有截然不同的柔性特征:PcTOT 的 R1 片段构象波动显著,而 R2、R3 区域残基水平 RMSF(均方根波动)更低,柔性显著被抑制(附图 19c)。CAVER 通道分析显示,这些刚性改变的区域恰好位于通向内部催化口袋的底物入口通道内壁(附图 19d)。综合静态结构与分子动力学结果,底物通道门控动态与蛋白柔性的改变,是两种同源酶催化能力分化的重要原因。

此外,尽管T9oxBAPT 等 6 个下游核心候选基因在基因组中保留,且与红豆杉同源基因序列保守性较高;但将其在本氏烟草中异源表达,无法检测到通路下游产物,与南方红豆杉同源基因的强催化活性形成鲜明对比(附图 20)。

图 3|白豆杉紫杉醇生物合成通路解析

a 热图展示白豆杉叶片与树皮组织中各生物合成基因的表达水平。不同颜色代表白豆杉单倍型 1 中不同的基因拷贝。

b 白豆杉叶片(Pc leaf)、白豆杉树皮(Pc bark)以及南方红豆杉叶片(Tm leaf)中关键紫杉烷代谢物的靶向液质检测结果。紫杉醇检测样本量:白豆杉叶片 n=6、白豆杉树皮 n=6、南方红豆杉叶片 n=6;紫杉素检测样本量:白豆杉叶片 n=5、白豆杉树皮 n=6、南方红豆杉叶片 n=6;紫杉宁 J 检测样本量:白豆杉叶片 n=4、白豆杉树皮 n=6、南方红豆杉叶片 n=6。基于原始浓度数值,使用 OriginPro 2026 SR1(V10.3.0.197)开展单因素方差分析(oneway ANOVA),后续采用 Fisher 最小显著差异法(LSD)进行多重比较,P <0.05 判定为统计学显著。不同小写字母代表组间存在显著差异。误差棒代表独立生物学重复的平均值 ± 标准差。注:Y 轴采用 log₁₀刻度,用于适配不同物种间巨大的浓度差异,该处理会在视觉上压缩代表生物学变异的误差棒。

c 通路示意图:T2αH、T7βH、T7AT、TBT 共同催化紫杉素(1)生成紫杉二烯六乙酸酯(2);TOT 催化紫杉二烯六乙酸酯(2)生成 1去羟基巴卡亭 Ⅳ(3)。

d、e 白豆杉或南方红豆杉来源的 T2αHT7βHT7ATTBT 组合(d)、TOT(e)在本氏烟草中异源表达后,目标产物的提取离子流图(EIC)。

f 白豆杉样品 SQS001(2024 年,黑色)提取物中检测到的紫杉二烯六乙酸酯(2)、1去羟基巴卡亭 Ⅳ(3)与紫杉醇的二级质谱(MS/MS)图谱;红色为对应标准品图谱。

讨论

白豆杉 15.43 Gb 的基因组组装以及高质量注释,为红豆杉科乃至裸子植物研究提供了宝贵参考基因组⁷⁻⁹,¹³,³⁷。本研究将该基因组的 contig N50、蛋白模型 BUSCO 完整度、重复序列占比与代表性裸子植物以及近期发表的另一版白豆杉基因组进行比较,证实本研究基因组数据集可靠性高(附表 5)⁷,¹³,¹⁶,²⁴,³⁷⁻⁴¹。尽管一致性组装可以获得更好的线性连续性,但本研究的单倍型分辨组装 能够更好解析该高杂合基因组的结构复杂性,该基因组重复序列占比超过 88%。本研究蛋白注释 BUSCO 完整度达 95%,在已报道裸子植物中处于较高水平;这套高分辨率组装可以实现完整代谢通路的精准重建。

本研究结果表明,白豆杉属与红豆杉属均发生过大规模 LTR 反转录转座子扩张,但二者基因组结构演化路径存在差异。白豆杉主要的 LTR 转座子扩张发生于约 2159 万年前,时间早于南方红豆杉。该扩张时期与中新世早期重大气候变迁高度吻合,其中最显著的事件为亚洲季风的增强⁴²。尽管现有分子定年的替换速率尚不能证实二者存在直接因果关系,但剧烈的环境波动很可能造成物种种群瓶颈⁴³。种群规模缩减会进一步削弱纯化选择的选择压力,使得大量重复序列得以保留在基因组中⁴⁴。白豆杉基因组偏大,主要原因并非转座子发生频率更高,而是不等价重组缺失导致古老重复序列清除效率低下 ⁴⁵,⁴⁶。多数植物中,不等价重组介导的 DNA 丢失可以平衡基因组扩张;但白豆杉基因组中 DNA 获得与 DNA 丢失的平衡被打破,造成重复序列长期累积。该机制可以解释这一 "活化石" 物种,即便转座子活跃爆发发生在久远地质年代,依然维持庞大基因组的原因。裸子植物基因组受重复序列持续增殖驱动发生大规模扩张,维持成簇排布的完整生物合成基因簇愈发困难 ²⁴,⁴⁵。

针对这一科学问题,本研究提出 ** 紫杉烷生物合成群岛(TBA)** 这一概念,揭示一项重要进化适应机制:在大的演化支系内部,通路基因的协同工作可以不依赖基因在染色体上物理邻近。TBA 由功能关联但空间上分散排布的多个生物合成基因簇构成,区别于传统紧密成簇的生物合成基因簇(BGC)经典模型 ³⁰;由此引出关键科学问题:基因组大尺度范围内,基因如何维持功能协同。传统模型通常用染色质环解释远距离共表达,而本研究在扩张型裸子植物基因组中揭示一套全新的空间调控模式。TBA 的三个基因簇虽然在空间上被划分至不同拓扑相关结构域(TAD),染色体线性距离很远,但共存于活跃染色质环境,维持较强的调控协同性。这种协同表达,可能源于它们共同定位于转录活跃的 A 区室,同时受反式调控信号统一调控。该发现完善了特化代谢的进化认知:在大规模扩张的基因组中,生物合成通路的完整性不一定需要基因线性成簇,可依托更大范围的染色质环境实现。功能模块在拓扑结构上相互分离,同时受全局共同调控信号同步调控⁴⁷。TBA 模型拓展了生物合成基因排布的概念,为大型复杂基因组中识别协同代谢通路提供新思路;这类基因组中功能基因物理位置分散,传统依赖基因物理邻近的基因簇搜索工具会将其遗漏。这种分散排布模式,是大型基因组的一种适应性特征,帮助物种在重复序列不断积累的背景下完成通路演化⁴⁶。

单倍型分辨组装揭示两套单倍型之间存在显著基因组差异,尤其拷贝数变异差异明显。例如 Pcb 单倍型中TS2 基因拷贝数几乎是 Pca 单倍型的两倍。二倍体植物代谢组为两套单倍型的混合,很难直接测定该等位基因扩张带来的代谢表型变化;本研究启动子分析为此提供有力间接证据,支持基因剂量的适应性进化策略 ⁴⁸:TS2 拷贝数扩张,有助于白豆杉在胁迫条件下增强茉莉酸(JA)介导的化学防御,在防御能力与代谢消耗之间实现平衡。此外,这类遗传变异与环境互作可以塑造不同化学型,提示开展代谢多样化研究必须考虑基因型环境互作(G×E)⁴⁹。白豆杉属于濒危物种,本研究结果对制定有效的保护策略具有重要参考价值:保护工作不能仅仅关注扩大种群数量,就地保护应当优先保护异质性微生境,保留维持化学多样性的基因型环境互作。同时,可利用本研究开发的单倍型特异性分子标记开展异地种质资源收集,完整保存该物种全部化学型及其对应的遗传背景。

关于白豆杉能否合成紫杉醇的历史争议,不仅源于代谢检测结果互相矛盾,也来自不同研究基因组解读的差异。例如 Wang 等人 ¹⁶提出,该通路在 10去乙酰巴卡亭 Ⅲ 之前就已经终止;该结论部分源于其一致性染色体水平组装缺失部分通路同源基因。与之相比,本研究单倍型分辨基因组证实,白豆杉基因组依然保留紫杉醇生物合成通路绝大部分遗传元件,包含核心 TBA 以及其他分散分布的必需基因。该结果进一步证明,处理高杂合植物基因组,想要精准重建复杂特化代谢通路,必须使用能够区分单倍型的基因组组装 。但基因组上通路基因完整保留,与生化层面产物积累水平极低,二者并不矛盾,反映动态演化历程。系统发育基因组学结果表明,紫杉醇通路相关遗传元件是逐步组装形成,在红豆杉属与白豆杉属共同祖先中就已经具备完整功能;但祖先基因组结构完整保留,不代表现代物种体内通路依然具备完整功能。自与红豆杉属分化之后,白豆杉支系的通路下游发生显著的功能退化。白豆杉叶片紫杉醇含量比南方红豆杉低 4 个数量级以上。最重要的是,本研究证实红豆杉属之外物种能否合成紫杉醇,不是简单的 "基因有无" 二元问题,而是典型的进化功能退化 案例。尽管祖先的生物合成群岛结构完整保留,通路同源基因 Ka/Ks 比值较低,提示持续受到纯化选择 ³⁴,在基因组大规模扩张过程中被保存下来;但结构保守不等于功能完整。紫杉醇仅在极少数样品中检出:仅 2024 年 4 月一份天然样品 SQS001 中检出(两套 LCMS/MS 平台独立验证,SCIEX Triple Quad 5500 结果见图 3f,SCIEX Triple Quad 7500 结果见附图 18);2026 年全部茉莉酸甲酯诱导枝条中,也仅出现 1 例阳性结果(附图 18)。上述极少数阳性信号,尚不足以证明该物种体内仍存在紫杉醇合成活性,但也不能完全排除该微弱活性存在的可能性。同时考虑 MeJA 诱导信号丰度极低、重复性差,样品处理、提取、仪器检测过程中的痕量污染,也可以解释该个别阳性结果⁵⁰,⁵¹。异源实验中 PcTOT 酶催化活性显著下降,多个下游酶未检测到催化活性,也证实通路下游发生严重功能衰减。综合生化与代谢组证据,更合理的解释是白豆杉已经丧失完整合成紫杉醇的功能;但不能完全排除特定原生条件下存在微弱残留活性,该问题有待进一步验证。紫杉醇检出率极低、结果不稳定,也能够解释以往不同研究关于白豆杉能否产生紫杉醇的报道相互矛盾 ¹⁴⁻¹⁶。想要厘清该问题,解析基因型环境互作对紫杉醇检测结果的影响,需要更大规模群体水平、多时空、多基因型、多环境的采样,增加生物学重复,严格的分析验证,以及更多体内体外生化功能实验。

为系统评估下游通路整体功能缺陷,本研究解析两个晚期通路核心功能模块。第一个模块包含参与母核修饰的氧化酶:T9ox (与红豆杉同源基因序列一致性 65.3%)、T9αH750C (68.7%)、紫杉烷 1β羟化酶T1βH184 (68.2%)。第二个模块为负责侧链合成与连接的末端酰基转移酶:巴卡亭 Ⅲ3氨基3苯基丙酰转移酶BAPT (67.8%)、紫杉烷3′N苯甲酰转移酶T3'NBT (73.0%)、3'N去苯甲酰2'去氧紫杉醇N苯甲酰转移酶DBTNBT (71.9%)。尽管上述基因在基因组中均存在,序列保守性较高,但在本氏烟草异源体系中均检测不到通路产物;而对应的南方红豆杉同源基因功能正常(附图 20)。

结合 PcTOT 催化产物生成量显著降低,多个下游模块在异源系统中完全无活性,证明紫杉醇生物合成通路下游发生深度功能衰减。我们不能完全排除一种可能性:这些酶在白豆杉体内特异性辅酶、细胞色素 P450 还原酶存在条件下,仍保留微弱基础活性,而异源系统缺少上述组分。但异源体系酶活普遍接近或低于检测限,与内源靶向代谢物检测结果相互印证。

综上,白豆杉基因组虽然保留一套近乎完整的紫杉醇合成遗传基础,但终产物无法大量积累。代谢流更多流向其他紫杉烷分支,尤其是紫杉宁 J。多个时空样品中紫杉宁 J 大量积累,部分样品可检测到一定丰度的紫杉素,而野生种群样品中始终检测不到巴卡亭 Ⅲ 等下游中间体,提示代谢流发生重定向。该紫杉烷积累模式,既不能简单归为通路完全丢失,也不能证明功能完整保留,而是反映紫杉醇通路发生严重功能衰减。因此,白豆杉大概率丧失完整合成紫杉醇的能力;但不能排除特定原生环境下,受基因型环境互作影响,存在痕量的残留活性,有待进一步验证⁵²。该现象源于祖先代谢通路的功能重利用与渐进式功能退化⁵³。

总而言之,这份濒危物种白豆杉的单倍型分辨基因组,为解析大规模扩张植物基因组中复杂特化代谢如何演化提供全新研究框架。本研究提出 TBA 概念,拓展代谢基因簇经典理论;在重复序列富集的裸子植物基因组中,通路基因即便物理位置分散,依然可以依靠共享的转录活跃染色质环境与反式调控信号维持协同表达。本研究整合结构基因组、时空代谢组、植物异源功能实验,厘清长期以来关于红豆杉属之外物种能否合成紫杉醇的争论。本研究揭示一种更为精细的代谢演化模式:尽管基因组剧烈扩张背景下祖先通路的遗传框架大体保留,但下游催化步骤发生显著功能退化,限制通路向下游推进;代谢流转向其他紫杉烷产物,例如紫杉宁 J 及其衍生物(附图 17),不同种群中也可检测到一定丰度的紫杉素。上述结果加深人们对紫杉烷类物质多样化的理解,同时为红豆杉科物种保护以及高价值紫杉烷的合成生物学改造提供重要基因组基础。

材料与方法

植物材料与样品采集

于中国江西三清山国家公园(北纬 28.90087°,东经 118.08942°)采集 2 株野生成熟白豆杉个体的新鲜叶片与树皮组织,材料编号 SQS001(雄株)、SQS006,采样海拔约 1296 m。另于江西井冈山(北纬 26.510254°,东经 114.161766°)采集 4 株野生成熟个体(GLM51GLM54)的新鲜叶片与树皮样品,采样海拔约 1292 m。样品分别采集于 2024 年 4 月与 2026 年 1 月。采集的组织立即置于液氮速冻,−80 ℃保存备用。

DNA 与 RNA 提取

采用改良 CTAB 法从幼叶中提取高质量基因组 DNA;DNA 经 RNase A 处理去除 RNA 污染,再使用 AMPure XP 磁珠(美国 Beckman Colter)进一步纯化。利用 NanoDrop 分光光度计、Qubit 4.0 荧光计、琼脂糖凝胶电泳以及脉冲场凝胶电泳评估 DNA 浓度与完整性。 使用 TRIzol 试剂(美国 Invitrogen)提取叶片与树皮组织总 RNA,经无 DNase 活性的 RNasefree DNase I(美国 New England Biolabs)去除残留基因组 DNA。通过 Agilent 2100 生物分析仪检测 RNA 完整性,仅选择 RIN 值大于 9.0 的样品用于测序。

文库构建与测序

PacBio HiFi 测序:DNA 质量检测合格后,采用 Pacific Biosciences 的 SMRTbell Express Template Prep Kit 2.0 构建 20 kb 文库。文库质控合格后,在 PacBio Revio 平台使用 1 个 8 M SMRT 细胞完成测序,得到 677.65 Gb HiFi 测序读段,基因组覆盖度约 47.25×。 短读长基因组文库在 MGI T7 平台测序(150 bp 双端),产出 1530.76 Gb 数据,覆盖度约 99.2×。 HiC 文库:甲醛固定的叶片细胞核提取染色质,DpnII 酶切、邻近连接,片段化至 300500 bp,MGI T7 平台测序,得到 2336.39 Gb 读段,覆盖度约 151.42×。 RNAseq 转录组文库使用 VAHTS Universal V10 RNAseq 建库试剂盒(中国 Vazyme)构建,MGI T7 平台测序。Isoseq 全长转录组文库同样采用 SMRTbell Express Template Prep Kit 2.0,PacBio Revio 平台测序,获得 54.42 Gb 全长转录组数据。所有文库构建及测序严格按照试剂盒说明书与质控标准执行。

基因组大小评估

以南方红豆杉为内参,利用流式细胞仪(CytoFLEX,Beckman Colter,美国)测定基因组大小,碘化丙啶染色,设置 3 个生物学重复。同时,基于 MGI 高质量短读长数据,使用 GCE v1.0.2 开展 21mer 分析,通过 kmer 深度分布与峰特征评估基因组大小、杂合度与重复序列占比。

基因组组装与染色体挂载

利用 hifiasm v0.16.1 对 677.65 Gb(~47.25×)HiFi 读段进行从头组装;结合 HiC 数据完成单倍型分型与染色体水平 scaffold 构建。HiC 数据通过 Juicer v1.6 流程生成互作图谱,3DDNA v180922 将 contig 锚定并定向到假染色体。使用 Juicebox Assembly Tools v1.11.08 对组装错误与 scaffold 错误进行人工校正;HapHiC v1.0.7 生成并可视化最终 HiC 互作热图。采用基于缺口的基因组填充(GBGF)方法填补 contig 之间的缺口,提升组装连续性。基于 MGI 短读长数据,merfin v1.0 完成序列抛光。 采用 BUSCO v5.0.0(Embryophyta_odb10,1614 个单拷贝同源基因)评估组装完整度;Merqury v1.3 评估碱基准确度与基因组完整性,保障组装质量。

重复序列注释与基因预测

使用 RepeatModeler v2.0.5 构建物种特异性转座元件文库,结合 Repbase 数据库,通过 RepeatMasker v4.1.5 完成全基因组重复序列识别与屏蔽。 基因结构预测采用多层策略: (1)从头预测:Augustus v3.5.0 与 BRAKER v3.0.8,整合从头模型与 RNAseq 证据; (2)同源预测:GeMoMa v1.9,参考小立碗藓、无油樟 SantaCruz_75 HAP1 v2.1、水稻 v7.0、拟南芥 araport11 的蛋白序列; (3)转录本证据预测:Isoseq 数据处理、二代 RNAseq 组装,使用 PASA v2.4.1 优化。 利用 EVidenceModeler v1.1.1 整合多套预测结果,再通过 PASA 更新模块进一步优化;借助 IGV v2.14.0 人工检查校正,得到高置信基因集。

功能注释

蛋白编码基因功能注释:DIAMOND v2.0.7 比对 NR、SwissProt、eggNOG 数据库(Evalue≤1e⁻⁵,比对覆盖度≥50%);InterProScan v5.5084.0(Pfam、SMART、CDD、TIGRFAMs、ProSite)进行结构域检索;HMMER v3.4 验证 PfamA 结构域。 通过 KEGG 自动注释服务器 KAAS 与 eggNOG 完成通路注释;GO 注释来源于 InterProScan 与 eggNOG 同源基因簇。过滤保留结构域覆盖度≥50%、KEGG 同源基因置信度≥0.8 的注释结果,遵循通用基因组注释规范。

系统发育基因组学与基因组进化

OrthoFinder v2.5.2 结合 DIAMOND 鉴定白豆杉与 10 个代表性植物基因组的同源基因家族(小立碗藓、无油樟、拟南芥、Croomia sessilifolia、攀枝花苏铁、油松、买麻藤、水杉、榧树、南方红豆杉;其中对南方红豆杉部分基因模型进行校正)。筛选 421 个单拷贝同源基因家族,MUSCLE v5 做多序列比对;RAxML v8.2.12 构建系统发育树,采用 PROTGAMMAJTT 模型,1000 次自举检验。 利用 PAML v4.9j 的 MCMCTree,在松弛分子钟模型下估算分化时间;基于 TimeTree 数据库的化石标定点校正分化时间。 WGDI v0.5.1 通过共线性区块分析检测全基因组复制(WGD)事件;利用 PAML 的 NG86、YN00 算法计算同源基因对同义替换率 Ks,高斯核密度可视化种内与种间 WGD 信号。

转录组分析

fastp v0.23.2 处理 RNAseq 数据;HISAT2 v2.2.1 分别比对至两套单倍型参考基因组(hap1、hap2);StringTie v2.1.4 定量基因表达;TBtools v1.09876188 完成 GO、KEGG 功能富集分析。

生物合成基因簇(BGC)鉴定

使用plantiSMASH v2.0.0,采用默认参数,基于基因邻近关系与保守结构域特征,在白豆杉基因组两套单倍型上(参数保持一致)初步筛选候选生物合成基因簇。为进一步优化候选集、确认基因功能协同性,整合各基因簇内代谢相关基因的共表达分析。具体地,在 R 语言中按照官方教程执行加权基因共表达网络分析(WGCNA v1.72.5)与皮尔逊相关性分析,定量评估基因簇的调控协同性。

为构建物种水平高可靠共表达网络,整合 124 个白豆杉转录组数据集,该数据集由三部分组成: (1)108 份白豆杉群体转录组数据(BioProject 号:PRJNA674020),来源于天然不同居群,与本研究测序个体 SQS001 为不同材料; (2)公开的白豆杉转录组数据(BioProject 号:PRJNA630781;PRJEB4922;PRJNA726756;PRJNA396655;PRJNA498605); (3)本研究产生的组织特异性转录组(BioProject 号:PRJCA042793)。

将全部 124 个样本所有基因的 TPM(每千碱基百万转录本)作为输入矩阵;选择软阈值幂次为 9,构建近似无标度拓扑网络。超过 80% 的代谢相关基因被分配至同一个共表达模块。满足该阈值的基因簇判定为功能协同的生物合成基因簇;即最终基因簇边界由调控共表达特征 而非单纯物理邻近来界定。

紫杉醇生物合成通路直系与旁系同源基因鉴定

采用双向最佳比对(RBH)策略,在南方红豆杉、白豆杉、水杉、榧树、银杏、攀枝花苏铁、油松、巨柏、落羽杉、赤松、买麻藤、小立碗藓、无油樟、拟南芥中鉴定紫杉醇通路直系同源基因。 以南方红豆杉基因为查询序列,blastp比对目标物种全部蛋白序列,Evalue 阈值\(<1×10^{-5}\);取目标物种得分最高的序列,再反向比对南方红豆杉全部蛋白,参数保持一致。双向最佳匹配且氨基酸序列一致性≥45% 的基因对判定为直系同源基因。

旁系同源基因鉴定:在各物种蛋白集内部执行selfblastp(Evalue\(<1×10^{-5}\));排除自身比对,与直系同源基因氨基酸一致性≥90%、比对覆盖度≥90% 的序列定义为旁系同源基因。

染色质区室与 TAD 拓扑关联结构域鉴定

使用HiCPro v3.1.0处理 HiC 双端测序 clean reads,比对至白豆杉参考基因组,分别构建 50 kb、500 kb 分辨率下 KR 归一化互作矩阵;后续染色质结构分析采用HiCExplorer v3.7.6。 利用hicPCA,基于特征向量区分 A/B 染色质区室:A 区室为转录活跃区,B 区室为转录抑制区。 分别使用参数--thresholdComparisons 0.01 --delta 0.25与--thresholdComparisons 0.01 --delta 0.05,通过hicFindTADs识别 TAD 拓扑关联结构域及其层级亚 TAD 边界。最后使用PyGenomeTracks v3.9可视化结果。

蛋白结构建模、分子对接、分子动力学模拟与通道分析

为考虑蛋白构象柔性,利用ColabFold v1.6.1预测 PcTOT 与 TmTOT 初始蛋白结构,再通过AlphaFlow生成构象集合;选取活性中心结构完整的代表性构象,使用AutoDock Vina v1.2.0开展分子对接。对接网格中心定位于含血红素的催化口袋。结合结合打分与催化几何构型评估对接构象:重点考察底物反应原子与催化氧原子之间的距离及反应角度。保留催化几何构型优异的构象,用于结构比较与后续分子动力学(MD)模拟。

将筛选得到的 PcTOT底物、TmTOT底物复合物进行 200 ns 分子动力学模拟(GROMACS v2022.6)。对轨迹去除周期性边界条件并做结构对齐;计算 RMSF(残基均方涨落)评估残基水平柔性,识别两个酶之间局部柔性差异区域并映射至三维蛋白结构。使用CAVER v3.0计算底物进入通道,起始点设置为对接底物旁的血红素活性中心。

紫杉醇合成基因克隆与本氏烟草瞬时表达

通过 PCR 从南方红豆杉与白豆杉 cDNA 中扩增 T2αH、T7βH、T7AT、TBT、TOT 基因的编码区。引物由生工生物合成,引物序列见补充数据 6。PCR 产物插入 pEAQHT 载体的 AgeIXhoI 酶切位点(New England Biolabs)。冻融法将重组质粒转入农杆菌 GV3101 菌株,随后侵染本氏烟草叶片。 同一株本氏烟草从下往上数第 68 片叶用于实验,设置 3 个生物学重复。

白豆杉与南方红豆杉样品代谢物提取

取80 ℃保存的白豆杉、南方红豆杉组织(510 g),液氮研磨过 4080 目筛,真空冷冻干燥。称取 100 mg 粉末,加入 1.5 mL 80% 甲醇提取。 用于 7500 质谱仪检测的样品,提取溶剂中加入 100 ng/mL 紫杉醇d5 稳定同位素内标,补偿提取损失与基质效应;用于 5500 质谱仪检测的批次不加内标,平行提取。 室温超声提取 1 h,4 ℃静置过夜。12 000×g 离心 10 min,收集上清再次离心;上清经 0.22 μm 尼龙针式滤膜过滤,转移至进样瓶,用于 LCMS 液质联用检测。

本氏烟草叶片代谢物提取

农杆菌侵染 5 天后,使用直径 1 cm 打孔器采集本氏烟草叶片,置于 2 mL 离心管;每个生物学重复取同一片叶的 4 个叶盘,约 40 mg 鲜重。 每管加入 500 μL 预冷 75% 乙腈水溶液(HPLC 级,Fisher Chemical),放入 1 颗 5 mm 不锈钢钢珠;组织研磨仪 30 Hz 处理 60 s 充分裂解。4 ℃条件下 12 000×g 离心 10 min 去除组织残渣;上清经 0.45 μm 亲水 PTFE 96 孔滤板(Millipore)过滤,转移至进样瓶,使用 SCIEX 5500 QTRAP 系统,外标法开展靶向代谢物检测。

液质联用(LCMS)分析

紫杉烷类化合物的靶向代谢物检测与痕量定量严格依据团体标准《红豆杉属植物中紫杉烷类成分定量检测指南》(T/CI 11152025)执行。

定量检测采用 SCIEX 5500 QTRAP® 三重四极杆线性离子阱复合质谱仪,配备 TurboV™离子源,联用岛津 LC2030 超高效液相色谱系统。 5500 系统色谱条件:Waters ACQUITY UPLC BEH T3 色谱柱(2.1×100 mm,1.8 μm),柱温 40 ℃;流动相 A 相:4 mM 乙酸铵水溶液,B 相:4 mM 乙酸铵甲醇溶液,流速 0.3 mL/min。32 min 梯度程序:02.5 min,B 相 10%→15%;2.526 min,B 相 15%→90%;2626.1 min,B 相 90%→98%;26.128 min,B 相 98%;2828.1 min,B 相 98%→10%;28.130 min,B 相 10%;之后平衡 2 min。进样体积 5 μL,自动进样器温度 8 ℃。

为对极低丰度紫杉醇的痕量检测进行严格交叉验证,同时采用灵敏度更高的 SCIEX 7500 三重四极杆质谱仪联用 ExionLC™系统(美国 AB SCIEX),配备加热电喷雾电离(HESI)离子源开展独立靶向分析。 7500 系统色谱条件:Waters ACQUITY UPLC HSS T3 色谱柱(2.1×100 mm,1.8 μm),柱温 40 ℃;流动相 A 相:4 mM 乙酸铵水溶液,B 相:4 mM 乙酸铵甲醇溶液,流速 0.3 mL/min。20 min 梯度程序:02.5 min,B 相 10%→15%;2.55 min,B 相 15%→40%;57 min,B 相 40%→70%;78 min,B 相 70%;811 min,B 相 70%→80%;1113 min,B 相 80%→100%;1316 min,B 相 100%;1616.5 min,B 相 100%→10%;之后平衡 3.5 min。进样体积 2 μL,自动进样器温度 8 ℃。

5500 质谱采用正电喷雾电离模式(ESI⁺),多反应监测(MRM)模式;通过标准品直接进样优化各化合物特征离子对。5500 系统采用外标法定量。为排除基质带来的假阳性,利用 5500 QTRAP 的线性离子阱功能触发增强子离子扫描(EPI),采集完整二级质谱(MS/MS)碎片谱,与标准品比对,从结构层面确证痕量紫杉醇。

高灵敏度 7500 系统用于低丰度样品的痕量定量,正离子模式 MRM 检测,采用紫杉醇d₅稳定同位素内标法,离子跃迁参数经标准品优化。 5500 离子源参数:气帘气 25 psi,喷雾电压 5.5 kV,离子源温度 500 ℃,雾化气 GS1 50 psi,加热气 GS2 50 psi。 7500 离子源参数:气帘气 40 psi,喷雾电压 2.5 kV,离子源温度 400 ℃,雾化气 GS1 35 psi,加热气 GS2 60 psi。 去簇电压、碰撞能、碰撞池出口电压等化合物专属参数,通过 Analyst®1.7 与 SCIEX OS 软件自动优化。

以 80% 甲醇溶剂逐级稀释标准品,匹配样品基质,建立紫杉素 J(CAS:18457460)、紫杉素(CAS:19605802)、巴卡亭 Ⅲ(CAS:27548932)、紫杉醇(CAS:33069624)以及本氏烟草叶片中其他目标代谢物的标准曲线,浓度范围 0.51000 ng/mL。7500 系统标品溶液中统一加入 20 ng/mL 紫杉醇d₅,与样品内标浓度保持一致。 每 10 针样品插入低、中、高三个浓度质控样本,监控系统稳定性与背景干扰;日内相对标准偏差 RSD<14.8%。 5500 系统:Analyst 1.7、MultiQuant 3.0 软件采集与定量,外标法校正。 7500 系统:SCIEX OS 软件完成化合物识别与峰积分,内标归一化,权重因子 1/x²。

紫杉二烯、Taxa-4 (20),11-二烯-5α-醇的气相色谱-质谱(GC-MS)分析

代谢物提取:液氮研磨后的植物组织精确称取约 20 mg 置于 1.5 mL 离心管,加入 1 mL 乙酸乙酯;涡旋 3 min,25 ℃、200 W 超声 30 min;12 000×g 离心 5 min。取 1 mL 上清转移至装有 100 mg 无水硫酸镁的离心管,去除残留水分与极性基质干扰;涡旋 3 min,12 000×g 离心 5 min;上清经 0.22 μm 有机相尼龙滤膜过滤,转移至进样瓶,用于 GCMS 检测。

定量仪器:赛默飞 TSQ 9000 三重四极杆质谱,联用 Trace1310 气相色谱。色谱柱:Agilent DB5MS UI 毛细管柱(30 m×0.25 mm,膜厚 0.25 μm)。进样量 1 μL,分流比 20:1;载气为 99.999% 高纯氦气,恒流 1.2 mL/min;进样口温度 270 ℃。 柱温程序:初始 100 ℃保持 1 min;15 ℃/min 升至 175 ℃;4 ℃/min 升至 220 ℃并保持 2 min;20 ℃/min 升至 290 ℃并保持 5 min。质谱传输线温度 250 ℃,电子轰击电离源(EI)温度 300 ℃;EI 模式 70 eV,选择离子监测模式(SIM)高灵敏度检测目标物。

将紫杉二烯(CAS:109808379)、Taxa4 (20),11二烯5α醇(CAS:148381560)标准品溶于正己烷乙酸乙酯(4:1,v/v)逐级稀释,配制成 0.01、0.02、0.05、0.1、0.2、0.5、1、2、5、10、20、50、100 μg/mL 系列标准溶液。依次进样,Chromeleon 软件采集数据并定量;以峰面积对浓度绘制标准曲线,建立线性回归方程,计算样品中两种紫杉烷的绝对含量。

Data availability

All sequencing data, including genomic sequencing, Hi-C, RNA-seq, andRevioHiFireads,havebeendepositedintheNGDCSequenceRead Archive (SRA) under BioProject PRJCA042793. The de novo genome assembly and annotation have been deposited in Figshare(https://doi. org/10.6084/m9.figshare.30340690). The mass spectrometry-based metabolomics data, including LC-MS/MS and GC-MS data, have been deposited in OMIX underaccession numberOMIX019547(https://ngdc. cncb.ac.cn/omix/release/OMIX019547). Source data are provided with this paper.

Code availability

The custom scripts and pipelines used for the genome assembly, haplotype phasing, and evolutionary analyses of paclitaxel biosynth esis in this study are publicly available in the GitHub repository (https://github.com/wanghuan766/Pseudotaxus-chienii-genome project) and also archived on Zenodo (https://doi.org/10.5281/zenodo. 21839213)111. References

相关推荐
让学习成为一种生活方式1 天前
26.5 Gbp 的海岸红杉基因组--G3 Genes|Genomes|Genetics
基因组
让学习成为一种生活方式2 个月前
Canu v2.3 安装与使用--生信工具106
基因组
让学习成为一种生活方式3 个月前
YaHS:一款新型 Hi-C 挂载组装软件--文献精读235
基因组
让学习成为一种生活方式3 个月前
睡莲基因组Nature-文献精读239
基因组
让学习成为一种生活方式3 个月前
DupGen_finder v1.0.0安装与使用--生信工具092
大数据·基因组
让学习成为一种生活方式3 个月前
豆科泛基因组--文献精读238
基因组
让学习成为一种生活方式3 个月前
丹参染色体水平基因组--文献精读234
基因组
wyhua20084 个月前
人类基因组基础知识与下载查询
基因组
zd2005724 个月前
Nature Genetics论文精读:如何用跨祖先GWAS+精细定位+功能注释提升近视多基因风险评分
基因组