Assembled and annotated 26.5 Gbp coast redwood genome: a resource for estimating evolutionary adaptive potential and investigating hexaploid origin
组装并注释 26.5 Gbp 的海岸红杉基因组:用于评估进化适应潜力与解析六倍体起源的研究资源

摘要
本研究完成了海岸红杉(Sequoia sempervirens )26.5 Gbp 六倍体基因组的测序、组装与注释,为挖掘气候适应相关基因、解析该物种六倍体基因组起源提供研究基础。研究利用单粒种子的单倍体组织获得高深度 Illumina 短读长测序数据,同时结合二倍体针叶组织的牛津纳米孔(ONT)长读长测序数据完成基因组初组装;再通过染色质互作(HiC)数据进行 scaffold 搭建,得到连续性优异的最终组装版本 SESE 2.1,其 scaffold N50 达 44.9 Mbp。该组装获得多个横跨完整染色体臂的 scaffold,scaffold 两端检测到端粒与着丝粒序列,证实了组装结果的可靠性。结构注释共得到 118 906 个基因;其中 113 个基因含有长度超过 500 Kbp 的内含子,有 1 个基因的内含子长度达到 2 Mb。基因组中近 19 Gbp 序列为重复序列,绝大多数属于长末端重复序列反转录转座子;Copia 与 Gypsy 转座子比例为 2.9∶1 ,这类元件可能参与基因表达调控。将海岸红杉与其他针叶树开展比较基因组分析,发现大量响应生物与非生物胁迫的基因发生物种特异性扩张,涉及真菌抗病、解毒、机体损伤修复与结构重塑,以及黄酮类生物合成通路。部分基因在海岸红杉中存在三份拷贝,而在其二倍体近缘种巨杉中仅单拷贝;对这类基因的分析支持已有假说:海岸红杉的六倍化源于同源多倍化 ,并非与其他近缘针叶树种杂交形成。
海岸红杉(Sequoia sempervirens )是全球最富盛名、最具代表性的树种之一(Barbour 等,2001)。其自然分布主要局限于加利福尼亚州北部太平洋沿岸地带(Lorimer 等,2009),但该物种现已被引种至世界各地。海岸红杉是现存最高的树木(已发现最高植株达 115.5 m),同时也是寿命最长的树种之一,最长寿命可达约 2200 年(Lanner,1999)。依据现行分类学界定,海岸红杉是红杉属(Sequoia )现存唯一物种,被世界自然保护联盟(IUCN)红色名录列为濒危物种 (Farjon 和 Schmid,2013)。它的两个近缘物种 ------ 巨杉(Sequoiadendron giganteum )与水杉(Metasequoia glyptostroboides ),同样分别是各自属内仅存的现生物种。海岸红杉为六倍体(2n = 6x = 66)(Hirayoshi 和 Nakamura,1943;Stebbins,1948;Saylor 和 Simons,1970;Ahuja 和 Neale,2002);而巨杉和水杉均为二倍体(2n = 2x = 22)。海岸红杉基因组庞大,早期预估基因组大小为 31.5 Gbp,约为两个二倍体近缘物种的三倍(巨杉 9.7 Gbp,水杉 10.8 Gbp)【基因组大小数据汇总自 Ahuja 和 Neale(2005),由已发表的流式细胞仪 pg/C 单位换算得到,换算系数:1 pg = 980 Mbp】。海岸红杉的多倍化起源长期存在争议。Stebbins(1948)提出其可能属于同源异源多倍体 ,该假说后续得到 Ahuja 和 Neale(2002)的支持。但近年 Scott 等人(2016)的研究表明,同源多倍化起源 的可能性更大。
欧洲移民迁入加利福尼亚州之后,海岸红杉林遭到大规模砍伐,近 95% 的原始林被破坏(Burns 等,2018)。目前学界十分关注如何恢复原始林的群落特征,包括重建含有高大乔木的复杂森林结构。森林修复与保护工作高度依赖遗传变异的检测与监测手段。传统上,林业科研人员通过种源试验等田间表型试验评估物种遗传变异(Kuser 等,1995)。该方法可以获取景观尺度下遗传变异的丰富度与分布特征的高质量数据;但试验周期漫长,试验圃的建设、维护与表型测定成本高昂。分子标记是另一种研究手段。然而,目前已开发的海岸红杉分子标记大多对应基因组非编码区变异,仅能够检测选择中性变异 (Ahuja,2017)。若要解析受选择作用的基因组区段、评估适应性遗传多样性,则需要来源于蛋白编码区的分子标记。此前海岸红杉缺乏这类标记,只有借助转录组或者全基因组测序才能够完成开发。
受经济与技术条件制约,针叶树基因组测序工作晚于人类基因组测序约十年。针叶树基因组大小是人类基因组的 310 倍,且基因组重复序列占比极高,给基因组组装带来巨大挑战。20102020 年间,上述技术瓶颈逐步被突破,目前已有 9 个针叶树基因组完成发表:挪威云杉(Picea abies )(Nystedt 等,2013)、锡特卡云杉 × 恩格尔曼云杉杂交种(Picea sitchensis × Picea engelmannii )(Birol 等,2013)、火炬松(Pinus taeda )(Neale 等,2014;Zimin 等,2014)、白云杉(Picea glauca )(Warren 等,2015)、糖松(Pinus lambertiana )(Stevens 等,2016)、花旗松(Pseudotsuga menziesii )(Neale 等,2017)、银冷杉(Abies alba )(Mosca 等,2019)、西伯利亚落叶松(Larix sibirica )(Kuzmin 等,2019)以及巨杉(Scott 等,2020)。多数针叶树种子的二倍体组织中含有单倍体大配子体组织 ;通常可以从单粒种子中分离出足量的该单倍体组织用于全基因组测序,大幅降低组装难度。除白云杉之外,上述已发表的针叶树基因组均采用大配子体作为测序材料。这些基因组组装版本大多碎片化程度较高;巨杉是重要例外,该研究结合长读长测序与 HiC 脚手架构建,得到 11 条染色体水平 scaffold,与该物种已知染色体数目完全匹配(Scott 等,2020)。本研究采用与巨杉几乎完全相同的测序策略完成海岸红杉基因组的测序与组装。
综上,本研究主要开展如下工作:完成超大六倍体海岸红杉基因组的测序、组装与注释;挖掘关键基因,评估海岸红杉在当前及未来环境下的进化适应潜力;解析海岸红杉六倍体的起源。
参考植株与实验材料
参考植株 SESE104 采自美国加利福尼亚州圣克鲁斯山脉。该树树高 107.2 m,预估树龄 1390 年。采集球果获取种子,分离 ** 大配子体(1n)** 用于 DNA 提取与 Illumina 短读长测序;采集针叶(2n),用于提取高分子量 DNA,开展牛津纳米孔(ONT)测序以及 HiRise 脚手架组装。
基因组测序与组装策略
DNA 提取与文库构建
参照巨杉基因组已发表的实验流程(Scott 等,2020),本研究构建两类测序读段:高精度 Illumina 短读长,以及准确度相对偏低的 ONT 长读长。Illumina 测序在加州大学戴维斯分校基因组中心的 Illumina HiSeq 4000 平台上完成,采用高产出模式。从 SESE104 单粒种子中分离大配子体并提取 DNA,参照火炬松(Neale 等,2014)及其他针叶树的实验策略,采用无 PCR 扩增的标准流程构建测序文库。
ONT 测序所需 DNA 用量远高于单粒种子能够提供的量,因此本研究采用针叶组织提取 DNA,最终获得大于 20× 覆盖度的 ONT 长读长数据。2017 年,采集同一株海岸红杉 SESE104 树冠上部叶片,种子也来源于该植株;参照 Workman 等人(2018)的方法,从叶片中提取高分子量 DNA。 首先通过细胞核提取裂解流程获得纯化基因组 DNA:成熟针叶组织液氮研磨,加入含精胺、亚精胺、曲拉通、β巯基乙醇的温和裂解缓冲液(参考 Zhang 等,2012),4 ℃搅拌 10 min。细胞匀浆经 5 层 Miracloth 纱布过滤至 50 mL 离心管;基于预估基因组大小约 28 Gbp,设置 4 ℃、1900 × g 离心 20 min。收集细胞核沉淀,使用 Circulomics α 版植物细胞核大 DNA 试剂盒(货号 NB90080101)裂解细胞核并沉淀基因组 DNA。取 1 μg 纯化基因组 DNA,按照连接测序试剂盒(LSK108LSK109,Oxford Nanopore Technologies)说明书进行建库;仅对末端修复步骤做优化:100 μL 样本体系,14 μL 酶、6 μL 酶,20 ℃孵育 20 min,随后 65 ℃孵育 20 min。使用 R9.4 流动槽,通过 minION 或 GridION 仪器测序 48 h;原始 fast5 数据采用 Albacore v2.13 软件进行碱基识别。
另采集 SESE104 的叶片样品,送至美国 Dovetail Genomics 公司(加利福尼亚州斯科茨谷),参照 Putnam 等人(2016)的方法,分别构建 Chicago 文库与 HiC 邻近连接文库。两类文库均可捕获染色体内部的长距离染色质互作,显著提升基因组组装的 scaffold 连续性。两套文库均在加州大学戴维斯分校基因组中心的 Illumina HiSeq 4000 平台完成测序,每个文库基因组覆盖度约 39 倍(表 1)。
|---------------------|----------------------------------|-------------------------|-------------------------------|--------------------------|
| Data type | Average read length (bp) | Number of reads | Genome coverage a | Source of tissue |
| Illumina paired end | 2 × 150 | 21,588,293,516 | 122x | 1n megagametophyte |
| Dovetail Chicago | 2 × 151 | 6,924,430,790 | 39x | 2n needle |
| Dovetail Hi-C | 2 × 151 | 6,918,097:308 | 39x | 2n needle |
| ONT | 7:775 | 74,815,884 | 22x | 2n needle |
Contig 组装
本研究的 contig 组装流程与巨杉基因组研究高度相似(Scott 等,2020)。初始 contig 组装采用 MaSuRCA v3.2.8 的混合组装模式,同时整合长读长与短读长数据(Zimin 等,2017)。MaSuRCA 的核心原理是利用 kmer 图对 Illumina 短读长进行唯一延伸,生成superreads(超读长) (Zimin 等,2013)。所有能够延伸至同一条 superread 的 Illumina 读段,会被替换为该 superread 的单一拷贝;再利用 superreads 对 ONT 长读长进行纠错。计算 superreads 与 ONT 读长的初步比对结果,针对每一条 ONT 读长,将与之精确重叠的 superreads 进行局部组装,得到最能代表该 ONT 读长序列的局部组装片段,该局部组装产物称为megareads(巨型读长) 。
组装采用软件默认参数,配置文件设置MEGA_READS_ONE_PASS = 1,执行单轮 megareads 构建流程。由于数据量极其庞大,本研究在 MaSuRCA 流程的create_mega_reads步骤中断流水线。将 superreads 拆分为多个批次,将每一批次分别与全部 ONT 读长进行比对。首先调用 MaSuRCA 内置程序jf_aligner完成 superreads 与 ONT 读长的全部初步比对。jf_aligner的内存消耗与 superreads 总序列量成正比;采用分批策略后,可在多台计算节点上并行运算,每台节点配置 1 TB 内存。全部比对完成后,使用merge_coords程序合并比对结果文件,将输出管道输入longest_path程序,完成 megareads 的构建。正常情况下,上述三个模块会封装在同一个可执行程序create_mega_reads中运行;但对于超大基因组组装项目,可以将模块拆分独立运行。本研究搭建专用本地计算集群,包含 50 台 1TB 内存的计算节点,采用 SLURM 调度系统。单节点内存占用约 0.5 TB,megareads 构建步骤总 CPU 耗时约 80 万核时。分批策略会产生大量中间文件,增加存储开销,因此该方式并不是 MaSuRCA 的默认运行模式。将longest_path的输出结果保存为文件,重新运行软件自动生成的assemble.sh脚本,继续执行 MaSuRCA 后续流程。值得注意的是,当前版本 MaSuRCA v4.0.3 已经对 megareads 模块做内存优化,对于海岸红杉这一量级的基因组,已无需拆分模块单独运行。后续后处理流程无需人工干预,MaSuRCA 调用其内置的改良版 CABOG 8 组装器,基于 megareads 完成组装;该组装步骤 CPU 耗时约 321160 核时,得到组装版本 1.0(表 2)。
|---------------------------|----------------------------------|-------------------------|-------------------------|
| Derived data type | Average read length (bp) | Number of reads | Genome coverage |
| Super-reads | 352 | 212,922,309 | 2.8x |
| Mega-reads | 6670 | 71,380,616 | 18x |
HiRise 脚手架构建
将 1.0 版本组装结果提交至 Dovetail Genomics 公司,利用邻近连接测序数据开展脚手架构建。采用 HiRise 脚手架组装软件(Putnam 等,2016),结合 Chicago 文库与 HiC 文库的连锁读段对 contig 进行脚手架拼接。该流程首先将两个文库的全部读段比对至 contig 序列,依据配对读段的连锁信息将 contig 进行连接;连锁读段数量越多,代表对应 contig 在最终 scaffold 上空间距离越近,脚手架软件基于连锁读段数目优化 contig 之间的距离。经过多轮脚手架构建,得到组装版本 2.1。
脚手架后处理
利用 HiRise 输出的 scaffold 序列,搜寻端粒与着丝粒序列。使用串联重复序列查找软件 Tandem Repeat Finder(TRF)扫描 contig,筛选高频重复单元,鉴定得到端粒重复序列为CCCTA/CAA。同时鉴定得到拷贝数极高的 148 bp 重复序列,确定为着丝粒重复单元: AAAAAATGAAGGTTCGCGAAAGGCGATAGAAAATACGCGTACAGAATGCACAACTACAGTGCAATCCACAATCGTAGTCACCAAAGTTGATCGATGGCCCACGAAAACTCAAACACGAGCGGTTTCCTAAATGCGGCTATAACTCAAC
使用 MUMmer 4 软件包中的 Nucmer(Marçais 等,2018),在 scaffold 中搜寻上述端粒、着丝粒重复序列。统计独立着丝粒区域时,将间隔小于 250 Kbp 的着丝粒拷贝合并。最终共鉴定 33 个着丝粒区域,与该物种预期 33 条染色体数目吻合。依据端粒的位置、方向,同时限定单个 scaffold 仅允许包含 1 个着丝粒区域,在 15 个位点对 scaffold 进行切割。例如 Dovetail 输出的初始最长 scaffold 长度约 1.4 Gbp,包含 2 个着丝粒拷贝,位置大致为 760 Mbp 与 1.02 Gbp;该 scaffold 在 779 Mbp、980 Mbp 位置存在端粒序列,因此在两处端粒位置进行切割,端粒位置即为染色体末端。 scaffold 切割完成后,开展污染序列筛查,鉴定得到 9 条单contig 的 scaffold(总长度 46650 bp)含有人类来源污染序列并予以剔除,得到更新后的组装版本 2.2。
基因组重复序列注释
使用 RepeatModeler v1.0.8(Smit 和 Hubley,20082015),调用 RECON、RepeatScout 与 TRF 软件鉴定重复家族;利用 LTRclassifier(Monat 等,2016)对得到的一致性重复序列文库进一步分类注释。将该重复文库输入 RepeatMasker v4.0.9(Smit 等,2019),获得重复元件的基因组坐标,并对基因组进行软掩码处理。
转录组测序与组装
RNA 提取与测序
采集 3 株海岸红杉共 9 种组织样品:树冠萌条叶片、基部萌条叶片、腋生嫩梢顶端、根、3 月龄幼苗茎、大配子体、未成熟雄球花、未成熟雌球花、成熟雄球花。样品采集后立即液氮速冻,80 ℃保存备用。所有组织在液氮条件下手工研磨,研磨时加入不溶性聚乙烯吡咯烷酮(PVPP)。采用 PureLink® 植物 RNA 试剂裂解组织;离心去除杂质,经过两轮氯化钠氯仿抽提,异丙醇沉淀 RNA,乙醇洗涤沉淀,无酶水重溶。再使用 Qiagen RNeasy® MinElute® 纯化试剂盒搭配无 RNase 的 DNase 处理,完成 RNA 纯化。
首先使用 Nanodrop 8000 检测总 RNA(平均浓度 1596 ng/μL,A260/280 均值 2.13,A260/230 均值 2.06);采用 Qubit 2.0 结合 Qubit RNA BR 试剂盒测定 RNA 真实浓度(平均浓度 1318 ng/μL);利用 BIORAD Experion™全自动电泳系统及配套 RNA StdSens 试剂盒评估 RNA 完整性,RNA 质量数 RQN 均值为 8.4。RNA 样品送至加州大学戴维斯分校基因组中心,在 PacBio Isoseq 平台开展全长转录组测序。
转录组组装
Iso-seq 数据处理参照 PacBio 官方流程:https://github.com/PacificBiosciences/IsoSeq/blob/master/isoseqclustering.md。简言之,将 subreads 合并生成环形一致性序列 CCS;去除引物污染,依据文库 barcode 拆分读段;修剪去除 polyA 尾与串联重复序列;将 CCS 读段聚类得到部分全长及全长转录本。利用 IsoSeq Polish 对每个读段聚类生成一致性序列,输出每个碱基的质量值 QV,完成转录本序列抛光。
公共转录组数据整合
本研究使用两套已发表 RNAseq 数据集:SRX7171900(150 bp 双端测序)(Breidenbach 等,2020),为多个无性系针叶混合文库;ERX2099880(100 bp 双端测序)(Matasci 等,2014),来自千植物计划 1KP,样品为带针叶的枝条顶端。 使用 Sickle v1.33(Joshi 和 Fass,2011)对 Illumina 读段过滤,参数:质量阈值 30,长度阈值 50。质控后读段使用 HISAT2 v2.1.0(Kim 等,2019)比对至海岸红杉基因组,最大内含子长度设置为 2 Mbp。两套比对结果依据读段名称排序,通过 Samtools v1.9(Li 等,2009)合并 bam 文件。合并后的比对文件作为 Braker2 v2.0.5(Hoff 等,2016)基因组注释流程的主要输入文件之一。
将三套独立转录组序列合并,使用 vsearch v2.15.0(Rognes 等,2016)按照 98% 相似度聚类:包含本研究 Isoseq 转录组、Dryad 数据库公开的二代组装转录组(Scott 等,2016,doi:10.5061/dryad.7nb70)、冷胁迫转录组(TSA 登录号 GIBU01000000,Breidenbach 等,2020)。利用 TransDecoder v5.0.2 预测开放阅读框,筛选保留含有起始密码子、终止密码子或二者均具备的转录本(包含部分完整与全长转录本)。使用 GMAP v.2019(Wu 和 Watanabe 2005)将转录本比对到基因组,参数:--mintrimmedcoverage 0.95 --minidentity 0.95 -F -K 1000000 -L 10000000 -a 1 --crossspecies -T --npaths=1。 得到 CDS 比对结果后,使用 gFACs(Caballero 和 Wegrzyn,2019)做过滤与统计,过滤阈值:外显子、内含子最小长度均为 9 bp,CDS 最小长度 100 bp。 将已发表转录组翻译得到的蛋白序列,使用 GenomeThreader v1.6.6(Gremme 等,2005)比对海岸红杉基因组,参数设置:识别起始密码子、终止密码子,切除内含子,dpminexonlen=20,dpminintronlen=9,gcmaxgapwidth=1000000,gcmincoverage=80。上述高质量转录本与蛋白比对结果,作为海岸红杉基因组注释的另一重证据。
结构注释
基于 Braker 的基因预测
Braker 软件的主要输入文件包括:经过软掩码处理的基因组、RNAseq 比对结果以及蛋白比对结果。合并后的 RNAseq 比对文件用于训练 GeneMarkET,通过读段堆积信息预测候选基因的外显子内含子边界。蛋白比对为 Braker2 结构注释的可选输入;该数据不会直接参与 GeneMarkET 训练过程中外显子内含子边界的预测,但会用于 AUGUSTUS 模型的训练。
由于基因组搜索空间庞大、重复序列占比高、假基因数量多,预测得到的基因集中会存在大量假阳性、片段化基因、假基因以及反转录转座子。因此需要设置多重筛选条件,对从头预测得到的基因集进行过滤。利用 gFACs 对从头预测基因施加如下筛选标准:具备完整开放阅读框;外显子、内含子最小长度均为 9 bp;CDS 最小长度 100 bp。最后,将转录组来源的比对证据与经过结构过滤的 Braker 基因模型进行比对,借助 Bedtools v2.29(Quinlan 和 Hall,2010)处理重叠的基因模型。
除基因结构信息外,本研究结合功能信息进一步判断基因的可靠性。使用 EnTAP v0.10.4(Hart 等,2020)比对 Uniprot(Apweiler 等,2004)、Plant RefSeq(Wheeler 等,2005)数据库以及其他裸子植物蛋白组,完成基因功能鉴定。自建裸子植物蛋白数据库包含以下物种的蛋白序列:挪威云杉、锡特卡云杉、银杏、苏铁、买麻藤、欧洲红豆杉、库页冷杉。将无序列比对注释结果、仅匹配单个蛋白结构域、无基因家族归属的基因予以剔除。利用 InterProScan v5.3574.0(Jones 等,2014)调用 Pfam 数据库,剔除基因区中的反转录转座子;该过滤附加条件:被标记为反转录转座子的序列至少 70% 被软掩码覆盖。由于假基因大量存在,单外显子基因数目会被严重高估;将单外显子蛋白序列比对至多外显子蛋白,筛选条件:序列一致性≥75%,且比对覆盖该单外显子基因≥70%。
直向同源基因簇鉴定与富集分析(比较基因组)
从林木基因组数据库 TreeGenes 下载已发表的全部裸子植物蛋白组(Falk 等,2018);选取无油樟(Amborella trichopoda )蛋白组作为裸子植物的外类群,数据来源于 Ensembl 数据库(Howe 等,2020)。使用 USEARCH(Edgar,2010)以 80% 序列相似度对转录组序列去冗余。对于具有≥15000 条非冗余序列的物种,采用 BUSCO v4.0.2(Seppey 等,2019)蛋白模式,使用 OrthoDB v10 的陆生植物数据集评估组装完整性。将完整性≥60% 的物种数据输入 OrthoFinder(Emms 和 Kelly,2019),鉴定直向同源基因簇。使用 USEARCH 以 70% 相似度对海岸红杉各基因家族内部基因聚类,判断基因复制事件。使用 Diamond v0.9.36(Hu 和 Kurgen,2019)将海岸红杉基因比对拟南芥蛋白组,建立海岸红杉基因与拟南芥基因的对应关系,借助 gprofiler(Raudvere 等,2019)开展功能富集分析。统计各基因家族的有无、扩张与收缩,家族拷贝数发生 2 倍及以上偏离即判定为扩张或收缩。基于检测到的 Copia 反转录转座子分布,筛选距离基因 3 Kbp 以内存在 Copia 插入的基因;其中部分基因显著富集于黄酮代谢与黄酮生物合成通路,将这部分基因作为 GeneMania(Montojo 等,2014)的输入构建蛋白互作网络,并在 Cytoscape(Su 等,2014)中对网络进一步优化。
群体基因组分析
核苷酸多样性与 Fst 计算
温室保存的 92 份海岸红杉材料来源于 Kuser 种源试验群体(Kuser 等,1995),覆盖该物种自然分布的地理与环境梯度,共得到 64358 个 SNP。序列捕获、测序、SNP 检测与过滤的详细流程参见 De La Torre 等(2021)。使用 VCFtools(Danecek 等,2011)的weirfstpop参数,基于 WeirCockerham 算法计算群体间分化系数 Fst。采用滑动窗口策略:窗口大小 10000 bp,步长 1000 bp(fstwindowsize、fstwindowstep)。同样利用 VCFtools 滑动窗口模式(windowpi、windowpistep)计算核苷酸多样性 π。将海岸红杉的核苷酸多样性与 Fst 结果,与一项未发表的巨杉研究进行对比,两项研究采用相近的靶向测序策略,SNP 数量相当。
序列分化度估算
分别计算两类基因的核苷酸分化度:海岸红杉巨杉共线性区域的单拷贝基因;红杉谱系特有基因(海岸红杉、巨杉、水杉之间比较)。红杉谱系特有基因在海岸红杉中为多拷贝,在巨杉中为单拷贝。选取共线性区域 11 个单拷贝基因、19 个红杉谱系特有基因,使用 MAFFT(Katoh 和 Standley,2014)进行序列比对。利用 MEGAX(Kumar 等,2018)计算 Kimura 双参数距离;使用 PAML v4.8(Yang,2007)计算成对同义替换率 dS 与非同义替换率 dN。CODEML 控制文件参数设置:runmode = −2用于成对序列比较;cleandata = 0,比对空位视为模糊位点;密码子频率选用 F3×4 模型;转换颠换比值、omega 的初始值分别设为 2、0.4,其余参数保持默认。
多拷贝基因家族的系统发育关系
为解析多拷贝基因与其他裸子植物同源基因的演化关系,对基因组内多拷贝基因开展系统发育分析。数据集筛选标准:海岸红杉中为多拷贝(2 或 3 个拷贝),而其他裸子植物中为单拷贝。依据该标准初筛得到 1700 个基因;再根据蛋白长度(>300 个氨基酸)、序列比对覆盖度不低于最长序列的 75% 做进一步过滤。同时剔除潜在串联重复产生的基因变异,最终保留 298 个基因。从中随机抽取 150 个基因,使用 MUSCLE 3.8(Edgar,2004)对氨基酸序列比对,构建系统发育树。每组比对结果使用 IQTREE2 v2.1.2(Minh 等,2020)开展最大似然分析;通过 ModelFinder(Kalyaanamoorthy 等,2017)基于贝叶斯信息准则(BIC)筛选最优替换模型;采用 300 次伪重复的非参数自举检验评估分支支持度。
结果
测序与组装
测序数据
本研究采用混合测序组装策略,结合准确度高但读长较短的 Illumina 双端读长,以及准确度相对偏低的 ONT 长读长。利用 Dovetail 公司的 Chicago 与 HiC 建库方案构建邻近连接文库,用于 contig 的脚手架拼接。Illumina 双端读长与 ONT 读长用于 contig 构建;Chicago、HiC 文库读长仅用于 scaffold 搭建。各文库测序数据统计见表 1。
基因组大小评估
使用 Jellyfish 软件(Marçais 和 Kingsford,2011)统计 Illumina 读长中的 31mer,评估单倍体基因组大小。31mer 直方图主峰(图 1)对应的 31mer 覆盖度为 57;主峰下 31mer 总数量为 1 503 160 425 741,由此估算基因组大小:1 503 160 425 741 ÷ 57 ≈ 26.5 Gbp 。该估算值低于流式细胞仪测定结果;已有研究表明,kmer 估算的基因组大小更接近常染色质(即排除着丝粒区域 DNA)的实际大小(Vurture 等,2017)。

图 1 海岸红杉单倍体样品 Illumina 短读长数据的 31mer 分布。主峰位于 X=57。基于曲线下面积统计 31mer 总数,剔除低计数 kmer(该部分大概率来自碱基识别错误)。图中 3 个峰(X=57、约 118、约 180)反映该基因组为六倍体;这些峰对应 2 个或 3 个亚基因组之间序列完全一致的 31mer。 (新标签页打开|下载幻灯片)
基于 superreads 与 megareads 的混合组装
MaSuRCA 组装软件(Zimin 等,2013)首先利用 Illumina 数据中的 kmer(k=127)对全部 Illumina 读长进行唯一延伸,生成更长的superreads(超读长) 。共得到约 2.13 亿条 superreads,平均长度 352 bp(表 2),而原始 Illumina 读长超过 100 亿条。superreads 构建总 CPU 耗时 11472 核时,峰值内存占用 1.2 TB。 随后 MaSuRCA 以 ONT 读长为模板,将 superreads 比对至 ONT 读长,依据精确重叠的 superreads 构建路径,还原底层 ONT 读长序列;该路径进一步生成megareads(巨型读长) (Zimin 等,2017),作为准确度大幅提升的 ONT 读长替代序列。megareads 略短于原始 ONT 读长,部分 ONT 读长会生成两条及以上互不重叠的 megareads,该现象已有文献报道。 值得注意:ONT 读长来源于二倍体 DNA 材料,约 50% 的 ONT 读长所属单倍型与 Illumina 读长对应的单倍型不一致。部分情况下,不同单倍型之间的插入缺失差异会造成比对断裂,进而导致 megareads 发生截断。
组装结果
海岸红杉基因组初始组装、HiRise 脚手架处理后组装、最终组装版本 v2.2 的统计结果见表 3。v1.0 版本以 contig 为主,脚手架程度很低,因此 contig N50 与 scaffold N50 数值十分接近:contig N50 为 96840 bp,scaffold N50 为 109446 bp。 最终版本 v2.2 先后完成两轮基于 Chicago 与 HiC 数据的 HiRise 脚手架构建,再经过后续后处理。HiC 邻近连接文库将 scaffold N50 提升至 53 Mbp。 对组装序列重复元件分析发现,v2.1 版本中多条长 scaffold 的序列内部中间区域存在着丝粒、端粒重复序列(详见材料与方法)。依据这些重复序列位置,对 scaffold 执行 15 处切割,得到最终组装 v2.2;切割操作使 scaffold N50 小幅下降至约 45 Mbp。同时剔除 9 条鉴定为外源污染的小 contig。 v2.2 组装共得到 33 条包含着丝粒区域的 scaffold,与预期染色体数目吻合。33 条 scaffold 的名称与长度详见附表 S1。其中 4 条 scaffold 的一端存在端粒重复序列,代表接近完整的染色体臂。该组中排名前 21 的大 scaffold 总序列长度约 7 Gbp。
|--------------------------|-----------------------------|------------------------------|--------------------------------|---------------------------|-----------------------------|
| Assembly version | Total sequence (bp) | N50 contig size (bp) | N50 scaffold size (bp) | Number of contigs | Number of scaffolds |
| v1.0 | 26,454,318,454 | 96,840 | 109,446 | 548,924 | 517,860 |
| v2.1 | 26,454,315,051 | 96,840 | 52,996,825 | 548,924 | 393,401 |
| v2.2 | 26,454,268,401 | 96,840 | 44,944,384 | 548,915 | 393,407 |
为保证统计口径统一,本研究采用26.5 Gbp 作为基因组预估大小,计算 contig 与 scaffold 的 N50 数值。
在 Illumina 数据组装过程中,检测到两类疑似新真菌物种的读段;该类序列数据量充足,可分别得到高质量真菌基因组组装。这两个真菌的组装与物种鉴定方法及结果详见补充文件 S1。
转录组数据集
针叶组织 RNAseq 文库 SRX7171900 与 ERX2099880 比对至基因组的总体比对率分别为 80% 和 87.96%。 整合三套转录组原始序列:PacBio Isoseq 长读长转录本、Breidenbach 等人(2020)基于短读长从头组装的针叶转录本、Scott 等人(2016)短读长从头组装转录本,原始转录本数目依次为 409 920、622 955、128 005 条。 经序列聚类去冗余后,分别得到 131 842 条 PacBio Isoseq 高质量转录本、568 778 条 Breidenbach 等(2020)转录本、97 764 条 Scott 等(2016)转录本。 合并后的参考转录组共计 798 384 条转录本,采用 BUSCO v5.0 陆生植物(Embryophyta)odb10 数据集评估,完整性为 94.4%。开放阅读框筛选后剩余 256 322 条转录本(BUSCO 完整性 90.8%);其中全长转录本 132 195 条,部分长度转录本 70 219 条,合计 202 414 条;该套转录本整体 N50 为 49 080 bp,BUSCO 完整性 90.6%。 在 202 414 条转录本中,共有 137 146 条可按照 95% 一致性、95% 覆盖度比对到基因组。进一步施加过滤条件:比对片段最小长度 100 bp,内含子、外显子最小长度均为 9 bp,去除重复序列,剔除所有不完整蛋白编码转录本;最终保留 114 113 条转录本,BUSCO 完整性 68.9%(表 4)。
|-----------------------------------------|-----------------|
| Total transcripts | 798,384 |
| N50 (bp) | 1,382 |
| BUSCO completeness | 94.4 |
| Transcripts (frame selected) | 256,322 |
| Transcripts (filtered for completeness) | 202,414 |
| N50 (bp) | 918 |
| BUSCO completeness | 90.8% |
| Total full-length | 132,195 |
| Aligned transcripts | 114,113 |
| N50 (bp) | 933 |
| BUSCO completeness | 68.9% |
| Max intron length (bp) | 1,977,916 |
| Total multiexon transcripts | 73,578 |
| Total single-exon transcripts | 40,535 |
基因注释
重复序列鉴定
基因组经过软掩码处理后,约 18.7 Gbp 序列被鉴定为重复序列;包含 872 类独特重复元件,占基因组总长度的 70%。与多数针叶树一致,重复区以转座元件(TE)为主,转座元件占重复序列的 59%(11.1 Gb),其中约 80%(8.7 Gb)为长末端重复序列(LTR)。 Gypsy 与 Copia 是陆生植物中广泛存在的 LTR反转录转座子超家族,在重复序列中占比很高(Casacuberta 和 Santiago,2003)。Gypsy 与 Copia 在植物基因组中的基因组分布位置存在差异(Ou 和 Jiang,2018):Copia 元件多分布在基因附近,Gypsy 元件主要富集于异染色质或近着丝粒区域(Baucom 等,2009)。 海岸红杉基因组中,两类元件总长度 8 Gbp,其中 Copia 为 2.06 Gbp,Gypsy 为 5.94 Gbp,Gypsy:Copia 比值为 2.88:1 。基因组中共 10512 个基因附近存在 Copia 元件插入;该部分基因在苯丙烷、黄酮生物合成通路显著富集(附图 S1)。在富集的 GO 功能条目里,生物胁迫响应、细菌响应、温度及热响应同样是显著富集的主要通路。
蛋白编码基因鉴定
最终注释共得到 118906 个候选基因模型;其中多外显子基因 86784 个,单外显子基因 32122 个。118906 个基因模型中,108231 个由多类比对证据共同构建,10675 个仅依靠转录组比对证据得到。转录组证据将初始 360 万个基因模型优化、合并为 173075 个基因模型。 不加入转录组比对证据时,陆生植物(Embryophyta)BUSCO v5.0 完整性仅为 33%;加入转录组比对证据后,完整性提升至 67.8%。同时,转录组证据参与基因构建,使基因平均总长度提升 93%(表 5)。
|---------------------------------------|------------------------------------------------------|----------------------------------------------------------|-----------|
| Predicted gene space (Braker) | Filtered gene space (structure and function) | Final gene space (predictions and transcriptome) |
| Total genes | 3,657,738 | 108,231 | 118,906 |
| Average gene size (bp) | 1,317 | 6,157 | 11,894 |
| Average CDS length (bp) | 663 | 1,151 | 1,150 |
| Average number of exons | 2.57 | 3.89 | 4.17 |
| Average intron lengths (bp) | 2,496 | 2,422 | 4,640 |
| Maximum intron length (bp) | 389,578 | 245,956 | 1,950,289 |
| Total single-exon genes | 3,048,838 | 31,110 | 32,122 |
| Total multiexon genes | 608,900 | 77,121 | 86,784 |
| BUSCO completeness (%) | 44.7 | 32.9 | 65.5 |
基因功能注释
采用严谨的双向比对功能注释策略,共有 55 402 条序列比对到自建针叶树数据库、NCBI 植物 RefSeq 数据库或 UniProt 数据库。绝大多数序列(117 714 条)可匹配 EggNOG 预计算基因家族数据库。比对结果主要来源于针叶树数据库,其中库页冷杉的匹配占比最高,其次为拟南芥与无油樟的数据库序列。 基于基因家族注释结果分配 GO 条目,共计 96 006 个基因(81%)获得至少 1 条 GO 注释。与现有公共数据库比对,共鉴定得到 591 个候选新基因(附表 S1)。
超长内含子分析
为解析携带超大内含子基因的功能特征,将基因按照内含子长度划分为三组开展分析。 第一组:内含子 50100 Kbp 的基因,共 1918 个(附表 S1)。KEGG 通路富集显示,该组基因显著富集于烟酸烟酰胺代谢、脂肪酸生物合成通路。烟酰胺腺嘌呤二核苷酸(NAD)及其衍生物 NADP 是高度保守的代谢物,负责调控植物细胞氧化还原稳态;该类核苷酸还参与活性氧介导的信号通路,介导 UV 辐射、盐胁迫、热激、干旱等多种非生物胁迫应答(Manai 等,2013)。 GO 功能独立富集结果包括:脂质代谢、非编码 RNA 加工、氧酸代谢、氮及有机氮化合物代谢、杂环化合物代谢、转录后基因沉默、大分子甲基化;萜类、支链淀粉、含硫化合物生物合成呈弱富集。
第二组:内含子 101500 Kbp 的基因,共 432 个。显著富集于葡萄糖感知与信号通路、花发育通路;花发育相关通路可能与海岸红杉种子发育或物候调控相关。除去基础代谢通路,RNA 加工是该组最主要的 GO 生物学过程。
第三组:内含子长度>500 Kbp 的基因,共 113 个。仅缬氨酰tRNA 氨酰化这一条主要通路显著富集;已有拟南芥研究表明,该通路基因过表达能够提升植物非生物胁迫抗性(Richardson 和 Mullen,2011)。
比较基因组分析
基因家族分析
使用 OrthoFinder 开展基因家族分析,共纳入 22 个物种,合计 841 087 条蛋白序列;其中 81%(680 419 条)可聚类形成基因家族(包含 2 条及以上蛋白的直向同源基因簇)。共得到 35 647 个直向同源基因簇,其中 1155 个为物种特有基因簇,5665 个为 22 个物种均存在的保守基因簇。海岸红杉基因分布于约 44% 的全部基因家族中。 在所分析的进化类群范围内,仅鉴定出 54 个跨物种单拷贝直向同源基因簇。海岸红杉近 77% 的基因归属于基因家族;巨杉(基因组注释版本)、水杉(转录组版本)对应比例分别为 88%、95%(附图 S2)。 鉴定得到 790 个基因家族:海岸红杉中为 3 拷贝,巨杉、水杉中为单拷贝;另有 1075 个家族在海岸红杉为 2 拷贝,另外两个物种为单拷贝。排除海岸红杉潜在串联复制基因后,共有 1394 个基因家族在巨杉、水杉、海岸红杉中为单拷贝(其中 288 个家族在海岸红杉内部存在串联复制)。海岸红杉特有基因家族数量最多,共 460 个。对基因家族的有无、扩张与收缩模式进行统计,详细结果见补充文件 S2。
海岸红杉特有基因家族
共鉴定 460 个海岸红杉特有基因家族,在其余比对物种中不存在。其中绝大多数特有家族与生物、非生物胁迫响应相关。 鉴定得到物种特有双功能枞二烯合酶家族(OG0022263),该基因参与针叶树受虫害或机械损伤后的防御性树脂合成(Celedon 和 Bohlmann,2019),专司二萜烯烃生物合成。 同时存在一个萜类合酶家族(OG0026422),参与倍半萜、二萜、单萜的生物合成。 鉴定得到类贝壳杉烯氧化酶基因家族(OG0035511),负责赤霉素合成;赤霉素是绝大多数防御相关二萜类物质的前体。 鉴定得到类黄酮 3'单加氧酶基因家族(OG0026401)。黄酮生物合成是苯丙烷代谢的重要分支;该通路受多个基因转录水平调控,同时受 MYB 转录因子调控,MYB 家族在针叶树中发生扩张(Li,2014)。黄酮类物质(黄酮、黄酮醇、黄烷醇、原花青素、花青素)会在非生物胁迫(细胞损伤)条件下发生修饰。 在脂肪酶基因中,鉴定得到 3 类脂肪酶蛋白家族(OG0035575);拟南芥研究报道该家族参与激活水杨酸介导的防御应答(Lai 等,2017)。
海岸红杉特有、柏科其他物种缺失的基因家族
共鉴定 1706 个基因家族,仅存在于海岸红杉,其余柏科物种均缺失。 针叶树普遍存在转座子活跃现象,本研究鉴定到染色质修饰蛋白 Chromo 家族(OG0011748)、FACT 复合体组分(OG0013343)、YT521 家族(OG0031005);该类基因参与染色质结构调控与表观抑制。 鉴定到 WAX2 类基因家族(OG0013236),参与角质层合成;拟南芥中 WAX2 变异会改变角质层结构,调控耐旱性,减少水分散失(Chen 等,2003)。 鉴定多个木葡聚糖内转糖基酶家族(OG0015084、OG0020157、OG0025511、OG0026451、OG0034404、OG0035623、OG0012689)。该类酶切割并修饰初生细胞壁核心组分木葡聚糖,参与生长组织的细胞壁构建;遭遇机械胁迫时,该基因参与重塑组织拉伸强度与柔韧性,帮助植物适应机械胁迫环境(Peña 等,2004)。 类乙酰肝素酶基因家族(OG0032932),在多个植物物种中参与非生物胁迫应答与结构重塑(Ni 等,2020)。 营养吸收相关:鉴定到甲酰胺酶家族(OG0033463),已有研究表明该基因可在磷、氮匮乏土壤中诱导排根形成(Rath 等,2010)。 还鉴定到树皮贮藏蛋白家族(OG0032932),该家族在杨树中受氮素诱导表达,参与氮储存(Coleman 等,1993)。
海岸红杉扩张基因家族
本研究鉴定得到 7724 个在海岸红杉中发生特异性扩张的基因家族。金属离子相关基因占比较高,包括 MATE 转运蛋白(OG0000181;OG0000326;OG0026382)以及重金属相关蛋白(OG0000170;OG0003233;OG0003549;OG0016719;OG0018282)。解毒蛋白以及类 Transparent Testa12 蛋白也大量存在。检测到大量解毒蛋白家族:Detoxification 27(OG0012979;OG0000322)、Detoxification 29(OG0013597;OG0019025;OG0000383)、Detoxification 40(OG0003366)、Detoxification 42(OG0004540)与 Detoxification 56(OG0011608)。相关的 TESTA 基因是黄酮生物合成的调控因子(Zhang 和 Shrader,2017)。此外,参与花青素修饰的 UDP鼠李糖依赖型鼠李糖基转移酶(OG0000043)也发生扩张(Hsu 等,2017)。
海岸红杉中规模最大的基因家族与抗病相关,尤以类 RPM1 抗病蛋白家族(OG0000038)最为突出。该蛋白能够特异性识别丁香假单胞菌的 AvrRpm1 III 型效应无毒蛋白(Guttman 和 Greenberg,2001)。抗病蛋白通过与无毒蛋白间接互作,帮助植物抵御携带对应无毒效应子的病原菌。酸性内切几丁质酶(OG0000527)是另一个海岸红杉特化扩张的大基因家族,该蛋白用于抵御含几丁质的真菌病原菌。最后还鉴定到与病原菌应答相关的氧代植二烯酸还原酶(OG0000500)。
核苷酸多样性与 Fst 估算
对 92 份材料的外显子捕获数据分析显示,海岸红杉平均核苷酸多样性为 0.0001842。该数值比大多数异交、广布裸子植物的单位位点平均核苷酸多样性低至少两个数量级(Savolainen 和 Pyhäjärvi,2007)。与近缘物种巨杉对比:海岸红杉平均核苷酸多样性 0.0001842,群体分化指数 Fst 为 0.01127;巨杉平均核苷酸多样性 0.000089,Fst 为 0.01593,二者处于相近水平。
海岸红杉六倍体的起源
本研究在 DNA 水平上将海岸红杉全基因组比对至巨杉基因组(详见材料与方法);但二者序列分化程度较高,难以检测全基因组水平的相似性。不过仍然识别出多处大片段共线性区域;最大的共线性片段对应巨杉 8 号染色体约 70 Mbp 区域,以及海岸红杉 Scaffold_195192(附图 S3)。该图显示二者存在大量染色体重排,但共线性关系明确。
选取该共线性区域内,在海岸红杉与巨杉中均完整保留的基因,用于评估两个物种之间的序列分化。通过分析这些基因,同时分析海岸红杉的额外基因拷贝,试图判断:海岸红杉基因组复制事件发生的时间,是早于还是晚于海岸红杉巨杉的物种分化时间。
针对上述共线性区域的基因开展 OrthoFinder 分析,包含巨杉 416 个基因、海岸红杉 1197 个基因以及水杉转录组序列,最终得到 11 个跨三物种的单拷贝基因家族(附表 S2)。11 个基因家族的核苷酸变异范围为 0.0170.478(1.7%48%)。单拷贝基因之间变异水平普遍偏低,符合预期;变异较高的基因可能是受到选择压力差异影响,或是分析混入旁系同源而非直向同源基因。尽管共线性区块中的单拷贝基因大概率为直向同源基因,但基因复制等进化事件仍可能引入旁系同源基因。 多数基因的 dS、dN 数值整体偏低;仅有 OG0000185、OG0000195、OG0000251、OG0000254 这 4 个基因的 dS 与 dN 显著升高,但四者 dN/dS 均小于 1,提示这些基因处于纯化选择压力下。
红杉谱系特有基因(包含海岸红杉多拷贝序列)中,绝大多数基因同样 dN/dS<1。大部分基因替换速率维持较低水平;仅 OG0018829、OG0018857、OG0018879 中海岸红杉部分拷贝的同义、非同义替换速率上升。该组基因的核苷酸变异区间为 0.0240.56;海岸红杉与巨杉之间绝大多数基因的核苷酸变异小于 10%。
海岸红杉多拷贝基因的系统发育关系
基于海岸红杉与巨杉完整基因组注释的多拷贝基因开展系统发育分析。随机选取 150 个基因构建最大似然树;其中 135 个基因的海岸红杉拷贝聚为独立分支,包含 91 个双拷贝基因、44 个三拷贝基因(附表 S3)。 在这 135 个基因中,78 棵进化树支持巨杉为海岸红杉的姐妹类群,远高于支持水杉作为姐妹类群的 26 棵树(图 2)。剩余 31 棵树无法明确分辨其与水杉或巨杉的亲缘关系。大量基因支持巨杉是海岸红杉最近缘物种,这与早期仅基于转录组数据得到的结论一致(Scott 等,2016)。 此外,所有进化树均显示:海岸红杉自身的多个基因拷贝之间亲缘关系更近,而与其他物种同源基因距离更远(图 2),该结果支持前人提出的海岸红杉同源多倍体起源假说(Scott 等,2016)。

图 2 将海岸红杉多拷贝基因,分别与巨杉、水杉以及其他物种的直向同源基因进行比较时,不同进化树拓扑结构的出现频次。
讨论
海岸红杉基因组庞大、重复序列占比高且为多倍体,将其与其他解析充分的植物基因组对比,为解析基因家族演化动态提供了研究材料。本研究发现,该物种在生物胁迫与非生物胁迫相关基因层面存在大量特有变异。海岸红杉以对害虫和病原菌具有较强抗性著称;在 400 余个物种特有基因家族中,次生代谢与防御相关家族显著富集。 在仅存在于海岸红杉、柏科其他物种缺失的基因中,鉴定出大量参与染色质重塑与甲基转移酶活性的基因。这类基因家族的存在及其表达特征,通常与多倍体物种相关(Yuan 等,2020)。柏科刺柏属内也存在多倍体物种,但本研究并未纳入该类群;若扩大物种覆盖范围,该富集信号或许会被稀释。 在海岸红杉显著扩张的基因家族中,防御相关基因依旧占主导;同时还检测到大量解毒基因、黄酮生物合成相关的 TESTA 家族基因,以及众多 MATE 转运蛋白。上述基因功能广泛,已有研究报道其参与耐旱、代谢物转运以及光信号介导的生长发育过程(Zhang 和 Shrader,2017;Volkov 和 Schwenke,2021)。
内含子的数量与长度会调控转录效率,在进化过程中可受到选择作用(Heyn 等,2015;Rose,2019)。此外,长内含子相对于翻译起始位点的位置也十分关键(Parra 等,2011)。长内含子会造成基因产物成熟过程发生延迟,该现象被称为内含子延迟效应 (Heyn 等,2015)。多个物种的研究均发现,携带长内含子的基因存在组织特异性表达特征(Jeong 等,2006;Baulin 等,2020)。 海岸红杉最终蛋白编码基因注释中,部分基因的内含子长度接近 2 Mbp,这与其他针叶树基因组的观测结果一致。其中一个携带超长内含子的基因参与防御应答调控、茉莉酸信号通路调控以及损伤响应。对不同长度长内含子基因集开展富集分析,相较于全部基因集,物候调控、干旱响应、萜类合成、甲基化调控通路持续显著富集。
与所有裸子植物基因组特征一致,海岸红杉基因组重复序列占比很高,且以长末端重复反转录转座子(LTR)为主。多数植物基因组中,Gypsy 元件通常被认为驱动基因组的扩张与演化(Zhang 等,2020)。然而,对同源四倍体高山南芥(同时存在二倍体个体)的研究表明,四倍体个体的基因区转座子积累水平更高;Copia 元件尤其富集在适应性性状相关基因的内部及周边,这些基因受到正选择或者宽松的纯化选择(Baduel 等,2019)。 已有研究证实植物 Ty1copia 类反转录转座子可被生物与非生物胁迫激活(JolyLopez 等,2017),包括物理胁迫(紫外线照射、机械损伤)以及化学胁迫(水杨酸处理)(Kimura 等,2001)。本研究鉴定到一万余个基因附近存在 Copia 元件插入,这些基因显著富集苯丙烷、黄酮生物合成通路,与基因家族分析得到的富集结果相互印证。
基于外显子捕获测序数据分析,海岸红杉以无性繁殖为主,仅偶尔发生有性生殖,其核苷酸多样性极低。该数值比大多数异交广布裸子植物的单位位点核苷酸多样性低至少两个数量级(Savolainen 和 Pyhäjärvi,2007),与主要行克隆繁殖的巨浮萍 Spirodela polyrhiza 接近,后者属于植物中核苷酸多样性最低的物种之一(Xu 等,2019)。巨杉同样具有较低的核苷酸多样性,提示需要保护现存全部或大部分种群,才能保障物种的长期存续。
多倍体现象在被子植物中十分普遍,但在裸子植物中却非常罕见(Khoshoo,1959;Ahuja,2005;Yang 等,2012)。20 世纪 40 年代,日本与美国研究者各自独立证实海岸红杉为六倍体(Hirayoshi 和 Nakamura,1943;Stebbins,1948)。Stebbins(1948)基于细胞遗传学证据,提出六倍体海岸红杉起源于异源多倍体(杂交事件)。后续 Ahuja 与 Neale(2002)对该假说进行修正,认为其为同源异源多倍体或者片段化多倍体。 海岸红杉六倍体起源问题长期悬而未决,直到 Scott 等人(2016)基于海岸红杉、巨杉、水杉的比较基因组测序,提出该物种起源于一次同源多倍化事件。研究者原本期待海岸红杉与巨杉的高质量全基因组测序(Scott 等,2020)能够彻底厘清这一问题。但本研究的分析结果虽整体偏向支持 Scott 等人(2020)的同源多倍体假说,仍无法给出完全确凿的结论。未来,若获得现存三种红杉属物种的高质量连续基因组,甚至实现已灭绝红杉类群的测序,将最终阐明海岸红杉六倍体的起源与发生时间。
Data availability
The coast redwood v2.2 assembly was deposited at NCBI as GenBank accession VDFB02000000, BioProject PRJNA542879. The genome assembly, annotation, and functional assessment are also available in the TreeGenes database (https://treegenesdb.org/). The GSA Figshare portal (https://doi.org/10.25387/g3.16682680) was used to upload Supplementary Table S1: Comparative genomics workbook containing the functional annotation for all protein-coding genes, gene family analysis via OrthoFinder, gene family comparisons, enrichment analysis for long introns, and genes in proximity to copia LTRs; Supplementary Table S2: Single-copy gene family analysis workbook; and Supplementary Table S3: Multicopy gene family analysis workbook.