从同一批测序读段中读取核 DNA 与叶绿体 DNA
以 Eranga Pawani Witharana 女士为第一作者、以本实验室为核心的研究团队,展示了一种从叶绿体基因组分析所用的同一批测序读段中高效提取核基因组系统发育信息的方法,从而实现两类数据的综合比较。
原始研究论文信息
标题: Subfamily evolution analysis using nuclear and chloroplast data from the same reads
作者: Eranga Pawani Witharana, 岩崎贵也(Takaya Iwasaki), Myat Htoo San, Nadeeka U. Jayawardana, 古藤田信博(Nobuhiro Kotoda), 山本雅史(Masashi Yamamoto) & 永野幸生(Yukio Nagano)
发表日期: 2025年1月3日(2024年12月13日接受)
DOI: 10.1038/s41598-024-83292-9
期刊指标: 2025 Journal Impact Factor: 4.9; 2025 5-year Journal Impact Factor: 4.8; 2025 SNIP: 1.339; 2025 SJR: 0.893; 全球被引用次数第二多的期刊 (截至 2026 年 7 月发布商列出的最新指标)
文章类型: 开放获取(Open Access)
叶绿体(chloroplast;cp)基因组较小且易于分析,因此广泛用于植物系统发育研究。然而,在许多被子植物中,cpDNA为单亲遗传(通常为母系遗传),可能与双亲遗传的核DNA呈现不同的phylogenetic signal。因此,仅凭叶绿体数据有时无法充分解析进化关系。
为了获得更全面的系统发育信息,从父母双方遗传的核DNA信息也很重要。核 DNA 提供了比 cpDNA 更全面的遗传视角。然而,获取完整的核 DNA 信息以前成本高昂。近年来,出现了获取核DNA数据的高性价比方法(例如目标捕获、RNA测序),但通常需要分别准备叶绿体和核DNA数据。
在这项研究中,为了应对这一挑战,我们重点开发和验证一种新方法,该方法从用于叶绿体基因组分析的“完全相同”的原始(未处理)读取序列数据中获取核 DNA 系统发育信息。
我们使用了一种新的计算工具,称为 Read2Tree。 Read2Tree 能够从原始读取序列数据中直接有效地提取保守的核基因序列。
论文发表后,为便于复现并进一步应用该 workflow,我们在 GitHub repository“Eranga-Witharana/rt2-phylogenomics”中公开了 analysis pipeline。
Read2Tree 的主要特点与优势
- 经济高效:使用与叶绿体分析相同的原始数据可降低数据采集成本。
- 全面的核数据检索:参考基因组引导的方法可以提取大量保守的核基因。
- 简化的分析:充当从基因识别到比对生成再到系统发育树构建的集成管道。
- 无需定制准备:使用现有参考数据集,无需设计和验证特定物种的探针组或数据库。
- 对于不一致分析有用:输出单个基因比对数据,可用于调查系统发育不一致的原因(例如基因树和物种树之间的差异)。
方法验证——以柑橘亚科(Aurantioideae)植物为例
为了验证这种新方法(使用 Read2Tree 进行核 DNA 系统发育分析)的有效性和实用性,我们以 Aurantioideae 植物群为目标。柑橘亚科(Aurantioideae)包括柑橘及其近亲,是一个具有复杂系统发育关系的重要类群。
研究使用Read2Tree获得了柑橘亚科(Aurantioideae)39个物种的保守核基因序列,并与同一批raw reads构建的叶绿体基因组系统发育树进行了比较。
- 与现有核 DNA 方法比较——将 Read2Tree 获得的核 DNA 系统发育树与既往研究采用的RAD-Seq 系统发育树进行比较,以评价 Read2Tree 的可靠性。
- 与叶绿体系统发育分析整合——使用同一批原始数据构建叶绿体基因组系统发育树,并与 Read2Tree 得到的核 DNA 树进行比较,从而分析叶绿体与细胞核系统发育不一致(cytonuclear discordance)。
- 分析不一致的原因——将 Read2Tree 输出的单基因比对数据与 D-statistic、DFOIL、QuIBL 等方法结合,分析不完全谱系排序(ILS)、基因渗入(introgression)及古代基因渗入等复杂进化过程是否导致所观察到的系统发育不一致。
结果——方法的有效性
本研究的结果揭示了以下几点,证明了使用 Read2Tree 的方法的有效性:
- 核DNA系统发育树比较:Read2Tree得到的核DNA系统发育关系与先前RAD-Seq研究的结果总体一致,但部分taxa的位置仍不确定,因此不能理解为所有分支均已最终确定。
- 数据复用效率:同一批short-read数据可同时用于叶绿体基因组分析和核DNA系统发育推断,比另行制备两套测序数据更具成本效率。这是数据获取方面的优势,并非正式的经济学评估。
- 系统发育不一致分析:多种分析提示incomplete lineage sorting(ILS)是多数不一致的主要原因;在特定clades中,introgression及ancient introgression也可能有所贡献。
结论
本研究表明,Read2Tree可从叶绿体基因组分析所用的同一批raw reads中提取保守核基因,从而比较核与叶绿体系统发育,并检验incomplete lineage sorting(ILS)和introgression的影响。部分分类单元的位置仍不确定,因此并非所有分支都已得到确定解析。
该方法有可能有助于未来植物系统发育研究中更详细、更可靠地重建进化史。
在食材研究中的潜在应用
以下内容是根据已验证的phylogenetic workflow推测的潜在应用,并非本论文直接检验的育种、风味、营养价值或抗病性结果。
例如,本研究中使用的像柑橘亚科植物这样的类群包括对全球食品和医药用途很重要的植物物种。了解它们精确的系统发育关系和复杂的杂交进化历史对于农业作物改良以及保护和利用可能成为未来食物来源的宝贵遗传资源(例如野生近缘种)至关重要。
这种使用 Read2Tree 的新方法可以使用相同的数据集从叶绿体和核 DNA 中高效检索信息,从而可以对许多以前难以分析的粮食作物物种进行更全面和详细的系统发育分析。
此外,分析复杂遗传过程(例如不完全谱系排序(ILS)和基因渗入)的能力为在遗传水平上理解食用植物的多种性状(例如高营养价值、特定风味以及对病虫害的抵抗力)如何在整个进化历史中获得和维持奠定了基础。
这样,该方法可以说为加深我们对用作食物的植物多样性的理解以及推动改良品种开发和可持续资源利用的研究提供了重要基础。