從同一批定序讀段中讀取核 DNA 與葉綠體 DNA
以 Eranga Pawani Witharana 女士為第一作者、以本實驗室為核心的研究團隊,展示了一種從葉綠體基因組分析所用的同一批定序讀段中高效擷取核基因組系統發育資訊的方法,從而實現兩類資料的整合比較。
原始研究論文資訊
標題: Subfamily evolution analysis using nuclear and chloroplast data from the same reads
作者: Eranga Pawani Witharana, 岩崎貴也(Takaya Iwasaki), Myat Htoo San, Nadeeka U. Jayawardana, 古藤田信博(Nobuhiro Kotoda), 山本雅史(Masashi Yamamoto) & 永野幸生(Yukio Nagano)
發表日期: 2025年1月3日(2024年12月13日接受)
DOI: 10.1038/s41598-024-83292-9
期刊指標: 2025 Journal Impact Factor: 4.9; 2025 5-year Journal Impact Factor: 4.8; 2025 SNIP: 1.339; 2025 SJR: 0.893; 全球被引用次數第二多的期刊 (截至 2026 年 7 月發布商列出的最新指標)
文章類型: 開放取用(Open Access)
葉綠體(chloroplast;cp)基因組較小且易於分析,因此廣泛用於植物系統發育研究。然而,在許多被子植物中,cpDNA為單親遺傳(通常為母系遺傳),可能與雙親遺傳的核DNA呈現不同的phylogenetic signal。因此,僅憑葉綠體資料有時無法充分解析演化關係。
為了獲得更全面的系統發育訊息,從父母雙方遺傳的核DNA訊息也很重要。核 DNA 提供了比 cpDNA 更全面的遺傳視角。然而,取得完整的核 DNA 資訊以前成本高昂。近年来,出现了获取核DNA数据的高性价比方法(例如目标捕获、RNA测序),但通常需要分别准备叶绿体和核DNA数据。
在这项研究中,为了应对这一挑战,我们重点开发和验证一种新方法,该方法从用于叶绿体基因组分析的“完全相同”的原始(未处理)读取序列数据中获取核 DNA 系统发育信息。
我們使用了一種新的計算工具,稱為 Read2Tree。 Read2Tree 能夠從原始讀取序列資料中直接有效地提取保守的核基因序列。
論文發表後,為便於重現並進一步應用該 workflow,我們在 GitHub repository「Eranga-Witharana/rt2-phylogenomics」公開了 analysis pipeline。
Read2Tree 的主要特點與優勢
- 經濟高效:使用與葉綠體分析相同的原始資料可降低資料擷取成本。
- 全面的核數據檢索:參考基因組引導的方法可以提取大量保守的核基因。
- 簡化的分析:充當從基因識別到比對生成再到系統發育樹構建的整合管道。
- 無需自訂準備:使用現有參考資料集,無需設計和驗證特定物種的探針組或資料庫。
- 對於不一致分析有用:輸出單一基因比對數據,可用於調查系統發育不一致的原因(例如基因樹和物種樹之間的差異)。
方法驗證——以柑橘亞科(Aurantioideae)植物為例
為了驗證這種新方法(使用 Read2Tree 進行核 DNA 系統發育分析)的有效性和實用性,我們以 Aurantioideae 植物群為目標。柑橘亞科(Aurantioideae)包括柑橘及其近親,是一個具有複雜系統發育關係的重要類群。
研究使用Read2Tree取得柑橘亞科(Aurantioideae)39個物種的保守核基因序列,並與同一批raw reads建立的葉綠體基因組系統發育樹進行比較。
- 與現有核 DNA 方法比較——將 Read2Tree 取得的核 DNA 系統發育樹與既往研究採用的RAD-Seq 系統發育樹進行比較,以評估 Read2Tree 的可靠性。
- 與葉綠體系統發育分析整合——使用同一批原始資料建立葉綠體基因組系統發育樹,並與 Read2Tree 得到的核 DNA 樹進行比較,藉此分析葉綠體與細胞核系統發育不一致(cytonuclear discordance)。
- 分析不一致的原因——將 Read2Tree 輸出的單基因比對資料與 D-statistic、DFOIL、QuIBL 等方法結合,分析不完全譜系排序(ILS)、基因滲入(introgression)及古代基因滲入等複雜演化過程是否造成觀察到的系統發育不一致。
結果——方法的有效性
本研究的結果揭示了以下幾點,證明了使用 Read2Tree 的方法的有效性:
- 核DNA系統發育樹比較:Read2Tree得到的核DNA系統發育關係與先前RAD-Seq研究結果整體一致,但部分taxa的位置仍不確定,因此不能理解為所有分支均已最終確定。
- 資料再利用效率:同一批short-read資料可同時用於葉綠體基因組分析與核DNA系統發育推斷,比另行準備兩套定序資料更具成本效率。這是資料取得方面的優勢,並非正式的經濟學評估。
- 系統發育不一致分析:多種分析顯示incomplete lineage sorting(ILS)是多數不一致的主要原因;在特定clades中,introgression及ancient introgression也可能有所貢獻。
結論
本研究顯示,Read2Tree可從葉綠體基因體分析所用的同一批raw reads中取得保守核基因,藉此比較核與葉綠體系統發育,並檢驗incomplete lineage sorting(ILS)和introgression的影響。部分分類單元的位置仍不確定,因此並非所有分支均已確定解析。
此方法有可能有助於未來植物系統發育研究中更詳細、更可靠地重建演化史。
在食材研究中的潛在應用
以下內容是根據已驗證的phylogenetic workflow推測的潛在應用,並非本論文直接檢驗的育種、風味、營養價值或抗病性結果。
例如,本研究中使用的像柑橘亞科植物這樣的類群包括對全球食品和醫藥用途很重要的植物物種。了解它們精確的系統發育關係和複雜的雜交進化歷史對於農業作物改良以及保護和利用可能成為未來食物來源的寶貴遺傳資源(例如野生近緣種)至關重要。
這種使用 Read2Tree 的新方法可以使用相同的數據集從葉綠體和核 DNA 中高效檢索信息,從而可以對許多以前難以分析的糧食作物物種進行更全面和詳細的系統發育分析。
此外,分析複雜遺傳過程(例如不完全譜系排序(ILS)和基因滲入)的能力為在遺傳層面上理解食用植物的多種性狀(例如高營養價值、特定風味以及對病蟲害的抵抗力)如何在整個進化歷史中獲得和維持奠定了基礎。
這樣,該方法可以說為加深我們對用作食物的植物多樣性的理解以及推動改良品種開發和可持續資源利用的研究提供了重要基礎。