利用同一批測序讀段分析細胞核 DNA 同葉綠體 DNA
以 Eranga Pawani Witharana 女士為第一作者,以我哋實驗室為中心嘅研究小組展示咗一種方法,可以從用於葉綠體基因組分析嘅相同測序讀取中有效恢復核系統發育資訊,令到可以綜合比較兩個資料來源。
原著論文資料
題目: Subfamily evolution analysis using nuclear and chloroplast data from the same reads
作者: Eranga Pawani Witharana, 岩崎貴也(Takaya Iwasaki), Myat Htoo San, Nadeeka U. Jayawardana, 古藤田信博(Nobuhiro Kotoda), 山本雅史(Masashi Yamamoto) & 永野幸生(Yukio Nagano)
發表日期: 2025年1月3日(2024年12月13日接納)
DOI: 10.1038/s41598-024-83292-9
期刊指標: 2025 Journal Impact Factor: 4.9; 2025 5-year Journal Impact Factor: 4.8; 2025 SNIP: 1.339; 2025 SJR: 0.893; 全球被引用次數第二多嘅期刊 (截至2026年7月出版商列出嘅最新指標)
文章類型: 開放取用(Open Access)
葉綠體體( cp )基因組係植物系統發育學中廣泛使用,因為佢哋相對細小同埋易處理。但係,喺好多被子植物入面, cpDNA 係單親遺傳嘅 — 通常係母本遺傳 — 所以可以帶有同雙親遺傳嘅核 DNA 唔同嘅系統發育信號。因此,單單葉綠體體數據可能唔足以解決某啲進化關係。
為咗獲得更全面嘅系統發育資料,由父母雙方遺傳嘅核 DNA 資料亦都好重要。核子 DNA 比 cpDNA 提供咗更全面嘅遺傳觀點。但係,以前要獲得全核 DNA 資訊同高成本有關。近年來,出現咗高成本效益嘅方法去獲得核 DNA 數據(例如目標捕捉、 RNA 測序),但係一般都係需要分別準備葉綠體同核 DNA 數據。
喺呢項研究中,為咗解決呢個挑戰,我哋著重開發同驗證一種新方法,呢種方法可以從用於葉綠體基因組分析嘅「完全相同」嘅原始(未經處理)讀取序列數據中獲得核 DNA 系統發育資訊。
我哋用咗一個新嘅計算工具,叫做 Read2Tree。 Read2Tree 可以直接有效噉提取保守核 基因序列嚟自原始讀取序列數據。
論文發表之後,為咗方便重現同進一步應用呢個 workflow,我哋喺 GitHub repository「Eranga-Witharana/rt2-phylogenomics」公開咗 analysis pipeline。
Read2Tree 嘅主要特點同優勢
- 成本效益:使用同葉綠體分析相同嘅原始數據可以降低數據采集成本。
- 綜合核數據擷取:參考基因組引導方法可以提取大量保守嘅核基因。
- 流線型分析:作為一個由基因識別到對齊生成到系統發育樹構建嘅綜合管道嘅功能。
- 唔需要自訂準備:使用現有嘅參考資料集,唔需要設計同驗證物種特定嘅探針集或者資料庫。
- 對不一致分析有用:輸出個別基因對齊數據,可以用嚟調查系統發育不一致嘅原因(例如基因樹同物種樹之間嘅差異)。
方法驗證:以 Aurantioideae 植物為例
為咗驗證呢個新方法(用 Read2Tree 進行核 DNA 系統發育分析)嘅有效性同有用性,我哋針對植物群金菊科。包括柑橘同佢嘅近親嘅 Aurantioideae 係一個重要嘅群體,有複雜嘅系統發育關係。
呢項研究利用 Read2Tree ,恢復咗39種 Aurantioideae 物種嘅保守核基因序列,並將所得嘅核系統發育同由相同嘅原始讀取建立嘅葉綠體基因組樹進行比較。
- 同現有嘅核 DNA 方法嘅比較:核 DNA 嘅系統發育 由 Read2Tree 得到嘅樹同 由 RAD-Seq 生成嘅樹,係之前研究中使用嘅另一種核 DNA 方法。呢個比較 評估咗 Read2Tree 嘅可靠性。
- 同葉綠體系統發育分析嘅整合:由相同嘅原始數據構建葉綠體基因組嘅系統發育樹,並同 Read2Tree 所產生嘅核 DNA 樹進行比較。呢個方法調查咗細胞核嘅不一致,即係葉綠體同核系統發育之間嘅不匹配。
- 分析不一致原因:使用個別基因對齊數據輸出 由 Read2Tree 同其他方法結合(啲統計, DFOIL , QuIBL 等),我哋分析咗觀察到嘅系統發育不一致係咪 由複雜嘅進化過程引起,例如 不完整嘅血統排序( ILS ), 入侵,或古代入侵。
結果(方法嘅有效性)
本研究結果顯示出以下幾點,證明咗使用 Read2Tree 嘅方法嘅有效性:
- 核系統發育比較: Read2Tree 核系統發育同早期嘅 RAD-Seq 研究報告嘅關係大致一致。有啲分類群嘅位置仍然係唔確定嘅,所以呢個分析唔應該被解讀為絕對解決每個分支。
- 有效重用數據:同一個短讀取數據集支援葉綠體基因組分析同核系統發育推斷,令到呢個方法比起準備獨立嘅測序數據集更有成本效益。呢個係數據獲取優勢,而唔係正式嘅經濟評估。
- 系統發育不一致分析:多項分析顯示,不完全譜系排序(incomplete lineage sorting; ILS)可解釋大部分觀察到嘅不一致;喺特定分支內,基因滲入(introgression)同古代基因滲入亦可能有所貢獻。
結論
研究顯示,Read2Tree 可以由葉綠體基因組分析所用嘅同一批原始測序讀段恢復保守核基因,從而比較細胞核同葉綠體系統發育,並評估不完全譜系排序(ILS)同基因滲入(introgression)嘅影響。部分 taxon 嘅位置仍然未確定,而研究亦未能對每一個分支作出定論。
呢個方法有潛力喺未來嘅植物系統發育研究中有助於更詳細同可靠嘅進化史重建。
應用於食材研究嘅可能性
以下幾點描述咗由經過驗證嘅系統發育工作流程推斷出嚟嘅潛在應用。呢篇論文冇直接測試過作物嘅繁殖、味道、營養價值或者抗病性。
例如,呢個研究所用嘅金盞花科呢類群體包括對全球食物同藥用都好重要嘅植物種類。理解佢哋嘅精確系統發育關係同埋雜交嘅複雜進化史對於農業嘅作物改良同埋保育同利用可能成為未來食物來源嘅寶貴遺傳資源(例如野生親戚)至關重要。
呢個使用 Read2Tree 嘅新方法,可以用相同嘅數據集有效噉擷取葉綠體同核 DNA 嘅資訊,令到可以對好多以前難以分析嘅食物作物物種進行更全面同詳細嘅系統發育分析。
此外,分析不完全譜系排序(ILS)同基因滲入(introgression)等複雜遺傳過程,有助我哋喺遺傳層面理解食用植物嘅高營養價值、特定風味、抗病蟲害等多樣性狀,喺演化歷史中係點樣獲得並維持。
噉樣,呢個方法可以話係為我哋深入理解用作食物嘅植物多樣性,同埋推動研究向改良品種嘅發展同可持續資源利用提供重要嘅基礎。