동일한 시퀀싱 리드에서 핵 DNA와 엽록체 DNA 읽기
Eranga Pawani Witharana를 제1저자로 한 우리 연구실 중심의 연구팀은 엽록체 게놈 분석에 사용한 동일한 시퀀싱 리드에서 핵 계통 정보를 효율적으로 얻는 방법을 제시하여 두 데이터원을 통합적으로 비교할 수 있게 했습니다.
원 논문 정보
제목: Subfamily evolution analysis using nuclear and chloroplast data from the same reads
저자: Eranga Pawani Witharana, Takaya Iwasaki, Myat Htoo San, Nadeeka U. Jayawardana, Nobuhiro Kotoda, Masashi Yamamoto & Yukio Nagano
학술지: Scientific Reports
게재일: 2025년 1월 3일(2024년 12월 13일 수락)
DOI: 10.1038/s41598-024-83292-9
학술지 지표: 2025 Journal Impact Factor: 4.9; 2025 5-year Journal Impact Factor: 4.8; 2025 SNIP: 1.339; 2025 SJR: 0.893; 세계에서 두 번째로 많이 인용되는 학술지 (2026년 7월 기준 최신 게시자 등록 측정항목)
논문 유형: 오픈 액세스
엽록체(chloroplast; cp) 게놈은 비교적 작고 분석하기 쉬워 식물 계통 연구에 널리 사용됩니다. 그러나 많은 피자식물에서 cpDNA는 한쪽 부모—대개 모계—로부터 유전되므로 양친에게서 유전되는 핵DNA와 다른 phylogenetic signal을 보일 수 있습니다. 따라서 엽록체 데이터만으로 일부 진화 관계를 충분히 해결하지 못할 수 있습니다.
보다 포괄적인 계통발생 정보를 얻으려면 부모 모두로부터 물려받은 핵 DNA 정보도 중요합니다. 핵 DNA는 cpDNA보다 더 전체적인 유전적 관점을 제공합니다. 그러나 이전에는 전체 핵 DNA 정보를 획득하는 데 높은 비용이 소요되었습니다. 최근 몇 년 동안 핵 DNA 데이터를 얻기 위한 매우 비용 효과적인 방법(예: 표적 포획, RNA 서열 분석)이 등장했지만 일반적으로 엽록체와 핵 DNA 데이터를 별도로 준비해야 했습니다.
본 연구에서는 이러한 과제를 해결하기 위해 엽록체 게놈 분석에 사용되는 "완전히 동일한" 원시(처리되지 않은) 시퀀싱 리드 데이터로부터 핵 DNA 계통발생 정보를 얻는 새로운 방법의 개발 및 검증에 중점을 두었습니다.
우리는 다음과 같은 새로운 계산 도구를 활용했습니다. Read2Tree. Read2Tree를 사용하면 원시 시퀀싱 리드 데이터에서 보존된 핵 유전자 서열을 직접적이고 효율적으로 추출할 수 있습니다.
논문 발표 후 workflow의 재현과 추가 활용을 돕기 위해 analysis pipeline을 GitHub repository “Eranga-Witharana/rt2-phylogenomics”에 공개했습니다.
Read2Tree의 주요 특징과 장점
- 비용 효율성: 엽록체 분석과 동일한 원시 데이터를 사용하면 데이터 수집 비용이 절감됩니다.
- 포괄적인 핵 데이터 검색: 참조 게놈 기반 접근 방식을 통해 보존된 핵 유전자를 대량으로 추출할 수 있습니다.
- 간소화된 분석: 유전자 식별부터 정렬 생성, 계통발생수 구성까지 통합 파이프라인으로 기능합니다.
- 맞춤형 준비가 필요하지 않습니다. 기존 참조 데이터 세트를 사용하므로 종별 프로브 세트 또는 데이터베이스를 설계하고 검증할 필요가 없습니다.
- 불일치 분석에 유용합니다. 계통발생적 불일치(예: 유전자 나무와 종 나무 간의 불일치)의 원인을 조사하는 데 사용할 수 있는 개별 유전자 정렬 데이터를 출력합니다.
방법 검증 — 감귤아과(Aurantioideae) 식물의 사례
이 새로운 방법(Read2Tree를 사용한 핵 DNA 계통발생 분석)의 효과와 유용성을 검증하기 위해 우리는 Aurantioideae 식물 그룹을 표적으로 삼았습니다. 감귤류와 그 가까운 친척을 포함하는 Aurantioideae는 복잡한 계통발생 관계를 가진 중요한 그룹입니다.
Read2Tree를 이용해 운향과 감귤아과(Aurantioideae) 39종의 보존된 핵 유전자 서열을 확보하고, 동일한 raw reads로 구축한 엽록체 게놈 계통수와 비교했습니다.
- 기존 핵 DNA 방법과의 비교 — Read2Tree로 얻은 핵 DNA 계통수를 선행 연구에서 사용한 RAD-Seq 계통수와 비교하여 Read2Tree의 신뢰성을 평가했습니다.
- 엽록체 계통 분석과의 통합 — 동일한 원시 데이터로 엽록체 게놈 계통수를 구축하고 Read2Tree로 얻은 핵 DNA 계통수와 비교하여 엽록체와 핵 계통 사이의 불일치인 cytonuclear discordance를 조사했습니다.
- 불일치 원인 분석 — Read2Tree가 출력한 개별 유전자 정렬 데이터를 D-statistic, DFOIL, QuIBL 등의 방법과 결합하여 불완전 계통분류(incomplete lineage sorting; ILS), 유전자 이입(introgression), 고대 유전자 이입과 같은 복잡한 진화 과정의 영향을 분석했습니다.
결과 — 방법의 유효성
본 연구의 결과는 다음과 같은 점을 보여주었으며, Read2Tree를 이용한 방법의 효율성을 입증하였다.
- 핵DNA 계통 비교—Read2Tree 핵DNA 계통은 선행 RAD-Seq 연구의 관계와 대체로 일치했습니다. 일부 taxa의 위치는 여전히 불확실하므로 모든 branch가 확정되었다는 의미는 아닙니다.
- 데이터 재사용 효율—동일한 short-read dataset을 엽록체 게놈 분석과 핵DNA 계통 추론에 모두 사용하므로 별도의 sequencing datasets을 준비하는 방법보다 cost-efficient합니다. 이는 정식 경제성 평가가 아니라 데이터 확보상의 이점입니다.
- Phylogenetic discordance 분석—여러 분석은 incomplete lineage sorting(ILS)이 관찰된 불일치 대부분의 주요 원인임을 시사했고, 특정 clades에서는 introgression과 ancient introgression도 기여했을 가능성을 보였습니다.
결론
이 연구는 Read2Tree가 chloroplast genome analysis에 사용한 동일한 raw reads에서 conserved nuclear genes를 얻어 nuclear와 chloroplast phylogenies를 비교하고 incomplete lineage sorting (ILS) 및 introgression의 기여를 검토할 수 있음을 보였습니다. 일부 taxa의 위치는 여전히 불확실하므로 모든 branch를 확정한 연구는 아닙니다.
이 방법은 미래 식물 계통발생 연구에서 진화 역사를 보다 상세하고 신뢰할 수 있게 재구성하는 데 기여할 수 있는 잠재력을 가지고 있습니다.
식재료 연구에 대한 잠재적 활용
아래 내용은 검증된 phylogenetic workflow에서 추론한 잠재적 활용 가능성입니다. 이 논문은 품종개량, 풍미, 영양가 또는 병 저항성을 직접 시험하지 않았습니다.
예를 들어, 이 연구에 사용된 Aurantioideae와 같은 그룹에는 전 세계적으로 식품 및 의약 용도로 중요한 식물 종이 포함됩니다. 정확한 계통발생 관계와 잡종의 복잡한 진화 역사를 이해하는 것은 농업의 작물 개선과 미래의 식량원이 될 수 있는 귀중한 유전자 자원(예: 야생 친척)의 보존 및 활용에 매우 중요합니다.
Read2Tree를 사용하는 이 새로운 방법을 사용하면 동일한 데이터세트를 사용하여 엽록체와 핵 DNA 모두에서 정보를 효율적으로 검색할 수 있으므로 이전에는 분석하기 어려웠던 많은 식량 작물 종에 대한 보다 포괄적이고 상세한 계통발생 분석이 가능해졌습니다.
더욱이, 불완전 계통분류(ILS) 및 유전자이입과 같은 복잡한 유전 과정을 분석하는 능력은 높은 영양가, 특정 풍미, 해충 및 질병에 대한 저항성과 같은 식품 식물의 다양한 특성이 진화 역사 전반에 걸쳐 어떻게 획득되고 유지되었는지 유전적 수준에서 이해할 수 있는 기반을 제공합니다.
이처럼 이 방법은 식품으로 사용되는 식물의 다양성에 대한 이해를 심화하고, 품종 개량 및 지속 가능한 자원 활용을 위한 연구를 추진하는 데 중요한 기반을 제공한다고 할 수 있습니다.