国家生物信息中心合作建立T2T-YAO v2.0

近日,国家生物信息中心联合北京大学人民医院、中国食品药品检定研究院、临汾市中心医院及瑞士日内瓦大学等单位,在 The Innovation 发表题为“Approaching an error-free diploid human genome using a support-based validation framework”的研究论文。研究提出基于直接测序证据的基因组正确性验证框架,开发“充分比对支持”(Sufficient Alignment Support,SAS)方法,并进一步优化汉族中国人二倍体端粒到端粒参考基因组“唐尧”(T2T-YAO),构建T2T-YAO v2.0。

随着端粒到端粒(T2T)组装技术发展,着丝粒、大片段重复和近端着丝粒染色体短臂等复杂区域逐步被纳入完整基因组,但“组装完整”并不意味着“序列准确”。针对不同测序平台和评估方法在复杂区域常产生不一致信号的问题,研究团队提出从“寻找差异”转向“寻找证据”:将每条测序读段视为真实DNA分子的独立实验观测,以能否获得充分、连续且一致的读段支持来评价组装可信度。基于该原则,SAS整合ONT超长读长、PacBio HiFi(SPRQ)和Element高准确率测序数据,从结构和碱基层面对基因组进行逐窗口评价。模拟测试显示,SAS对多类模拟组装错误的检测F1值超过0.99。

团队以T2T-YAO v1.1为基础,综合Pore-C、ONT超长读长和高准确率测序数据开展SAS指导的多尺度迭代校正,并开发多平台整合窗口共识(PWC)校正方法,对SAS定义的缺乏支持区域进行精修。经过47轮校正,获得T2T-YAO v2.0。除当前技术仍难完全解析的rDNA阵列及348处长同聚物区域外,几乎所有非rDNA区域均获得充分独立测序证据支持。

团队随后采用k-mer、结构、覆盖度和碱基差异等多种相互独立的方法重新评估T2T-YAO v2.0。Merqury的21-mer质量值(QV)由67提升至76,31-mer QV由62提升至68;残余的“错误k-mer”来自HiFi和短读长测序偏倚无法覆盖的基因组区域,在集合中加入ONT来源k-mer后,检测不到错误的21-mer。但需要注意:重复区域中k-mer方法灵敏度有限,因此“零错误k-mer”不能等同于“绝对零错误基因组”。

在碱基层面,多种变异识别工具检出的高置信SNV类差异(GQ>20)从v1.1的63,398个降至v2.0的2,354个。大多数剩余信号来自同聚物区域;非同聚物相关差异仅38个,其中36个位于rDNA区域,另外2个经人工检查有充分读段支持。Pore-C数据进一步支持染色体尺度组织和单倍型分离。总体上,与国际常用的人类基准基因组HG002最新发布的组装版本 v1.1 相比,在多种相同评估框架下,T2T-YAO v2.0 的关键残余信号数量总体相当或更低,尤其是残余结构错误信号的数量和影响范围均明显更少。

研究还解析了大片段重复、着丝粒、近端着丝粒染色体短臂、多拷贝基因及长同聚物等复杂区域。与首个人类T2T基因组T2T-CHM13 v2.0(欧洲裔)相比,T2T-YAO v2.0在多拷贝基因扩增及重复区域结构上呈现出显著差异,进一步揭示了不同人群间复杂基因组区域的结构多样性。T2T-YAO v2.0为东亚人群复杂基因组研究提供了高可信二倍体参考,该研究框架未来还有望拓展应用于探索群体基因组、高重复植物、多倍体及复杂肿瘤基因组等研究。

国家生物信息中心楚亚男、黄濯、邵长君和临汾市中心医院郭淑明为共同第一作者;国家生物信息中心康禹研究员、北京大学人民医院高占成教授、中国食品药品检定研究院黄杰研究员和中国科学院大学于军研究员为共同通讯作者。研究得到国家重点研发计划、国家自然科学基金等项目支持。

基于测序证据的验证与分层校正助力构建近无错误的人类二倍体基因组


论文链接


附件下载: