仪器设备
全部分类
产品分类
首页产品中心前沿应用选型指南问答与排查品牌专区

纳米孔长读长测序与 SAGA 泛基因组框架协同的人群规模结构变异发现与基因分型

Evan2026-09-01 16:46:08646 阅读

利用 Oxford Nanopore 长读长测序 1019 例人类样本,结合 SAGA 线性与图参考比对、图增强和 Giggles 基因分型框架,实现超十万个结构变异与三十万个 VNTR 的群体规模解析。

结构变异(SV)在人类遗传多样性与疾病中发挥重要作用,但在群体规模队列中的表征仍不充分。本研究对 1000 Genomes 计划中覆盖 26 个人群的 1019 例样本进行牛津纳米孔(ONT)长读长测序,构建了中等覆盖度资源,并整合线性参考基因组与图泛基因组分析,发现超过 10 万个序列解析的双等位 SV,并对 30 万个多等位可变数目串联重复(VNTR)进行基因分型。核心仪器与技术包括 ONT 测序平台、线性参考比对(GRCh38、CHM13)、图形参考比对(HPRC_mg)、SV 发现工具(Sniffles、DELLY、SVarp)、图增强流程(minigraph)、基因分型工具(Giggles)以及 VNTR 专用工具(vamos)。这些仪器与技术协同形成了从数据生成、变异发现、图增强到基因分型的完整证据链,最终构建了可供临床变异优先级排序参考的群体资源。

实验流程

实验环节仪器技术解决问题产生数据
DNA 质量检测Varioskan LUX 微孔板读数仪,DeNovix DS-11 分光光度计,Femto Pulse 系统评估 DNA 浓度与纯度,确认片段长度符合长读长测序要求DNA 浓度、260/280 比值、片段长度分布
片段筛选Circulomics Short Read Eliminator Kit去除小于 25 kb 的 DNA 片段,富集长片段≥25 kb 的 DNA 片段
长读长测序Oxford Nanopore PromethION 48,FLO-PRO002 流动槽产生长读长测序数据,覆盖 SV 断点与重复区域原始信号(FAST5)、碱基序列(FASTA)
碱基调用与接头去除Guppy v.6.2.1,Porechop v.0.2.4将原始信号转为序列并去除接头,提高数据质量高质量长读长序列
参考基因组比对minimap2,Minigraph将长读长比对至线性(GRCh38、CHM13)与图形(HPRC_mg)参考基因组线性比对(BAM/CRAM)、图形比对(GAF)
SV 发现(线性参考)Sniffles v.2.0.7,DELLY v.1.1.7利用线性参考识别缺失、插入等结构变异单样本与群体 VCF 文件
SV 发现(图形参考)SVarp发现线性参考中不存在的、但存在于图参考中的 SVSV 序列重叠群(svtigs)
图增强Minigraph,bcftools,自定义伪单倍型流程将新发现的 SV 整合进 HPRC_mg 图,构建增强泛基因组增强图(HPRC_mg_44+966)、新气泡(bubbles)
SV 基因分型与定相Giggles,SHAPEIT5,WhatsHap对增强图中的 SV 进行基因分型并统计定相基因分型与定相的 VCF 文件
质量评估与 HGSVC 组装比较、孟德尔一致性、Hardy-Weinberg 检验评估 SV 调用与基因分型的准确性和敏感性FDR、敏感性、一致性统计
VNTR 基因分型vamos对多等位 VNTR 进行群体规模基因分型VNTR 重复单元计数与等位基因长度
SV 注释与断点分析SVAN,BLAST,RepeatMasker对 SV 分类(如转座子插入、VNTR、重复介导等)并分析断点同源性SV 分类注释、断点同源性记录
倒位分析与基因分型NGMLR,DELLY,Sniffles,GeONTIpe识别倒位并基因分型,尤其是小倒位倒位调用与基因型
患者基因组分析PacBio HiFi 测序,PAV,Sniffles,DELLY利用构建的 SV 资源过滤患者基因组中的候选 SV候选 SV 缩减列表

关键环节

长读长测序数据生成

研究对 1019 例样本进行 ONT 测序,目标为中等覆盖度(中位 16.9×)和较长读长(中位 N50 20.3 kb)。测序前使用 Circulomics 试剂盒进行片段筛选,去除短片段,保证读长足以覆盖 SV 断点。使用 PromethION 平台和 FLO-PRO002 流动槽完成测序,并通过 Guppy 和 Porechop 进行碱基调用与接头去除。该环节产生高质量的 ONT 长读长序列,为后续 SV 发现提供了能够跨越重复区域和断点的数据基础。

线性与图形参考比对

为充分利用长读长信息,研究将 ONT 读长分别比对至线性参考(GRCh38 和 CHM13)与图形参考(HPRC_mg)。minimap2 用于线性参考比对,minigraph 用于图形参考比对。比较显示,HPRC_mg 和 CHM13 在比对一致性上优于 GRCh38,且 HPRC_mg 更全面覆盖了移动元件插入和缺失。这一环节解决了单一线性参考对变异表征不全的问题,为后续图形感知的 SV 发现提供了比对基础。

SV 发现

研究采用多种 SV 发现策略以互补不同方法的能力。Sniffles 和 DELLY 基于线性参考进行调用,平均每样本分别发现 15,301 和 21,529 个 SV。SVarp 则利用图形比对,针对线性参考中缺失的单倍型进行本地组装,构建 SV 序列重叠群(svtigs),平均每样本构建 1,145 个 svtigs。SVarp 的应用显著提高了对插入等复杂 SV 的发现能力,尤其是那些在参考基因组中不存在的等位基因。

图增强

为整合所有 SV 调用结果,研究开发了图增强流程,通过构建伪单倍型(将非重叠 SV 植入参考基因组)并使用 minigraph 工具将其整合到 HPRC_mg 图中。最终构建了 HPRC_mg_44+966 图,包含 220,168 个气泡,相比原图增加了 117,797 个新气泡。评估显示,将 HG00513 样本的 ONT 读长比对至增强图时,比对读数和碱基数显著增加,表明增强图更好地代表了群体中的 SV 多样性。

SV 基因分型与定相

基因分型是群体遗传分析的前提。研究使用 Giggles 工具对增强图进行基因分型,得到 167,291 个主要 SV 位点的基因型,并通过 SHAPEIT5 进行统计定相,最终 164,571 个 SV 位点成功定相。基因分型与定相数据支持后续等位基因频率分析和单倍型结构研究。质量评估显示,与 HGSVC 组装比较,删除和插入的 FDR 分别为 15.55% 和 15.89%,且对大于 250 bp 的 SV 错误率更低;与短读长基因分型相比,一致性达 98.7%(删除)和 96.8%(插入),验证了基因分型的准确性。

技术协同

关系类型涉及仪器/技术关系说明
流程互补ONT 测序 → 线性参考比对 → Sniffles/DELLY长读长数据提供跨断点读长,线性参考比对明确基因组位置,SV 调用工具识别变异位点与类型。
互补增强图形参考比对 → SVarp → 图增强SVarp 发现线性参考缺失的单倍型变异,图增强将其整合进泛基因组,扩展变异表征范围。
验证支撑Giggles 基因分型 → 质量评估(HGSVC 比较、孟德尔一致性)基因分型结果通过多平台组装比较和家系一致性验证,确保数据可靠性。
扩展应用SVAN 注释 → 断点分析 → 患者基因组过滤SV 注释分类与断点同源性分析揭示变异形成机制,为临床变异优先级排序提供过滤依据。

研究组合

研究目标可参考仪器组合组合价值
群体规模 SV 发现与基因分型ONT 测序 + minimap2/minigraph + Sniffles/DELLY + SVarp + minigraph 图增强 + Giggles整合线性与图形参考,全面提升各类 SV(尤其是插入和复杂位点)的发现与分型能力,适用于大规模人群队列。
VNTR 精细基因分型ONT 测序 + vamos针对多等位 VNTR,提供群体规模精准重复单元计数,补充图结构分型的不足。
倒位发现与分型ONT 测序 + 高错配区域识别 + NGMLR 重比对 + DELLY/Sniffles + GeONTIpe借助长读长和局部重比对策略,提高倒位检测灵敏度,实现群体规模基因分型。
临床变异优先级排序PacBio HiFi 测序 + PAV/Sniffles + DELLY-pg + 本资源 SV 频率过滤利用群体等位频率过滤患者基因组中常见多态性,显著减少候选致病 SV 数量,同时保留罕见致病位点。

上述组合的适用前提是需要有足够的测序深度或读长以覆盖 SV 区域,且需考虑计算资源与算法对大规模数据的处理能力。例如,SVarp 的应用依赖于短读长数据辅助单倍型标记,并非所有场景都适用;图增强流程对参考图的选择和伪单倍型的构建要求较高。在类似研究中,可以参考上述组合但需根据样本特性、测序平台和研究目标进行调整。

文献信息

Schloissnig S, Pani S, Ebler J, et al. Structural variation in 1,019 diverse humans based on long-read sequencing. Nature, 2025. DOI: 10.1038/s41586-025-09290-7. PMID: 40702182.