结构变异(SV)在人类遗传多样性与疾病中发挥重要作用,但在群体规模队列中的表征仍不充分。本研究对 1000 Genomes 计划中覆盖 26 个人群的 1019 例样本进行牛津纳米孔(ONT)长读长测序,构建了中等覆盖度资源,并整合线性参考基因组与图泛基因组分析,发现超过 10 万个序列解析的双等位 SV,并对 30 万个多等位可变数目串联重复(VNTR)进行基因分型。核心仪器与技术包括 ONT 测序平台、线性参考比对(GRCh38、CHM13)、图形参考比对(HPRC_mg)、SV 发现工具(Sniffles、DELLY、SVarp)、图增强流程(minigraph)、基因分型工具(Giggles)以及 VNTR 专用工具(vamos)。这些仪器与技术协同形成了从数据生成、变异发现、图增强到基因分型的完整证据链,最终构建了可供临床变异优先级排序参考的群体资源。
实验流程
| 实验环节 | 仪器技术 | 解决问题 | 产生数据 |
|---|---|---|---|
| DNA 质量检测 | Varioskan LUX 微孔板读数仪,DeNovix DS-11 分光光度计,Femto Pulse 系统 | 评估 DNA 浓度与纯度,确认片段长度符合长读长测序要求 | DNA 浓度、260/280 比值、片段长度分布 |
| 片段筛选 | Circulomics Short Read Eliminator Kit | 去除小于 25 kb 的 DNA 片段,富集长片段 | ≥25 kb 的 DNA 片段 |
| 长读长测序 | Oxford Nanopore PromethION 48,FLO-PRO002 流动槽 | 产生长读长测序数据,覆盖 SV 断点与重复区域 | 原始信号(FAST5)、碱基序列(FASTA) |
| 碱基调用与接头去除 | Guppy v.6.2.1,Porechop v.0.2.4 | 将原始信号转为序列并去除接头,提高数据质量 | 高质量长读长序列 |
| 参考基因组比对 | minimap2,Minigraph | 将长读长比对至线性(GRCh38、CHM13)与图形(HPRC_mg)参考基因组 | 线性比对(BAM/CRAM)、图形比对(GAF) |
| SV 发现(线性参考) | Sniffles v.2.0.7,DELLY v.1.1.7 | 利用线性参考识别缺失、插入等结构变异 | 单样本与群体 VCF 文件 |
| SV 发现(图形参考) | SVarp | 发现线性参考中不存在的、但存在于图参考中的 SV | SV 序列重叠群(svtigs) |
| 图增强 | Minigraph,bcftools,自定义伪单倍型流程 | 将新发现的 SV 整合进 HPRC_mg 图,构建增强泛基因组 | 增强图(HPRC_mg_44+966)、新气泡(bubbles) |
| SV 基因分型与定相 | Giggles,SHAPEIT5,WhatsHap | 对增强图中的 SV 进行基因分型并统计定相 | 基因分型与定相的 VCF 文件 |
| 质量评估 | 与 HGSVC 组装比较、孟德尔一致性、Hardy-Weinberg 检验 | 评估 SV 调用与基因分型的准确性和敏感性 | FDR、敏感性、一致性统计 |
| VNTR 基因分型 | vamos | 对多等位 VNTR 进行群体规模基因分型 | VNTR 重复单元计数与等位基因长度 |
| SV 注释与断点分析 | SVAN,BLAST,RepeatMasker | 对 SV 分类(如转座子插入、VNTR、重复介导等)并分析断点同源性 | SV 分类注释、断点同源性记录 |
| 倒位分析与基因分型 | NGMLR,DELLY,Sniffles,GeONTIpe | 识别倒位并基因分型,尤其是小倒位 | 倒位调用与基因型 |
| 患者基因组分析 | PacBio HiFi 测序,PAV,Sniffles,DELLY | 利用构建的 SV 资源过滤患者基因组中的候选 SV | 候选 SV 缩减列表 |
关键环节
长读长测序数据生成
研究对 1019 例样本进行 ONT 测序,目标为中等覆盖度(中位 16.9×)和较长读长(中位 N50 20.3 kb)。测序前使用 Circulomics 试剂盒进行片段筛选,去除短片段,保证读长足以覆盖 SV 断点。使用 PromethION 平台和 FLO-PRO002 流动槽完成测序,并通过 Guppy 和 Porechop 进行碱基调用与接头去除。该环节产生高质量的 ONT 长读长序列,为后续 SV 发现提供了能够跨越重复区域和断点的数据基础。
线性与图形参考比对
为充分利用长读长信息,研究将 ONT 读长分别比对至线性参考(GRCh38 和 CHM13)与图形参考(HPRC_mg)。minimap2 用于线性参考比对,minigraph 用于图形参考比对。比较显示,HPRC_mg 和 CHM13 在比对一致性上优于 GRCh38,且 HPRC_mg 更全面覆盖了移动元件插入和缺失。这一环节解决了单一线性参考对变异表征不全的问题,为后续图形感知的 SV 发现提供了比对基础。
SV 发现
研究采用多种 SV 发现策略以互补不同方法的能力。Sniffles 和 DELLY 基于线性参考进行调用,平均每样本分别发现 15,301 和 21,529 个 SV。SVarp 则利用图形比对,针对线性参考中缺失的单倍型进行本地组装,构建 SV 序列重叠群(svtigs),平均每样本构建 1,145 个 svtigs。SVarp 的应用显著提高了对插入等复杂 SV 的发现能力,尤其是那些在参考基因组中不存在的等位基因。
图增强
为整合所有 SV 调用结果,研究开发了图增强流程,通过构建伪单倍型(将非重叠 SV 植入参考基因组)并使用 minigraph 工具将其整合到 HPRC_mg 图中。最终构建了 HPRC_mg_44+966 图,包含 220,168 个气泡,相比原图增加了 117,797 个新气泡。评估显示,将 HG00513 样本的 ONT 读长比对至增强图时,比对读数和碱基数显著增加,表明增强图更好地代表了群体中的 SV 多样性。
SV 基因分型与定相
基因分型是群体遗传分析的前提。研究使用 Giggles 工具对增强图进行基因分型,得到 167,291 个主要 SV 位点的基因型,并通过 SHAPEIT5 进行统计定相,最终 164,571 个 SV 位点成功定相。基因分型与定相数据支持后续等位基因频率分析和单倍型结构研究。质量评估显示,与 HGSVC 组装比较,删除和插入的 FDR 分别为 15.55% 和 15.89%,且对大于 250 bp 的 SV 错误率更低;与短读长基因分型相比,一致性达 98.7%(删除)和 96.8%(插入),验证了基因分型的准确性。
技术协同
| 关系类型 | 涉及仪器/技术 | 关系说明 |
|---|---|---|
| 流程互补 | ONT 测序 → 线性参考比对 → Sniffles/DELLY | 长读长数据提供跨断点读长,线性参考比对明确基因组位置,SV 调用工具识别变异位点与类型。 |
| 互补增强 | 图形参考比对 → SVarp → 图增强 | SVarp 发现线性参考缺失的单倍型变异,图增强将其整合进泛基因组,扩展变异表征范围。 |
| 验证支撑 | Giggles 基因分型 → 质量评估(HGSVC 比较、孟德尔一致性) | 基因分型结果通过多平台组装比较和家系一致性验证,确保数据可靠性。 |
| 扩展应用 | SVAN 注释 → 断点分析 → 患者基因组过滤 | SV 注释分类与断点同源性分析揭示变异形成机制,为临床变异优先级排序提供过滤依据。 |
研究组合
| 研究目标 | 可参考仪器组合 | 组合价值 |
|---|---|---|
| 群体规模 SV 发现与基因分型 | ONT 测序 + minimap2/minigraph + Sniffles/DELLY + SVarp + minigraph 图增强 + Giggles | 整合线性与图形参考,全面提升各类 SV(尤其是插入和复杂位点)的发现与分型能力,适用于大规模人群队列。 |
| VNTR 精细基因分型 | ONT 测序 + vamos | 针对多等位 VNTR,提供群体规模精准重复单元计数,补充图结构分型的不足。 |
| 倒位发现与分型 | ONT 测序 + 高错配区域识别 + NGMLR 重比对 + DELLY/Sniffles + GeONTIpe | 借助长读长和局部重比对策略,提高倒位检测灵敏度,实现群体规模基因分型。 |
| 临床变异优先级排序 | PacBio HiFi 测序 + PAV/Sniffles + DELLY-pg + 本资源 SV 频率过滤 | 利用群体等位频率过滤患者基因组中常见多态性,显著减少候选致病 SV 数量,同时保留罕见致病位点。 |
上述组合的适用前提是需要有足够的测序深度或读长以覆盖 SV 区域,且需考虑计算资源与算法对大规模数据的处理能力。例如,SVarp 的应用依赖于短读长数据辅助单倍型标记,并非所有场景都适用;图增强流程对参考图的选择和伪单倍型的构建要求较高。在类似研究中,可以参考上述组合但需根据样本特性、测序平台和研究目标进行调整。
文献信息
Schloissnig S, Pani S, Ebler J, et al. Structural variation in 1,019 diverse humans based on long-read sequencing. Nature, 2025. DOI: 10.1038/s41586-025-09290-7. PMID: 40702182.