种子含油量是甘蓝型油菜的重要农艺性状,自然群体中其遗传基础复杂,常规QTL定位往往只能解析有限位点。该研究基于388份甘蓝型油菜自交系自然群体,采用广泛靶向代谢组学策略,通过液相色谱质谱联用技术定量成熟种子中的代谢物,获得2172种代谢物,并筛选出与含油量相关的标记代谢物。随后以这些标记代谢物为切入点,联合代谢物全基因组关联分析、代谢物转录组关联分析、eQTL分析和加权基因共表达网络分析构建多组学关系网络,预测并验证了BnaTT4与BnaC05.UK等候选基因的功能。研究展示了从代谢物检测、关联定位、网络分析到基因编辑验证的完整技术路线,其中液相色谱质谱联用承担了核心的代谢物筛选功能。
实验整体流程可概括为:先由液相色谱质谱联用定量代谢物并筛选含油量标记代谢物;再结合群体重测序数据和种子发育时期转录组,通过mGWAS和mTWAS定位与代谢物显著关联的遗传位点及基因;进一步利用eQTL和WGCNA构建代谢物-位点-基因三元网络,缩小候选基因范围;最后使用CRISPR/Cas9基因编辑敲除候选基因并测定含油量、代谢物含量、RNA-seq等变化验证基因功能。各环节数据互为支撑,形成从代谢表型到遗传变异再到基因功能的证据链。
实验流程
| 实验环节 | 仪器/技术 | 解决问题 | 产生数据 |
|---|---|---|---|
| 种子代谢物提取与定量 | 液相色谱-电喷雾电离串联质谱(LC-ESI-MS/MS,QTRAP 4000),样品经组织研磨仪破碎后采用70%甲醇提取 | 大规模定量成熟种子代谢物,为筛选含油量相关代谢物提供数据基础 | 两年共2172种代谢物相对含量数据(388份材料) |
| 代谢物注释与标准谱库构建 | QTRAP 4000(线性离子阱模式)建立MS2谱标签库,Agilent 6520 Q-TOF获取精确质量数,参考MassBank、HMDB、METLIN等谱库注释 | 鉴定代谢物身份,明确类黄酮、脂质等代谢物类别,为筛选标记代谢物提供结构信息 | MS2T谱库、已注释代谢物列表(含45种含油量相关代谢物) |
| 含油量表型测定 | Foss NIRSystems 5000近红外光谱仪及气相色谱质谱联用(GCMS-QP2010 Ultra) | 获取群体含油量表型,用于筛选与含油量相关的标记代谢物 | 每个品系6次重复的含油量数据(用于NIRS),脂肪酸组成数据(用于GC-MS验证) |
| 标记代谢物筛选及相关分析 | Pearson相关分析(数据工具),部分代谢物进行超几何检验 | 确定与含油量显著相关的代谢物(|r|> 0.2),缩小关联分析的代谢物数量 | 131种含油量相关标记代谢物,其中105种负相关,30种类黄酮、4种脂质等注释结果 |
| mGWAS分析 | 基于群体重测序数据(已发表的变异数据),使用FaST-LMM软件进行全基因组关联分析 | 定位与标记代谢物相关的遗传位点(mQTL),揭示代谢物的遗传结构 | 1318个变异-代谢物关联,聚为445个mQTL(两年合并) |
| 转录组分析及mTWAS | 基于群体转录组数据(40 DAF种子,已发表),采用线性回归进行代谢物转录组关联分析 | 鉴定与标记代谢物表达显著关联的基因,直接连接基因与代谢物 | 7316个与标记代谢物显著关联的基因(p < 1.41×10⁻⁵) |
| eQTL分析 | 利用转录组数据与变异数据进行关联分析,采用PLINK进行变异筛选 | 解释基因表达差异的遗传原因,识别调控基因表达的位点(eQTL) | 5242个eQTL(包含cis和trans),部分eQTL热点关联多个基因 |
| 加权共表达网络分析(WGCNA) | WGCNA R包,软阈值β=6 | 聚类共表达模块,找到与含油量及标记代谢物显著相关的模块,为网络分析提供模块信息 | 139个共表达模块,其中模块15、17等与含油量显著相关 |
| 三元网络构建与候选基因预测 | 整合mQTL、eQTL、共表达模块(网络数据整合),结合基因功能注释 | 系统展示代谢物-位点-基因关系,筛选影响含油量的候选基因 | 包含4384个节点、21000条边的网络,240个候选基因(如BnaA03.TT4、BnaC02.TT4、BnaC05.UK) |
| 候选基因功能验证 | CRISPR/Cas9基因编辑技术,利用pKSE401载体进行甘蓝型油菜遗传转化 | 验证预测候选基因对含油量及代谢物变化的因果作用 | 突变体含油量、种子颜色、代谢物含量、千粒重等表型数据 |
| 突变体代谢物分析及转录组分析 | 同上述LC-MS/MS代谢组学方法;RNA-seq技术 | 分析突变体代谢物变化和差异表达基因,揭示基因影响的生物学通路 | 突变体差异代谢物列表(如儿茶素、柚皮素含量下降),差异表达基因及GO富集结果 |
| 亚细胞定位与种子种皮黏液分析 | 共聚焦激光扫描显微镜(FV1200)、光学显微镜(BX53M)、农杆菌介导的烟草瞬时表达 | 确认基因编码蛋白的亚细胞定位,与表型联系解释基因可能的作用机制 | BnaC05.UK定位于叶绿体,突变体种皮黏液渗漏增多 |
关键环节
代谢物定量与标记代谢物筛选
研究采用QTRAP 4000液相色谱质谱联用系统进行广泛靶向代谢组学分析。代谢物提取使用70%甲醇溶液,样品经组织研磨仪粉碎,提取液经过滤后进行LC-MS/MS检测。量化采用计划多反应监测(scheduled MRM)模式,可同时对2173种代谢物进行相对定量。仪器的高灵敏度、高选择性和高通量为自然群体中大量样本的代谢组分析提供了稳定平台。获得代谢物含量数据后,作者计算每个代谢物与含油量的Pearson相关系数,筛选出131种显著相关代谢物,作为后续关联分析的表型。筛选出的代谢物中类黄酮类占比较高,且大部分与含油量负相关。超几何检验显示类黄酮家族与含油量的相关性显著,排除了随机性,这为聚焦类黄酮途径提供了统计支持。
mGWAS位点定位与标记代谢物的遗传解析
mGWAS利用群体重测序的变异数据(每个年份约8.27百万个变异)与标记代谢物含量进行关联分析。使用FaST-LMM软件执行混合线性模型以控制群体结构和亲缘关系。以Bonferroni校正阈值(p = 1.2×10⁻⁷)确立显著关联,最终检测到445个mQTL。其中数个mQTL(如染色体A03、C05)含多个代谢物,且与以往研究中含油量QTL共定位,这种共定位直接连接了代谢物与含油量性状。
转录组整合与候选基因预测
作者将40 DAF(花后40天)种子的转录组数据(已发表的基因表达数据)与代谢物含量进行关联分析,提出mTWAS方法。mTWAS利用基因表达量作为中介,比mGWAS更能直接反映基因与代谢物的关联。通过WGCNA将mTWAS显著基因聚类到模块中,例如模块15中包含BnaTT4同源基因并富集类黄酮和长链脂肪酸代谢途径。eQTL分析进一步揭示了调控这些基因表达的遗传变异。综合mQTL和eQTL共定位以及共表达模块,构建包含21000个边和4384个节点的三元网络。作者从网络中优先选择关键枢纽基因或无注释功能的基因进行功能验证。
CRISPR/Cas9基因功能验证
基于多组学预测,作者选定BnaTT4(类黄酮合成关键酶)和BnaC05.UK(未知功能基因)进行基因编辑验证。利用CRISPR/Cas9系统构建载体,通过农杆菌介导转化甘蓝型油菜,获得T2纯合突变体。BnaTT4突变体种子出现黄色种皮表型,含油量提高5.6%(L53)和4.8%(L68);突变体种子中查尔酮、柚皮素、儿茶素等类黄酮显著下降,而脂肪酸合成增强。BnaC05.UK突变体含油量增加2.6%(L1)和3.1%(L5),类黄酮含量降低,并影响果胶和叶绿体RNA加工相关基因表达。这些结果直接验证了网络预测的因果性,并解释了代谢物与含油量的关联机制。
技术协同
| 关系类型 | 涉及仪器/技术 | 关系说明 |
|---|---|---|
| 数据获取-表型支撑 | LC-MS/MS代谢组学、近红外光谱仪、GC-MS脂肪酸分析 | LC-MS/MS定量代谢物作为中间表型,近红外光谱获得含油量表型,GC-MS用于脂肪酸组成验证,共同支撑含油量相关代谢物的筛选。 |
| 关联定位-网络整合 | mGWAS(基于变异的关联)、mTWAS(基于表达)、eQTL(表达与变异关联)、WGCNA(共表达模块) | mGWAS将代谢物与变异关联,mTWAS将基因与代谢物关联,eQTL建立变异与基因表达的关联,三者通过位点共定位和模块归属连接成三元网络,缩小候选基因。 |
| 功能验证-机制解释 | CRISPR/Cas9基因编辑、LC-MS/MS代谢物定量、RNA-seq | CRISPR突变体用于表型确认,LC-MS/MS检测突变体代谢物变化,RNA-seq分析差异表达基因,三者共同确认候选基因的功能及其影响的代谢和发育通路。 |
| 亚细胞定位-表型解释 | 共聚焦显微镜、光学显微镜 | 亚细胞定位补充基因作用位置信息,结合突变体种皮黏液染色表型帮助解释基因可能的生物学功能。 |
研究组合
| 研究目标 | 可参考仪器组合 | 组合价值 |
|---|---|---|
| 代谢组筛选与标记代谢物驱动关联分析 | LC-MS/MS(广泛靶向代谢组)+高密度基因分型数据+转录组测序 | LC-MS/MS提供大规模代谢物定量数据,结合群体基因型和表达谱,可高效开展mGWAS、mTWAS和eQTL分析,尤其适用于复杂农艺性状的遗传解析。需要样本量足够且群体结构合理,以提高统计效力。 |
| 构建多组学关系网络并候选基因排序 | mGWAS输出mQTL+mTWAS输出基因-代谢物关联+eQTL网络+WGCNA共表达模块;数据整合后使用网络可视化软件(如Cytoscape) | 将遗传变异与多个层次的分子表型连接,可在不进行全基因组功能筛选的情况下优先候选基因,适合挖掘常规差异分析遗漏的未知基因。需要注意共定位标准(如100 kb)可能导致假阳性,需后续功能验证。 |
| 候选基因功能验证与机制分析 | CRISPR/Cas9基因编辑+LC-MS/MS(代谢物检测)+RNA-seq(转录组);如果需要定位亚细胞位置,可增加荧光显微镜和瞬时表达系统 | 该组合用于确认基因对性状的因果作用,并解释代谢物变化和基因调控网络差异。适用于模式作物或易转化作物,需要谨慎评估转化成本和脱靶影响。当候选基因功能未知,且缺少较强功能注释时,可用转录组差异和代谢物变化做反向推断。 |
该研究中的仪器与技术组合对于解析复杂农艺性状的遗传基础具有参考价值,尤其适合已有自然群体和组学数据的作物研究。值得注意的是,代谢组数据质量受提取方法和LC-MS/MS稳定性影响,跨批次检测时应使用内标和统一条件。对于候选基因筛选标准,可以结合多个证据来源增加可靠性,其中功能验证实验是必要一环。
文献信息
文献标题:Characterization of novel loci controlling seed oil content in Brassica napus by marker metabolite-based multi-omics analysis
作者:Long Li, Zhitao Tian, Jie Chen, Zengdong Tan, Yuting Zhang, Hu Zhao, Xiaowei Wu, Xuan Yao, Weiwei Wen, Wei Chen, Liang Guo
期刊:Genome Biology,2023年,DOI:10.1186/s13059-023-02984-z
PMID:37337206
数据可用性:基因组重测序数据和转录组数据可在GSA获取,代谢组数据存放于国家生物信息中心。