作者
通讯作者
《分子植物育种》网络版, 2026 年, 第 24卷, 第 1 篇
收稿日期: 2026年05月20日 接受日期: 2026年06月23日 发表日期: 2026年06月29日
方宣钧, 2026, SNP遗传力并非参数,而是由模型定义的统计对象——基于UK Biobank的实证分析, 分子植物育种, 24(1): 37-49 (10.5376/mpb.2026.24.0003) (Fang X.J., 2026, SNP-based heritability is not a parameter but a model-defined estimand: evidence from UK biobank, Fenzi Zhiwu Yuzhong (Molecular Plant Breeding), 24(1): 37-49 (doi: 10.5376/mpb.2026.24.0003))
SNP遗传力通常被视为复杂性状的基本遗传属性,但不同方法之间的估计结果却存在显著差异。本文表明,这种差异的根本原因在于不同方法估计的并非同一统计对象:SNP遗传力本质上是一个由模型定义的统计对象(estimand),而非单一的生物学参数。基于UK Biobank身高性状数据,我们系统比较了个体数据方法(GCTA–GREML及其扩展)与基于汇总统计量的方法(LDSC与SumHer)的估计结果。结果显示,GREML类方法给出较高估计(约0.60–0.69),LDSC方法系统性偏低(约0.56),而SumHer方法则介于两者之间或略高(约0.63)。在统一样本与SNP集合条件下,这些差异仍然存在,表明其并非由抽样误差所致。进一步分析表明,这些差异源于数据表示方式、模型假设以及对连锁不平衡(LD)和等位基因频率的处理差异。具体而言,不同方法对应不同的统计对象:GREML估计基于基因组关系的遗传方差,LDSC估计LD加权的边际效应方差,而SumHer则刻画依赖于MAF和LD结构的遗传架构。该框架统一解释了不同方法之间的系统性差异,并表明在未统一模型假设的情况下,跨方法比较SNP遗传力在统计上通常不成立。更广泛地,本文将SNP遗传力重新定义为依赖于SNP覆盖、LD结构及估计框架的模型函数。本研究为遗传力结果的正确解释提供了理论基础,并对生物库数据分析及基因组预测研究具有重要意义。