作者
通讯作者
计算分子生物学, 2026 年, 第 15卷, 第 1 篇
收稿日期: 2026年08月23日 接受日期: 2026年09月15日 发表日期: 2026年09月25日
方宣钧, 2026, 统计遗传学中的机器学习:从表征学习到因果推断的统一框架, 计算分子生物学, 15(1): 30-41 (10.5376/cmb.2026.15.0003) (Fang X.J., 2026, Machine learning in statistical genetics: a unified framework from representation learning to causal inference, Jisuan Fenzi Shengwuxue (Computational Molecular Biology), 15(1): 30-41 (doi: 10.5376/cmb.2026.15.0003))
复杂性状的遗传解析正面临由高维数据、非线性结构与多模态信息共同驱动的范式转变。传统统计遗传学方法以线性混合模型(LMM)为核心,在群体结构校正、效应估计与因果推断方面具有稳健优势,但在捕捉高阶交互与复杂调控结构方面存在局限。与此同时,机器学习与人工智能(ML/AI)方法通过表征学习与非线性建模,在大规模基因组与多组学数据中展现出显著的预测性能优势,但其结果多停留于关联层面,且在可解释性与可迁移性方面面临挑战。本研究从方法论层面系统重构统计遗传学与ML/AI的关系,提出一个统一的分析框架:以ML/AI作为表征学习层(representation layer),用于压缩高维信号并提取潜在结构;以统计遗传学方法作为推断层(inference layer),实现效应估计与假设检验;最终在因果推断框架下整合两者,构建“预测—表征—推断—因果”的闭环路径。在此基础上,进一步讨论了解释稳定性与结果可迁移性作为ML/AI应用的关键约束,并分析了结构先验(如调控网络与因果图)在缓解表观相关与推进因果识别中的作用。研究表明,ML/AI的核心价值不在于替代传统统计模型,而在于提升复杂遗传信号的表征能力;而统计遗传学方法则在确保推断可检验性与结果可靠性方面不可替代。未来的发展方向应聚焦于结构约束下的模型融合,以及标准化基准数据与评价体系的建立,从而推动复杂性状研究从关联分析迈向因果理解,并实现预测性能与生物学解释的统一。