多基因风险评分(PRS)通过整合数百至数百万个遗传变异来预测疾病风险,但其临床应用受限于历史全基因组关联研究(GWAS)高度集中于欧洲人群的问题。跨人群的遗传结构、群体结构和等位基因频率差异会导致模型在非欧洲人群中准确率大幅下降,而为每个目标人群重新开展数十万人规模的 GWAS 成本过高。从现有欧洲中心 GWAS 进行迁移学习,并用目标人群特异性数据加以补充,成为一种可行路径。
据 Google Research 介绍,其研究团队系统评估了在八项临床性状上,不同规模的欧洲与目标人群样本组合对 PRS 性能的影响。实验以英国生物样本库(UKB)中数十万欧洲个体作为发现集,以近 20 万名日本个体组成的日本生物样本库(BBJ)作为目标验证集。
三种迁移策略与八项评估性状
研究选取了两组人群共同测量的八项临床性状:身体质量指数(BMI)、收缩压、舒张压、红细胞计数、白细胞计数、高密度脂蛋白胆固醇(HDL)、低密度脂蛋白胆固醇(LDL)和血糖。在 UKB 中,这些性状的单核苷酸多态性遗传力估计值介于 0.07 至 0.28 之间。
团队使用了三种方法评估 PRS 的可迁移性:
- UKB 发现 GWAS + 弹性网络:先在 UKB 全量欧洲人群中运行 GWAS,筛选出同时存在于 BBJ 中的独立变异,再在不同规模的 BBJ 与 UKB 样本组合上训练弹性网络模型。每个性状产生了 96 至 104 个 PRS 模型,用于探索变异的直接可迁移性。
- Meta 分析 + 弹性网络:分别对 UKB 全量人群和抽样的 BBJ 人群运行 GWAS,通过 Meta 分析合并遗传关联后生成变异集,再在混合数据集上训练弹性网络,以考察在变异发现阶段混入目标人群数据的效果。
- PRS-CSx:应用专为处理跨人群连锁不平衡差异设计的 PRS-CSx 模型,在全量 UKB 和抽样 BBJ 样本上运行,并在验证集中寻找两个群体评分的最优线性组合。
所有模型的最终评估均在同一批预留的 BBJ 样本上进行,以 Pearson 相关系数衡量性能。
更多数据并不总是更好
实验结果显示,当目标人群数据有限或完全缺失时,欧洲发现数据能提供有效的基线支撑。但当 BBJ 样本量达到约 1.5 万后,仅使用目标人群数据的模型开始优于混合训练模型——与外部欧洲数据联合训练反而限制了目标人群随样本量增加所能获得的精度提升。这一现象在所有被评估的表型中均成立。
具体拐点取决于性状的跨人群遗传相关性。对于 BMI 等遗传上较为“保守”的性状,两人群间遗传相关性较高,合并 UKB 数据的优势可延续至目标样本量达 2.5 万至 4 万以上。而 HDL、LDL 和血糖等高度人群特异性的性状,由于 UKB 数据偏离目标分布更远,其受益窗口明显更短,最优 UKB 样本规模也更小。
Meta 分析与 PRS-CSx 的适用边界
前一类实验仅使用在 UKB 中发现的变异,排除了 BBJ 独有的关联位点。为覆盖这些变异,研究引入了 Meta 分析和 PRS-CSx 两种扩展方法。
Meta 分析在保守性状上的增益较低,主要因为较小规模的 BBJ GWAS 统计效力不足。但对于 HDL、LDL 及血糖等人群特异性性状,Meta 分析显著优于单人群发现方案。其收益主要来自对弹性网络输入变异的调整:在 BBJ 样本不超过 1 万时,训练中纳入 UKB 欧洲样本可略微改善预测,但这一改善在更大样本量下不再出现。
PRS-CSx 能够动态加权各人群特异性模型,理论上对保守或特异性性状的敏感度更低。然而该模型需要更多数据才能发挥优势:在目标样本低于 2.5 万时,除 BMI 外,PRS-CSx 在所有性状上均不及最强的弹性网络模型;当样本量接近 10 万时,除血糖外,PRS-CSx 在所有性状上追平或超越了最佳模型。
这项研究表明,优化非欧洲人群的基因组预测不能简单依赖扩大外部数据规模,而需要根据目标样本量和性状的遗传特性选择建模策略。
