可穿戴设备能够在人群规模上持续采集心率动态、睡眠模式等生理信号,但将这些信号转化为可靠的临床生物标志物仍是瓶颈。现有的语言模型智能体系统在处理生理时间序列数据时,往往侧重预测性能而忽视统计有效性,容易产生虚假相关和数据泄露。
为此,Google Research 推出了 Biomarker Discovery Framework。这是一个多智能体系统,将候选生物标志物的优先级排序设计为在人类监督下运行的迭代研究循环,结合假设生成、并行统计分析、模型训练、对抗性验证以及基于文献的推理来加速发现过程。
六阶段流水线与对抗性验证
该系统由一个 Orchestrator 智能体负责将自然语言研究指令分解为执行计划,并引导专用智能体完成六个阶段:
- 数据理解:Scout 智能体映射数据结构、缺失值、时间结构和临床终点,同时通过泄露控制确保目标标签与特征构建分离。
- 候选假设落地:Literature 和 Hypotheses 智能体检索并验证既有证据,提出具有生理学合理性的特征和复合指标。
- 迭代发现循环:Statistical 和 ML 智能体执行确定性代码以构建特征、估计关联、进行多重检验校正并评估预测信号;Critic 智能体负责识别薄弱假设和未解决的缺口。
- 对抗性验证:Critic 与 Defender 智能体对候选标志物进行压力测试,检查目标泄露、过拟合、混杂敏感性、构念重叠、不稳定性及生理学不合理性。一个包含 11 项检查的内部电池会为其分配 screened、conditional、exploratory、rejected 或 unstable 等报告标签。
- 深度研究与评估:Mechanism、Novelty 和 Strategy 智能体评估生物学合理性、既往文献和潜在转化价值,但不将关联视为因果证据。
- 报告撰写与组装:Report 智能体根据事实表核验数值主张,并将分析、图表、文献和局限性汇编成供专家审阅的草稿。
整个流程通过共享内存、结构化事实表和通用工具保持可追溯性,将用于数值分析的确定性计算与用于假设形成的生成式推理分离开来。
跨领域队列中的候选标志物发现
该框架被独立应用于三个大型队列(共 9279 个参与者观测),涵盖心理健康(DWB 和 GLOBEM)与代谢疾病(WEAR-ME)领域,自主识别出 41 项心理健康候选数字生物标志物和 25 项代谢结果候选标志物。
在心理健康领域,两个抑郁队列优先选出了同一“昼夜节律不稳定性”构念的不同操作化指标。在 DWB 数据集中,睡眠时长变异性与 PHQ-8 严重程度存在关联(ρ = 0.252,p < 0.001);在 GLOBEM 数据集中,入睡时间变异性作为探索性低信号关联出现(ρ = 0.126,p < 0.001;CV AUC = 0.535)。由于队列、终点和特征定义各不相同且没有完全相同的候选标志物被复制,这一模式被视为提示性的构念层面趋同,而非直接复制。
在代谢领域,该框架推导出一个心血管健康指数(步数除以静息心率)作为胰岛素抵抗的非侵入性相关指标。这些特征并非简单选取现有变量,而是构建了新的复合特征。将这些派生特征与人口统计学变量结合后,预测性能有所提升(抑郁症 ΔR² = 0.040,胰岛素抵抗 ΔR² = 0.021)。
专家盲评表现
来自医学、生物医学数据科学、机器学习、生物信息学和数字健康领域的 15 位专家,对该框架与另外三个 AI 研究系统(Google DeepMind 的 AI co-scientist、Biomni 和 Google ADK 的 Data Science Agent)生成的盲审报告进行了评估。
在该研究的模拟编辑评分标准下,Biomarker Discovery Framework 在全部七个质量维度上获得了最高平均分,也是唯一获得“Accept”或“Minor Revision”推荐的系统(2 项 Accept、8 项 Minor Revision、8 项 Major Revision、3 项 Reject)。审稿人估计平均会保留该系统生成稿件内容的 56.9%,而基线系统的保留比例为 18.8% 至 30.4%。在 13 次四系统排名会议中,该系统有 9 次位列第一。
该项目由 MIT 博士生 Yubin Kim 在 Google 实习期间主导推进,由 Daniel McDuff 和 Hamid Palangi 指导。
