在最近发表在《信号转导和靶向治疗》杂志上的一篇选择性综述中,作者探讨了人工智能 (AI) 如何支持跨疾病的生物标志物发现、验证、生物学解释、临床实用性和治疗整合。 背景一个有前途的生物标志物需要的不仅仅是强大的预测能力才能在患者护理中发挥作用。生物标志物可以帮助检测、分类和指导健康问题的治疗,但许多在早期研究中效果良好的候选物可能无法在独立队列中重现或改善临床决策。与此同时,生物标志物研究依赖于测量的组合,包括基因组、转录组、蛋白质组、代谢、成像、细胞、循环和数字。 人工智能可以整合这些数据并识别多元模式,但偏差、模糊性、数据异质性、过度拟合和弱外部验证可能会限制翻译。作者呼吁生物标志物具有可重复性、生物学相关性、临床适用性和前瞻性验证。 生物标志物数据的类型生物标志物的发现跨越多个领域,包括分子、细胞、循环、成像和数字生物标志物。在分子领域,研究人员使用基因组学、表观基因组学、转录组学和蛋白质组学等方法。 多组学策略整合了这些层,而单细胞和空间方法保留了细胞和组织背景。细胞生物标志物包括免疫激活、耗竭、代际变化、炎症程序和组织环境。中性粒细胞胞外陷阱将先天免疫激活与血管损伤、血栓形成和组织损伤联系起来。 循环生物标志物提供了一种评估疾病生物学的微创方法。无细胞脱氧核糖核酸 (cfDNA) 等信号,包括循环肿瘤 DNA、无细胞核糖核酸 (cfRNA)、蛋白质和代谢物,可以支持相关临床环境中的疾病检测和监测。它们的临床价值取决于分析前处理、分析灵敏度、肿瘤负荷、治疗时间和患者特征。 细胞外囊泡携带反映其细胞来源并促进细胞间通讯的分子信号,但分离方法、污染物、定量标准和实验室差异使其难以用作生物标志物。 成像生物标志物提供有关组织结构和功能的信息。放射组学和计算成像可识别计算机断层扫描、磁共振成像、正电子发射断层扫描和数字病理学的特征,但必须控制扫描仪、采集协议、分割和位点间对齐的差异。 来自可穿戴设备、智能手机和环境传感器的数字生物标记可以记录睡眠、运动、自主生理学和症状。设备异质性、数据不完整、行为混淆和社会经济偏见仍然令人担忧。 用于生物标志物发现的人工智能方法当数据集有很多变量但主题很少时,经典机器学习仍然有用。常规回归、支持向量机和树集成可以识别候选生物标志物,但泄漏、重新调整、基于结果的选择和不精确的解释可能会产生过于乐观的结果。 深度学习对于非线性和结构化数据(例如图像、数组和图形)非常有用。表示学习可以生成可重用的部署,而自学习可以将冗余数据用于需要在设置之间传输的任务。 多模态机器学习结合了图像、实验室测量、纵向临床数据和其他来源。转移研究可以使用大型电子健康记录集合来支持较小的配对组学和临床小组。 图神经网络可以对基因、蛋白质、通路、药物和表型之间的关系进行建模,并将生物结构纳入学习中。 在大型生物数据集上训练的基本模型可用于与组学、药物发现和生物分析相关的任务。这些模型还可以对批次、谱系或位点特异性信号进行编码,如果研究人员不控制它们,这些信号就会作为生物标志物出现。 生成的模型和模拟可以建议候选特征、分子状态、应激反应、途径假设和可能的机制。这些结果最初应被视为假设而不是证据。 候选者的进一步接受将需要内部一致性、外部复制、跨人群和平台的稳健性测试以及具有临床意义的实用性。解释性方法可以支持审计和透明度,但不能取代生物学验证或实验测试。 机械人工智能和临床翻译大多数人工智能衍生的生物标志物都是相关的:它们识别与结果相关的模式,但不确定这些模式发生的原因。此类标记物可能仍可用于风险分层,但当标记物用于指导治疗或定义治疗目标时,机制证据很重要。 机械人工智能结合了生物途径、网络、扰动数据或因果结构,将特征与疾病过程联系起来。路径受限模型可以对已知的信号关系进行编码,而来自集群短回文复制实验、药物反应测定和细胞因子刺激的扰动数据集可以帮助区分因果因素和下游相关性。 因果表征研究寻找在干预下保持稳定的特征,但观察数据仍然容易受到混杂因素和疾病随时间变化的影响。 […]