在最近发表在《信号转导和靶向治疗》杂志上的一篇选择性综述中,作者探讨了人工智能 (AI) 如何支持跨疾病的生物标志物发现、验证、生物学解释、临床实用性和治疗整合。
背景
一个有前途的生物标志物需要的不仅仅是强大的预测能力才能在患者护理中发挥作用。生物标志物可以帮助检测、分类和指导健康问题的治疗,但许多在早期研究中效果良好的候选物可能无法在独立队列中重现或改善临床决策。与此同时,生物标志物研究依赖于测量的组合,包括基因组、转录组、蛋白质组、代谢、成像、细胞、循环和数字。
人工智能可以整合这些数据并识别多元模式,但偏差、模糊性、数据异质性、过度拟合和弱外部验证可能会限制翻译。作者呼吁生物标志物具有可重复性、生物学相关性、临床适用性和前瞻性验证。
生物标志物数据的类型
生物标志物的发现跨越多个领域,包括分子、细胞、循环、成像和数字生物标志物。在分子领域,研究人员使用基因组学、表观基因组学、转录组学和蛋白质组学等方法。
多组学策略整合了这些层,而单细胞和空间方法保留了细胞和组织背景。细胞生物标志物包括免疫激活、耗竭、代际变化、炎症程序和组织环境。中性粒细胞胞外陷阱将先天免疫激活与血管损伤、血栓形成和组织损伤联系起来。
循环生物标志物提供了一种评估疾病生物学的微创方法。无细胞脱氧核糖核酸 (cfDNA) 等信号,包括循环肿瘤 DNA、无细胞核糖核酸 (cfRNA)、蛋白质和代谢物,可以支持相关临床环境中的疾病检测和监测。它们的临床价值取决于分析前处理、分析灵敏度、肿瘤负荷、治疗时间和患者特征。
细胞外囊泡携带反映其细胞来源并促进细胞间通讯的分子信号,但分离方法、污染物、定量标准和实验室差异使其难以用作生物标志物。
成像生物标志物提供有关组织结构和功能的信息。放射组学和计算成像可识别计算机断层扫描、磁共振成像、正电子发射断层扫描和数字病理学的特征,但必须控制扫描仪、采集协议、分割和位点间对齐的差异。
来自可穿戴设备、智能手机和环境传感器的数字生物标记可以记录睡眠、运动、自主生理学和症状。设备异质性、数据不完整、行为混淆和社会经济偏见仍然令人担忧。
用于生物标志物发现的人工智能方法
当数据集有很多变量但主题很少时,经典机器学习仍然有用。常规回归、支持向量机和树集成可以识别候选生物标志物,但泄漏、重新调整、基于结果的选择和不精确的解释可能会产生过于乐观的结果。
深度学习对于非线性和结构化数据(例如图像、数组和图形)非常有用。表示学习可以生成可重用的部署,而自学习可以将冗余数据用于需要在设置之间传输的任务。
多模态机器学习结合了图像、实验室测量、纵向临床数据和其他来源。转移研究可以使用大型电子健康记录集合来支持较小的配对组学和临床小组。
图神经网络可以对基因、蛋白质、通路、药物和表型之间的关系进行建模,并将生物结构纳入学习中。
在大型生物数据集上训练的基本模型可用于与组学、药物发现和生物分析相关的任务。这些模型还可以对批次、谱系或位点特异性信号进行编码,如果研究人员不控制它们,这些信号就会作为生物标志物出现。
生成的模型和模拟可以建议候选特征、分子状态、应激反应、途径假设和可能的机制。这些结果最初应被视为假设而不是证据。
候选者的进一步接受将需要内部一致性、外部复制、跨人群和平台的稳健性测试以及具有临床意义的实用性。解释性方法可以支持审计和透明度,但不能取代生物学验证或实验测试。
机械人工智能和临床翻译
大多数人工智能衍生的生物标志物都是相关的:它们识别与结果相关的模式,但不确定这些模式发生的原因。此类标记物可能仍可用于风险分层,但当标记物用于指导治疗或定义治疗目标时,机制证据很重要。
机械人工智能结合了生物途径、网络、扰动数据或因果结构,将特征与疾病过程联系起来。路径受限模型可以对已知的信号关系进行编码,而来自集群短回文复制实验、药物反应测定和细胞因子刺激的扰动数据集可以帮助区分因果因素和下游相关性。
因果表征研究寻找在干预下保持稳定的特征,但观察数据仍然容易受到混杂因素和疾病随时间变化的影响。
通路状态的生物标志物可能比功能活性的孤立分子丰度的测量更有效。他们不是测量相互作用分子网络的单个组成部分,而是评估它们的行为方式。
在这篇文章中,磷酸肌醇 3-激酶-蛋白激酶 B-雷帕霉素的机制靶标、丝裂原激活蛋白激酶、核因子 kappa B 和 Janus 激酶(信号转导器和转录途径激活剂)被认为是生物系统变化的例子,其激活并不总是取决于单个组件。
中性粒细胞胞外陷阱提供了另一个例子:它们可能反映炎症和凝血过程的相互作用,但它们在指导治疗方面的价值仍有待测试。
机械方法可能支持治疗反应的分类、患者分层、试验的丰富性和治疗目标的优先顺序,但可接受的目标仍然需要实验和独立验证。
测试和实施
作者提出了一个开发途径,包括发现、外部验证、不同条件下的测试、临床实用和部署。
需要跨独立队列和亚组进行外部验证,因为发现表现可能会高估疗效。
评估不应局限于曲线下面积等歧视性措施,还应包括决策分析、工作流程集成和患者结果。当生物标志物指导治疗选择、剂量或丰富临床试验时,前瞻性研究尤为重要。
常见的障碍包括数据异质性、有限的队列多样性、不完整的生物学解释、报告不一致、数据集漂移、治疗相关的混淆以及与临床工作流程的整合不足。
该审查建议协调数据收集、前瞻性多中心验证、透明报告以及测量一致性、校准、公平性和临床效用的标准化评估。
结论
该评论的结论是,人工智能可以通过整合分子、细胞、成像、循环和数字数据来识别疾病特征,从而扩大生物标志物的发现。但仅靠准确的预测并不能确定临床价值。生物标志物还需要可重复的测量、独立的验证以及其使用改善护理的证据。生物学假设应该指导多学科整合,而实验应该测试所提出的机制。
作者将前瞻性研究、协调数据、透明报告、标准化评估、监管协调和跨学科合作确定为将人工智能衍生的生物标志物从发现环境推进到治疗开发和临床决策的优先事项。 医学新闻
