科技

美国投9850万美元做罕见病AI:先补数据,才谈缩短确诊

|作者: QUASA 编辑团队|2 分钟阅读| 4
美国投9850万美元做罕见病AI:先补数据,才谈缩短确诊

美国高级健康研究计划局(ARPA-H)于2026年8月31日公布Rare Disease AI/ML for Precision Integrated Diagnostics(RAPID)合同授予结果。ARPA-H的正式公告 确认,该计划将在4.5年内投资最高9850万美元,由北卡罗来纳大学、Sage Bionetworks、FDNA和Probably Genetic牵头的团队承担数据资源、共享与评测平台、多模态检测工具和患者端工具等研发任务。

目前可以确认的是合同规模、执行团队和预定交付能力,而不是已经投入常规诊疗的成熟产品。现有公开资料没有给出RAPID工具的前瞻性临床试验结果、诊断准确率、监管批准情况或实际缩短确诊时间的数据;项目首先要建立可训练、可治理和可比较的数据基础,再验证AI能否改善诊断。

为什么模型开发要从纵向数据开始

研究团队把罕见病患者的连续症状、检查与基因组资料整理为可分析的纵向记录

罕见病AI面对的首要限制不只是算法能力,而是可用病例少、资料分散且记录方式不一致。病例可能分布在医院、登记系统、研究机构和患者组织,不同来源使用的疾病编码、症状描述、检查方法和随访周期也可能不同。未经统一的数据直接用于训练,模型可能学到某家机构的记录习惯,而非疾病的稳定特征。

RAPID因此把纵向患者数据放在技术基础层。一次就诊只能呈现一个时间点,连续记录则可以保留症状出现顺序、检查变化、既往判断、治疗反应和疾病进展。对于早期表现不典型或症状随时间变化的疾病,这种时间关系可能提供单次检查缺失的诊断上下文。

基因组信息同样需要临床背景。部分遗传变异的意义必须结合症状和病程解释,另一些罕见病尚无已知遗传原因。RAPID拟连接纵向临床记录、基因组数据、患者报告及其他健康资料,目的不是简单扩大文件数量,而是形成可供训练和基准评估的一致记录。

“先补数据”指的是验证AI疗效所需的技术依赖,而非要求各团队完全按先后顺序工作。数据收集、平台建设和模型研发可以同时推进,但只有代表性、隐私治理、独立评测和临床验证均产生证据后,才能判断项目是否真正缩短了确诊过程。

四支团队分别补齐研发链条

此次合同把任务拆成相互依赖的环节,而不是让四支团队重复开发同一种模型。北卡罗来纳大学团队负责整合临床、基因组和患者报告资料;Sage Bionetworks建设安全、可互操作的数据与基准平台;FDNA收集照片、视频、语音和患者报告等纵向资料;Probably Genetic则将整合可穿戴设备、功能评估、临床记录和基因组数据,并开发患者端工具。

北卡罗来纳大学医学院与埃默里大学牵头的数据项目获得最高3500万美元支持,执行期为4.5年。UNC发布的项目资料 将建设目标描述为覆盖约2700种罕见病的大规模数据集,资料来自患者登记系统和真实世界来源;姓名等身份信息将在进入RAPID资源前移除,访问权限则按照数据敏感程度分级管理。

两家企业团队的任务更接近患者端数据和工具。FDNA拟利用多模态资料开发面向临床和患者直接使用场景的检测工具;Probably Genetic拟生成合成数据,并把患者端工具与确认性检测、就医导航和临床试验机会连接起来。这些都是合同约定的研发方向,不能据此认定相关工具已经完成临床验证。

共享规则与统一基准为何不可缺少

数据管理人员对罕见病多模态资料去标识化并实施分级访问

集中数据不等于全面公开。临床记录、基因组、患者报告和面部影像的隐私风险不同,删除直接身份信息也不能消除所有重新识别风险。项目仍需处理知情同意、数据使用协议、分级访问、跨机构互操作,以及部分资料不能集中存储时的联邦式连接。

Sage Bionetworks负责建设Rare Disease Data Commons,即RAPID的中央数据存储和基准平台。Sage Bionetworks提供的合同说明 显示,其支持上限为2800万美元、周期为4.5年,平台将协调其他团队和外部贡献者的数据,管理访问规则,并建设带版本控制的Rare Disease Benchmark Dataset。

统一基准用于区分“模型不同”和“测试数据不同”。如果开发者只在自己的患者队列上报告表现,结果差异可能来自疾病构成、病例难度或资料质量。共同测试集、固定版本和一致评价标准,才能检验候选模型在未参与训练、来源不同的病例上能否保持稳定表现。

模型还必须进入临床工作流接受验证

临床医生复核罕见病AI风险线索并决定是否安排确认性检测

RAPID的医护端目标是诊断支持,而不是让AI取代医生作出最终诊断。模型即使在基准数据上表现良好,仍要解决电子病历衔接、提示触发时机、证据呈现、转诊路径和误报负担;这些因素会决定风险线索能否转化为确认性检测。

患者端工具面对另一组限制。照片、声音、视频、主诉和可穿戴设备数据可以补充门诊记录,但采集质量会受到设备、环境和表达方式影响。项目对这类工具的定位,是发现可能被单一数据类型遗漏的线索,并把患者连接到检测和医疗支持,而不是在家庭环境中直接给出确定诊断。

患者组织参与项目设计也与数据质量和治理有关。患者愿意长期提供哪些资料、同意如何管理、谁能访问敏感数据,以及工具能否回应真实需求,都会影响数据覆盖面和系统的实际可用性。这些并非模型训练之外的附属问题,而是后续临床验证能否成立的条件。

9850万美元购买的是研发能力

9850万美元是RAPID在4.5年执行期内的投资上限,不代表全部资金已经一次性支付。四支团队获得的是面向未来交付的研发合同,“建设”“开发”“评估”和“验证”等任务也不能改写为已经实现的诊断结果。

接下来需要观察的证据包括:纵向数据资源实际覆盖的疾病和人群,敏感资料能否持续合规地跨机构使用,不同模型是否可以在统一基准上比较,以及候选工具能否在真实医疗环境中通过前瞻性验证。误报、漏报、不同人群之间的表现差异,以及工具对临床工作量的影响,也需要公开结果回答。

截至2026年9月1日,RAPID的确定进展是从项目规划进入合同执行。只有数据资源、独立评测和临床验证陆续产生可审查的结果后,外界才有依据判断这笔联邦投入是否真正缩短罕见病患者的确诊历程。

分享:

订阅我们的新闻通讯

将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。

0