AI × 医疗健康 · 2026-07-29
AI × 医疗健康 · 2026-07-29
一句话概览: 今天有一条直击根本的研究值得展开:《自然·医学》刚刚发布一个「医学 AI 超级智能测试」框架(MAST),揭示了一个令人警醒的数字——大模型在标准化医学考试上已能拿 92 分,但扔到真实临床任务里却只剩 44.8 分,中间这 47 个百分点的鸿沟,恰恰是「AI 看起来很聪明」与「AI 真能看病」之间的距离。另一条是制度层面的:FDA 推出全新的 TEMPO 试点通道,让 Dexcom 的 AI 血糖管理系统成为第一个绕过传统上市前审查、直接在真实世界收集证据的数字健康产品——监管逻辑正从「先审后用」转向「边用边验」。
1. 医学考试 92 分 vs 真实临床 44.8 分:《自然·医学》揭开 AI「看病」的真实水位
是什么。 7 月 28 日,《自然·医学》发表论文「Toward a Test of Medical AI Superintelligence」,提出了一套名为 MAST 的框架,用以正式评估 AI 系统是否在临床推理上真正超越了人类专家。论文的核心发现是:当前最强的大语言模型在标准化医学执照考试上已达到约 92% 的正确率,但在用真实临床场景构建的 BRIDGE 基准上,正确率骤降至 44.8%——两者之间存在高达 47 个百分点的落差。
为什么重要。 这篇论文接着前几期我们反复关注的那根主线——「AI 准不准」与「拿什么尺子量」。7 月 25 日那期记录过一项研究显示通用大模型在标准问答上跑赢了 FDA 批准的专用 AI,当时暴露的是「FDA 审批只看合规,不做横向比较」的制度盲区。而这次 MAST 框架把问题推进了一步:即便横向比较了,选的基准不对也没用——考试分数和临床实战之间存在「测量幻觉」。换句话说,行业迫切需要的不只是「独立评测」(已有 AHA 在做),更是一把能代表真实临床复杂度的标尺,否则无论厂商还是监管,都在用错误的分数做判断。
背后的原理。 标准化医学考试(如 USMLE)考的大多是「一段病史 + 一道选择题」,答案封闭、上下文完整、不存在信息缺失。真实临床完全不同:信息不全、多病共存、患者叙述模糊、时间压力下需要连续决策、还要考虑禁忌症和个体差异。BRIDGE 基准试图模拟的正是这种「开放、模糊、需要连续推理」的场景,结果大模型的表现就被打回了原形。MAST 框架的意义,是给行业画出了一条分界线——只有当 AI 在这类真实临床任务上也能系统性地超过人类专家时,才有资格被称为「医学超级智能」;否则,考试高分不过是语言模式匹配的副产品,不等于临床能力。来源:Nature Medicine(2026-07-28) · Clinical Trial Vanguard 评述(2026-07-28)
2. FDA 开辟 TEMPO 快速通道:Dexcom AI 血糖系统第一个「先用再审」
是什么。 7 月 22 日,FDA 宣布连续血糖监测巨头 Dexcom 成为其全新 TEMPO(Technology-Enabled Meaningful Patient Outcomes)试点计划的首位参与者。Dexcom 的「血糖健康计划(Glucose Health Program)」将在 CMS 的 ACCESS 模式框架下,为前驱糖尿病和 2 型糖尿病患者提供实时代谢状态监测和 AI 生成的健康洞察——关键在于,这些功能可以在不经过传统上市前审查的情况下,通过 FDA 的「执法自由裁量权(enforcement discretion)」直接面向患者。
为什么重要。 传统路径下,一款 AI 驱动的医疗设备要经历漫长的 510(k) 或 De Novo 审批才能上市,期间产品可能已经迭代了好几版。TEMPO 试点代表一种全新的监管思路:让有前景的数字健康产品先在真实世界使用,在使用中收集疗效和安全性证据,FDA 同步监控——本质上是把「先审后用」改成了「边用边验」。这与前几期我们记录的一系列监管动作(ONC 数据标准、CMS 新设健康技术办公室、实时临床试验)指向同一方向:监管机构正在从「守门人」转变为「并行观察者」,以跟上数字健康产品的迭代速度。
背后的原理。 连续血糖监测(CGM)设备本身已在糖尿病管理中广泛使用;TEMPO 的增量是在 CGM 之上叠加 AI 分析层——把原始血糖波动数据转化为可操作的建议(如饮食调整、运动时机、用药提醒),并面向更早期的前驱糖尿病人群做筛查。这里的”执法自由裁量权”意思是:FDA 认为该产品风险可控,暂不对其执行上市前审查要求,但保留随时介入的权力;同时要求参与者持续报告真实世界证据。这套模式如果走通,将为更多 AI 数字健康产品提供一条比传统审批快得多的”试验性上市”路径。来源:FDA 官方公告(2026-07-22) · Dexcom 投资者公告(2026-07-22)
其他值得关注的线索
- 医疗 AI 的「油箱」还没修好:Cloudera 报告称 28% 的医疗机构基础设施持续拖后腿(2026-07-28)。 Cloudera 发布的《数据就绪指数 2026》显示,虽然 87% 的医疗机构已经知道自己的数据在哪,但 28% 的机构承认基础设施性能「持续阻碍」运营——问题不在于找不到数据,而在于搬不动、管不住、跑不起来。Cloudera 全球 AI 解决方案总监直言:把大量受监管的医疗数据搬进单一公有云「通常不现实、不经济、难以治理」。这印证了本栏前几期反复强调的一个判断:AI 医疗最大的瓶颈不是算法,而是数据基础设施——模型再聪明,数据管道不通也白搭。来源:GlobeNewsWire / Cloudera(2026-07-28)
- 美国政府押注「AI 加速慢性病研究」:HHS 加入 Genesis Mission(2026-07-22)。 NIH、FDA 和 ARPA-H 联合加入总统的「创世纪使命」(Genesis Mission),将 AI 和先进计算用于加速慢性病根因研究、儿童癌症和药物发现。NIH 局长说:「患癌症、慢性病和罕见病的患者等不起数十年。」这是美国联邦层面最大规模的「AI + 生物医学研究」协调行动,值得跟踪其是否能催生新的数据共享和 AI 训练基础设施。来源:HHS 官方公告(2026-07-22)
- AI 智能体即将被立法「管起来」:参议员 Warner 推出 AI AGENT Act(2026-07-21)。 该法案要求面向消费者的 AI 智能体在隐私、网络安全和透明度方面达标,并在 FTC 注册。虽然不专门针对医疗,但考虑到前几期记录的医院后台 AI 智能体爆发(Trase 传真分诊、IntelePeer Aqurio 治理平台),一旦立法落地,医疗领域的 AI 智能体将首当其冲面临合规要求——前几天说的「谁来管智能体」这个问题,立法端也开始给答案了。来源:参议员 Warner 办公室(2026-07-21)