出品 | 搜狐健康
作者 | 吴施楠
编辑 | 袁月
如今,人工智能(AI)正在深度重构医疗行业的诊疗模式,从影像筛查、辅助诊断到临床决策、慢病管理,医学AI已走出实验室试点阶段,全面迈入真实临床场景落地应用。然而,准确性越来越高并不意味着安全。一旦AI造成漏诊、延误或过度治疗,后果可能要到数月或数年后才会显现。因此,一个适配的安全性评价标准,对于医学AI的落地应用非常关键。
8月17日,上海交通大学盛斌,清华大学黄天荫、宋佳颖、吴嘉敏,斯坦福大学Nigam Shah,伦敦国王学院Josip Car在NEJM AI发表观点文章,提出医学AI的S1—S4四级安全分类框架。作者强调,医学AI不仅要证明当下的性能,还要通过长期监测发现未来风险,将医学“首先,不伤害”的核心承诺强化为“首先,不伤害——无论现在还是未来”。
医学AI风险滞后性强
研究团队在研究中指出,医学AI的风险具有滞后性、隐匿性和不可逆性,这也是传统安全评价体系的核心不足。
不同于普通互联网AI、消费级AI的即时性风险,医学AI引发的诊疗伤害往往存在漫长的潜伏期。部分由AI算法偏差、数据偏见、场景适配缺陷导致的诊疗问题,不会在单次诊断、干预后立刻显现,可能在数月甚至数年后,才以病情延误、过度诊疗、慢性病进展、并发症加重等形式暴露。
更棘手的是,这类远期伤害链条冗长、影响因素繁杂,事后很难精准追溯至最初的AI决策输出,最终造成严重甚至不可逆的患者健康损害,而风险源头却被模糊、忽略。这意味着,暂时未观察到伤害,并不足以证明医学AI系统的长期安全性。
基于这一核心认知,研究团队跳出传统“结果导向”的安全评价思维,构建起一套过程化、全周期、分级管控的S1-S4医学AI安全风险分级框架,重构医疗AI安全的评判逻辑。
具体来看,S1指范围狭窄且可测试的应用;S2指临床医师在采取行动前须审核的决策支持;S3指重要伤害可能仅在随访后才显现,因而在广泛推广前须进行监测和结局监测的应用;S4指应予禁止或仅在采取特殊保障措施下才允许的高风险自主行动。
需要注意的是,S等级不是AI模型本身的固定属性,而是具体部署方式的安全标签。等级取决于AI承担的临床任务、所嵌入的工作流程、服务的患者群体、能否持续跟踪患者的后续情况,以及医生能否在采取行动前进行有效复核与干预。
因此,框架不再单一关注AI模型的静态准确率,而是聚焦医学AI落地临床的核心核心命题:当AI系统在新患者群体、新诊疗场景、新工作流程中出现意外偏差与异常行为时,医疗机构能否快速感知、精准溯源、及时干预、止损风险。
来源 / NEJM医学前沿
重塑医学AI安全评价标准
过去行业评价AI安全,核心看“模型准不准、当下有没有问题”;而研究团队提出的新标准,核心看“系统稳不稳、风险能不能控、隐患能不能查”。其本质是将医学AI的安全治理,从“静态结果验收”升级为“全流程动态风控”,从“事后追责补救”前置为“事前分级预判、事中动态监测、事后精准溯源”的全周期治理模式。
在医学AI加速落地的当下,研究团队牵头构建的四级风险框架,补齐了缺乏统一的风险评判与管控依据这一行业短板,具备极强的行业价值与现实意义。
文章强调,S1-S4框架旨在补充而非替代欧盟《人工智能法案》、国际医疗器械监管机构论坛的软件医疗器械框架,以及美国食品药品监督管理局、美国国家标准与技术研究院和世界卫生组织的相关指南。其主要价值在于,将伤害何时显现、医生何时必须复核、何时需要链接随访结局,以及谁有权暂停或回滚系统,纳入同一套临床治理逻辑。
它为研发机构提供了标准化的模型优化方向,推动医学AI研发从“追求高准确率”的单一目标,转向“准确率、安全性、稳定性、可溯源性”多维均衡发展,倒逼算法研发兼顾通用性能与场景适配安全。此外,它为医疗机构的AI落地应用提供了清晰的准入、运维、风控标准,助力医院建立分级分类的AI使用管理制度,针对不同风险等级的AI应用,匹配差异化的人工复核、动态监测、风险预警机制。
研究团队最后指出,医疗AI不仅应以目前的表现或安全性来判断,还应看医疗系统能否发现、追溯并减轻它未来可能造成的伤害。S1-S4框架由此将医学“首先,不伤害”的原则延伸为:既关注当下,也守护未来。
参考资料:
1、NEJM AI:清华、上交大团队提出医学AI安全分级,强化“不伤害”原则
https://mp.weixin.qq.com/s/0n15XoIyIhFBXzzAeXSP_Q
2、黄天荫团队提出医疗人工智能安全风险分级框架
https://mp.weixin.qq.com/s/rJ4njKbnjR84ChrbstSFuQ
上一篇:AI算力大事追踪:美国多州收紧数据中心建设;OpenAI强化AI安全防护
下一篇:没有了