“AI 诊断”听起来像一个产品类别,临床上却不存在抽象的“诊断准确率”。同一个模型用于胸片初筛、急诊排序、影像第二阅片或患者自测,输入、用户、时间压力、错误代价和验证方法完全不同。
所谓垂直深耕,不是把模型做得越来越庞大,也不是收集尽可能多的疾病标签,而是把一个窄用途说清、测透、接稳:它为谁服务,在工作流哪一步出现,给出什么输出,不能处理什么,错误由谁发现,发生偏移时如何退出。
本文只讨论临床辅助系统的研发与评估方法,不提供个人诊断或治疗建议。任何患者相关决定都应由具备资质的医疗专业人员结合完整病史、检查和当地流程作出。
## 从“预期用途”锁定问题
一个可验证的项目,开头不应写“识别肺部疾病”,而应写成更具体的任务,例如:在某类医院、某个年龄范围、某种设备产生的胸片中,为放射科医生标记疑似异常区域,作为第二阅片提示,不独立生成最终诊断,也不自动改变治疗。
这句话确定了目标人群、数据类型、使用者、工作位置和决策边界。它也暴露了不能回避的问题:漏掉异常和误报哪个代价更高;病种患病率如何影响阳性预测值;医生看见提示后会不会过度依赖;系统故障时原流程是否还能继续。
“深耕”的第一步是拒绝用途膨胀。为一种设备和一个人群验证的模型,不能因为界面相同就扩展到别的医院、儿科、便携设备或急诊分诊。每扩大一个边界,都可能需要新的数据与证据。
## 标签不等于临床真相
医疗数据里的标签可能来自报告关键词、账单编码、单名医生判断、病理结果或长期随访,它们代表的证据强度不同。如果把报告中“不排除”简单映射成阳性,模型学习到的也许是记录习惯,而不是疾病本身。
团队应在训练前定义参考标准:由谁标注,依据哪些资料,意见不一致如何仲裁,是否允许“不确定”,标注者能否看到模型结果。对于需要多名专家判断的任务,应报告一致性,而不是把分歧藏进一个最终标签。
数据划分要按患者而非单张影像进行,避免同一人的相近检查落入训练和测试两边。还要检查时间、设备、科室和医院泄漏。一个模型可能从图像边角、压缩方式或医院特有标记猜出数据来源,从而在内部测试表现很好,却没有学到真正目标。
## 先内部验证,再走出原医院
内部回顾性验证适合发现明显错误,但它只说明模型在相近数据分布中能否复现。Zech 等人的跨医院胸片研究显示,肺炎识别模型在原机构内部和外部机构的表现并不一致,模型甚至能非常准确地辨认影像来自哪家医院。医院流行率、采集流程和处理方式都可能成为捷径。
因此,测试集应保留一个更晚的时间窗口,并尽量增加独立机构、不同厂商设备和不同患者构成。外部验证不是把几家医院的数据混在一起重新随机切分,而是保留真正未参与开发的地点,观察模型能否迁移。
报告不能只给 AUROC。还要根据用途给出灵敏度、特异度、阳性与阴性预测值、校准情况和置信区间,并展示关键亚组的失败。预测值会随患病率变化;模型在研究数据上看似可靠,换到低患病率人群后,误报负担可能明显上升。

## 前瞻静默运行是必要的缓冲层
回顾性数据无法完整重现真实医院里的缺失字段、临时设备、接口延迟和录入习惯。前瞻静默运行让模型接收实时病例并生成结果,但不向临床人员展示,也不改变患者流程。团队可在不干预决策的条件下观察数据是否到齐、响应是否及时、性能是否随班次或设备变化。
静默阶段要预先定义周期、样本量、失败指标和停止条件,而不是运行到结果好看为止。它还应记录模型无法处理的病例、接口中断和选择性缺失。若系统只在“干净”病例上成功,整体数字会掩盖真实可用性。
静默运行仍不能证明人机协作有效。它通过后,才适合进入小范围、受控的辅助试点,让少量受训使用者看见结果,同时保留原有诊疗路径与即时回退。
## 临床试点要测人和流程
模型加入工作流后,新的风险来自人机互动。医生可能因为系统很少出错而放松核查,也可能被大量低价值提示拖慢,形成告警疲劳。解释图或置信分数若设计不当,还会制造虚假的确定感。
DECIDE-AI 指南强调早期、现场临床评估中的工作流和人因;CONSORT-AI 则帮助报告涉及 AI 干预的临床试验。实际试点应记录医生何时看到建议、是否采纳、为什么覆盖、处理时间如何变化,以及模型失败是否被及时发现。
界面要同时表达建议、依据和不确定性,避免醒目的单一“阳性/阴性”压过原始资料。系统还要允许用户快速忽略、纠正和报告问题。人工覆盖不是失败,而是衡量辅助系统是否真正可协作的重要信号。
## 准确率之外,最终要看临床效用
高 AUROC 不会自动改善患者结局。一个模型可能在离线测试中区分能力很好,却因为告警太多、出现太晚或没有可行动路径而毫无帮助。反过来,适度的模型若能提前把高风险病例送到正确人员手中,也可能产生实际价值。
评估层级应逐步提升:先看技术性能,再看医生与模型共同工作的表现,然后看流程指标,如报告周转时间、漏诊复核、额外检查和工作负荷;条件成熟时,才通过合适的前瞻或随机研究观察患者相关结局。
一项随机 AI 心电图告警研究就是这种思路的例子:研究者评估的不只是模型分数,而是把告警嵌入临床流程后对结局的影响。单项研究不能证明所有 AI 诊断工具有效,它说明的是证据终点需要靠近真实使用结果。
## 让“不确定”成为产品状态
医疗模型不应被迫对每个输入作出结论。图像质量不足、设备不支持、患者超出验证人群、关键字段缺失或多个信号冲突时,安全输出可能是“不适用”或“需要人工复核”。
团队要为拒绝和升级设定规则,并分别评估。若只统计被模型接受的样本,容易把困难病例排除后获得漂亮数字。完整报告应同时说明覆盖率、拒绝率、拒绝原因,以及被拒绝人群是否集中在某些亚组。
校准也很关键。概率为 20% 的病例群体,长期观察应大致出现相应比例的目标事件;如果概率只是排序分数,界面就不应把它包装成个体真实风险。向临床人员和患者沟通时,应说明证据范围与限制。

## 持续监测设备、流程和人群漂移
上线不是验证结束。医院更换设备或成像协议、修改电子病历字段、调整转诊规则,甚至季节性疾病变化,都可能改变输入分布和患病率。模型本身不变,输出意义也可能变化。
监控应覆盖数据缺失、图像质量、设备与科室分布、输出分布、校准、人工覆盖、告警数量和响应时间。真实结局往往滞后,因此需要同时设置早期代理信号。发现异常时,系统应能降级为不显示建议,保留原临床流程。
重新训练也不是自动修复。新数据可能引入新的标注规则或亚组偏差,每次更新都应有版本、变更说明、独立回归测试和回退条件。对动态模型而言,验证对象不仅是权重,还包括数据管道、阈值和界面。
## 一支垂直团队需要共同证据
临床负责人定义用途和失败代价;数据与机器学习人员负责数据来源、训练和复现;统计人员设计样本量、比较与不确定性;人因或体验人员观察实际使用;信息与运维人员保障接口、日志和回退。
这些角色不一定对应独立岗位,但责任不能空缺。团队应共享一份用途说明、一套数据谱系、一组锁定测试集、一次完整运行轨迹和一张风险登记清单。每次迭代回答“解决了哪类失败,是否引入新的失败”,而不是只宣布总分提高。
STARD-AI、TRIPOD+AI、DECIDE-AI 和 CONSORT-AI 分别覆盖诊断准确性研究、预测模型、早期现场评估和临床试验的报告重点。它们不是替项目作决定的打勾清单,却能暴露证据链中遗漏的信息。
## 结语:深度来自边界与证据
AI 诊断的垂直深耕,不是为更多病种添加按钮,而是为一个明确用途建立从数据、参考标准、外部验证、静默运行到临床试点的完整证据,并在上线后继续观察漂移和人的行为。
一个可信系统会坦率说明自己何时不适用,让专业人员看见依据,保留原流程和回退能力。真正的进展不是模型越来越敢下结论,而是团队越来越清楚哪些结论可以支持、哪些必须交还给人。
## 参考资料