检测与阅片 2026年8月24日 · 领航国际影像
领航国际影像:医学影像AI已经找到一个“可疑区域”以后,为什么医生还需要看整张图?
如果一个影像AI工具已经能够在一张CT或X光图像上,把可疑区域相当准确地框出来,很自然会让人产生一个疑问:既然重点区域已经被标出来了,医生是不是可以直接把注意力集中在那个框里,甚至跳过通读整张图像的过程?现实中的答案是否定的,而理解这背后的原因,需要区分两个概念:Local Detection (局部检测)和Global Context (整体上下文)。
局部检测本质上是一个模式识别任务:模型被训练用于识别某一类特定异常在图像局部区域内的视觉特征,然后输出一个位置标记。这个任务本身有明确的边界——模型只对它被训练识别的那一类(或那几类)异常敏感,对训练范围之外的发现,它既不会主动寻找,也没有能力做出判断。这不是模型“不够聪明”,而是任务设定本身就是局部、有限范围的。
而一次完整的影像阅读,医生要做的事情远不止“找到异常”。医生需要把当前图像里能看到的所有线索——包括那些不在AI训练范围内的次要发现、组织之间的相对位置关系、与既往检查的对比变化——放在一起,结合患者的临床背景,形成一个连贯的判断。这个过程更接近于建立一个完整的空间和临床叙事,而不是简单地确认“框里的东西是不是异常”。
这里还涉及一个容易被忽略的风险:如果医生因为AI已经框出了重点区域,就不自觉地缩小了自己扫视全图的范围,反而可能错过AI没有被训练识别、但确实存在临床意义的其他发现。这种现象和后文将要讨论的Automation Bias (自动化偏见)有关——人会倾向于相信自动化系统已经完成了它该做的工作,从而降低自己在其覆盖范围之外保持警觉的程度。工作流设计如果没有考虑到这一点,AI辅助工具反而可能在某些情况下带来负面效果。
因此,比较负责任的产品和流程设计,通常会明确提示AI的检测范围仅限于特定类型的发现,并鼓励医生保持完整的通读习惯,而不是把AI标记的区域当作“已经审查完毕”的信号。一些医院在引入影像AI工具时,会专门针对这一点调整培训内容,提醒医护人员AI提示只是众多线索之一,而不是审阅流程的替代品。
把“框得准”放回它该在的位置
AI在检测任务上框得准,说明的是它在特定类型异常的定位能力,这本身是一项有价值的技术进展,值得认可。但如果因此认为“框得准”约等于“诊断已经完成”,就混淆了一个具体技术任务和一个综合临床判断过程之间的边界。这条边界并不复杂,但因为AI输出的视觉呈现(一个清晰的红框)往往比它背后的技术含义更直观、更具说服力,反而更容易被读者在无意中忽略。
本文用于医学影像AI技术教育,不针对任何具体病例或检查结果提供解读。
定量影像 2026年8月22日 · 领航国际影像
CT图像里隐藏的定量信息越来越多以后,为什么医院不能把AI生成的每一个数字都直接放进报告?
一次CT扫描采集到的原始数据里,其实包含了远比一份传统报告更丰富的信息。放射科医生的常规报告,通常只描述临床上关注的重点发现;但如果用AI对同一批图像做系统性的量化分析,理论上可以提取出体积、密度、纹理、形态等上百种结构化指标,覆盖比常规报告更广泛的解剖结构。这种能力被称为Quantitative Imaging (定量影像),是医学影像正从“定性观察”走向“定量测量”的重要方向。
但“能够测出来”和“测出来的东西有临床价值”,是两个完全不同的问题。一个AI系统可以轻松输出上百个数字,可这些数字里,哪些是已经被证实和某个临床结局相关、哪些只是统计学意义上存在但尚不清楚含义的关联、哪些甚至只是测量误差的正常波动,这些问题不会因为“数字被生成出来了”而自动得到答案。
这就引出了Clinical Validation (临床验证)的必要性。一个新的定量指标要真正进入临床报告,通常需要经过系统性的验证过程:这个指标是否在多个独立的人群和数据集上都表现出稳定、可重复的测量结果?它与某个具体临床结局(比如疾病进展、治疗反应)之间,是否存在经过严谨研究证实的关联?如果只是在一批数据里观察到某种统计相关性,还远远不足以支撑它成为临床决策依据。
另一个需要谨慎处理的问题是Reference Range (参考区间)。很多定量指标的“正常范围”本身就因年龄、性别、种族、测量设备的不同而存在差异,如果直接套用某个数据集里得出的参考区间,用在特征分布不同的另一批患者身上,可能会产生大量假阳性或假阴性的判断,这也是为什么建立一个可靠的参考区间,往往比开发提取指标的算法本身更耗时。
还有一类需要单独讨论的情况是Incidental Measurement (偶然测量发现)——AI在扫描主要关注部位以外的区域,顺带测出了一些原本不在检查目的范围内的数值。这类发现可能有临床意义,也可能只是正常的个体差异,如果不加区分地全部呈现给医生和患者,反而可能造成不必要的焦虑和进一步检查负担,这也是医学界长期讨论的“偶然发现”议题在AI时代的延伸。
更多数字不等于更多有用信息
医学影像AI真正需要证明的,不是“能从一张图像里提取出多少个数字”,而是这些新指标能否切实改善医生的理解和患者的诊疗决策。在这个证明完成之前,医院选择只把经过验证、被认为具有明确临床价值的少数指标纳入正式报告,而不是把AI能算出的一切都堆进报告里,是一种审慎而非保守的做法。
本文介绍定量影像技术的一般性知识,不对具体检查报告中的数值进行解读。
Foundation Model 2026年8月20日 · 领航国际影像
医学影像Foundation Model可以学习大量图像以后,为什么“见过更多数据”仍然不代表它适用于每一家医院?
Medical Imaging Foundation Model (医学影像基础模型)是近两年医学影像AI领域的重要前沿方向:不同于早期为单一任务单独训练的模型,基础模型通常先在大规模、多来源的影像数据上进行Pretraining (预训练),学习到相对通用的图像表征能力,再针对具体任务通过Fine-tuning (微调)或少量数据适配到不同的临床场景。这种范式的潜力在于,理论上可以用更少的标注数据,更快地扩展到新的任务和新的疾病类型。
但“预训练数据量很大”本身,并不能自动保证模型在任何一家新医院都能保持同样的表现。这里的核心问题是Generalization (泛化能力)——模型能否把在训练数据上学到的能力,稳定迁移到它没有见过的新环境中。而现实中,医学影像的产生环境存在大量系统性差异,这些差异不会因为训练数据规模变大就自动消失。
第一个差异来自Scanner (扫描设备)。不同厂商、不同型号的CT或MRI设备,即使扫描同一个部位,输出图像的噪声特征、对比度、分辨率都可能存在细微但系统性的差异。如果基础模型的预训练数据主要来自某几种设备型号,遇到训练时没见过的设备型号,表现可能出现意料之外的下降。
第二个差异来自Population (人群特征)。不同地区、不同医院收治的患者群体,在年龄结构、疾病谱、体型特征上可能存在明显差异。一个主要基于某一类人群数据训练的模型,迁移到人群特征差异较大的另一家医院,模型学到的统计规律未必同样适用。
第三个差异来自Protocol (扫描协议)。同样是CT检查,不同医院、甚至同一医院不同科室,扫描参数(如层厚、造影剂使用方式、采集角度)都可能不同。这些协议差异会直接反映在图像特征上,是影响模型迁移表现的另一个重要变量。
正因为存在这些差异,负责任的做法是在模型进入新的医院环境之前,进行针对性的External Validation (外部验证)——用目标医院自己的数据重新评估模型表现,而不是想当然地认为“预训练数据够大,到哪里都能用”。这也是为什么即便是被寄予厚望的基础模型路线,业界依然强调它是研究和发展中的方向,而不是可以直接宣传为“一套模型诊断所有疾病”的成熟产品。
规模是起点,不是终点
基础模型带来的规模效应,确实为医学影像AI打开了新的可能性,但规模本身解决的是“覆盖更多任务、降低标注成本”的问题,不能替代针对具体医院、具体设备、具体人群的验证工作。见过更多数据是一个好的起点,能不能在你所在的医院稳定工作,仍然是一个需要单独回答的问题。
本文介绍医学影像基础模型的研究方向与一般性技术原理,具体研究进展请以同行评审文献和官方技术资料为准。