领航国际官网 · 国际医疗科技AI大模型与全球MedTech知识平台领航国际App下载指南
领航国际影像 · Medical Imaging AI

领航国际影像与全球医学影像AI

领航国际影像围绕CTMRIX-RayUltrasound等成像技术,以及Medical Imaging AIRadiology AI在其上完成的检测、分割、量化等任务,提供技术科普内容。本栏目不阅读、不分析用户上传的任何医学影像,也不对具体检查结果给出诊断意见。

医学影像技术看似只是“拍一张片子”,但不同成像方式背后的物理原理完全不同,产出的数据结构也不同,这直接决定了AI能在上面做什么、不能做什么。理解这些差异,是理解医学影像AI能力边界的第一步,而不是先去关心某个模型的准确率数字。

医学影像技术示意图
成像技术比较

CT、MRI、X-Ray与Ultrasound有什么不同

CT扫描通过X射线旋转采集形成断层图像的原理示意图

CT(计算机断层扫描)通过围绕人体旋转的X射线采集大量投影数据,重建出断层图像,擅长展示骨骼和器官结构的三维空间关系,是急诊和结构性病变评估的常用手段。

MRI利用磁场和射频信号获取软组织图像的原理示意图

MRI(磁共振成像)利用强磁场和射频信号激发体内氢原子核,通过信号差异生成图像,对软组织的对比度通常优于CT,且不涉及电离辐射,但扫描时间相对更长。

X光通过射线穿透人体在探测板上形成投影图像的原理示意图

X-Ray(X光)让射线穿过人体在探测板上形成投影图像,是最基础、最普及的影像技术之一,成像速度快、成本低,但是二维投影会造成组织结构的重叠。

超声通过探头发射声波并接收回波形成实时图像的原理示意图

Ultrasound(超声)通过探头发射声波并接收组织反射的回波成像,没有电离辐射,可以实时动态观察,常用于产科检查和心脏功能评估,但图像质量对操作者手法依赖较高。

Mammography(乳腺X线摄影)是针对乳腺组织专门优化的低剂量X光技术,用于乳腺筛查,AI在这一领域的常见任务包括可疑钙化点和肿块区域的检测辅助。

PET(正电子发射断层扫描)通过示踪剂在体内的代谢分布成像,擅长反映组织的功能和代谢活性,常与CT或MRI融合使用(PET-CT、PET-MRI),获得结构与功能的双重信息。

概念速览

理解医学影像AI的核心词汇

医学影像AI是什么?

指应用机器学习或深度学习方法对CT、MRI、X光、超声等医学图像进行检测、分割、分类、量化等处理的技术,任务类型不同,输出的信息和适用场景也不同。

Detection和Diagnosis有什么区别?

Detection(检测)是AI在图像中标记出可疑区域的技术任务;Diagnosis(诊断)是医生结合症状、病史、检查结果等多方面信息做出的临床判断,二者不是同一件事,不能直接画等号。

Segmentation是什么?

指在图像中精确勾画出某个结构或病灶的边界范围,比单纯的检测框更精细,常用于测量体积、面积等定量指标的前置步骤。

Quantitative Imaging是什么?

指从影像中提取结构化的数值指标(如体积、密度、纹理特征),而不只是给出定性描述,是医学影像正在从“看图”向“测量”延伸的重要方向。

PACS是什么?

Picture Archiving and Communication System,用于存储、管理、传输和查看医学影像的系统体系,是医院影像数据流转的核心枢纽,但PACS本身不是影像标准,而是承载标准数据的系统。

DICOM是什么?

Digital Imaging and Communications in Medicine,是医学影像及相关信息的数据格式与传输标准,规定了图像如何携带患者信息、设备参数等元数据,PACS存储和传输的正是符合DICOM标准的数据对象。

DICOM影像对象包含图像与元数据并在PACS和影像AI系统之间流转的示意图

DICOM不等于PACS

这是医学影像领域一个常见的混淆点:DICOM是标准,PACS是系统。DICOM规定了医学影像数据应该长什么样、携带哪些信息;PACS则是负责存储、检索和展示这些符合DICOM标准数据的具体系统。可以把DICOM理解为“信封的通用格式”,PACS则是“负责收发和归档信封的邮局系统”——两者配合工作,但解决的是不同层面的问题。

影像设备采集数据经PACS存储后由查看端读取的Modality PACS Viewer流程示意图
任务分类

医学影像AI能完成的九类技术任务

医学影像AI检测分割分类量化优先级排序重建等任务分类示意图

Detection 检测

在图像中标记可能存在异常的位置,是最基础的技术任务之一,输出通常是一个区域框或热力图。

Segmentation 分割

精确勾画结构或病灶边界,为后续测量提供基础。

Classification 分类

判断图像或图像中的某个区域属于哪一类,例如良性或不典型特征的粗分类。

Quantification 量化

从图像中计算体积、密度、长度等结构化数值指标。

Prioritization 优先级排序

在大量待读片的检查中,识别可能更紧急的病例并调整阅片顺序,帮助优化工作流而非替代阅片本身。

Reconstruction 重建

从原始采集数据中重建出可供阅读的图像,某些AI方法可用于提升重建质量或缩短采集时间。

Image Quality 图像质量

评估图像是否存在伪影、噪声或采集不完整等问题,辅助判断是否需要重新采集。

Risk Estimation 风险评估

基于影像特征输出某种风险评分,属于研究和探索较活跃的方向,结果通常需要结合其他临床信息解读。

Report Assistance 报告辅助

协助生成结构化报告草稿或提炼关键发现,最终报告仍需医生审核确认。

这九类任务彼此不同,一个模型在某一类任务上表现好,不代表它在另一类任务上同样适用,讨论医学影像AI能力时需要具体到任务层面。

Detection不等于Diagnosis

AI在影像上发现(Detect)一个可能存在的异常区域,是一项具体的技术任务;而完成诊断(Diagnosis)通常需要结合患者症状、既往病史、其他检查结果和临床经验,是一个更综合的判断过程。把“AI框出了异常区域”直接理解为“AI已经完成诊断”,是本栏目希望反复提醒读者注意的一条边界。

AI检测仅基于影像输出可疑区域标记而临床诊断需综合症状病史检查等多方信息的对比示意图
人机协作

AI提示如何影响阅片判断

错误AI提示可能改变影像阅片者视觉注意和判断过程的人机协作安全示意图

医学影像AI安全不只是测试模型本身准不准,还需要观察当医生看到AI给出的提示后,他们的判断过程会发生什么变化。这里涉及几个值得关注的现象:Automation Bias(自动化偏见,倾向于相信自动化系统的输出)、Over-reliance(过度依赖)、Alert Fatigue(提示疲劳,频繁的提示会降低警觉性)以及Human Factors(人因工程,界面设计如何影响人的注意力分配)。这些现象说明,医疗AI系统的安全性评价,不能脱离“人怎样使用它”这个环节单独讨论。

放射科医生与显示AI提示区域的屏幕之间视觉注意交互的人机协作示意图

AI把放射科报告改写得更容易理解,边界在哪里?

让专业影像报告变得更容易被非专业读者理解,是医学影像AI一个正在发展的应用方向。但这里最容易被忽略的一点是:报告中的“可能”“建议结合临床”“不能排除”这类表述,承载的是真实存在的Clinical Uncertainty(临床不确定性),而不是可以随意省略的修饰词。把报告改写得更短、更好懂是有价值的,但如果连同这些不确定性一并删除、把原本开放式的表述改写成确定性结论,就已经超出了“简化表达”的范围,变成了一种误导。负责任的做法是保留不确定性本身,只是用更清楚的语言呈现它。

医学影像隐私

医学影像数据的隐私边界

医学影像即使去除姓名等明显标识仍可能包含敏感信息需要去标识化处理的隐私保护示意图

一份医学影像,即便已经移除了姓名等明显的身份标识,也不代表它已经变成一份完全不含敏感信息的普通图像文件。影像本身可能携带设备序列号、检查时间、机构信息等元数据,某些解剖结构在特定情况下也可能成为辅助识别个体的线索,这也是De-identification(去标识化)在医学影像数据管理中需要专门流程处理的原因,而不能简单等同于删除文件名里的患者姓名。

用于训练医学影像AI模型的数据,同样需要考虑Memorization(记忆化)和Privacy Leakage(隐私泄露)风险——模型在训练过程中,理论上存在记住特定训练样本细节特征的可能性,这是模型训练与数据治理领域持续研究的问题。本页仅作一般性知识科普,不提供任何重新识别患者身份的方法或技术路径。

领航国际影像 · 原创专题

三篇关于医学影像AI的长文

检测与阅片· 领航国际影像

领航国际影像:医学影像AI已经找到一个“可疑区域”以后,为什么医生还需要看整张图?

医学影像AI在图像中勾画出局部区域而完整解读仍需结合全图上下文的示意图

如果一个影像AI工具已经能够在一张CT或X光图像上,把可疑区域相当准确地框出来,很自然会让人产生一个疑问:既然重点区域已经被标出来了,医生是不是可以直接把注意力集中在那个框里,甚至跳过通读整张图像的过程?现实中的答案是否定的,而理解这背后的原因,需要区分两个概念:Local Detection(局部检测)和Global Context(整体上下文)。

局部检测本质上是一个模式识别任务:模型被训练用于识别某一类特定异常在图像局部区域内的视觉特征,然后输出一个位置标记。这个任务本身有明确的边界——模型只对它被训练识别的那一类(或那几类)异常敏感,对训练范围之外的发现,它既不会主动寻找,也没有能力做出判断。这不是模型“不够聪明”,而是任务设定本身就是局部、有限范围的。

而一次完整的影像阅读,医生要做的事情远不止“找到异常”。医生需要把当前图像里能看到的所有线索——包括那些不在AI训练范围内的次要发现、组织之间的相对位置关系、与既往检查的对比变化——放在一起,结合患者的临床背景,形成一个连贯的判断。这个过程更接近于建立一个完整的空间和临床叙事,而不是简单地确认“框里的东西是不是异常”。

这里还涉及一个容易被忽略的风险:如果医生因为AI已经框出了重点区域,就不自觉地缩小了自己扫视全图的范围,反而可能错过AI没有被训练识别、但确实存在临床意义的其他发现。这种现象和后文将要讨论的Automation Bias(自动化偏见)有关——人会倾向于相信自动化系统已经完成了它该做的工作,从而降低自己在其覆盖范围之外保持警觉的程度。工作流设计如果没有考虑到这一点,AI辅助工具反而可能在某些情况下带来负面效果。

因此,比较负责任的产品和流程设计,通常会明确提示AI的检测范围仅限于特定类型的发现,并鼓励医生保持完整的通读习惯,而不是把AI标记的区域当作“已经审查完毕”的信号。一些医院在引入影像AI工具时,会专门针对这一点调整培训内容,提醒医护人员AI提示只是众多线索之一,而不是审阅流程的替代品。

把“框得准”放回它该在的位置

AI在检测任务上框得准,说明的是它在特定类型异常的定位能力,这本身是一项有价值的技术进展,值得认可。但如果因此认为“框得准”约等于“诊断已经完成”,就混淆了一个具体技术任务和一个综合临床判断过程之间的边界。这条边界并不复杂,但因为AI输出的视觉呈现(一个清晰的红框)往往比它背后的技术含义更直观、更具说服力,反而更容易被读者在无意中忽略。

本文用于医学影像AI技术教育,不针对任何具体病例或检查结果提供解读。

定量影像· 领航国际影像

CT图像里隐藏的定量信息越来越多以后,为什么医院不能把AI生成的每一个数字都直接放进报告?

一次CT扫描通过AI自动提取多项结构化测量数值的定量影像示意图

一次CT扫描采集到的原始数据里,其实包含了远比一份传统报告更丰富的信息。放射科医生的常规报告,通常只描述临床上关注的重点发现;但如果用AI对同一批图像做系统性的量化分析,理论上可以提取出体积、密度、纹理、形态等上百种结构化指标,覆盖比常规报告更广泛的解剖结构。这种能力被称为Quantitative Imaging(定量影像),是医学影像正从“定性观察”走向“定量测量”的重要方向。

但“能够测出来”和“测出来的东西有临床价值”,是两个完全不同的问题。一个AI系统可以轻松输出上百个数字,可这些数字里,哪些是已经被证实和某个临床结局相关、哪些只是统计学意义上存在但尚不清楚含义的关联、哪些甚至只是测量误差的正常波动,这些问题不会因为“数字被生成出来了”而自动得到答案。

这就引出了Clinical Validation(临床验证)的必要性。一个新的定量指标要真正进入临床报告,通常需要经过系统性的验证过程:这个指标是否在多个独立的人群和数据集上都表现出稳定、可重复的测量结果?它与某个具体临床结局(比如疾病进展、治疗反应)之间,是否存在经过严谨研究证实的关联?如果只是在一批数据里观察到某种统计相关性,还远远不足以支撑它成为临床决策依据。

另一个需要谨慎处理的问题是Reference Range(参考区间)。很多定量指标的“正常范围”本身就因年龄、性别、种族、测量设备的不同而存在差异,如果直接套用某个数据集里得出的参考区间,用在特征分布不同的另一批患者身上,可能会产生大量假阳性或假阴性的判断,这也是为什么建立一个可靠的参考区间,往往比开发提取指标的算法本身更耗时。

还有一类需要单独讨论的情况是Incidental Measurement(偶然测量发现)——AI在扫描主要关注部位以外的区域,顺带测出了一些原本不在检查目的范围内的数值。这类发现可能有临床意义,也可能只是正常的个体差异,如果不加区分地全部呈现给医生和患者,反而可能造成不必要的焦虑和进一步检查负担,这也是医学界长期讨论的“偶然发现”议题在AI时代的延伸。

更多数字不等于更多有用信息

医学影像AI真正需要证明的,不是“能从一张图像里提取出多少个数字”,而是这些新指标能否切实改善医生的理解和患者的诊疗决策。在这个证明完成之前,医院选择只把经过验证、被认为具有明确临床价值的少数指标纳入正式报告,而不是把AI能算出的一切都堆进报告里,是一种审慎而非保守的做法。

本文介绍定量影像技术的一般性知识,不对具体检查报告中的数值进行解读。

Foundation Model· 领航国际影像

医学影像Foundation Model可以学习大量图像以后,为什么“见过更多数据”仍然不代表它适用于每一家医院?

医学影像基础模型证据强度从个案研究回顾性研究前瞻性研究到外部验证逐级递增的金字塔示意图

Medical Imaging Foundation Model(医学影像基础模型)是近两年医学影像AI领域的重要前沿方向:不同于早期为单一任务单独训练的模型,基础模型通常先在大规模、多来源的影像数据上进行Pretraining(预训练),学习到相对通用的图像表征能力,再针对具体任务通过Fine-tuning(微调)或少量数据适配到不同的临床场景。这种范式的潜力在于,理论上可以用更少的标注数据,更快地扩展到新的任务和新的疾病类型。

但“预训练数据量很大”本身,并不能自动保证模型在任何一家新医院都能保持同样的表现。这里的核心问题是Generalization(泛化能力)——模型能否把在训练数据上学到的能力,稳定迁移到它没有见过的新环境中。而现实中,医学影像的产生环境存在大量系统性差异,这些差异不会因为训练数据规模变大就自动消失。

第一个差异来自Scanner(扫描设备)。不同厂商、不同型号的CT或MRI设备,即使扫描同一个部位,输出图像的噪声特征、对比度、分辨率都可能存在细微但系统性的差异。如果基础模型的预训练数据主要来自某几种设备型号,遇到训练时没见过的设备型号,表现可能出现意料之外的下降。

第二个差异来自Population(人群特征)。不同地区、不同医院收治的患者群体,在年龄结构、疾病谱、体型特征上可能存在明显差异。一个主要基于某一类人群数据训练的模型,迁移到人群特征差异较大的另一家医院,模型学到的统计规律未必同样适用。

第三个差异来自Protocol(扫描协议)。同样是CT检查,不同医院、甚至同一医院不同科室,扫描参数(如层厚、造影剂使用方式、采集角度)都可能不同。这些协议差异会直接反映在图像特征上,是影响模型迁移表现的另一个重要变量。

正因为存在这些差异,负责任的做法是在模型进入新的医院环境之前,进行针对性的External Validation(外部验证)——用目标医院自己的数据重新评估模型表现,而不是想当然地认为“预训练数据够大,到哪里都能用”。这也是为什么即便是被寄予厚望的基础模型路线,业界依然强调它是研究和发展中的方向,而不是可以直接宣传为“一套模型诊断所有疾病”的成熟产品。

规模是起点,不是终点

基础模型带来的规模效应,确实为医学影像AI打开了新的可能性,但规模本身解决的是“覆盖更多任务、降低标注成本”的问题,不能替代针对具体医院、具体设备、具体人群的验证工作。见过更多数据是一个好的起点,能不能在你所在的医院稳定工作,仍然是一个需要单独回答的问题。

本文介绍医学影像基础模型的研究方向与一般性技术原理,具体研究进展请以同行评审文献和官方技术资料为准。