基于视觉基础模型的自监督儿童腹部CT多器官分割方法

发布时间:2026-09-11 19:19  浏览量:1

腹部CT影像

是诊断儿童腹部肿瘤、急性腹痛等疾病的重要手段[1],精准的器官分割是儿童腹部疾病诊疗、疗效评估及治疗规划的关键前提[2]。然而,儿童腹部CT影像的高质量标注主要依赖具备专业经验的临床专家逐层勾画,该过程难度较大且成本高昂,导致高质量儿科影像标注数据极为稀缺[3-4]。这一临床现状严重制约了传统全监督深度学习方法在儿童腹部CT分割任务中的应用[5]。此外,儿童群体具有器官体积小、解剖差异大且发育异质性显著的生理学特征,导致现有分割模型难以学习到兼具鲁棒性与儿科特异性的特征表征,使其在面对跨年龄段儿童数据时泛化性能受限,进一步限制了其临床应用。

自监督预训练利用大规模无标注数据学习通用特征,为缓解儿科标注数据匮乏、提升模型泛化性能提供了重要途径[6-7]。然而,现有的视觉基础模型迁移至医学领域时仍面临以下挑战:一是自然图像与医学影像在成像机制、纹理特征及语义结构等方面差异显著;二是模型对局部解剖结构和细粒度边界信息的捕捉能力较差[8]。

此外,现有医学自监督模型大多基于成人数据预训练[9],而儿童疾病谱与成人不同,其解剖结构随年龄持续变化,导致模型对儿童CT的适配性不足、泛化能力受限,限制了其在儿科领域的临床应用[10-13]。

目前,两阶段域适应预训练可解决上述问题:首先,在大规模成人数据上进行预训练;随后,在儿童数据上进行目标域微调,从而在标注数据有限的条件下提升其鲁棒性与泛化性能[14]。本研究基于无标注儿童腹部CT数据,开展面向儿童腹部CT的域适应自监督预训练,并验证其在儿童腹部多器官分割任务中的性能,旨在提升该模型对儿童腹部解剖特征的表征能力与跨数据分布的泛化能力,并在公开儿科数据集上进行验证,以期为儿童腹部影像自动化分析提供技术支持。

1 资料与方法

1.1数据集信息

本研究的模型训练与评估基于三个相互独立的数据集,分别用于通用表征预训练、儿科域适应预训练以及下游分割微调与性能验证。通用表征预训练阶段采用公开成人CT无标注数据集CT-3M[15],用于模型学习通用放射学解剖表征,为后续儿科域迁移提供基础;儿科域适应阶段采用华中科技大学同济医学院附属同济医院的无标注儿童腹部CT影像,用于自监督域适应预训练;下游微调与评估阶段采用公开数据集Pediatric-CT-SEG(Pediatric Chest/Abdomen/Pelvic CT Exams with Expert Organ Contours)[16],用于全监督微调与性能验证,其专家标注结果作为模型训练和评估的金标准。该队列纳入标准为腹部CT解剖序列完整;为贴近真实临床场景并提升模型泛化能力,未设置严格的病理排除标准,仅剔除序列不全或图像质量极差病例。所有数据均豁免患者知情同意,且完成严格脱敏处理。

1.2模型架构与自监督预训练

基于视觉基础模型DINOv3的自监督学习范式[17],针对儿童影像的解剖特征,构建领域自适应预训练框架,旨在通过多级表征学习提取更具鲁棒性的解剖特征表示,模型整体架构详见图1。

图1

基于DINOv3的儿童腹部CT影像分割模型示意图

EMA: 指数移动平均; ViT : 视觉 Transformer 模型

模型总体框架包含以下3个阶段:

1通过大规模成人无标注CT的自蒸馏预训练构建通用解剖先验;

2将冻结的预训练网络作为Gram教师模型,约束学生模型完成儿科域的特征对齐;

3结合多尺度特征融合和轻量级Primus解码器,在小样本儿童腹部CT数据上进行端到端的全监督微调。

1.2.1 全局-局部自蒸馏预训练

本阶段旨在通过多目标融合策略,同步优化模型对CT医学影像的全局语义理解与局部空间细节感知能力[18]。在目标函数设计上沿用DINOv3的基础损失设计[17],图像级自蒸馏损失£DINO通过教师-学生网络的知识蒸馏机制,引导学生网络学习整张影像的全局语义表示;而像素块(Patch)级重建损失£iBOT 则要求模型从掩码区域的局部特征中重构被遮挡信息,从而保持对微小组织和空间细节的敏感性。为提升特征表示质量,本阶段引入Sinkhorn-Knopp算法替代传统中心化操作,将特征分布对齐转化为最优传输问题进行迭代优化,在有效防止特征坍缩的同时,更好地维持特征分布的多样性与区分度。

最后,为克服无监督学习中缺乏显式标签易导致的特征退化问题,引入Koleo正则化项£Koleo,通过惩罚批次内特征间的过度相似性,促使模型在隐空间中学习到更加丰富、均匀分布的特征表示。第一阶段总损失函数的计算方法见公式(1):

1.2.2 基于 Gram 锚定的儿科域适应

为缓解自监督预训练后期由于过度优化全局目标而导致的Patch级局部特征质量退化问题,第二阶段引入了Gram锚定(Gram anchoring)机制。该机制不直接约束特征向量本身,而是通过Gram矩阵(即图像中所有Patch特征成对点积构成的P×P对称矩阵)来间接维持局部特征的空间相似性结构。

与DINOv3中选取预训练早期教师模型作为Gram教师(Gram teacher)不同,本研究将第一阶段训练得到的成人CT影像教师模型作为提供理想空间结构模板的Gram教师模型。学生模型则在无标注的儿童腹部CT数据上进行域适应学习,负责计算常规自蒸馏损失的教师模型则不参与梯度回传,仅通过学生模型权重的指数移动平均(EMA)进行动量更新。具体而言,假设图像被划分为 P个Patch,特征维度为do 设 Xs 与XG 分别表示学生模型与Gram教师模型的L2归一化局部特征矩阵(大小为P×d),两者对应的Gram矩阵分别为Xs · XTs 和 XG · XTG 。Gram锚定损失函数的计算方法见公式(2):

式中,‖·‖F表示Frobenius范数。L2归一化确保了不同Patch特征向量具有相同范数,使得Gram矩阵值纯粹反映特征间的余弦相似度而非幅度差异,从而稳定了训练过程;此外,仅约束相对相似性结构,使得Patch特征在高维空间中仍能自由演化与优化;最后,该损失仅作用于局部Patch间的相互关系,与由Class Token承载的全局特征学习实现了解耦。这一机制有效修复了训练中丢失的空间局部性,对于精准捕捉儿童腹部微小器官与模糊边界具有重要意义。第二阶段总损失函数的计算方法见公式(3):

1.2.3 高分辨率特征适配

尽管前序阶段在256×256分辨率下有效平衡了训练效率与特征表达,但直接将其应用于高分辨率(≥512×512)且器官体积微小的儿童CT影像时,极易导致精细空间细节的丢失。为解决上述问题,本阶段引入基于混合分辨率的高分辨率适配策略。具体而言,模型在同一训练批次内动态采样不同尺寸的图像裁剪对:全局裁剪(尺寸为512和768)提供高分辨率的宏观解剖视图;多尺度局部裁剪(尺寸为112、168、224和336)则用于强化模型在不同感受野下的局部特征提取能力。该策略无需从头训练即可引导特征空间的平滑过渡,使模型在保留低分辨率全局感知优势的同时,能够高效地精准捕获高分辨率儿童影像空间细节。

1.2.4 面向医学分割的多尺度特征聚合

有研究表明,Transformer在医学分割任务中的性能提升有限,其表现仍不及传统卷积神经网络[19-22]。Primus架构[23]通过引入轻量级转置卷积解码器,在分割任务中表现优异。然而,Primus仅将最后一个Transformer块作为解码器的输入,未能有效利用中间层层次化表征信息,因而难以充分建模密集分割任务所需的局部结构特征与空间先验信息。

针对以上问题,本研究以ViT-B结构为骨干编码器,提出了一种多尺度特征聚合方法。该方法从多个Transformer中间层(第2、5、8、11块)中提取Patch Token,将其拼接后输入解码器,以增强模型对层次化语义信息的表征能力。该设计能够在一定程度上弥补ViT局部性偏置不足的局限,提升模型对细粒度解剖结构及边界信息的感知能力,从而为医学影像密集预测任务提供更加充分的空间先验支持。

在下游分割任务中,使用了nnU-Net框架中已被广泛验证具有较强鲁棒性的组合分割损失函数[23],即交叉熵损失(£CE)与Dice损失(£Dice)的加权和。

设第k个器官的模型预测分割结果为Mk,对应专家标注金标准为Mg,k,则该器官的Dice系数定义为:

对应的Dice损失定义为:

多器官Dice损失为各器官Dice损失的平均值:

交叉熵损失定义为:

其中,K表示分割器官类别数,Mk(i,j )表示像素位置(i,j )属于第k器官的预测概率,Mg,k(i,j )表示对应位置的专家标注金标准。第三阶段最终分割损失函数的计算方法见公式(8):

1.3实验设置

1.3.1 数据预处理

本研究对867例无标注CT数据进行了统一标准化预处理:

1.空间重采样:采用双线性插值将所有CT的面内分辨率统一至0.45 mm×0.45 mm,以减小不同扫描条件下空间分辨率差异对预训练表征学习的影响;

2.灰度归一化:将图像HU值截断于[-1000,1000]范围内,在滤除背景、金属伪影及高密度骨骼干扰的同时,完整保留腹部实质脏器信息,随后线性映射至[0,1]区间;

3. 2D切片提取:沿轴状面(axial plane)逐层切分3D体素,最终构建出包含高质量无标注二维CT切片的大规模预训练数据集。

针对下游全监督分割任务,本研究在 Pediatric-CT-SEG 数据集上遵循 nnU-Net 的自动化预处理框架,以确保不同模型间评估基准的一致性,从而保障实验结果的公平性与可复现性。

1.3.2 实验配置

本研究在PyTorch的nnU-Net框架内采用五折交叉验证进行训练和评估,并与4种主流模型(全监督的nnU-Net,在相同数据集上进行自监督预训练的MAE[24]和MoCov2[25],以及在大规模医学影像上预训练的VoCo[26-27])进行比较。所有模型均训练了100个epoch,每个epoch进行250步的迭代。这种基于统一框架、标准化预处理以及五折交叉验证的实验设计,有效消除了人为调参和数据划分偶然性带来的偏差,确保了各方法间分割性能的公平对比。

1.3.3 评估指标

本研究采用医学影像分割任务的通用评价指标评估不同模型的分割效果:

1Dice相似系数(DSC),用于评估分割结果与金标准的区域重合度,取值范围为0~1,值越接近1代表分割精度越高;

2交并比(IoU),用于评估预测分割区域与金标准区域的交集与并集之比,取值范围为0~1,值越接近1代表整体分割的重叠程度越好。

1.4统计学处理

采用VSCode Python软件进行统计分析。模型分割性能指标以均数±标准差表示。基于逐病例配对结果,采用Wilcoxon符号秩检验比较DSC和IoU在本研究模型与基线模型nnU-Net之间的差异,并计算本研究模型相对于nnU-Net的性能提升幅度。所有检验均为双侧检验,检验水准α=0.05,P<0.05为差异有统计学意义。

2 结果

2.1数据集构建结果

本研究首先采用CT-3M公开成人CT数据集进行第一阶段通用表征预训练。该数据集包含3 868 833张无标注成人CT切片,用于学习通用放射学解剖表征。第二阶段纳入华中科技大学同济医学院附属同济医院0~16岁儿童腹部CT影像867例,用于儿科域适应自监督预训练,经统一预处理后,共获得367 588张二维CT切片。第三阶段采用Pediatric-CT-SEG公开数据集进行下游全监督微调与性能评估。该数据集包含0~16岁儿童胸腹盆腔CT影像359例,并提供29个器官的专家标注,作为模型训练与评估的金标准。

2.2不同模型的整体分割性能比较

本研究模型与4种主流模型在公开儿童分割数据集Pediatric-CT-SEG上的整体分割性能比较详见表1。

表1

不同模型的整体分割性能比较

结果显示,本研究模型的平均DSC和平均IoU均高于其他模型。本研究模型与基线模型nnU-Net相比,DSC和IoU均有所提升,差异具有统计学意义(P<0.05)。具体而言,模型的平均DSC较nnU-Net提升3.22%,较MAE、MoCov2、VoCo分别提升7.17%、16.33%与5.10%;同时,平均IoU较基线模型nnU-Net提升3.59%,较MAE、MoCov2、VoCo分别提升8.32%、18.71%与5.70%。

2.3不同方法在各腹部器官中的分割性能比较

本研究模型在各腹部器官中的分割性能均表现优异(表2)。

表2

不同模型在各腹部器官中的Dice相似系数比较

值得注意的是,在十二指肠、胰腺、肾上腺及胆囊等体积较小或边界复杂的器官中,本研究模型的DSC均高于基线模型nnU-Net,且差异均具有统计学意义(P均<0.05),分割精度提升尤为显著。具体而言,相较于全监督基线nnU-Net,本研究模型在十二指肠(5.78%)和胰腺(4.69%)上的平均DSC均有较大幅度的提升;在左肾上腺(2.89%)、右肾上腺(1.12%)及胆囊(1.86%)上也有稳定提升,说明本研究模型在处理微小目标与复杂解剖边界时具有显著优势。

2.4消融实验评估结果

为验证本研究模型中各模块的有效性,在下游Pediatric-CT-SEG数据集的Fold 1上开展消融实验,具体评估结果详见表3。

表3

消融实验评估结果

消融实验充分验证了本研究模型中各组成模块的有效性。随机初始化的基线模型DSC 为 64.51%,说明在缺乏医学解剖先验的情况下,模型对儿童腹部复杂结构的表征能力有限。引入基于大规模成人 CT 的第一阶段预训练后,模型获得了通用解剖结构先验,DSC升至 65.95%,较基线提高了 1.44 %,但由于成人与儿童之间仍存在明显的解剖结构和分布差异,性能提升相对有限。

在此基础上,进一步加入儿童域适配后,DSC升至 68.17%,表明目标域自监督对齐能够有效缓解成人到儿童的域偏移问题。随后,在儿童域适配基础上引入高分辨率适配策略,DSC进一步升至 70.29%,说明该策略能够增强模型对小器官边界细节和局部结构信息的建模能力。最终结合多尺度特征融合后,本研究模型的 DSC 升至70.96%,较基线提升 6.45%,表明多尺度特征聚合可进一步弥补 ViT 局部归纳偏置不足的问题,提升分割结果的边界连续性与结构完整性。

2.5不同模型的可视化分割结果

图2展示了不同模型在同一儿童腹部CT样本上的可视化分割结果。

图2

不同模型的可视化分割结果

nnU-Net等模型在微小器官和器官边界的分割中,易出现边界模糊、欠分割或过分割问题;而本研究模型可精准捕捉器官的解剖边界,对微小器官的分割完整性显著优于其他模型,与专家手动标注的金标准具有极高的一致性。

具体而言,nnU-Net、MAE和MoCov2在小肠、肝脏、胃及胰腺等区域存在不同程度的边界不连续、局部漏分割或跨类别误分割;VoCo的整体轮廓较其他模型有所改善,但仍存在分割类别错误问题。相比之下,本研究模型的预测区域与金标准在器官位置、形态及边界连续性方面更为接近,尤其在小肠、胰腺及邻近软组织边界处显示出较好的结构一致性。

3 讨论

本研究基于大规模无标注儿童腹部CT数据,构建了域适应预训练自监督模型,并在儿童腹部多器官分割任务中取得了优异性能,整体表现优于现有主流方法。结果表明,该方法能够有效缓解儿科标注数据稀缺导致的模型泛化能力不足问题,为儿童腹部影像的自动化分析与临床辅助诊断提供新的技术方案。

3.1域适应自监督预训练价值

儿童腹部CT多器官精准分割是儿科放射学及辅助诊疗的重要基础。首先,在儿童放疗计划制定中,自动分割可辅助危及器官勾画与剂量保护分析,为个体化放疗方案设计提供客观参考。其次,在术前规划中,分割结果能够更清晰地呈现腹部器官边界及其毗邻关系,有助于腹部肿瘤切除、先天畸形矫治等手术的解剖定位与路径评估。此外,在器官发育评估场景中,自动分割可支持肝脏、脾脏、肾脏等器官体积、形态及发育变化的定量分析,从而为儿童生长发育监测及疾病随访提供影像学依据。

然而,高质量儿童标注数据的稀缺以及现有通用模型对儿童特异性解剖特征适配不足,仍是该领域的核心瓶颈。针对这一问题,本研究以视觉基础模型DINOv3为基础,提出了面向儿童腹部CT的二阶段自监督预训练与多尺度分割框架。定量实验结果表明,本研究模型在公开数据集上的分割DSC达71.38%,较医学影像分割的基线模型nnU-Net[24]提升3.22%,并显著优于MAE、MoCov2及VoCo等自监督方法。

这一结果表明,通过针对性域自适应预训练,大规模自然图像视觉先验能够被有效迁移并重构为契合儿童解剖特征的医学表征。该策略在不依赖额外人工标注的前提下,充分利用无标注儿童影像数据,为儿童医学影像中标注数据稀缺问题提供了可行的技术路径。

3.2模型表现与优势

本研究模型在胰腺、十二指肠等复杂边界器官的分割中展现出显著的性能优势。儿童腹部脏器体积小、边缘模糊[11],且不同年龄段儿童的器官形态差异较大,深层网络在特征提取过程中容易丢失高频空间细节。本研究通过多尺度特征融合策略,实现了全局语义与局部细节的兼顾,从而增强模型对小器官边界、局部结构和复杂解剖形态的识别能力。

本研究在儿童腹部多器官分割任务中的性能提升主要得益于预训练范式和模型结构两方面设计。在预训练范式上,本研究提出了“成人通用先验-儿童目标域对齐”的二阶段自监督预训练策略。由于儿童与成人在解剖形态、生长发育等方面存在差异,成人数据预训练模型直接迁移至儿科任务时常面临泛化瓶颈。受Capellán-Martín等[14]提出的跨域迁移思路启发,本研究首先利用大规模成人CT数据学习通用放射学解剖表征,再基于无标注儿童CT数据进行目标域自适应训练,以增强模型对儿童腹部局部拓扑结构和解剖特征的表征能力,从而缓解成人与儿童影像之间的域偏移问题。

在网络结构上,本研究结合多尺度特征融合机制与轻量级Primus解码器,从多个Transformer中间层提取并聚合层级特征,使模型同时利用低层空间细节与高层语义信息;同时,轻量级解码器减少了复杂卷积模块带来的冗余计算及对域适应特征空间的干扰。上述设计在控制模型复杂度的基础上提高了特征利用效率,增强了模型对儿童腹部微小脏器及复杂边界结构的分割能力。

尽管本研究模型在十二指肠和肾上腺等小器官上的DSC较基线模型有所提高,且提升差异具有统计学意义,但其绝对分割精度仍有限。本研究中十二指肠DSC约为69%,肾上腺DSC约为55%,尚未达到大体积实质脏器分割中通常期望的一致性水平。对于自动分割结果直接用于临床决策的场景,通常需要更高的轮廓一致性和边界稳定性;而对于十二指肠、肾上腺等体积小、边界模糊且解剖变异较大的器官,当前模型结果更适合作为辅助初始分割,用于减少人工勾画负担,而不宜直接替代临床专家确认后的最终轮廓。

本研究的局限性:

(1)儿科域适应预训练数据集仅来源于单中心儿童腹部CT影像数据,未来需纳入多中心儿童腹部CT数据,进一步提升模型的泛化能力;

(2)本研究主要在单一公开数据集 Pediatric-CT-SEG 上开展验证,尚无法替代多中心、多设备外部测试,未来需在更多儿科外部数据集上进一步验证模型的可复现性与普适性;

(3)本研究在三维空间建模和自适应特征融合方面仍有进一步提升空间,本研究采用2D轴位切片建模,主要是基于当前研究目标、数据条件和计算资源约束的阶段性技术选择。2D建模能够充分利用大规模切片级无标注数据,降低预训练显存开销,便于继承DINOv3等视觉基础模型已有的二维表征能力。针对单切片建模难以显式捕获层间空间连续性的问题,本研究通过Gram锚定、高分辨率适配和多尺度特征聚合,增强模型对局部拓扑结构、边界细节和多尺度语义信息的建模能力,在一定程度上缓解了2D建模的空间连续性不足。同时,固定层Token融合策略具有较好的训练稳定性和参数效率,但尚无法根据不同器官大小、边界复杂度和病例差异进行自适应特征选择,可能限制模型在极小器官和低对比度边界区域的进一步提升。因此,未来将进一步探索2.5D相邻切片输入、轻量级3D解码器及自适应特征融合机制,并补充95% 分位数豪斯多夫距离(HD95)、平均对称表面距离(ASSD)、三维连通性和体积一致性等指标,以更全面评价模型的空间连续性与边界精度,持续提升模型的泛化能力和临床应用价值;

(4)本研究目前的验证主要集中于儿童腹部CT影像的器官分割,尚未完成放疗计划、术前规划和器官发育评估等临床任务的独立验证。

综上,本研究模型在公开数据集上已展现出显著的技术优势,未来将通过任务驱动的临床验证,为其在真实儿科诊疗场景中的推广及应用奠定坚实基础。

后续研究可围绕以下3类任务开展验证:

(1)面向儿童腹部肿瘤放疗计划制定,利用模型输出的肝脏、肾脏、脾脏、胃肠道等器官轮廓辅助危及器官自动勾画,并以放疗医师修订后的轮廓作为参考标准,通过DSC、HD95、平均表面距离、人工修订时间及医师5分主观评分指标,系统评估自动勾画在放疗流程中的实用性;

(2)面向腹部肿瘤、先天性畸形及复杂炎症性疾病的术前规划,评估分割结果对器官边界显示、邻近结构识别及术前解剖定位的辅助价值,并通过外科医师盲法评分评价其临床可解释性;

(3)面向儿童器官发育评估与疾病随访,进一步输出肝脏、脾脏、肾脏等器官体积及形态指标,并采用组内相关系数、Bland-Altman分析和体积误差率评价自动测量结果与人工测量结果的一致性。