【表格+影像】超融合:一种多模态整合表格和医学影像数据的超网络方法,用于预测建模

【表格+影像】超融合:一种多模态整合表格和医学影像数据的超网络方法,用于预测建模 论文总结1、主要贡献在于将超网络引入表格和医学影像融合中。这确实挺创新的超网络通过生成主网络的部分权重实现动态条件化影像处理这种机制比传统的拼接、FiLM、DAFT等方法更灵活。2、作者实验设计的很丰富将所提出的超网络框架用于了脑龄预测的回归任务中和多分类阿茨海默症分类任务中在回归和分类任务中都验证了模型的有效性3、有开源代码https //github.com/daniel4725/HyperFusion 。摘要整合多种临床方式如医学影像和从患者电子健康记录EHR提取的表格数据是现代医疗的关键环节。对多源的综合分析可以全面理解患者的临床状况从而改善诊断和治疗决策。深度神经网络DNN在医疗领域的多种多模态任务中始终展现出卓越的性能。然而有效将医学影像与临床、人口统计和遗传信息以数值表格数据表示融合的复杂工作仍是一项高度活跃且持续进行的研究工作。我们提出了基于超网络的新型框架通过将图像处理条件化于电子健康记录的数值和测量数据将临床影像和表格数据融合。该方法旨在利用这些模态中互补的信息提升各种医疗应用的准确性。我们在两种不同的脑磁共振成像MRI分析任务中展示了该方法的强大和通用性分别是基于受试者性别的脑年龄预测和基于表格数据的多类别阿尔茨海默病AD分类。我们证明该框架优于单模态模型和最先进的MRI表格数据融合方法。我们的代码链接可在 https //github.com/daniel4725/HyperFusion 找到。引言在医疗决策中临床医生依赖全面的患者数据包括临床、遗传、人口统计和影像信息以深入了解个体状况从而提升诊断准确性和治疗效果。深度神经网络DNN在广泛的医疗任务中持续取得最先进的成果。然而它们仍无法达到人类专家整合医学影像和非影像数据信息的能力。图像具有高维、连续和空间性而患者的电子健康记录EHR通常以数值表格形式格式化包含具有多种类型、尺度和范围的低维定量属性。视觉语言模型VLMs如CLIP对比语言-图像预训练Radford等2021在捕捉文本概念与图像之间的跨模态关系方面取得了显著成功。这些方法依赖于对比学习即模型被训练以对齐图像表示与其密切相关的文本描述同时区分无关的对。然而在医学领域由于数据分布不均匀也存在挑战Wang 等2023。具体来说通常没有明确的一对一语义映射;同一个图像可以关联多个概念单个概念可能对应不同的图像。影像与表格而非文本数据的融合带来了额外的复杂性。虽然某些指标如大小或形态可以直接与扫描解剖相关但许多其他临床和人口统计属性如医学实验室结果或患者人口统计则独立于影像数据提供互补信息。患者的胸部X光与体温之间没有“正确”或语义匹配;后者作为连续变量可以取给定范围内的任何值。然而结合使用时这两种数据来源可以提升肺炎等疾病的评估Huang等2020。为了充分发挥视觉和表格信息我们提出了一种概念创新的方法将临床测量和人口统计数据视为先验影响图像分析网络的结果。整个融合过程类似于通过调整频率选择电台和音量来调节无线电发射器的听觉输出。这一核心概念通过超网络实现。超网络框架最初由Ha等人2016年提出由分配给特定任务的主网络和生成主网络特定层权重和偏置的超网络组成。该元学习框架的主要优势在于与训练后保持固定的标准深度模型不同主图像处理网络会根据输入的表格属性动态调整即使在测试时也是如此。该工作的主要贡献包括1引入了HyperFusion这是一种基于超网络的新框架有效融合了成像和表格数据其中表格信息作为先验影响图像分析网络的结果。这种动态融合过程被证明特别强大使图像处理网络能够在测试时根据不同的输入属性进行调整。2将该框架应用于两个具有挑战性的脑MRI分析任务基于性别的脑年龄预测以及利用阿尔茨海默病AD、轻度认知障碍MCI和认知正常CN受试者的临床、人口和遗传数据进行分类。3实证结果表明HyperFusion在这两项任务中都优于最先进方法为医学诊断中影像与表格数据的整合提供了新见解。本文其余部分的组织如下。第二部分回顾了影像与表格数据的融合包括超网络的概念及其应用以及关于大脑年龄预测和阿尔茨海默病分类的相关研究。第三部分介绍了我们的超网络框架详细介绍了每个任务的架构及关键实现方面。第四部分介绍实验设置包括数据集、预处理和训练/评估程序随后进行结果的展示和讨论。最后我们在第五节作总结。相关工作融合方法多种多样的医疗数据模式的整合是一个活跃的研究领域Heiliger 等2023。虽然多模态成像数据集的融合已被探索超过十年Menze 等2014;Carass 等2017;Sui 等2023影像与非成像数据的合并带来了额外挑战相关算法相对较新。结合医学影像与表格数据的融合策略可分为三种不同类型如Huang等2020所述早期融合即原始或提取特征在输入层面串接例如Chieregato等2022;联合融合或中间融合在融合模型中学习特征提取阶段;以及晚期融合即在决策层面将预测或预训练的高层特征结合如Pandeya和Lee2021以及Prabhu等2022。本研究采用联合融合方法促进模组间的有意义互动。由于表格数据与图像数据之间的固有差异直接积分不可行因此需要一定的预处理。早期融合在端到端处理方面不足导致图像特征的独立处理阻碍了中间层次模态间相互学习的可能性。而晚期融合仅发生在训练模型的决策层面未能促进模态间的相互学习。相比之下关节融合不仅具备端到端训练的优势还能基于彼此条件化模态处理。一种直观且直接的融合图像和表格数据的方法是为每种数据类型使用独立的网络——通常使用多层感知器MLP用于表格数据卷积神经网络CNN用于成像。虽然晚期融合方法基于集体决策提供预测Prabhu 等2022而联合融合框架则将每种模态嵌入特征向量然后进行向量连接Esmaeilzadeh 等2018;El-Sappagh 等2020;Venugopalan 等2021。然而串接方法将表格数据与成像之间的交互限制在高层描述符忽视了在CNN层中融合因为关键的空间图像上下文得以保留。更先进的关节融合技术对中间CNN层中的图像特征进行仿射变换其中移位和尺度参数由处理另一种数据模态的网络生成。在Perez等人2018中引入了特征级线性调制FiLM用于对文本进行图像处理应用于视觉问答任务。基于FiLMWolf等人2022年引入了动态仿射特征图变换DAFT将脑MRI和表格数据融合在一起。然而在这些技术中不同数据类型的交互仅限于处理流程的特定阶段和线性变换可能限制了网络充分发挥数据融合优势的能力。针对另一个相关但不同的问题Hager 等人2023探讨了推断阶段假设表格数据不可用但在训练中可用于利用成像数据中的语义依赖的情景。该方法论采用对比学习来理解成像与表格对应关系。然而正如第一部分所强调的我们的研究观察到最相关的表格特征在成像数据中明显存在。在某些情况下表格数据包含了仅靠影像难以或几乎不可能推导出的关键属性如特定蛋白质测量和代谢指标。此外值得注意的是Hager等人2023依赖大量数据集进行有效对比学习利用而我们的研究也涉及较小数据集缺乏全面代表的情况。在这种情况下明确从表格数据中提供信息比依赖隐式提取图像更有利。我们的工作结合了通过超网络框架对表格数据进行图像处理条件化的概念。与其他方法不同我们的超网络方法具有多样性和全面性。具体来说所提超网络学习一种通用变换不一定线性以适应传输到主网络层的参数无论其架构或位置如何。这种灵活性使成像能够与其他模态融合无论具体情境如何。超网络超网络的概念由Ha等人2016年提出即一个网络超网络为另一个网络主网络生成权重和偏置。我们从两个截然不同的超网络应用中汲取灵感其中之一是Littwin和Wolf2019的工作。这项工作利用输入超网络的二维图像通过主网络重建描绘的三维物体。另一个鼓舞人心的应用是Aharon和Ben-Artzi2023提出的去噪框架其中超网络被训练以生成受输入图像潜在信噪比SNR条件条件的主网络参数。超网络也在医疗领域找到了应用。在Wydmański等人2023中一个超网络框架利用随机特征子集处理表数据。在这里一个随机的二元掩模选择了部分表格特征同时作为负责产生特征处理网络参数的超网络输入。然而需要注意的是这种方法是单模态的专注于表格数据且缺乏与影像数据的整合而这正是我们工作中重点关注的。据我们所知这里首次提出了在医疗领域利用超网络融合不同数据模态的方案。为了展示我们的方法我们选择了两个可能受益于影像与表格数据融合的脑MRI分析挑战脑年龄预测、回归问题和多类别分类涉及AD、MCI和CN的分类。关于这些任务的更多细节见下文。脑龄预测基于大脑解剖学预测人类年龄的任务在医学研究中引起了广泛关注这得益于人工智能回归工具的发展和脑成像数据日益普及Franke 和 Gaser2019;Peng 等2021;Lee 等2022;Cole和Franke2017年;Feng 等2020;Levakov 等2020。目前仅基于影像学的方法显示出良好的预测准确性健康受试者的实际年龄与预测脑年龄之间的平均差距不到三年。然而由于这些研究的主要目标是解释神经网络旨在提供脑老化动态的信息仅依赖影像无法捕捉可能影响这些过程的其他属性。认识到男女衰老轨迹的差异Coffey 等1998;Piçarra 和 Glocker2023我们探讨了纳入受试者性别信息是否能改善脑年龄预测。据我们所知我们是首个研究基于受试者性别条件的脑年龄推断任务的。然而必须注意的是这项探索是我们研究的次要目标。主要目标是展示和演示我们提出的超网络框架特别关注成像与非成像数据的融合。多分类阿茨海默症预测通过脑MRI早期发现AD是一个积极的研究课题因其重要意义。最具挑战性的方面在于对MCI患者的分类MCI是一个过渡阶段可能作为阿尔茨海默病发展的预测因子。与Bäckström等2018和Wang等2018中提出的二元分类方法CN与AD不同我们的重点是对CN、MCI和AD的多类分类。尽管许多研究仅依赖影像数据如Wen等2020及相关研究所示神经学相关文献建议纳入临床和人口统计数据以增强预测效果。例如Letenneur等1999和Fratiglioni等1991等研究指出女性与男性以及不同教育水平个体之间阿默默病的危险比存在差异。阿尔茨海默病神经影像倡议ADNI数据集提供了额外的表格数据包含阿尔茨海默病检测所需的关键属性和生物标志物如脑脊液CSF中的特定蛋白质测量值以及由正电子发射断层扫描PET扫描得出的新陈代谢指标。这些额外的属性及其相互作用提供了仅凭脑部MRI扫描可能无法获得的相关信息。近年来已有多种多模融合方法被提出用于阿尔茨海默病检测Dolci等2022;Venugopalan等2021;ElSappagh 等2020;Zhou 等2019;Liu 等2018;Spasov 等2018。本文特别引用了Wolf等2022、Esmaeilzadeh等2018和Prabhu等2022的研究他们讨论了MRI与ADNI数据集表格数据的融合用于三类AD分类。方法超网络融合图1HyperFusion框架的示意图。图的上部和下方分别展示了两个主要组成部分——超网络和主网络。答输入T和I分别表示表格和成像数据。B超网络 φ由 K 个独立网络组成{hk}k1,...,K 这些网络为主网络的特定外部层生成参数 hkT θhk红箭头。C主网络由内部层组成这些层在反向传播过程中不断更新黄色箭头和外部层红色标记。拟议的深度学习框架旨在整合影像和表格数据以提升临床决策能力。图1描述了其两个主要构件用 φ表示的超网络和主网络 ψθ其中 φ 和 θ 分别代表各自的参数。为简化起见我们用 ∲ {φ ؈θ} 表示整个网络复合体。 输入 ሲ 由一对表向量组成包含 d 个测量值/值 T ∈ Rd 和一个多维图像 I具体为三维 MRI见图1A。给定表向量Tψ∴生成数据集特定的网络参数θʈ ሴ φT与内部学习的参数θʈ结合形成了完整的主要网络参数集合θ {θ θ}。初级网络的输出 ψθI 代表期望的临床预测。在前馈传递中输入图像被输入到主网络 ψθ见图1C。同时表格数据输入由超网络 φ图1B处理。超网络块由 K 个子网络 {hk}k1 ,...,K 组成每个子网络嵌入表格属性见第 3.1.1 节并为主网络 ψθ 中对应层生成权重和偏置 hkT θhk红色框。主网络层的这些外部参数依赖于T并相应影响提取的成像特征。在训练阶段损失会通过主网络和超网络反向传播黄色箭头影响可学习参数θ和φ黄色星标。具体来说梯度会更新内部的主网络层只通过外部层来更新相应超网络的参数。值得注意的是外部主要网络参数θ由超网络间接更新红色箭头。这种结构使我们能够基于表格数据进行图像分析。对表格数据的依赖性由外部参数与内部参数的比值决定。为了获得洞见让我们看看两个极端案例。当仅依赖内部网络参数无超网络时预测对表格信息变得无关紧要。相反所有主要网络参数均为外部且由超网络生成的情况则近似为每种表格属性组合采用独立网络的情景。例如在脑年龄预测中超网络可能会为男性和女性生成不同的参数集。不过虽然由于嵌入会有一些依赖第3.1.1节但如果所有参数都外部可能需要一个更长的训练过程和更多的训练数据。在我们的配置中我们选择低级别初级网络层的参数为内部参数假设表格属性如性别对提取最终预测的低层成像特征不太可能相关。这种选择的参数源组合使我们能够最大化利用现有的训练扫描同时结合相应的表格数据以获得额外收益。表格数据Embedding如图1B所示所提超网络通过两步过程生成权重和偏置。最初表格数据被输入嵌入网络形成潜在向量。随后这个潜在向量会经过两个不同的线性层一层用于生成权重另一层用于生成偏置。设 ζ ∶ Rd → Rl 定义嵌入函数将表格数据 T 映射到一个较低维空间 l d。所需嵌入特征向量应对原始数据有浓缩且有意义的表示旨在捕捉隐藏的模式和复杂的相互作用同时保留相关信息。嵌入是融合过程中的关键步骤为表格数据提供了复杂的关联。对于我们的表格嵌入网络我们选择了MLP模型因为表格数据缺乏空间上下文。这一选择符合其在小型数据集中优异的性能和适用性正如Borisov等人2022所指出的。然而超网络配置依然灵活允许集成任何期望的嵌入架构。所提框架为端到端嵌入参数与整个网络同步学习如图1所示。此外嵌入空间的连续性使相似的样本更接近地映射这使得插值成为可能。这一能力使模型能够为之前未见过的样本生成有意义的表示增强了其泛化能力。超层的位置选择虽然所提的超网络概念具有通用性但其适应不同应用需要适应主网络的特定架构。受Lutati和Wolf2021提出的层选择方法启发我们通过评估每个主网络层在未训练的骨干网络下的影响识别出超层的“良好候选”。评估通过随机初始化所选层的参数多次N 1000同时保持其他网络层的随机参数不变来实现。基于层的损耗的熵表示该层的影响并基于每次随机初始化所获得的损失值的归一化直方图计算得出。从候选人池中进行最终层的实证选择正如附录D中消融研究所示。权重初始化网络的收敛取决于其参数的初始分布。通常神经网络层参数的初始化考虑其扇入或扇出这种做法稳定了它们的收敛正如 He 等人2015和 Glorot 和 Bengio2010所述。在我们的语境中参数初始化扮演着关键角色特别是对于由超网络其输出为主网络生成的θ。这些参数是作为超网络前馈过程的一部分计算的不能直接初始化以遵循特定的分布。此外这些参数会随着每个不同的输入样本T 而变化。为应对这一挑战我们采用了 Chang 等人2019中详细描述的技术对超网络输出 θ 进行了方差分析。该方法旨在初始化每个超网络k的参数φk使超网络前馈过程能够生成拟合特定分布的外部主网络参数θhk。更准确地说这些参数的分布应确保它们在主网络中指定层的输出方差与输入方差紧密对齐。这种初始化有助于所提超网络框架的趋同。形式上设φk {HW k HB k } 表示 hk 的全连通层参数分别生成权重 W j k ∈ θhk 和偏置 Bj k ∈ θhk 到主网络中的超层 j。设dk和dj分别表示超网络层和主网络层的扇入大小。我们也表示 eT 表示预处理表数据的嵌入MLP 的输出用 Var⋅ 表示方差。为了实现所需的方差每个超网络k的参数HM k通过从− √ 3≂H M k和√ 3≂H M k之间的均匀分布中抽样来初始化其中M代表权重W或偏置B对于每组参数计算 ≂HM k 如 Chang 等人2019所述损失函数如图1黄色箭头所示损失在整个网络复合体中反向传播影响内部主网络参数和超网络。鉴于我们框架的灵活性损失函数可以适应广泛的应用。它由两个组成部分组成任务特定损失、目录任务和权重衰减正则化项具体如下规范y ψ T I 纠正任务y ሲ T I 纠正规范化{φ θሼ } 3 其中 y 是真实标签/值。正则化应用于φ和θ∼以减少过拟合。回想超网络产生的外部主要网络参数即θ∴不会经过梯度下降过程因此不被正则化。回归任务中的损失项规范任务是预测_与基层真实值之间的均方误差MSE具体如下对于分类任务作者使用加权交叉熵损失函数缺失值处理出现缺失值的表格数据并不罕见。处理缺失值是表格数据预处理的关键环节因为它会显著影响建模和分析的质量。有多种应对这一挑战的策略。例如Dolci等人2022提出的多模态生成方法通过三模块框架补偿缺失的模态。在第一个模块中每个模态独立处理第二个模块通过预训练生成器输入不可得的数据最后一个模块融合预测前的所有特征。在我们的研究中我们采用迭代方法来估算缺失值。表格数据以矩阵形式呈现每列代表一个属性每行代表训练集样本。每一步选择一个属性列作为输出z其余列视为输入X。回归器训练于z X的非缺失值然后用于预测z的缺失值。这一迭代过程对每列重复。如同Wolf等人2022所述我们添加了一个指示符如NaN标志来表示已归算值。虽然该技术被广泛使用但必须承认它可能带来的偏差。通常特定属性的值在属于特定类别的数据集中始终缺失。例如与健康受试者相关的数据集通常缺乏可能带来健康风险的测量需要侵入性操作或电离辐射成像。在这种情况下缺失值指示器的存在本身可能就是一种“不公平”的提示可能导致因“错误的原因”而获得更好的结果。此外在与某一类相关的数据集中带有缺失值的属性补值可能严重依赖于另一类的现有值从而可能影响其有效性。尽管存在这些顾虑我们仍选择上述补值策略以确保与现有采用该方法的公平比较。集成学习为了增强和稳定推理过程我们使用了一个集合模型记为 ∱它汇总了 M 训练模型从 ∲1 到 ∲M的结果。针对回归问题最终预测是所有集合模型预测结果的简单平均在涉及C类的多类分类任务中每个模型 ∲m 生成预测类别的概率分布向量表示为 pm pc1 ... pcC m。为了获得最终的集合预测 ∱classificationT I这些模型通过其概率分布的加权平均进行组合具体如下这里 wm 定义了 ψ m 预测在集合中的权重。一般来说我们希望置信度更高的模型不确定性较低的 wm 更高。假设预测的不确定性与其熵正相关我们将 wm 设为与网络预测熵成反比具体如下成像-表格数据融合应用为了展示所提影像-表格数据融合框架的多功能性我们探索了两种不同的医学影像应用每种应用都具有独特的架构配置。这些应用涵盖了根据受试者性别进行脑年龄预测第3.5.1节以及将受试者分为AD、MCI和CN组的多类别分类第3.5.2节。利用超网络进行条件化大脑年龄预测用于条件化大脑年龄预测的超网络框架如图2所示。主网络输入健康受试者的3D脑MRI扫描T1w而输入超网络的表格数据单一属性则由代表受试者性别的2D单热向量组成。超网络化合物训练用于解决回归问题使用方程中定义的损失函数。3和4。主要网络架构图2B-C是VGG骨干链的一种变体Simonyan和Zisserman2014如Levakov等人2020提出的用于脑年龄预测。其最后四层线性层红色框的参数是外部的由超网络生成。网络输出受试者的脑年龄∈ R损失函数是回归损失MSE和体重衰减正则化的加权和定义在方程中。(3)–(4).图2C详细展示了卷积块包含两个卷积层具有ReLU激活、批处理归一化和通过最大池化下采样。如图2D所示超网络由四个子网络h1、h2、h3、h4组成每个子网络对应主网络中的线性层之一。每个 hk 由一个 2 对 1 的 MLP 组成用于嵌入 onehot 输入向量。嵌入步骤至关重要尤其是在使用性别属性01或10的正交单热表示时。如果不嵌入超网络会为每个性别属性值生成一组不同的权重。我们发现在这种情况下超网络最有效的集成发生在最终处理阶段的线性层内。使用超网络进行AD分类图3直观展示了将受试者多类别分类为CN、MCI和AD组的超网络框架。超网络的输入图3A是表格数据包含九个临床和人口属性详见第4.3.3节。与脑年龄预测的应用类似主网络通过3D脑MRI扫描数据供给见图3B。然而为了进行AD分类图像被裁剪为仅包含海马体及其周围组织正如Wen等2020所建议的那样。裁剪显著减少了输入大小最终减少了所需网络参数的数量并实现了更好的分类结果。我们注意到海马体是边缘叶的重要组成部分是学习和记忆的关键区域。海马萎缩是阿尔茨海默病的已知生物标志物Rao等2022;Salta 等2023。图3C所示的超网络由一个非线性单层MLP组成用于嵌入采用参数化ReLUP-ReLUHe等2015。MLP为主网络生成权重和偏置。主要的网络预测是由softmax层生成的概率分布PCN、PMCI、PAD。损失是多类分类损失WCE和权衰减正则化项的加权和详见方程。(3), (5).主网络的骨干网如图3B所示基于激活前的ResNet块随后是两层线性结构。最后一个ResNet块用红色框框称为HyperRes块其参数子集来自超网络。Fig. 3D中展示了激活前的ResNet区块的近距离视图。该架构基于 He 等2016对所有块都是相同的但图中特别指的是 HyperRes 块它将参数从超网络中获取到其卷积层红色框的部分。实验本节详细介绍了实验配置、消融研究、预测结果及两种不同脑成像分析应用的比较旨在展示所提多模态融合超网络框架的稳健性和适应性。特别是第4.2节深入探讨了受受试者性别条件下的脑年龄估计实验和发现而第4.3节则讨论了受试者在CN、MCI或AD组的多类别分类。关于二元反向分析分类的更多实验见附录B。实验详情所有实验均使用配备PyTorch的Tesla V100 32GB显卡进行。表1展示了阿尔茨海默症分类和脑年龄预测任务的实验细节。网络的所有架构细节分别收录在附录A.2和附录C.2的表A.2和C.3中。根据性别条件的脑龄预测虽然大多数现有方法仅基于脑MRI数据进行脑年龄估计但我们以受试者的性别为条件来判断脑年龄回归问题。我们首先验证了性别信息能提高大脑年龄预测准确性的假说。随后我们评估了超网络框架在融合成像与表格数据方面的效率。该评估涉及与仅依赖脑MRI数据的基线模型进行比较。数据本研究数据包括来自19个来源的26,691次不同健康受试者的脑部MRI扫描。附录A.1的表格提供了每个数据集的全面信息包括受试者数量以及他们的年龄和性别分布。训练与评估我们利用时间与预测年龄之间的平均绝对误差MAE评估超融合及替代脑年龄预测框架。为确保鲁棒性我们训练了多个具有不同随机权重初始化的模型以减轻偶发结果的潜在影响。测试结果基于验证过程中确定的五个表现最佳模型的集合计算。集合的输出是通过模型预测的平均值得出的详见第3.4节进一步提升了我们发现的可靠性。预处理与分区我们对T1加权MRI扫描应用了预处理流水线详见附录A.1。在用作模型输入之前这些图像被标准化为在所有非零体素中均值为零标准差为1确保数据一致性以实现有效训练。我们注意到受试者的性别和年龄在扫描访问中会常规记录。因此我们几乎可以利用所有可用的扫描数据而无需处理缺失值相关的问题。在此情况下表格数据由一个二进制值组成即受试者的性别男性或女性。我们的研究中该值由二维一热向量表示。我们将数据集划分为训练80%、验证10%和测试10%子集保持所有子集的年龄和性别分布一致。男性和女性大脑衰老的差异图4。条件化大脑年龄预测结果。A仅为成像实验。针对仅男性蓝色、女性粉色和混合绿色等大小训练集的基线网络测试集由仅男性左、女性中间或混合右子集组成MAE得分。B 超融合比较仅使用成像数据的基线模型橙色、基于串接的融合浅蓝色、不同嵌入的超融合——输入为二维矢量输出为二维矢量橄榄绿以及采用MAE度量的拟议超融合模型紫色。推断使用男性测试数据左、女性测试数据中间或整个混合测试数据集右。在展示整合影像和表格数据的超网络在受试者性别条件下预测脑年龄任务的强大性之前我们进行了基线实验以支持性别信息可用性增强预测结果的假设。我们训练了三个CNN每个针对特定数据集一个专门针对男性脑扫描另一个针对女性脑扫描第三个涵盖男女混合数据。混合数据集约占完整数据集一半确保了训练期间各模型的公平样本代表性便于公平比较。我们的评估涵盖了整个测试集以及两个子集——一个仅包含男性受试者另一个专门针对女性受试者。通过这组实验获得的MAE分数见图4A。蓝色、粉色和绿色条分别表示仅男性、女性或混合数据的网络训练保持训练集大小相等。文本集由仅男性左侧、仅女性中间或混合右侧子集组成。该图强化了我们关于性别信息有助于大脑年龄预测的假设推动了提出的超网络框架。比较与消融研究图4B展示了拟议的超融合方法紫色条与仅图像橙色条和常见的平板成像连接浅蓝色条方法的比较。比较对象包括男性左边条、女性仅中间条及整个右边测试数据。为了与我们的超融合模型公平对比该模型提供了主网络中所有四个线性层的参数连接模型将基线网络中每个线性层的性别特征和图像特征结合起来。此外我们对超网络嵌入进行了消融研究具体比较了我们提出的单热向量映射紫色条与映射到二维矢量橄榄色条。评估拟议外部层选择的消融研究见附录D。结果与讨论图4中展示的比较清楚表明所提出的超融合模型在所有男性女性列车测试配置中均优于仅图像网络以及标准的连接框架。虽然超出本文范围但有趣的是女性年龄的预测远比男性年龄的预测更准确见图4A和B中最左侧和中间的横线。我们推测这可能是由于男性大脑年龄的变异性更大。多分类AD分类为了进一步评估网络融合成像和表格数据的效率我们对多类别阿尔茨科病分类任务进行了一组实验条件是不同数量和组合的表格数据属性。我们将结果与使用任一数据模式及其他现有方法获得的结果进行比较。数据我们使用了ADNI数据库的四个阶段ADNI1、ADNI2、ADNI GO和ADNI3——为每个个体选择一个完整数据集首次访问时获得。每个选定数据集都包含一次T-1 MRI扫描和时间上对应的电子病历EHR。所用ADNI数据的统计数据见表2。信息包括每个标签“N”样本数、年龄均值和标准差以及每个诊断组内的男女比例。所用数据及对应的ADNI受试者识别编号可在本研究随附的Git仓库中查阅。图像预处理MRI扫描的预处理流程与第4.2.1节相似。如第3.5.2节所述我们将扫描裁剪为两个3D子图像尺寸为64×96×64个体素包括左侧或右侧海马体区域。表格预处理虽然受试者的电子健康记录包含多种属性但我们只使用其中九项。人口统计属性包括年龄、性别和教育。脑脊髓液生物标志物包括Aβ42、P-tau181和T-tau。第三类属性涵盖了18F-氟脱氧葡萄糖FDG和氟贝他壬AV45PET扫描得出的综合指标。需要注意的是电子健康记录中的认知评分被排除在研究之外因为它们直接用于阿尔茨海默症诊断。换句话说仅凭这些分数就足以进行阿尔茨海默症分类Qiu 等2018使整个研究变得毫无意义。二元属性性别及其他离散属性被转换为单热向量。相反具有连续值的属性被集中化并归一化为零均值和标准差为一。缺失值的处理方式见第3.3节。数据集划分数据集被划分为五个大小相等且不重叠的子集确保每个子集保持年龄、性别和诊断的相似联合分布符合Wen等人2020提出的方法论。在这五个子集中四个用于交叉验证第五个子集留作测试详见附录C.1。划分涉及使用预定义的随机种子称为分裂种子对数据进行随机洗牌。这种系统化的数据拆分方法提升了评估过程的有效性和通用性展示了我们模型的稳健性消融实验和比较为了评估我们提出的HyperFusion方法在图像-表格数据融合中的有效性我们进行了全面分析将其与众多单模态和多模态模型进行了比较。单模模型包括为表格数据设计的基线MLP和为图像数据处理优化的预激活ResNet。基线MLP和ResNet均构成了我们完整的超网络复合体如图3C和图B左侧所示。我们比较的成像-表格融合模型包含多种方法。第一种称为“串接”涉及使用我们的预激活ResNet骨干见图3B但用常规预激活Res块替代HyperRes块。表格属性与倒数第二个全连通层串接这一技术在之前的研究中已有记载如Esmaeilzadeh等2018。此外我们将方法与两种当代成像-表格融合技术的结果进行了比较DAFTWolf等2022和Prabhu等2022提出的晚期融合方法。为确保公平比较并突出超网络的独特孤立贡献我们构建并训练了两个额外网络。具体来说我们使用了主要的网络骨干和训练方案包括提出的正则化加权类别损耗函数保持FiLMPerez等2018类FiLM实现和DAFTWolf等2022类DAFT实现的方法论。我们注意到FiLM的实现是基于Wolf等人2022的改进因为FiLM最初设计用于文本和自然图像融合。训练和评估我们使用Adam优化器进行训练并配合正则化的WCE损失方程。3 5如第3.2节和3.5.2节所述。WCE损失反映了训练数据中CN、MCI和AD类别之间的不平衡。然而使用标准的类别交叉熵损失同时对频率较低的类别进行过采样也能解决类别失衡问题。嵌入MLP在第3.5.2节中有详细讨论并在图3C中展示完全与训练表数据进行预训练以加快整个网络复合体的收敛。如第3.5.2节所述每个受试者的成像数据包含左右海马的两个三维子图像。在训练过程中我们通过在每次前馈迭代中随机选择任一子图像来增强数据集。为了在验证和测试中获得更好的预测我们对每个受试者的数据分别处理两次分别对应大脑一侧并对软决策进行平均。此外我们采用集合模型实现了增强测试结果详见第3.4节。为保证研究结果的稳健性我们采用了广泛的交叉验证策略涵盖三个独特的分裂种子每个种子分别进行三轮随机初始化版本。在每次交叉验证迭代中四个模型在不同的数据折叠上进行训练和验证。为了有效利用结果将特定版本和分裂种子中的四个模型汇总以评估它们在共享的未公开测试集中的整体表现。图中提供了可视化以更好地理解训练、验证和测试过程。附录C.1中的C.2。我们使用多种指标评估框架的性能并与其他模型进行比较。这些指标包括平衡准确率BA和精度PRC。这里c ∈ {CN MCI AD}T Pc F Nc F Pc 分别代表 c 类的真阳性、假阴性和假阳性值。此外我们使用了宏观 ROC 曲线下面积AUC和宏观 F1 评分。宏观 AUC/F1 评分是所有类别 AUC/F1 分数的算术平均值。这些指标考虑模型的整体表现。对于每个类别的具体评估我们还使用了每个类别的真阳性TP率TP-CN、TP-MCI、TP-AD。 详尽评估见附录 C.3图 C.3。结果和讨论本节对第4.3.5节讨论的所有模型与我们的超网络模型进行了全面比较评估了全局和类别特定指标。结果总结于表3和图5。在条形图和表格中我们展示了所有随机拆分和版本中测试数据的平均差和标准差。包括“DAFT类∗”和“FiLM类法∗的比较方法详见第4.3.5节。值得注意的是所有多模态方法在全局性能指标和几乎所有类别特定指标上均优于单模态模型。表3还展示了DAFTWolf等2022和晚期融合法Prabhu等2022在某些指标上的得分报告以及我们在第4.3.5节所述实施方法的得出结果。为公平评估比较我们注意到以下差异。Prabhu等人2022的晚期融合法使用了3256名受试者的数据集35.4% CN51.1% MCI13.5% AD均来自我们所使用的相同ADNI阶段。表格数据包含广泛的20项属性包括患者人口统计、病史、生命体征、神经生理检测结果、认知功能及其他相关诊断信息。其中一些属性是有意为之。如第4.3.3节所述已被排除在我们的研究之外。值得注意的是晚期融合法由于使用不平衡数据集存在两项指标之间的固有权衡获得了更高的PRC得分但BA结果较弱。通过在训练期间对损失函数应用类权调整尽管使用了更少的受试者和较少的表格属性集我们仍能获得比晚期融合方法结果更好的PRC和BA结果见附录C.4。报道的DAFT方法Wolf等2022使用了1341名受试者40.3% CN40.1% MCI19.6% AD来自同一ADNI来源的数据集并使用了类似的表格属性集。为解决数据大小差异我们还展示了使用类似DAFT方法实现所得的分数第4.3.5节。总体而言与其他单模态及多模态融合方法相比全球和类别特定指标的得分显示了所提超网络框架的优越性。通过Mann–Whitney U检验计算的p值评估了结果差异的统计显著性。讨论和总结我们引入超网络作为整合表格与影像数据复杂任务的解决方案。此外我们展示了这些网络如何基于患者的电子病历数据来调控患者的脑MRI分析。影像与表格信息的互动增强了对医学数据的理解促进了全面的诊断过程。我们方法的鲁棒性和通用性通过两种不同的临床应用得到了验证。提出的核心概念可适应不同的网络架构。此外预训练网络的直接集成到我们的框架中承诺加快收敛和提高准确性。综合来看这些方面使我们的方法成为数据融合的实用且多功能工具。我们的超网络方法超越了仅依赖成像或表格数据的模型。与许多融合方法通常采用简单连接或基于两种模式的混合决策不同包括一些仅限于特定变换的高级方法我们的方法因其更高的灵活性和自由度而脱颖而出确保了架构中卓越的数据利用率。令人惊讶的是当与最先进的融合技术进行基准测试时我们的方法不仅带来了更优的结果还展示了其统计显著性。在本研究中我们通过患者的电子健康记录EHR来调整图像处理采用一种直观的方法让人联想到通过患者的表格数据视角观看图像。未来研究的一个有趣方向是逆转这一过程将EHR分析条件化为图像。此外超越CNN和MLP领域探索超网络与其他架构的整合开辟了一条有前景的道路。此类适应可能为更广泛的数据模态中稳健的数据融合技术铺平道路。总之这项研究不仅识别并解决了关键的深度学习挑战还通过超网络提供了坚实的解决方案。这项工作的潜在影响从提升诊断到塑造个性化医疗的更广泛格局。随着DNN在医疗领域的快速发展像我们这样跨越多样数据模式的方法有望发挥重要作用。