超越展开:面向密集红外小目标的 60 倍快速单阶段解混

超越展开:面向密集红外小目标的 60 倍快速单阶段解混 大家读完觉得有帮助记得关注和点赞摘要受光学衍射极限和远距离成像的影响密集红外小目标CSIST通常表现为能量重叠在红外图像中呈现为不可区分的模糊斑块。这种模糊性使得传统检测的一对一映射假设失效从而需要向 CSIST 解混进行范式转换即将这些斑块分解为离散的亚目标。然而当前主流的深度展开网络DUN受限于其反复迭代架构所固有的高延迟和结构僵化。为此我们提出了 FOCUS快速单阶段 CSIST 解混方案一种单阶段轻量级范式证明 CSIST 解混并不需要深度展开。受图像超分辨率SR与 CSIST 解混共享同构退化模型这一关键观察的启发我们的洞见是通过完全转换标签空间、损失函数和评价指标可以实现从图像 SR 到 CSIST 解混的范式迁移。具体而言为避免几何恢复与伪影抑制相互纠缠FOCUS 采用单程映射内部包含由粗到细的流程逐步将目标定位从粗略空间分布细化到更精细的亚像素精度。虽然稀疏正则化能抑制背景杂波但也会削弱目标强度。为补偿有效信号的这种衰减我们引入通量守恒作为竞争约束将信号能量恢复到目标中心。据我们所知本工作首次尝试在不依赖 DUN 范式的情况下通过轻量级单阶段框架解决 CSIST 解混任务。实验表明我们的方法在定位和解混精度上达到或超越了最先进的展开方法同时推理速度提升了 60 倍。代码已开源https://github.com/GrokCV/GrokCSO。Ⅰ 引言图1IRSTD、SR 和 CSIST 解混的概念比较。IRSTD 采用一对一的范式通过边界框识别目标。SR 专注于视觉恢复同时仍保持一对一对应关系。相比之下CSIST 解混采用一对多范式从重叠的能量区域中恢复离散的亚像素点源。红外成像凭借其在低照度条件下工作和穿透大气遮蔽物的强大能力在早期预警、海上监视和边境防护等关键领域发挥着不可或缺的作用 [1]。然而随着远距离探测需求的增加 [2]感兴趣的目标如远距离飞行器由于成像距离远往往表现为强度微弱、对比度低的暗淡光斑 [3]。这对红外小目标检测IRSTD系统的准确性和鲁棒性提出了严格要求。然而当前的 IRSTD 研究主要聚焦于目标定位即“目标在哪里”。现有研究从经典滤波 [4]、分解 [5] 到深度学习架构 [6]其核心尝试都是突出暗淡目标同时抑制虚警。这种现状任务设定受限于一个默认假设衍射光斑与目标之间存在严格的一对一映射即图像中的每个光斑恰好对应一个真实目标 [7]。然而在实际中当目标变得密集如无人机集群且成像距离增大时光学能量扩散会导致多个相邻目标合并成一个重叠的模糊斑块 [8]从而产生所谓的密集红外小目标CSIST场景。传统 IRSTD 方法在这种场景下由于一对一假设而遭受漏计数和坐标丢失的问题如图 1 所示。为超越这一限制研究已从粗略检测转向精确解混构成了专门的任务——CSIST 解混 [7]。该任务是将能量重叠的斑块在亚像素级别解缠为离散的点源从而恢复其精确坐标和强度。因此与目标检测截然不同CSIST 解混本质上是一个一对多的逆映射问题。当前的 CSIST 解混方案依赖深度展开范式即将迭代算法映射为展开的层。例如DISTA-Net [9] 将迭代收缩阈值算法展开为动态框架。DeRefNet [7] 通过引入帧间对齐将该范式扩展到序列数据。这两种方法为单帧和多帧 CSIST 解混奠定了基础。近期STSA-Net [10] 通过在展开结构中引入目标敏感卷积和像素自适应阈值来改进该范式。随后DSCSNet [11] 采用基于交替方向乘子法ADMM[12] 的展开架构并施加严格的稀疏性约束以保护辐射能量峰值。这些模型共同表明深度展开范式为解决 CSIST 场景提供了有效途径。尽管有效但对展开迭代的依赖带来了结构性限制 [13]。算子的递归应用导致高计算开销进而造成推理延迟。此外网络层与数学步骤之间的耦合限制了模块化设计或轻量化优化的灵活性。这些缺点要求一种能够高速推理、避免迭代循环计算开销的直接映射架构。在本文中我们提出一种范式转换证明 CSIST 解混并不需要展开。确实虽然展开提供了解混的一种途径但它只是可能的选择而非唯一解。这一立场源于我们的关键观察CSIST 解混与图像超分辨率SR共享共同的数学基础因为两个任务都从同构退化模型Y H x n重构原始场景。因此一个自然的问题是我们能否舍弃繁琐的 DUN 范式转而利用超分辨率领域的高效、轻量级端到端网络来解决 CSIST 解混问题我们的答案是肯定的。通过转换标签空间、损失函数和评价指标我们成功地实现了范式迁移即将图像 SR 范式修改为解决 CSIST 解混问题。这一转换将通用卷积网络的优化从重建视觉纹理重定向到离散点源的精确反演。此外该策略消除了对迭代展开结构的依赖在保证架构灵活性的同时提高了推理速度。为此我们提出了 FOCUS快速单阶段 CSIST 解混方案一种轻量级单阶段架构由两个专用模块组成两者以共享的同构单元为基础。与将空间重建与伪影抑制混为一谈的通用图像 SR 网络不同FOCUS 采用内部由粗到细的流程显式分离两个目标第一个模块从低分辨率观测中恢复空间拓扑第二个模块执行残差细化以在全分辨率下抑制上采样伪影。为将信号能量集中到精确的目标位置带有稀疏正则化的双分支门控结构在抑制背景响应的同时以亚像素分辨率保留目标质心。然而稀疏化在抑制背景的同时不可避免地削弱目标信号幅度。因此引入通量守恒作为竞争约束将总重建能量锚定到其物理真值确保被抑制的能量恢复到目标中心而非丢失。实验表明FOCUS 在保持竞争性解混精度的同时相比迭代基线实现了 60 倍 的加速。我们的主要贡献总结如下新颖范式我们将 CSIST 解混重新表述为单阶段映射用轻量级前馈推理替代迭代式 DUN。约束设计我们提出了带有稀疏正则化和通量守恒约束的 FOCUS通过平衡约束权衡共同缓解背景干扰和幅度衰减。效率提升FOCUS 在保持竞争性解混精度的同时相比迭代范式实现了 60 倍 的加速。Ⅱ 相关工作Ⅱ-A 图像超分辨率作为一项基础的低层视觉任务 [14]图像 SR 旨在从降质观测中重建高保真细节从残缺测量中恢复丢失的高频信息 [15]。自 SRCNN [16] 开创端到端卷积映射范式以来该领域在架构设计上经历了快速发展。后续研究大致分为两个方向通过更深的残差网络如 SAN [17]、SRResNet [18]最大化重建质量以及通过轻量级结构如 IMDN [19]、RFDN [20]优化推理效率。这些进展赋予了现代 SR 网络强大的非线性拟合能力和高效的特征提取机制。然而如图 1 所示虽然图像 SR 旨在克服分辨率限制但其主要目标是视觉恢复 [21]增强纹理丰富度以生成连续且美观的图像。如果将一个模糊的红外光斑输入标准 SR 系统输出仍然是一个边缘更平滑、颗粒度更高的细化光斑而不是像 CSIST 解混那样物理分离的点源 [22]。受这些不同目标的驱动SR 和 CSIST 解混的技术路线已经分叉。SR 社区大多采用纯粹数据驱动的卷积神经网络如 ESPCN [23]、DBPN [24]。相比之下CSIST 解混社区则更倾向于模型驱动的深度学习特别是 DUN如 DISTA-Net [9]、DeRefNet [7]。这些方法将迭代优化算法展开为神经层嵌入稀疏先验以解决成像逆问题。我们的工作通过以下两个亮点弥合了这一差距跨领域适应与局限于低层视觉恢复的传统图像 SR 模型不同本方案将 SR 映射重新用于高层 CSIST 解混以恢复离散点目标。通量保持的稀疏策略与仅依赖平滑性优化的通用图像 SR 方法相比本工作开创性地将结构稀疏性和通量守恒作为竞争性训练约束实现了源锐度与幅度保真度之间的平衡。Ⅱ-B 密集红外小目标解混在过去十年中模型驱动的深度学习特别是 DUN已确立为计算成像中解决逆问题的主导范式 [25]。通过将迭代优化算法如 ISTA [26]、ADMM [12]展开为级联神经架构DUN 融合了物理模型的可解释性与深度网络的学习能力 [27, 28]。在 CSIST 解混的特定领域开创性工作如 DISTA-Net [9] 和 DeRefNet [7] 确立了一个严格的范式将解混任务重新表述为深度学习框架内的稀疏驱动信号恢复问题。随后STSA-Net [10] 通过目标敏感近端算子扩展了该范式DSCSNet [11] 则通过基于 ADMM 的展开和严格的 ℓ₁ 范数稀疏约束进行了扩展。从根本上说这些方法基于点扩散函数PSF[29] 显式构建感知矩阵。通过将数据保真度与稀疏正则化之间的交替展开为可学习的网络阶段它们有效地引导潜在特征从弥散观测域向高维离散解空间迁移。这种机制实现了可解释的源解缠并展示了突破衍射极限的潜力。尽管这些 CSIST 解混方法提供了理论保证但它们存在共同的局限受限于物理算子的僵化和迭代结构的递归特性。对固定退化算子的显式依赖使其难以适应空间变化的能量分布而网络的深度直接与推理延迟相关。我们的工作通过以下两个亮点解决这些结构瓶颈范式转换我们从僵化的多阶段迭代 DUN 架构转向灵活的单阶段前馈范式。这一根本性转变消除了递归优化瓶颈产生了显著更易于优化和适应的精简架构。推理加速通过用精简的单阶段前馈管道替代繁重的递归算子我们大幅降低了计算负担。该方法在不牺牲亚像素定位精度的情况下显著减少了计算延迟。Ⅲ 重新审视 CSIST 解混来自图像超分辨率的同构视角图2图像超分辨率左和 CSIST 解混右的同构前向成像管道视觉比较。两个任务共享由能量扩散、空间量化和后处理组成的统一数学结构但在其物理先验和潜在信号特性上有所不同。图像 SR 和 CSIST 解混都旨在从退化的低分辨率观测 Y 重建高分辨率信号 X。尽管应用背景不同两个任务的成像过程共享统一的数学框架 [30]。如图 2 所示这两个任务的前向成像过程遵循平行的结构。令下标 i ∈ {SR, CSIST} 表示特定任务。广义观测模型表述为其中 n_i ∈ ℝ^{h×w} 表示加性系统噪声_i: ℝ^{H×W} → ℝ^{h×w} 是复合退化算子。基于成像系统理论 [31]算子 _i 可分解为同构变换的顺序链_i _i ∘ _i ∘ _i。 (2)虽然结构映射在两个域中保持相同但在每个算子的实例化过程中物理解释和由此产生的潜在先验出现分歧。Ⅲ-1 光学模糊算子 _i 建模辐射能量的空间扩散。此过程被推广为真实信号与特定核之间的卷积_i(X_i) X_i ∗ h_i。 (3)在图像 SR 中核 h_SR 通常是人为模拟以模仿分辨率损失采用数学代理如高斯核各向同性模糊、方向线性核运动模糊或圆盘核散焦。相比之下对于 CSIST 解混退化 h_CSIST 是光学组件固有的物理 PSF。它包含了复杂的波光学效应包括波前像差、彗差和视场相关畸变这些都会扰动亚像素能量分布。Ⅲ-2 量化算子 _i 描述从连续光学域到离散数字域的映射。两个任务都涉及在探测器感光区域 Ω 上的网格级积分虽然两个任务都因这种采样而遭受信息损失但影响不同。在 SR 中这种离散化滤除了高频纹理细节。在 CSIST 解混中重叠能量分布积分成像素强度进一步破坏了亚像素位置信息。这种共享的退化结构使得两个任务都是高度欠定的逆问题。Ⅲ-3 后处理对于 SR_SR 通常涉及算法级处理如为存储效率进行的压缩或为增强训练鲁棒性而进行的增强这通常导致数字平滑、对比度调整或下采样。对于解混_CSIST 主要限于电子级退化反映读出电路在信号到达数字接口之前对红外信号的影响。Ⅲ-4 加性系统噪声n噪声项 n 进一步区分了任务。在 SR 管道中n_SR 通常包括自然传感器噪声和人为注入的噪声如 JPEG 伪影或合成高斯噪声以提高模型泛化能力。相反n_CSIST 严格基于红外探测器内的自然随机过程如暗电流和热波动建模。Ⅲ-5 范式迁移的理论基础_SR 与 _CSIST 之间的结构同构性表明为图像恢复而完善的特征提取架构可以重新用于物理解混。通过尊重潜在的稀疏性和辐射通量守恒范式可以从视觉美学转向离散辐射源的精确参数反演。Ⅳ FOCUS快速单阶段 CSIST 解混方案图3FOCUS 框架及其物理约束优化策略概览。(a-b) 该架构通过 DMM 和 SMM 模块采用由粗到细的流程并包含同构源生成单元ISGU该单元分叉强度路径和掩码路径以确保离散源恢复。(c-e) 标准超分辨率SR与所提解混范式之间的标签特征和预测演化比较。在联合 L_MSE、L_Sparsity 和 L_Energy 约束下的演化通过优化向量图可视化展示了为保持结构稀疏性和通量守恒以实现高保真信号重建而达到的竞争性平衡。Ⅳ-A 整体框架渐进式单阶段范式给定退化模型 y Φ(x) nCSIST 解混的目标是从观测到的低分辨率输入 y ∈ ℝ^{H×W} 重建高分辨率稀疏源图 x ∈ ℝ^{rH×rW}其中 r 是上采样因子。这构成了一个严重病态的逆问题 [32]。为高效求解我们提出了 FOCUS 框架。如图 3(a) 所示FOCUS 被构造为一种单阶段渐进式由粗到细流程。关键要区分我们的单阶段范式与传统单阶段网络如标准 SRCNN [16] 或 RCAN [33]。与传统黑盒范式其中上采样和恢复纠缠不清不同FOCUS 采用分层策略显式解耦几何恢复与物理保真度校正从而降低优化复杂度在统一的前馈流程中实现严格的物理精度。因此实现解耦重建-校正DRR策略我们将整体映射 ℱ_Θ 表述为一个全局学习过程。首先输入通过数字显微镜模块_DMM投影到高分辨率空间获得粗略的几何估计。随后为抑制该估计中固有的上采样伪影空间调制器模块ℛ_SMM 充当残差学习器。它预测一个稀疏校正图然后通过全局跳跃连接叠加到粗略估计上。数学上我们将这种渐进式由粗到细演化封装为一个统一的映射函数其中 ℱ_Θ 表示由 Θ 参数化的整体映射函数。σ(·) 代表 PReLU [34] 激活用于在残差学习之前将几何估计校正到有效的非负特征空间。该流程包含两个物理上不同的阶段数字显微镜模块DMM类似于放大微小标本的光学显微镜该模块_DMM充当几何投影器。它负责将信号从低维观测空间逆投影到高维目标空间11×11 → 33×33建立点源的空间拓扑。空间调制器模块SMM类似于在不改变放大倍数的情况下塑造波前的空间光调制器该模块ℛ_SMM充当稀疏性校正器。它在固定的高分辨率空间尺度1内运行仅专注于滤除上采样伪影如振铃效应并调制能量分布以拟合尖锐的狄拉克增量先验。Ⅳ-B 同构源生成单元ISGU如图 3(b) 所示支撑 DMM 和 SMM 的原子计算引擎是同构源生成单元ISGU。我们称之为同构因为两个阶段共享相同的拓扑架构反映我们的洞见无论是从背景噪声还是从计算伪影中物理检索点源都依赖于相同的稀疏结构。设 Z_in 为输入特征。ISGU 引入一种结构稀疏诱导架构将流程分叉为强度路径Z_int 估计潜在辐射能量而掩码路径Z_mask 估计空间存在概率。最终稀疏输出通过门控投影生成其中 _{×s} 表示尺度因子 s 的亚像素卷积DMM 中 s3SMM 中 s1ς 是 Sigmoid 激活⊙ 是哈达玛积。通过使用掩码物理门控强度ISGU 在架构层面显式强制结构稀疏性。Ⅳ-B1 动态物理约束为引导轻量级网络朝向物理有效解我们引入一个复合损失函数在三个约束之间编排动态博弈。该过程不是简单的误差求和而是力的竞争性平衡如图 3(c–e) 所示。优化从根本上由重建损失_rec锚定我们采用焦点均方误差MSE。数学上它最小化预测 x̂ 与真值 x 之间的方差该项充当空间锚。通过惩罚强度分布的偏差它迫使预测光斑的质心与真值对齐。然而为最小化轻微错位的空间惩罚MSE 固有地偏好平滑的高斯分布而非尖锐的狄拉克增量导致平滑偏差。为抵消这种平滑并消除背景噪声结构稀疏性强制项_sse 施加 ℓ₁ 正则化与 ℓ₂ 惩罚梯度在强度接近零时消失不同ℓ₁ 梯度保持恒定±1。这在整个图像平面上施加均匀的抑制力。它积极地将背景噪声和伪影截断为零但不可避免地也对目标信号施加相同的向下压力导致幅度衰减。关键地为解决抑制与保真度之间的冲突我们引入物理约束的通量对齐_pcfa该项充当全局通量锚。由于 _sse 已将背景抑制为零而 _rec 已将空间拓扑锁定到目标位置系统产生由能量赤字ℰ_ref - Σ x̂驱动的恢复力。由于背景区域受稀疏项强烈抑制优化景观迫使缺失的能量被注入空间锚允许的唯一活跃区域——目标质心。因此这种结构锐化了峰值并恢复了物理强度而不会导致能量漂移到背景。最终目标代表这些冲突但互补力的平衡该机制确保最终输出不仅在空间上准确而且物理上稀疏且能量守恒。Ⅴ 实验在本节中我们对所提出的 FOCUS 框架进行全面评估。核心目标是验证轻量级单阶段直接反演范式能否超越传统展开范式的局限。我们认为 FOCUS 不仅保持了迭代求解器的物理精度而且实现了推理效率的显著飞跃。Ⅴ-A 实验设置指标 评估同时考虑解混保真度和计算效率以评估所提单阶段范式的性能。为量化实时能力和架构轻量性报告每秒帧数FPS和浮点运算次数FLOPs。为评估亚像素解混的保真度我们采用平均精度mAP作为主要评价指标遵循 [9] 中的协议。mAP 定义为在五个亚像素距离阈值 d ∈ {0.05, 0.10, 0.15, 0.20, 0.25} 像素处计算的平均精度AP_d的均值。这种多阈值方法严格惩罚空间定位偏差和辐射强度估计误差反映了一对多分解的准确性。训练设置 FOCUS 框架在 PyTorch 中实现并通过复合损失 _total _rec λ₁ _sse λ₂ _pcfa 进行优化。通过交叉验证惩罚系数设为 λ₁1×10⁻⁴结构稀疏性和 λ₂0.1通量校准。模型使用 Adam 优化器训练 300 轮批量大小 64初始学习率 1×10⁻³。为确保吞吐量比较的公平性所有模型包括基线均在单张 NVIDIA GeForce RTX 4090 GPU 上评估。图4CSIST-100K 训练集目标数量分布。(a) 按目标数量的比例。(b) 每类绝对样本数。分布遵循近似二项模式2–4 个目标场景占主导86.7%。数据集 我们在 CSIST-100K 数据集 [9] 上评估这是一个用于 CSIST 解混的大规模合成基准包含 80,000 个训练样本、10,000 个验证样本和 10,000 个测试样本。每个样本包含一个 11×11 低分辨率红外观测和对应的 33×33 高分辨率真值通过高斯 PSF 退化模型σ0.5合成。除原始数据描述外我们进一步分析目标数量分布发现其遵循近似二项模式图 42–4 个目标场景占主导86.7%与亚像素距离内密集目标的实际出现频率一致而单目标和五目标场景各保留约 6.6%以增强对密度极值的泛化能力。验证集和测试集遵循相同分布。Ⅴ-B 与现有先进方法的比较表Ⅰ在 CSIST-100K 数据集上与最先进的深度展开和超分辨率范式的定量比较。粗体和 * 分别表示最佳结果和性能上限在底部行突出显示。模型mAPAP05AP10AP15AP20AP25FPSFLOPsCSIST 解混的深度展开范式LIHT [35]10.350.060.924.9914.7430.50460091.36 GLAMP [36]14.220.051.117.3121.5641.06126250.28 GLISTA [37]30.130.254.1322.2951.1872.82341111.36 GISTANet [27]44.990.407.1040.1082.6094.80212711.37 GISTANet [27]45.570.306.7040.4084.3096.00169624.33 GDISTA-Net [9]46.470.306.7041.2086.4097.601099235.10 GFISTANet [38]44.970.507.7040.4081.8094.501251618.96 GTiLISTA [39]14.950.061.237.7222.5046.2394080.28 GUSRNet [40]41.820.306.8035.7075.7090.50108436.02 GRPCANet [41]45.470.306.6040.2083.8096.40189247.39 G为 CSIST 解混修改的图像超分辨率范式RLFN [42]29.030.203.4020.0048.6073.00223303.86 GSMFANet [43]28.010.203.4019.6047.1069.80128891.29 GCGA [44]45.220.407.2039.7083.0095.90178411.95 GRDN [45]45.570.307.2040.6083.5096.2050500.17 TEDSR [46]45.410.407.5041.0082.9095.30280753.02 GASSA [47]43.500.306.3037.2079.7094.00213812.74 GPFT [48]45.340.408.1039.5082.3096.4010769.78 GSSIU [49]43.730.407.0038.9079.7092.7071870.46 GCAMixerSR [50]44.870.407.2040.1082.3094.40113820.42GFOCUS我们的45.500.407.3041.0083.2095.501225221.63 GFOCUS我们的*46.530.407.4042.2085.6097.001100341.49 GⅤ-B1 与深度展开网络的比较表Ⅰ的上半部分将 FOCUS 与深度展开范式进行了比较。ISTANet 被用作基础基线因为它代表了当前 CSIST 解混研究中主导的原型递归架构。虽然最近的扩展如 DISTANet 引入了动态参数以提高精度但基本的计算代价仍然是底层 ISTANet 递归的固有属性。通过将 FOCUS 与该基础框架进行比较约 60 倍 的加速122,522 vs 2,127 FPS凸显了消除迭代循环本身所带来的效率飞跃。虽然标准 FOCUS 取得了有竞争力的 mAP 45.50%但迭代变体 FOCUS 被评估以探索性能上限。在与 DISTANet 相当的吞吐量约 11,000 FPS下FOCUS 相比 DISTANet 取得了更高的 mAP。这验证了参数驱动的同构逻辑特别是自适应阈值和可学习步长的集成为源恢复提供了比传统展开单元更精确的表示。结果证实只要网络逻辑由适当的结构约束引导展开对于实现高解混保真度并非必需。这一效率增益使 FOCUS 成为高速红外感知的可行解决方案而传统迭代循环在其中成为主要延迟。Ⅴ-B2 与修改后的超分辨率范式的比较与为解混任务重新制定了标签空间、损失函数和评价指标的修改后图像 SR 范式相比FOCUS 在精度、计算成本和推理吞吐量之间建立了卓越的平衡。标准重建模型固有地针对视觉纹理进行优化这导致平滑偏差将离散辐射源合并为连续能量团。虽然现代架构如 CAMixerSR 和 EDSR 实现了分辨率增强但由于缺乏显式稀疏约束它们在解混保真度上往往落后。例如CAMixerSR 的 mAP 为 44.87%低于 FOCUS尽管需要更高的计算预算20.42G vs 1.63G FLOPs。关键地FOCUS 的吞吐量达到 122,522 FPS比 CAMixerSR1,138 FPS快 100 倍以上比精确的 CGA 方案1,784 FPS快 60 倍。即使与 SSIU 等轻量级模型相比FOCUS 仍保持 17 倍的速度优势同时 mAP 提升近 2%。另一方面RLFN 等模型尽管速度高但未能捕获红外目标的稀疏性导致 mAP 相比 FOCUS 严重下降。FOCUS 的优越性归功于 ISGU 架构其中掩码路径显式门控强度路径以强制结构稀疏性。这一设计代表了重建原则对离散点源反演的成功适应。通过将任务特定约束注入前馈流程FOCUS 允许一个 1.63G FLOPs 的模型以精度和速度解析混叠能量区域性能优于重型迭代和视觉恢复范式证明架构效率不必以牺牲源恢复精度为代价。图5CSIST-100K 数据集上不同目标密度下的解混结果视觉比较。每行代表从单目标到五个拥挤目标的具体场景列显示不同范式的重建结果。红色框突出显示亚像素目标簇的放大细节。这些结果证实即使在高度拥挤的场景中所提框架仍保持稳健的解混性能和精确定位。Ⅴ-C 视觉分析图 5 展示了 CSIST-100K 数据集上不同目标密度下重建结果的定性比较。总体而言FOCUS 在保持高重建精度的同时实现了模型参数的显著减少这种平衡在所有测试场景中视觉上都很明显。具体地单目标结果表明FOCUS 提供的分辨率增强不会引入空间畸变或损害孤立红外目标的定位精度。这表明模型在上采样过程中有效保留了红外信号的点状特性。与深度展开方法如 ISTA-Net 和 FISTA-Net相比FOCUS 在恢复目标强度和锐利边缘方面表现出更高的精度。此外将 FOCUS 与 SR 方法如 ESPCN、SRCNN 和 CAMixerSR进行比较时出现了明显的性能差距。随着混叠目标从三个增加到五个这些基于 SR 的方法遭受严重的块状伪影和模糊能量分布无法区分密集目标。相比之下FOCUS 即使在高度拥挤的场景中也能一致地产生清晰且可区分的重建。总之这些视觉结果证实 FOCUS 有效平衡了模型效率与高保真重建。它对混叠干扰保持鲁棒使其成为红外压缩感知重建的可靠解决方案。Ⅴ-D 消融研究我们沿三个递进维度构建消融研究架构设计的合理性、物理引导约束的有效性以及跨不同场景的泛化能力。表Ⅱ在 CSIST-100K 数据集上对所提组件的消融研究。基线SSEPGFCHCFmAP (%)AP20AP25✓42.6177.3089.70✓✓43.74 (1.13)79.3090.00✓✓✓44.10 (0.36)79.9091.30✓✓✓✓45.50 (1.40)83.2095.60Ⅴ-D1 不同设计的影响为评估 FOCUS 内每个组件的单独贡献在 CSIST-100K 数据集上进行了增量消融研究。一个通用的单阶段回归网络作为基线mAP 为 42.61%AP25 为 89.70%。表Ⅱ中总结的结果验证了每个设计元素对于解析亚像素辐射源都是必要的。通过 ISGU 掩码路径集成结构稀疏性强制SSE使 mAP 提高了 1.13%。该机制引入抑制力将低强度背景杂波推向零促进更锐利的目标质心形成。这种稀疏诱导的好处体现在亚像素定位精度上AP20 从 77.30% 升至 79.30%。通过惩罚输出强度的绝对和SSE 确保网络优先采用稀疏解以对抗卷积层典型的能量扩散。然而L1 范数的向下梯度也可能在抑制背景的同时导致目标信号衰减。物理引导通量校准PGFC 通过将辐射能量锚定到参考水平来解决这种衰减。通过与 SSE 的抑制力形成平衡PGFC 将能量重新分配到识别的目标坐标。该过程将 mAP 提升至 44.10%AP25 提升至 91.30%。这一结果证实通量守恒对于在强制稀疏性的同时保持离散源的辐射保真度是必要的。SSE 与 PGFC 之间的相互作用确保模型在不牺牲辐射幅值的情况下锐化目标响应。表Ⅲ不同约束配置下 TP 检测与 GT 之间的平均强度偏差。绝对值越低表示幅度恢复越好。约束Δ幅度相对提升AP05AP10AP05AP10ℒ_MSE-66.223-68.061––ℒ_Sparsity-52.478-54.87320.76% (↑)19.38% (↑)ℒ_Energy-49.036-53.3666.56% (↑)2.75% (↑)HCF 流程的引入带来了最可衡量的性能增益将 mAP 提升 1.40% 至 45.50%。该策略将粗略空间拓扑恢复与亚像素坐标细化解耦到专用模块中。与未区分的单阶段架构相比隔离几何估计与伪影抑制减少了优化纠缠。这种分层策略的有效性体现在严格定位指标的提升上AP20 达到 83.20%AP25 达到 95.60%。这种层级确保网络逻辑收敛到尖锐的狄拉克增量先验。总体而言这些结果证明了从迭代展开向任务特定的直接映射范式转换的合理性。Ⅴ-D2 约束的影响表Ⅲ考察了在渐进约束集成下检测相对于真值的幅度恢复保真度。图6逐步添加约束后的能量强度变化。这些约束的个体影响通过图 6 中的代表性案例可视化。理论上稀疏正则化施加均匀的向下压力如果单独使用将削弱信号强度。然而作为均方误差空间锚定之外的辅助约束稀疏强制主要抑制弥散背景噪声和低强度虚警。这种竞争性交互迫使网络将辐射通量集中到预测的目标坐标导致表Ⅲ中观察到的强度增长。具体而言在 0.05 像素阈值处的幅度误差从 66.22% 改善到 52.48%增益达 20.76%。随后通量守恒提供目标能量校准进一步消除残余虚警。通过将总预测通量锚定到参考水平该约束促进能量从被抑制的伪影重新分配到目标质心。这种恢复过程在 0.05 像素阈值处额外减少 6.56% 的幅度赤字在 0.10 像素阈值处减少 2.75%。在放宽阈值处递减的收益与通量守恒关注细粒度幅度保真度而非粗略定位一致。虽然图 6 中的 3D 可视化为特定实例说明了这种能量重新分配但表Ⅲ中的统计数据证实这些约束在整个数据集上充当互补力。稀疏性与能量守恒之间的协同建立了恢复性平衡通过保持空间离散性和辐射准确性确保了解混保真度。表Ⅳ不同高斯噪声水平下的鲁棒性评估。σFOCUSASSACAMixerCGAISTANetUSRNet045.5043.5044.8745.2244.9941.820.0545.4536.4444.8020.9344.9441.740.145.3736.4344.6119.9244.8141.510.344.5135.8842.9817.5843.7239.240.641.8734.5438.4816.1240.2432.481.037.1231.5333.1014.9834.8923.04图7对高斯噪声的鲁棒性。FOCUS 在所有噪声水平下保持持续更高的性能轨迹而竞争方法在训练分布之外表现出更陡峭的退化。Ⅴ-D3 泛化——对高斯噪声的鲁棒性通过向测试输入注入标准差 σ 从 0 到 1.0 的高斯噪声来评估解混方案对加性噪声干扰的弹性。这一选择范围从理想观测到远远超出训练分布限于 σ≤0.05的退化条件。表Ⅳ中总结的定量结果和图 7 中说明的性能轨迹证实FOCUS 在所有噪声强度下都保持了持续的领先。在无噪声条件σ0下FOCUS 达到 45.50% 的 mAP优于最佳重建模型 CAMixer 和最强展开基线 ISTANet。对退化曲线的详细分析揭示了所提范式与现有模型之间泛化能力的明显分歧。当噪声强度超出训练边界时所有竞争方法都表现出急剧的性能下降。通用架构的脆弱性在 CGA 中最为明显它从 σ0 时的 45.22% 立即坍缩到 σ0.05 时的 20.93%最终达到 14.98% 的底部。类似地USRNet 和 ASSA 等基于 SR 的模型显示出快速下降轨迹表明纯粹数据驱动拟合在分布外扰动下无法保持信号完整性。相比之下FOCUS 表现出优雅退化的特性即使在最高噪声水平下仍保持 37.12% 的 mAP。这种稳健性能表明辐射通量守恒与结构稀疏性的整合提供了一种恢复性平衡防止了解混逻辑失效。通过将优化锚定到辐射真值水平而非仅依赖学习的纹理模式FOCUS 有效区分辐射目标尖峰与随机背景波动。在 σ1.0 时 FOCUS 与次优竞争者 ISTANet 之间不断扩大的性能差距37.12% vs 34.89%进一步证实了单阶段映射架构在确保一致解混保真度方面的优势。总体而言这些结果验证了一个良好约束的直接映射范式可以在不需要迭代求解器或重训练的情况下在多样传感器环境中提供稳定的源恢复。表Ⅴ不同泊松噪声水平下的鲁棒性评估。峰值FOCUSASSACAMixerCGAISTANetUSRNet1000044.3842.2843.5443.3943.8540.42500043.3641.0642.3541.9342.7339.11100035.9834.0334.9832.9835.7131.6550030.0828.4129.2227.0830.0125.8925523.5821.7923.1721.4923.0220.09图8对泊松噪声的泛化。FOCUS 在整个峰值光子计数范围内从科学级传感器峰值10000 到严重光子匮乏条件峰值255持续领先所有竞争方法。Ⅴ-D4 泛化——对泊松噪声的鲁棒性泊松噪声源于光子探测的离散量子特性是低光红外成像中的主要干扰源。本评估考虑了代表性比较方案在从科学级传感器峰值 10000到严重光子匮乏条件峰值 255的峰值光子计数谱上的表现。如表Ⅴ详述FOCUS 在所有噪声强度下保持最高的 mAP 分数。为量化这种鲁棒性图 8 展示了各模型相对于 ISTANet 基线的性能偏差。虽然 ISTANet 提供了稳定的迭代参考但 FOCUS 始终在此基线上产生正余量证实了单阶段映射架构可以跨不同传感器状态可靠泛化。所提框架的优势随着光子计数的减少而变得更加可测量。在峰值强度 1000 时FOCUS 达到 35.98% 的 mAP保持对 CAMixer 和 CGA 的持续领先。在峰值 255 的极端条件下信噪比严重受损USRNet 和 ASSA 等通用重建模型遭受精度崩溃远低于 ISTANet 基线。相比之下FOCUS 保持 23.58% 的 mAP比次优迭代模型高出 0.56%。这种弹性归因于通量守恒与结构稀疏性之间的竞争性平衡。通过将总能量锚定到辐射真值FOCUS 防止了通用恢复模型在背景抑制期间典型的目标尖峰过度衰减。这些结果共同验证了直接映射范式在无需迭代求解器递归延迟的情况下确保了优越的信号完整性使 FOCUS 成为不利感知环境下鲁棒的解混解决方案。表ⅥFOCUS 在不同目标数量下的解混精度。数量mAPAP05AP10AP15AP20AP25151.100.6010.4051.5093.20100.00249.400.509.7047.0090.5099.10347.600.408.7044.9086.4097.60442.700.305.9036.6078.0092.60538.100.104.4031.6068.4086.20图9不同目标数量下解混精度的可视化。扇形图展示了五个距离阈值内圈到外圈上 AP 分数在数量 1 到 5扇形段上的分布。Ⅴ-D5 泛化——跨目标密度的性能为评估 FOCUS 在不同目标密度下的鲁棒性我们在包含 1 到 5 个空间邻近目标的场景上进行实验。定量结果详见表Ⅵ并通过图 9 的扇形热图进一步可视化。结果表明FOCUS 在所有密度水平上均产生卓越的解混保真度。对于孤立目标数量 1模型达到 51.10% 的 mAP在 AP25 阈值上达到完美的 100% 准确率。随着目标数量从 1 增加到 5性能呈优雅退化而非急剧崩溃。具体地即使在 5 个目标的拥挤场景中FOCUS 仍保持 38.10% 的 mAP 和 86.20% 的 AP25。这种下降趋势与 CSIST 任务的物理性质一致即更高的目标密度导致严重的能量混叠和重叠的点扩散函数提升了源分离的难度。所提框架的优越性在精确定位中尤为明显。如扇形热图所示虽然 AP05 由于 0.05 像素精度的极端挑战而保持较低但 AP20 和 AP25 的分数即使在目标更密集时仍保持较高。这一性能表明同构单元和物理引导约束有效地将辐射能量集中到离散坐标防止了标准架构中常见的平滑偏差。在最高密度数量 5下在 0.25 像素半径内解析 86.20% 目标的能力证实 SOURCE 为拥挤红外源恢复提供了可靠解决方案。表Ⅶ更高上采样因子下的性能比较。模型#参数FLOPsmAPAP10AP15c5ISTANet0.171M39.54G62.5753.880.5ISTANet0.225M48.16G63.4553.281.9FISTANet0.038M55.99G61.5350.779.0FOCUS我们的0.055M4.26G64.6154.683.7c7ISTANet0.171M89.51G68.8774.681.1ISTANet0.255M103.00G71.0974.984.9FISTANet0.038M0.12T67.8171.780.3FOCUS我们的0.069M8.19G73.2879.686.7Ⅴ-D6 对更高上采样因子的可扩展性FOCUS 的弹性在更高上采样因子 c5 和 c7 下进一步检验。这些尺度通过二次方扩展亚像素定位所需的潜在空间增加了解混任务的病态性。如表Ⅶ报告单阶段范式在两种分辨率设置下始终提供卓越的精度。FOCUS 在 c5 时达到 64.61% 的 mAP在 c7 时达到 73.28%相比最强展开基线 ISTANet 取得了可测量的改进。详细分析表明所提框架的精度领先随着上采样因子的增长变得更加明显。FOCUS 与 ISTANet 之间的性能差距从 c5 的 1.16% 扩大到 c7 的 2.19%。这一趋势表明由粗到细层级在高分辨率映射固有的维度挑战面前比展开架构的重复循环更鲁棒。通过隔离空间拓扑恢复与坐标细化FOCUS 避免了在高度欠定场景中常影响递归模型的优化纠缠。此外FOCUS 的计算扩展性相对迭代方案显示出明显优势。虽然 FISTANet 和 ISTANet 等基线的 FLOPs 急剧上升FISTANet 在 c7 时达到 0.12TFOCUS 仅保持 8.19G 的高效足迹。这种差异证实了直接映射范式解决了迭代求解器的计算代价后者通常随分辨率需求的增加而扩展性差。一个轻量级网络利用极少计算预算超越重型迭代模型的能力验证了物理引导映射逻辑的有效性。总体而言这些结果证实 FOCUS 在不同上采样因子上优雅泛化在解混保真度和推理效率之间保持恢复性平衡。Ⅵ 结论为解决迭代展开方法固有的计算开销和延迟特征本文介绍了 FOCUS一种单阶段前馈 CSIST 解混范式。通过识别图像 SR 与 CSIST 解混的退化模型之间的数学同构性我们建立了将高效卷积架构适应于解混的理论基础。结构稀疏性和通量守恒的整合将优化从视觉平滑转向离散辐射源的精确反演。定量评估证实FOCUS 相比 ISTANet 基线实现了约 60 倍 的加速而展开变体 FOCUS 通过超越当前最先进的展开模型达到了更高的精度记录。这一从迭代求解器到直接映射的转换为时间敏感场景中的高速 CSIST 解混开辟了实用路径。