跳到正文
TranquilYu's Blog
返回

【论文阅读 | TPAMI 2024 | IVIF任务进展和应用概述:从数据兼容性到任务适配性】

约 29 分钟 · 10,706 字
论文阅读
文章目录62 节
  1. 1.1 可见光(VIS)与红外(IR)回顾
  2. 1.2 IVIF 的任务定位
  3. 1.3 这篇 TPAMI 综述在做什么?
  4. 2.1 IVIF 任务定义
  5. 2.2 实际应用中的两大核心难点
  6. 2.3 从数据到任务的完整流程
  7. 3.1 用于视觉增强的融合方法
  8. 3.1.1 基于自编码器(Auto Encoder)的方法
  9. (a)融合规则改进
  10. (b)网络架构创新
  11. 3.1.2 基于 CNN 的方法
  12. (1)优化驱动 CNN(Optimization-inspired)
  13. (2)损失函数驱动(Loss is almost everything)
  14. (3)架构创新(Architecture matters)
  15. 3.1.3 基于 GAN 的方法
  16. (1)单判别器(Single Discriminator)
  17. (2)双判别器(Dual Discriminators)
  18. 3.1.4 基于 Transformer 的方法
  19. 代表方法
  20. 优缺点小结
  21. 3.2 面向应用的融合(任务适配)
  22. 3.2.1 面向目标检测的融合
  23. (1)TarDAL:双层优化的目标感知融合
  24. (2)DetFusion:检测驱动注意力指导融合
  25. (3)MoE-Fusion:混合专家(Mixture of Experts)
  26. (4)MetaFusion:元特征嵌入
  27. (5)不显式生成融合图的多模态检测方法(对照)
  28. 3.2.2 面向语义分割的融合
  29. (1)SeAFusion:融合 + 分割级联 + 语义损失
  30. (2)SuperFusion:多功能配准 + 融合 + 语义感知框架
  31. (3)PSFusion:渐进式语义注入
  32. (4)SegMiF:双任务相关性的联合学习
  33. (5)MRFS / CAF / TIMFusion 等统一感知驱动框架
  34. 3.2.3 其他感知任务(略)
  35. 3.3 数据兼容性:未配准、通用融合与对抗攻击
  36. 3.3.1 未配准(Misaligned)图像的融合
  37. (1)基于风格迁移的配准 + 融合范式
  38. (2)基于潜在空间的模态无关特征
  39. 3.3.2 通用融合框架(General Fusion)
  40. (1)损失函数创新方向
  41. (2)架构设计方向
  42. 3.3.3 对抗攻击与鲁棒性
  43. 3.4 架构总结与讨论
  44. 3.5 损失函数总结与讨论
  45. 4.1 数据集概览
  46. 4.1.1 早期面向融合的数据集
  47. 4.1.2 目标检测数据集
  48. 4.1.3 语义分割数据集
  49. 4.2 评估指标
  50. 4.2.1 融合质量指标(9 个)
  51. 4.2.2 配准指标
  52. 4.2.3 感知任务指标
  53. 5.1 图像融合质量(TNO / RoadScene / M³FD)
  54. 5.2 未对齐图像融合性能(RoadScene / M³FD)
  55. 5.3 面向目标检测的融合性能(M³FD + YOLOv5)
  56. 5.4 面向语义分割的融合性能(FMB + SegFormer)
  57. 5.5 计算效率与资源消耗
  58. 6.1 未配准 & 对抗鲁棒性
  59. 6.2 任务驱动的融合设计
  60. 6.3 更大、更真实、更难的数据集
  61. 6.4 更合理的评价体系
  62. 6.5 轻量化与部署友好
文章目录62 节
  1. 1.1 可见光(VIS)与红外(IR)回顾
  2. 1.2 IVIF 的任务定位
  3. 1.3 这篇 TPAMI 综述在做什么?
  4. 2.1 IVIF 任务定义
  5. 2.2 实际应用中的两大核心难点
  6. 2.3 从数据到任务的完整流程
  7. 3.1 用于视觉增强的融合方法
  8. 3.1.1 基于自编码器(Auto Encoder)的方法
  9. (a)融合规则改进
  10. (b)网络架构创新
  11. 3.1.2 基于 CNN 的方法
  12. (1)优化驱动 CNN(Optimization-inspired)
  13. (2)损失函数驱动(Loss is almost everything)
  14. (3)架构创新(Architecture matters)
  15. 3.1.3 基于 GAN 的方法
  16. (1)单判别器(Single Discriminator)
  17. (2)双判别器(Dual Discriminators)
  18. 3.1.4 基于 Transformer 的方法
  19. 代表方法
  20. 优缺点小结
  21. 3.2 面向应用的融合(任务适配)
  22. 3.2.1 面向目标检测的融合
  23. (1)TarDAL:双层优化的目标感知融合
  24. (2)DetFusion:检测驱动注意力指导融合
  25. (3)MoE-Fusion:混合专家(Mixture of Experts)
  26. (4)MetaFusion:元特征嵌入
  27. (5)不显式生成融合图的多模态检测方法(对照)
  28. 3.2.2 面向语义分割的融合
  29. (1)SeAFusion:融合 + 分割级联 + 语义损失
  30. (2)SuperFusion:多功能配准 + 融合 + 语义感知框架
  31. (3)PSFusion:渐进式语义注入
  32. (4)SegMiF:双任务相关性的联合学习
  33. (5)MRFS / CAF / TIMFusion 等统一感知驱动框架
  34. 3.2.3 其他感知任务(略)
  35. 3.3 数据兼容性:未配准、通用融合与对抗攻击
  36. 3.3.1 未配准(Misaligned)图像的融合
  37. (1)基于风格迁移的配准 + 融合范式
  38. (2)基于潜在空间的模态无关特征
  39. 3.3.2 通用融合框架(General Fusion)
  40. (1)损失函数创新方向
  41. (2)架构设计方向
  42. 3.3.3 对抗攻击与鲁棒性
  43. 3.4 架构总结与讨论
  44. 3.5 损失函数总结与讨论
  45. 4.1 数据集概览
  46. 4.1.1 早期面向融合的数据集
  47. 4.1.2 目标检测数据集
  48. 4.1.3 语义分割数据集
  49. 4.2 评估指标
  50. 4.2.1 融合质量指标(9 个)
  51. 4.2.2 配准指标
  52. 4.2.3 感知任务指标
  53. 5.1 图像融合质量(TNO / RoadScene / M³FD)
  54. 5.2 未对齐图像融合性能(RoadScene / M³FD)
  55. 5.3 面向目标检测的融合性能(M³FD + YOLOv5)
  56. 5.4 面向语义分割的融合性能(FMB + SegFormer)
  57. 5.5 计算效率与资源消耗
  58. 6.1 未配准 & 对抗鲁棒性
  59. 6.2 任务驱动的融合设计
  60. 6.3 更大、更真实、更难的数据集
  61. 6.4 更合理的评价体系
  62. 6.5 轻量化与部署友好

题目:Infrared and Visible Image Fusion: From Data Compatibility to Task Adaption

会议:IEEE Transactions on Pattern Analysis and Machine Intelligence (IEEE TPAMI)

代码:https://github.com/RollingPlain/IVIF_ZOO

时间:23 December 2024

本文将近年来的IVIF方法进行了总结分析,可以将本文当做快速学习IVIF方法的途径


1. 引言:从光谱到 IVIF

1.1 可见光(VIS)与红外(IR)回顾

典型互补性:
VIS:看清细节、结构
IR:看清重要目标
→ 于是不难想到:把两者融合成一张“既清晰又目标突出的”图像。

1.2 IVIF 的任务定位

红外与可见光图像融合(IVIF)的目标:

给定一对 IR / VIS 图像,生成一张融合图像 F,使其包含:

  • VIS 的纹理与结构信息
  • IR 的显著目标与轮廓信息
    同时兼顾视觉效果(给人看)与感知性能(给机器看)。

IVIF 早期主要是作为图像增强技术,服务于夜视、监控等“人眼观察”;
近年来逐渐变成多模态感知的前端模块,服务于:

1.3 这篇 TPAMI 综述在做什么?

论文的核心点不是简单罗列方法,而是提出了一个三维视角

  1. 数据兼容性(Data Compatibility)

    • 未配准图像如何处理?
    • 对抗样本 / 传感器扰动如何应对?
  2. 融合方法(Image Fusion)

    • AE / CNN / GAN / Transformer / 通用融合框架
    • 损失函数和网络架构如何演化?
  3. 任务适配(Task Adaption)

    • 如何为检测 / 分割等下游任务设计“任务驱动”的融合网络?
    • 如何评估“好看”和“好用”的平衡?

本综述整理了 180+ 种深度学习 IVIF 方法,结合大量对比实验、表格与可视化结果,给出了当前研究现状与未来趋势。


2. 任务定义与整体流程

2.1 IVIF 任务定义

给定一对由不同传感器采集的 IR / VIS 图像:

要求:

2.2 实际应用中的两大核心难点

  1. 未必有“完美配准”的数据

    • 不同相机视角、安装方式、分辨率都不一样;
    • 精准像素级对齐很难,特别是移动平台、动态场景。

    也就是说,一般没有红外与可见光两张图重合起来完美重合的情况,会有一些偏差。

  2. 很多方法只优化“图像质量”,忽视“任务表现”

    • 只看 MI / VIF / AG / SF 等融合指标;

    • 但在目标检测 / 语义分割等任务上表现平平甚至退化。

正因如此,我们需要“任务驱动的融合”:在训练时就把 YOLO / SegFormer 等网络拉进来一起优化。

2.3 从数据到任务的完整流程

可以将上图抽象成三步:

数据兼容性 → 融合网络 → 任务网络


3. 文献综述:方法、任务与数据兼容性

本节是组会的主要部分,按三条线讲:

  1. 用于视觉增强的融合方法(AE/CNN/GAN/Transformer);
  2. 面向应用任务的融合(检测 / 分割 / 其他);
  3. 针对数据兼容性的未配准、通用融合框架与对抗攻击。

图4. 包含典型融合方法的分类桑基图。


3.1 用于视觉增强的融合方法

假设数据已经对齐,目标是“图像本身要好看、信息量大”。

这类方法大多遵循统一 pipeline):

特征提取(Encoder / Backbone)

特征融合(Fusion Rule / Attention)

图像重建(Decoder / Generator)

3.1.1 基于自编码器(Auto Encoder)的方法

基本范式

  1. 预训练自编码器 AE:

    • 可以用 VIS 图(单模态)或 IR/VIS 图对(多模态)进行训练;
    • AE 学到“如何从特征重建图像”。
  2. 图像重建(推理阶段):

    • IR / VIS 分别通过共享的 Encoder 得到特征 (F_{IR}, F_{VIS});
    • 某种融合规则得到 (F_{Fuse});
    • Decoder 将 (F_{Fuse}) 重建为融合图。

核心问题:哪种“融合规则”。

(a)融合规则改进

(b)网络架构创新

现有的 AE 方法可分为两类:


3.1.2 基于 CNN 的方法

当前数量最多的一类。此类算法的关键优势在于它们能够从数据中自主学习复杂的高级特征。

仍然遵循三步:特征提取 → 融合 → 重建,区别在于:

  1. 是否由优化模型展开(Optimization-inspired);
  2. 损失函数如何设计(Loss-driven);
  3. 网络结构如何堆叠(Architecture)。

(1)优化驱动 CNN(Optimization-inspired)

思想:把传统的优化模型或变分模型“展开”为网络,每一层对应一次迭代。

优化驱动 CNN 的共同特点:
“每一层做一小步优化”,有可解释性,而且适合写理论/推导。

(2)损失函数驱动(Loss is almost everything)

无监督 IVIF 没有 GT 融合图 → 损失函数几乎决定模型上限。

实际上,很多方法网络”长得“差不多,真正区别在损失函数怎么写。

(3)架构创新(Architecture matters)

在基于 CNN 的图像融合方法领域,有三种创新方法脱颖而出:


3.1.3 基于 GAN 的方法

GAN 天然适合“无监督分布建模”,与 IVIF 相当契合。GAN在无需标签监督的情况下对数据分布进行建模方面已证明其有效性。这种无监督方法自然适用于 IVIF 任务,GAN 已成为主要的方法之一。:

但也存在典型问题:

(1)单判别器(Single Discriminator)

单判别器方法利用原始 GAN ,将融合图像约束为与一种模态相似。

单判别器的普遍问题:监督信号偏向单模态,难以同时保留 IR + VIS 两端的优势。

(2)双判别器(Dual Discriminators)

双判别器方法利用两个判别器来平衡典型的模态信息。···································································

总结:GAN 系方法在视觉效果上很亮眼,但
在检测 / 分割等任务上的提升并不必然优于 CNN / Transformer 系。


3.1.4 基于 Transformer 的方法

核心:用自注意力建模长程依赖 + 跨模态交互

总体上的趋势还是:CNN + Transformer 混合结构

代表方法

优缺点小结


3.2 面向应用的融合(任务适配)

说人话,这一节就是体现“从给人看 → 给机器看”的地方。

论文重点讲了两类任务:

  1. 目标检测(Detection-aware Fusion)
  2. 语义分割(Segmentation-aware Fusion)

此外还提到跟踪、人群计数、显著性检测、深度估计等任务,这些与 IVIF 关系略弱,因此本节简略带过。


3.2.1 面向目标检测的融合

背景:有了像 M³FD 这样同时包含 IR/VIS 图像对和目标检测标注的数据集,可以直接让检测网络参与融合网络训练。

(1)TarDAL:双层优化的目标感知融合

Liu 等人率先探索了图像融合和目标检测,提出了 TarDAL 方法,并构建了最大的多模态目标检测数据集M3FDM^{3} FD。TarDAL 提出了一种双层优化公式来建模两个任务之间的内在关系,并展开优化以构建目标感知的双层学习网络。

(2)DetFusion:检测驱动注意力指导融合

Zhao 等人引入元特征嵌入以实现目标检测和图像融合之间的兼容性。Sun 等人提出了令人瞩目的 DetFusion 方法,利用检测驱动的信息通过共享注意力机制指导融合优化。目标感知损失在从目标位置学习像素级信息方面也起着关键作用。

(3)MoE-Fusion:混合专家(Mixture of Experts)

Cao 等人提出了 MoE - Fusion 方法,集成了局部 - 全局专家混合模型来动态提取各自模态的有效特征。这种对局部信息和全局对比的动态特征学习证明了目标检测的有效性。

(4)MetaFusion:元特征嵌入

Zhao 等人提出了 MetaFusion 方法,利用来自目标检测的元特征嵌入来对齐语义和融合特征,实现有效的联合学习。

(5)不显式生成融合图的多模态检测方法(对照)

在此论文中也提到一些不生成融合图,只做特征级多模态检测的工作:

这些方法从“检测任务”出发看问题,而本文综述更多是从“通用融合 + 下游任务”的角度出发。

换而言之,这些方法只关心结果,不生成融合图,直接做多模态检测,只要任务完成得好就行。


3.2.2 面向语义分割的融合

目标:使融合图对语义分割任务友好,提高 mIoU/mAcc。

(1)SeAFusion:融合 + 分割级联 + 语义损失

SeAFusion 将图像融合与分割任务级联,通过基于循环的训练引入语义损失以增强融合的信息丰富度。

(2)SuperFusion:多功能配准 + 融合 + 语义感知框架

Tang 等人提出了 SuperFusion,这是一个用于多模态图像配准、融合和语义感知的通用框架。

(3)PSFusion:渐进式语义注入

PSFusion 在特征级别引入渐进式语义注入,考虑了融合的语义需求。它还表明,在计算资源较少的情况下,图像级融合在感知任务中与特征融合具有可比的性能。

(4)SegMiF:双任务相关性的联合学习

Liu 等人提出了 SegMiF,利用双任务相关性来提高分割和融合性能,引入分层交互注意力进行细粒度任务映射,并收集了这些任务的最大全时基准数据集。

(5)MRFS / CAF / TIMFusion 等统一感知驱动框架


3.2.3 其他感知任务(略)

这些任务与 IVIF 是“应用层面的延伸”,与任务本身不完全以 IVIF 为核心,因此简略描述:


3.3 数据兼容性:未配准、通用融合与对抗攻击

理论上的红外和可见光图像的融合是美好的,但是现实是残酷的:未对齐、带噪声、甚至遭攻击。

3.3.1 未配准(Misaligned)图像的融合

大致分为两条路线:

  1. 基于风格迁移的“伪标签”方法(Style Transfer-based)
  2. 基于潜在空间的模态无关特征(Latent Space-based)

(1)基于风格迁移的配准 + 融合范式

生成伪标签,将多模态配准转换为单模态配准

典型流程:

  1. MTN(模态转换网络)
    • 将 VIS → IR 风格 或 IR → VIS 风格,生成“伪标签图像”;
  2. STN(空间变换网络)
    • 学习源图像与伪标签之间的空间变形场;
  3. 完成配准后,再用常规融合网络处理。

代表方法:

优点:

缺点:

(2)基于潜在空间的模态无关特征

构建模态无关的特征空间,将多模态图像特征映射到共享空间,并利用共享特征预测变形场

核心思想:

代表方法:

定量结论(基于 RoadScene / M³FD)

说明:配准质量、融合质量、纹理丰富度、语义表现等之间存在复杂 trade-off。


3.3.2 通用融合框架(General Fusion)

目标:一套框架尽可能适配多种模态、多种任务:

为了解决多模态图像融合中通用融合框架的核心问题:

(1)损失函数创新方向

(2)架构设计方向


3.3.3 对抗攻击与鲁棒性

对抗攻击是指在图像上添加难以察觉的扰动,很容易欺骗神经网络的估计。网络在多模态视觉下对抗攻击的脆弱性尚未得到广泛研究。考虑到多模态分割在对抗攻击下的鲁棒性,PAIFusion 率先利用图像融合来增强鲁棒性。该工作通过详细分析确定了脆弱的融合操作和规则。

意义:对确保现实世界应用的鲁棒性和安全性至关重要。

问题背景

图7. 数据兼容的红外与可见光图像融合(IVIF)方法的基本分阶段流程。

PAIFusion

未来研究:
设计“对抗鲁棒融合网络”,即使 IR/VIS 中有一模态被攻击,融合结果仍可用。


3.4 架构总结与讨论

论文把现有深度融合网络按结构复杂度和设计思路分为四类:

  1. 使用现有架构

    • 直接使用 ResNet / DenseNet / U-Net 等成熟架构;
    • 典型:DenseFuse、RFN-Nest 等;
    • 优点:开发成本低、训练稳定。
  2. 复杂堆叠网络

    • 把多种模块(残差块、注意力、Transformer、金字塔、GNN 等)堆在一起;
    • 典型:Re2Fusion、CDDFuse、TGFuse 等;
    • 强调极致性能,但结构复杂,难以部署。
  3. 多分支 / 多批次架构

    • 为不同模态(IR/VIS)设计不同编码器;
    • 常见于任务适配网络(TarDAL / DetFusion / MoE-Fusion 等)。
  4. 递归 / 扩散结构

    • 使用递归网络或扩散模型逐步优化融合结果;
    • 典型:ReCoNet、DDFM;
    • 适合质量要求极高或序列数据,但代价是计算量巨大。

总体而言,红外和可见光图像融合的研究正朝着更复杂和精细的网络结构发展,以满足复杂的融合需求。


3.5 损失函数总结与讨论

在无监督红外和可见光图像融合领域,损失函数的设计和选择至关重要。

这些函数通常可从像素级别、评估指标和数据特征三个主要维度进行理解和分类。(本节不讨论 GAN 和扩散模型等生成模型)

在像素级别,L1 和 MSE 损失函数通过直接比较像素来评估图像相似性。SSIM 作为关键的评估指标,通过考虑图像结构和质量扩展了这一概念,反映了人类视觉感知。针对数据特征的损失函数(如图像梯度)则侧重于在融合过程中保留详细纹理。

在此基础上,出现了更复杂的损失函数变体来解决图像融合中的特定挑战。例如,在像素级别应用视觉显著性图(VSM)代表了一种创新,产生了更细致的融合效果。在评估指标层面,使用空间频率(SF)等不太常见的指标作为损失函数,强调了图像的频率特征和视觉效果,从而在保持视觉舒适度的同时实现有效融合。此外,基于复杂图像特征的损失函数(如最大化梯度或边缘提取,以及包括感知和对比损失)提供了更深入的见解和解决方案。

损失函数的设计多种多样,除了上述类型,还引入了许多专门设计的损失函数。研究人员可以根据源图像的特征和任务要求选择、组合和优化这些损失函数,推动图像融合领域的进一步发展和创新。

三大维度

  1. 像素级损失

    • L1 / MSE:直接度量像素差;
    • SSIM:考虑结构 / 亮度 / 对比度,更符合人眼感知。
  2. 结构 / 特征级损失

    • 梯度 / 边缘损失:保持纹理和边缘清晰;
    • 频域损失(如 SF):强调细节和高频信息;
    • 视觉显著性图(VSM):对显著区域赋予更大权重;
    • NR-IQA(无参考图像质量评价)指标也被用作损失(FusionDN 等)。
  3. 语义 / 对比 / 感知损失

    • 语义损失:利用分类 / 检测 / 分割网络的中间特征;
    • 对比损失:CoCoNet、EMMA 等充分利用;
    • 感知损失:基于 VGG 等预训练网络的高维特征差异;
    • 任务驱动损失:检测 / 分割的任务损失直接反向训练融合网络(TarDAL、SeAFusion、SegMiF 等)。

实际做法:
通常是多种损失混合加权,通过验证集(包括感知指标)来调整权重。


4. 基准数据集与评估指标

4.1 数据集概览

图8. 现有红外-可见光图像融合(IVIF)数据集示意图

大致分三类:

4.1.1 早期面向融合的数据集

4.1.2 目标检测数据集

4.1.3 语义分割数据集


4.2 评估指标

4.2.1 融合质量指标(9 个)

有参考(基于源图像)

  1. MI(Mutual Information,互信息)

    衡量源图像信息被传递到融合图的程度(信息量);

  2. VIF(Visual Information Fidelity)

    评估融合的保真度,与人类视觉系统对齐,值越高表示性能越好;

  3. CC(Correlation Coefficient)

    评估融合图像对源图像的反映程度,侧重于线性相关性;

  4. SCD(Sum of Correlation of Differences)

    衡量源图像独特信息的整合情况。CC 强调现有关系,而 SCD 关注新元素;

  5. QAB/FQ_AB/F(基于梯度的融合质量指标)

    看边缘 / 梯度细节是否得到良好保留(越接近 1 越好)。

无参考指标

  1. EN(Entropy,熵):衡量融合图像中的信息内容(信息量大小)(但对噪声敏感);
  2. SF(Spatial Frequency,空间频率):评估细节和纹理的清晰度,值越高表示边缘和纹理信息越丰富;
  3. SD(Standard Deviation,标准差):从分布和对比度方面反映图像质量,对比度越高,SD 值越大;
  4. AG(Average Gradient,平均梯度):衡量纹理特征和细节,AG 值越高表示融合性能越好。

注意:EN / SF / AG 等指标高不一定就好,有可能是噪声多。


4.2.2 配准指标

  1. MSE(Mean Squared Error)

    测量两幅图像像素之间的平均平方差,用于评估它们的对齐程度。MSE 值越低,表示相似度越高,是图像配准和融合中的关键指标;

  2. MI(互信息)

    是图像配准中常用的相似性指标。MI 值越高,表明两幅图像对齐越好;

  3. NCC(Normalized Cross Correlation)

    是评估两幅图像中对应窗口相似性的指标,用于评价配准精度。


4.2.3 感知任务指标

评估时最好把“融合指标 + 感知指标”一起看,单纯依赖 MI / VIF 容易误判。


5. 性能总结与消融对比

5.1 图像融合质量(TNO / RoadScene / M³FD)

定性分析

定量分析


5.2 未对齐图像融合性能(RoadScene / M³FD)

定性结果

图10. 未对齐的多模态图像在两个典型图像对上的表现,与多种最新的图像融合方法进行了对比。

定量结果

结论:风格迁移 + 潜在空间方法各有优劣;
若能结合两者优势,可能得到更通用的未配准融合框架。


5.3 面向目标检测的融合性能(M³FD + YOLOv5)

定性对比

定量结果

进一步说明:“任务驱动训练的融合方法 > 只看图像指标的融合方法”。


5.4 面向语义分割的融合性能(FMB + SegFormer)

统一使用先进的 SegFormer 作为基础分割器,在一致的设置下对各种先进融合方法进行训练,以衡量它们的性能。采用 FMB 数据集的官方训练集和测试集划分。

定性比较

图12. 基于图像融合的语义分割结果与几种最先进的方法进行了比较

在这个场景中,由于能见度低,位于黑暗区域的行人对大多数方法来说都难以准确分割。同时,公交车发出的强光导致场景过曝,使得许多方法将公交车误分类为汽车,且无法捕捉其完整轮廓。这些挑战凸显了处理极端光照条件场景的持续困难。

定量比较:在表 6 中,我们报告了语义分割任务的数值结果。


5.5 计算效率与资源消耗

论文统计了在 M³FD 上处理 10 张 1024×768 图像的三项指标:

总体趋势:

实际应用(自动驾驶 / 边缘设备)中,需要注意
“mAP / mIoU 与 FPS / 耗能之间的 trade-off”。


6. 挑战与未来研究方向

论文最后总结了若干重要开放问题,这里挑与 IVIF 强相关的部分:

6.1 未配准 & 对抗鲁棒性

6.2 任务驱动的融合设计

6.3 更大、更真实、更难的数据集

6.4 更合理的评价体系

6.5 轻量化与部署友好


分享文章:

  1. 【论文阅读 | TPAMI 2025 | RWKVFusion:利用统一语言与掩码引导的高效图像融合网络】论文阅读 · An Efficient Image Fusion Network Exploiting Unifying Language and Mask Guidance
  2. 【论文阅读 | TPAMI 2026 | CDTFusion:跨域与跨任务协同的红外-可见光图像融合方法】论文阅读 · CDTFusion: Crossing Domain and Task for Infrared and Visible Image Fusion
  3. 【论文阅读 | CVPR 2024 | RSDet_去除再选择:一种用于 RGB - 红外目标检测的由粗到精融合视角】论文阅读 · RSDet_去除再选择:一种用于 RGB - 红外目标检测的由粗到精融合视角
上一篇
2025.12.02 C语言程序设计上机实习五
下一篇
2025.11.11 C语言程序设计上机实习四