点亮黑暗:脉冲神经网络如何彻底改变低光照图像增强

你是否曾经尝试拍摄迷人的夜景,结果却发现拍出来的照片是一团黑暗、充满噪点且难以辨认的糊图?如果是这样,你就经历了低光照图像增强 (LLIE) 的核心挑战。

当相机传感器在低光照环境下捕捉图像时,它会极度缺乏光子。这种光子缺乏,加上传感器噪点和受限的动态范围,产生的图像不仅在视觉上缺乏美感,而且对于目标检测或人脸识别等下游计算机视觉任务来说也毫无用处。

为了解决这个问题,深度学习研究人员开发了极其强大的人工神经网络 (ANN) ——尤其是卷积神经网络 (CNN) 和视觉 Transformer——它们可以通过数字方式对这些图像进行“重新打光”和去噪。但这有一个巨大的代价: 这些模型在计算上极度消耗资源。它们需要数十亿次数学运算,会迅速耗尽智能手机、无人机和边缘设备的电池。

Spike-RetinexFormer 应运而生,这是研究人员提出的一种突破性架构,彻底重新构想了我们处理 LLIE 的方法。通过协同经典的色彩理论 (Retinex) 、视觉 Transformer 的全局推理能力,以及受生物学启发的脉冲神经网络 (SNN) 的极致能效,作者创建了一个能够媲美最先进增强器,同时在理论上将能耗降低一个数量级的模型。

在这篇深度解析中,我们将拆解 Spike-RetinexFormer 的工作原理。我们将探索它所建立的理论基础,逐步剖析其新颖的脉冲驱动架构,并分析使其成为高能效计算机视觉领域里程碑式论文的实验结果。

1. 背景知识: 光、Transformer 与脉冲#为了真正领会 Spike-RetinexFormer 的精妙之处,我们首先需要了解支撑它的三大支柱: Retinex 理论、视觉 Transformer 和脉冲神经网络。

支柱 1: Retinex 理论#早在深度学习出现之前,科学家们就试图了解人类的眼睛和大脑如何在不同的光照条件下感知颜色。1971 年,Edwin Land 提出了 Retinex 理论 (由 retina (视网膜) 和 cortex (大脑皮层) 组成的一个混成词) 。

Retinex 理论的核心假设非常简单优美。它提出任何观察到的图像 (\(I\)) 实际上是两个独立组件的数学乘积:

反射率 (\(R\)) : 场景中物体的内在真实颜色和纹理。这不受光照影响。光照 (\(L\)) : 照射到场景上的环境光。在数学上,这表示为 Hadamard (逐元素) 乘积:

在低光照增强的背景下,如果算法能够成功地将暗图像分离 (分解) 为 \(R\) 和 \(L\),它就可以简单地人为“提升”光照 \(L\),将其与 \(R\) 乘回去,从而生成一张光照完美的图像。尽管传统方法在分解过程中经常会受到光晕和颜色失真等伪影的困扰,但现代深度学习已经采用了这个框架来明确指导网络如何自然地提亮图像。

支柱 2: 视觉 Transformer#近年来,Transformer 已经占据了计算机视觉的主导地位。与通过小的局部窗口 (卷积) 观察图像的 CNN 不同,Transformer 使用了自注意力机制 (self-attention mechanism) 。 这使得网络能够将图像的每一个图块与其他所有图块进行比较,从而捕获长距离的全局依赖关系。

对于低光照增强这样的任务,全局上下文至关重要。想象一个只有一个明亮台灯的暗室。CNN 可能会使桌子过度曝光,同时让角落仍然漆黑一片。然而,Transformer 能够理解全局的光照变化,并能在整个场景中平衡增强效果。

缺点是什么?众所周知,Transformer 对内存和计算能力的需求极高。它们的自注意力机制呈二次方扩展——这意味着如果将图像分辨率翻倍,计算成本将增加四倍。

支柱 3: 脉冲神经网络 (SNN)#这就是受生物学启发的魔法发生的地方。标准的人工神经网络 (ANN) 使用连续的浮点数 (例如 0.874) 来处理信息。移动和乘加这些高精度数字,正是耗尽标准 GPU 电池寿命的罪魁祸首。

脉冲神经网络 (SNN) 的建模更接近真实的生物大脑。SNN 中的神经元不使用浮点数,而是使用分布在离散时间步 (\(T\)) 上的稀疏二进制脉冲 (1 和 0) 进行通信。

SNN 中最常用的神经元模型是泄漏积分发放 (Leaky Integrate-and-Fire, LIF) 模型。这是 SNN 的数学核心:

让我们从概念上进行拆解:

积分 (Integrate, \(U\)) : 神经元接收传入的电流 (\(I\)) 并将其添加到其内部膜电位 (\(U\)) 中。就像一个漏水的桶一样,一部分电压会随着时间的推移流失 (由衰减因子 \(\lambda\) 控制) 。发放 (Fire, \(S\)) : 如果内部电压 \(U\) 超过特定阈值 (\(V_{th}\)) ,神经元就会“发放”一个脉冲 (\(S = 1\)) 。如果没有越过阈值,它就保持安静 (\(S = 0\)) 。重置 (Reset, \(H\)) : 发放后,神经元的电压降回低点,为下一个时间步做准备。为什么这很重要? 因为 SNN 仅通过 1 和 0 进行通信,标准神经网络中沉重且耗电的乘加 (Multiply-Accumulate, MAC) 操作变成了简单的累加 (Accumulate, AC) 加法。在专用的神经形态硬件中,一次加法操作消耗的能量比一次乘法少一个数量级。此外,SNN 是稀疏的——神经元只是偶尔发放脉冲,这意味着硬件在没有脉冲时可以有效地“休眠”,从而实现巨大的节能。

然而,最终的挑战在于,低光照图像增强 (LLIE) 是一项连续的、高精度任务 (恢复精细的颜色渐变) ,而 SNN 本质上是离散且粗糙的。跨越这一鸿沟正是 Spike-RetinexFormer 的核心成就。

2. 核心架构: Spike-RetinexFormer#作者提出了一种完全使用脉冲基元实现的单阶段 Retinex 增强流水线。该架构大致分为两个主要阶段:

脉冲光照估计器 (Spiking Illumination Estimator)脉冲损坏恢复器 (Spiking Corruption Restorer)在深入细节之前,让我们先看看完整的高层蓝图。

观察图 1 中的架构,请注意输入图像 (\(I\)) 首先进入光照估计器以弄清楚光照情况。由此产生的光照特征引导一个更大的 U-Net 风格流水线 (损坏恢复器) ,该流水线利用脉冲卷积和一种新颖的注意力机制来生成最终的增强图像。整个网络在 \(T\) 个时间步上运行,从一连串的二进制脉冲中积累最终的视觉结果。

让我们仔细剖析这些阶段的具体工作原理。

阶段 1: 脉冲光照估计器#如果我们遵循传统的 Retinex 理论 (\(I = R \odot L\)) ,获得真实的反射率 (被照亮的图像) 需要将输入图像除以光照 (\(R = I / L\)) 。

然而,在极暗的区域,\(L\) 接近于零。除以一个接近于零的数字会导致数值爆炸,使得神经网络在数值上变得脆弱且极难训练。

为了规避这个问题,作者没有试图预测 \(L\)。相反,他们预测了一个点亮图 (light-up map, \(\bar{L}\)) , 它作为光照倒数 (\(L^{-1}\)) 的近似值。通过用乘法代替除法,他们稳定了数学计算:

这里,\(I_{lu}\) 是被粗略点亮的图像。请注意,它等于反射率 (\(R\)) 加上损坏 (\(C\)) 。这种损坏囊括了当你激进地提亮一张暗图时所出的一切问题: 传感器噪点被放大,颜色发生偏移,量化伪影变得可见。

为了生成这个点亮图,输入图像 (\(I\)) 被馈送到脉冲光照估计器 (\(E\)) 中。

如图 2 所示,该估计器是一个轻量级、较浅的脉冲驱动卷积神经网络。它获取暗图像以及一个简单的光照先验 (图像的平均亮度) ,并将其穿过各层脉冲卷积。

因为网络在 \(T\) 个时间步上运行,连续的输入图像必须被编码为时间格式。作者使用了一种特定的时间共享、\(T\)-归一化的电流注入方式:

这个数学公式基本上确保了无论 SNN 运行多少个时间步 (\(T\)) ,注入网络的总“电荷”都保持稳定。这个估计器的输出有两部分:

点亮图 (\(\bar{L}\)) ,它在物理上提亮图像以创建 \(I_{lu}\)。一组丰富的光照特征 (\(F_{lu}\)) ,它们被向前传递,作为网络其余部分的“光照指南”。阶段 2: 脉冲损坏恢复器#现在我们有了一张明亮的图像 (\(I_{lu}\)) ,但它被噪点 (\(C\)) 严重损坏。 脉冲损坏恢复器 (\(G\)) 的任务是通过预测残差校正 (\(\Delta I\)) 将这张充满噪点的亮图映射为干净、增强的图像。

为此,网络使用了 U-Net 风格的编码器-解码器架构。U-Net 以捕获精细局部细节 (通过浅层) 和宽泛结构上下文 (通过深的压缩层) 而闻名。

然而,让这个 U-Net 显得与众不同的是在每个解码器阶段注入的新颖组件: 脉冲光照引导注意力 (SIGA) 和光照引导的 FiLM 。

通过光照引导的 FiLM 调制脉冲#在讨论注意力机制之前,网络在处理图像时是如何“知道”光照条件的?作者使用了特征线性调制 (Feature-wise Linear Modulation, FiLM) 。

在解码器的每个尺度上,脉冲神经元的突触电流都会受到参数的调制,这些参数专门源自我们在阶段 1 中计算的光照特征 (\(F_{lu}\)) 。

这里,\(\alpha\) 缩放信号,\(\beta\) 偏移信号。这些参数是根据场景的光照上下文动态预测的。

如果某个区域被检测为漆黑,网络可能会改变其发放阈值以激进地去噪。如果某个区域已经光照良好,网络会抑制增强以防止过度曝光。这就创建了一个完全容纳在脉冲框架内的动态的、感知光照的网络。

重大突破: 脉冲光照引导注意力 (SIGA)#这是这篇论文最大的技术成就。标准的视觉 Transformer 使用密集的自注意力机制。它们获取一系列 token (图像块) ,并生成查询 (Queries, \(Q\)) 、键 (Keys, \(K\)) 和值 (Values, \(V\)) 。为了弄清楚哪些图像块应该相互“关注”,它们将查询与键相乘 (\(Q \times K^T\)) ,应用 softmax 函数获得概率分布,然后乘以值。

这种密集的矩阵乘法从根本上来说与脉冲神经网络的二进制、事件驱动性质是不兼容的。你无法对稀疏的二进制脉冲执行传统的 softmax。

那么,我们如何只使用脉冲来执行注意力机制呢? 通过巧合 (Coincidence) 运算。

如图 3 所示,SIGA 模块完全绕过了密集的矩阵乘法,取而代之的是一种事件驱动的硬门控机制 (hard gating mechanism) 。 以下是其逐步工作原理:

脉冲生成 : 输入特征被投影到查询、键和值中。因为这是一个 SNN,这些 \(Q\)、\(K\) 和 \(V\) 的表示是随着时间发生的二进制脉冲流。巧合检测 : SIGA 不是将浮点数相乘,而是寻找时间上的重叠。如果位置 A 的查询神经元在完全相同的时间步 (\(t\)) 发放了一个脉冲,并且位置 B 的键神经元也发放了一个脉冲,则建立连接。逻辑很简单: \(Q_A[t] == 1\) AND \(K_B[t] == 1\)。硬门控 : 当这种巧合发生时,位置 A 和位置 B 之间会瞬间打开一个“硬门控”。值路由 : 如果门打开,值脉冲 (\(V_B[t]\)) 被允许流过并更新位置 A 的状态。如果门关闭 (没有巧合) ,该值就会被阻断。这个过程受光照特征的调制,光照特征可以微妙地改变神经元的发放阈值,使得根据局部光照条件,门更容易或更难打开。

为什么这如此强大?

在一个标准的 Transformer 中,注意力是在所有 token 对之间计算的,导致了巨大的计算浪费。在 SIGA 中,由于脉冲是稀疏的 (神经元仅偶尔发放脉冲) ,这种交互也是极度稀疏的。每个查询只选择一个较小的、相关的键子集。复杂度随脉冲的发放率 (firing rate) 缩放,而不是图像大小的平方。这既保留了 Transformer 的全局上下文感知能力,又释放了神经形态计算的极致能效。

汇总: 读出机制 (Readout)#在所有空间尺度上处理图像并在 \(T\) 个时间步上积分脉冲序列之后,网络必须将内部电压转换回连续的、可视的 RGB 图像。

网络使用单步读出。它获取最后一个时间步的最终膜电位,将其通过一个简单的 1x1 卷积 (Head 头) ,将其加到最初的点亮图 (\(I_{lu}\)) 上,并将值裁剪到 0 和 1 之间 (标准图像像素边界) 。

就这样,一个完全由脉冲驱动的流水线成功地分解、分析并重建了一张暗图像。

3. 实验与结果#为了证明 Spike-RetinexFormer 不仅仅是一个理论上的奇思妙想,作者在一系列标准 LLIE 基准测试中对其进行了考验。这些数据集——包括 LOL (低光照) 、SID (暗视界) 和 SDSD (动态场景) ——包含了数千张成对的暗图像和曝光正常的图像。

模型主要在两个指标上进行评估:

PSNR (峰值信噪比) : 测量像素级精度。越高越好。SSIM (结构相似性指数) : 测量图像的结构和纹理在多大程度上符合人类感知。越接近 1.0 越好。定量结果: 与重量级模型抗衡#SNN 与标准的连续值深度学习模型相比如何?非常出色。

观察 表 1 (在 LOL 数据集上的评估) ,我们可以看到一个引人注目的情况。

像 RetinexNet 和 KinD 这样的经典深度 Retinex 模型分别达到了 16.77 dB 和 20.86 dB 的 PSNR。强大的现代 Transformer 模型,如 MIRNet、Restormer 和 RetinexFormer 突破了界限,得分在 24 到 25.16 dB 的范围内。Spike-RetinexFormer (本文方法) 在 LOL-v1 上达到了惊人的 25.50 dB , 击败或匹敌了绝对最先进的 ANN。更令人印象深刻的是表格的右侧。看看参数量和计算 FLOPs。Spike-RetinexFormer 仅用 1.5M (150万) 个参数和 16.2G FLOPs 就实现了这种顶级性能。相比之下,Restormer 需要高达 26.1M 个参数和 144.3G FLOPs。

这一趋势在极端的、充满噪点的数据集中得以延续,如表 2 所示。在极具挑战性的 SDSD 室内和室外数据集上,Spike-RetinexFormer 始终获得最高分 (超过 30 dB) ,证明该网络非常擅长区分真实的结构细节和随机的传感器噪点。

理论上的节能#仅仅看 FLOPs 并不能说明 SNN 的全部优势。因为 Spike-RetinexFormer 用更简单的累加替换了乘加 (MAC) 操作,其理论上的节能是巨大的。

研究人员基于神经形态硬件的约束条件进行了粗略计算。由于在任何给定的时间步长中,网络中只有大约 18% 的神经元发放脉冲,他们估计其模型消耗的能量大约比同等的人工神经网络模型低 5 到 10 倍 。

定性结果: 视觉证据#表格上的数字固然很好,但图像增强的最终测试是人类的感知。这些图像看起来真的好看吗?

在图 4 中,我们看到了由不同算法处理的场景的并排比较。

像 UR_Retinex 这样的模型留下了明显的黑斑,并且难以保持色彩保真度。EnlightenGAN 经常会引入奇怪的色彩偏移或“漂白”伪影。最初的 RetinexFormer 表现出色,但偶尔在精细文本清晰度或过度平滑方面表现不佳。Spike-RetinexFormer (本文方法) 产生了令人难以置信的自然结果。如果你看桌子上的书或墙上色彩缤纷的流苏,Spike-RetinexFormer 干净地恢复了纹理,而没有引入激进的噪点,生成的图像与目标真实图像惊人地接近。4. 消融实验: 窥探引擎盖下的奥秘#为了理解 为什么 Spike-RetinexFormer 表现得如此出色,研究人员进行了消融实验——系统地剥离或改变模型的某些部分,看看什么会导致性能下降。

时间的力量#SNN 按顺序处理信息。那么,需要多少个时间步 (\(T\)) 才能获得一张好图像呢?

正如表 5 所示,仅使用 \(T=4\) 个时间步会导致 PSNR 下降 (25.21) ,并迫使产生高脉冲发放率 (神经元为了快速传输信息而恐慌性地不断发放) 。

跳到 \(T=8\) 达到了“恰到好处”的区域: PSNR 上升到 25.50,发放率降至稀疏的 18.7%,提供了最佳的准确率。推至 \(T=12\) 仅提供了边际改进 (25.59 dB) ,却线性地增加了处理延迟。因此,\(T=8\) 被选为默认值。

为什么我们需要 Retinex 和 SIGA?#你可以只使用一个没有花哨的光照估计和注意力模块的标准脉冲 U-Net 吗?研究人员尝试了。

基线 (纯脉冲 U-Net) : 仅达到 23.11 dB。添加单阶段 Retinex 框架 (+ ORF) : 通过点亮图提供显式的曝光建模,立即将分数提升至 24.56 dB。添加 SIGA (+ SIGA) : 引入脉冲光照引导注意力将模型推至其 25.50 dB 的峰值性能。消融实验清楚地证明了,对于脉冲域中的高保真恢复来说,显式的光照建模和全局脉冲注意力是不可或缺的。

5. 绿色视觉的未来#Spike-RetinexFormer 的开发是底层计算机视觉的的一个分水岭时刻。多年来,学术界一直在一种假设下运作,即图像去噪和颜色恢复等连续的高精度任务不适合脉冲神经网络的离散和二进制特性。

作者巧妙地将 Retinex 理论基于物理的逻辑与 Transformer 的全局推理相结合,并通过 SIGA 和巧合路由 (coincidence routing) 将它们映射到脉冲动力学中,从而打破了这一假设。

它的意义是深远的。随着计算机视觉模型规模的不断扩大,它们在边缘设备 (智能手机、自主无人机、监控摄像头) 上的部署成为电池寿命和热限制的瓶颈。Spike-RetinexFormer 为未来提供了一个实用的蓝图。它证明了我们不需要牺牲图像保真度来实现节能的 AI。

虽然目前还在模拟指标上进行评估,但下一个前沿领域将是将此类模型直接部署到专用的神经形态硬件芯片上。当那一天到来时,我们的设备将能够毫不费力地“在黑暗中视物”,以等同于生物大脑的能效处理复杂的视觉环境。

没带银行卡,有什么方法改密码?
微信拍卖系统怎么做_公众号怎么添加微信拍卖系统