基于全局学习扩展的可见光-红外行人重识别
浙江大学学报(工学版), 2026.
Accepted for publication.
主要贡献。 提出全局学习扩展(GLE)嵌入增强网络,融合ViT全局建模与CNN局部特征提取优势,通过多样化嵌入生成和图结构对齐机制显著缩小可见光-红外模态差异
研究概述
GLE网络由全局特征聚合(GFA)模块和特征多样化扩展(FDE)模块组成。GFA通过循环卷积和位置编码模拟ViT全局建模能力,FDE利用CNN+ViT多分支生成多样化嵌入特征,配合全局特征学习(GFL)损失通过图结构对齐机制减小模态差异。在SYSU-MM01和LLCM上Rank-1分别比基线DEEN提升4.24%和9.05%。
研究问题
现有方法使用单一CNN或ViT架构,难以平衡全局语义理解和局部细节捕捉。跨模态行人重识别面临可见光与红外图像在颜色、纹理等视觉特征上的显著差异,现有方法忽视跨模态特征对齐,限制了实际应用性能。
核心思路
通过循环卷积融合ViT全局建模能力到CNN中,利用多分支(CNN空洞卷积+ViT自注意力)生成多样化嵌入,并通过图结构亲和矩阵对齐(KL散度)驱动ViT分支嵌入引导原始特征关注全局信息,同时缩小跨模态差异。
关键组成
- GFA
全局特征聚合模块
- 将输入特征分为水平/垂直方向,分别添加可学习位置编码后执行循环卷积,在纯卷积框架下实现全局感受野,同时保持位置敏感性。可嵌入主干网络多个阶段,计算效率高于ViT自注意力。
- FDE
特征多样化扩展模块
- 包含3个分支:分支1-2使用不同扩张率(1,2,3)的3×3空洞卷积捕获多尺度局部特征,分支3采用双头自注意力ViT模块捕获全局特征。所有嵌入与原始特征拼接后输入下一阶段,有效缓解训练样本不足问题。
- GFL Loss
全局特征学习损失
- 通过图结构亲和矩阵(KL散度)实现三重对齐:(1)可见光模态下ViT嵌入引导原始特征关注全局;(2)红外模态下同样对齐;(3)可见光与红外原始特征跨模态对齐,生成模态差异更小的嵌入。

整体架构:双流ResNet-50提取可见光/红外初始特征,前3阶段分别接入GFA模块融合局部与全局信息,第3阶段额外接入FDE模块生成多样化嵌入,通过GFL损失约束嵌入质量和模态一致性,端到端联合优化交叉熵+三元组+GFL损失。

GFA通过将特征分为水平/垂直两路,分别添加可学习位置编码后执行循环卷积(堆叠输入并首尾连接形成闭环),在保持位置敏感性的同时实现全局感受野。相较于ViT自注意力,纯卷积实现计算效率更高。

GFL损失构建特征间关系的亲和矩阵(基于欧氏距离的softmax归一化),通过KL散度对齐ViT分支嵌入与原始特征的图结构(传递全局信息),以及可见光/红外模态原始特征的图结构(减小模态差异)。超参数λ1=0.6, λ2=0.6, λ3=0.2时最优。
实验结果
- SYSU-MM01 全搜索
- 78.94% Rank-1
- 比基线DEEN(74.7%)提升4.24%
- Rank-10(98.39%)和Rank-20(99.55%)达SOTA
- SYSU-MM01 室内搜索
- 85.99% Rank-1
- 比基线DEEN(80.3%)提升5.69%
- 室内搜索模式表现突出
- LLCM 可见光检索红外
- 71.55% Rank-1
- 比基线DEEN(62.5%)提升9.05%
- 低光照场景显著提升
- RegDB 可见光检索红外
- 94.92% Rank-1
- Rank-10(98.84%)达SOTA
- 多指标达到当前最优水平
| Method | SYSU-MM01 R-1 | SYSU-MM01 mAP | RegDB R-1(V→I) | LLCM R-1(V→I) |
|---|---|---|---|---|
| DART | 68.7 | 66.3 | 83.6 | 60.4 |
| MPANet | 70.6 | 68.2 | 82.8 | - |
| DEEN | 74.7 | 71.8 | 91.1 | 62.5 |
| HOS-Net | 75.6 | 74.2 | 94.7 | 64.9 |
| IDKL | 81.4 | 79.9 | 94.7 | 72.2 |
| GLE | 78.94 | 76.07 | 94.92 | 71.55 |
GLE在SYSU-MM01全搜索模式达到78.94% Rank-1和76.07% mAP,比基线DEEN分别提升4.24%和4.27%。在LLCM低光照数据集上Rank-1提升达9.05%。消融实验证实FDE+GFL+GFA完整模型比基线提升4.2% Rank-1和4.3% mAP。模型参数量115.20M,推理延迟13.23ms,在可接受范围内。


结论
GLE网络通过GFA模块融合局部细节与全局结构信息,FDE模块生成多源嵌入特征提升判别性,GFL损失通过图结构对齐减小模态差异。在SYSU-MM01、RegDB和LLCM数据集上取得领先的Rank-1、Rank-10、mAP等指标,验证了其在复杂跨模态场景下的有效性与鲁棒性。
核心结论。 循环卷积+位置编码可在纯CNN框架下高效实现全局建模,多分支(CNN+ViT)嵌入生成有效缓解样本不足。关键启示:通过图结构亲和矩阵对齐实现跨模态特征分布一致性,是一种简单有效的模态差异减小策略。
BibTeX
@article{guo2026gle,
title={全局学习扩展的可见光-红外行人重识别},
author={郭子强 and 肖璇 and 陶浩然 and 王少荣},
journal={浙江大学学报(工学版)},
volume={60},
number={8},
pages={1670--1677},
year={2026},
doi={10.3785/j.issn.1008-973X.2026.08.006}
}