摘要:目的真实场景下,由于目标自身特性、环境交互及成像条件共同作用,导致军用车辆目标在可见光遥感成像条件下的可分辨性、可分离性显著降低。尽管基于深度学习的遥感图像目标检测技术近年来取得了显著进展,但现有研究对遥感图像特殊性的充分适应、效率与精度的平衡、以及真实场景下的泛化能力等方面,仍有待进一步突破。针对真实场景目标检测的难点,基于YOLOv11(you only look once)算法提出一种雾密度引导的真实场景军用车辆遥感图像检测算法(YOLO for military vehicle detection under foggy conditions, MVF-YOLO)。方法在网络输入端增加一个基于雾密度权重的边缘特征恢复模块(fog density-driven edge restoration, FDER),自适应恢复被雾衰减的边缘信息;在网络颈部设计了空间注意力引导的频域信息选择模块(spatial attention-based frequency selection, SFS),增强高频判别特征并抑制低频噪声,并且利用遥感车辆刚性目标特性和目标长宽比先验知识,使用基于目标长宽比先验的分类损失函数(aspect ratio binary cross-entropy Loss, ar_BCELoss)优化分类精度。结果在MVRSD-V2.0数据集上,所提方法在IoU阈值为0.5时的平均准确率达到87.6%,较基线模型提升4.4%。结论试验结果表明,该方法在真实场景下具有强鲁棒性和军用车辆检测能力。
摘要:目的针对连续视频动作分割与预测任务中局部动作动态与长时语义上下文之间交互建模不足、连续动作过渡阶段边界表征不足以及未来序列预测稳定性不足等问题,提出一种融合跨尺度时序交互与边界概率细化的连续动作分割与预测方法。方法面向动作分割与预测两类任务,构建由局部时空编码、跨尺度时序交互和边界概率细化组成的统一框架。对于分割任务,采用膨胀三维卷积网络(inflated 3D convolutional network,I3D)对RGB视频序列进行时空特征编码;对于预测任务,采用X3D网络对RGB序列与光流序列同时进行时空特征提取,并通过双向交叉注意力机制实现多模态信息融合。在此基础上,设计跨尺度时序交互模块,对不同层级时空特征进行编码—解码式建模,刻画不同时间尺度下的上下文依赖关系,增强模型对局部动态变化与全局时序结构的协同表征能力;进一步引入边界概率细化模块,对动作边界进行显式建模,从而提升动作分割与预测结果的稳定性及边界定位精度。结果在50Salads、GTEA、Breakfast等生活场景连续动作分割数据集以及JIGSAWS手术手势数据集上进行了实验验证。所提方法在50Salads、GTEA、Breakfast和JIGSAWS分割任务上的准确率(accuracy,Acc)分别达到92.3%、88.0%、83.2%和90.5%,Edit分别达到89.0%、95.8%、84.7%和95.2%;在JIGSAWS手术动作预测任务中,预测准确率达到90.3%。实验结果表明,所提方法在多数指标上优于现有代表性方法。结论所提方法能够有效兼顾局部动态特征建模、长程时序依赖建模与边界结构优化,在连续动作分割与预测任务中表现出良好的泛化能力与稳定性。
摘要:目的无监督可见光-红外行人重识别(Unsupervised Visible-Infrared Person Re-identification,USVI-ReID)旨在无标注条件下实现跨模态行人匹配。然而,现有方法中的困难样本挖掘策略通常未考虑困难正负样本在对比学习中的不同优化作用,导致模型的类内紧凑性不足且类间分离性有限。针对上述问题,提出一种角色感知难样本建模方法,在嵌入空间中对困难正负样本进行差异化建模,以协同优化类内一致性与类间判别性。方法首先,基于共享伪标签构建模态特定身份中心,并利用同一身份在不同模态中心之间的偏移生成困难正样本,使生成样本能够在保持身份一致性的同时包含更具挑战性的跨模态差异;其次,通过子簇划分与近邻簇搜索,挖掘不同身份间的局部相似关系,并沿近邻簇方向构造困难负样本,以增强模型对易混淆身份的判别能力;此外,受课程学习思想启发,引入渐进式训练策略,通过逐步调整困难样本生成幅度控制训练难度,提高模型优化稳定性。结果在SYSU-MM01和RegDB两个公开可见光-红外行人重识别数据集上的实验结果表明,所提方法能够有效提升无监督跨模态特征学习性能。在SYSU-MM01数据集全搜索模式下,相比现有最优方法,Rank-1和mAP(mean average precision)分别提升5.5%和4.1%;在RegDB数据集的可见光-热成像搜索模式中,Rank-1和mAP分别达到93.0%和86.2%。结论通过区分困难正负样本在对比学习中的优化角色,并针对性地构造跨模态变化样本和类别边界样本,所提方法能够同时增强跨模态一致性和身份判别能力,为无监督可见光-红外行人重识别提供了一种有效的难样本建模策略。
摘要:目的夜间甜瓜识别和采摘严重依赖人工光源。不同人工补光配置下,甜瓜果实和茎部的图像表观可能不同,语义分割模型的训练和跨配置测试结果也可能存在差异。为助力夜间农产品识别和采摘,构建了多颜色人工光照甜瓜分割图像数据集MelonNightColor。方法在保持相机位置、拍摄距离和补光灯方位一致的条件下,切换补光灯红、绿、蓝通道配置,获取红、蓝、绿、青、紫、黄、白7种人工补光配置下的夜间甜瓜图像。当前已发布5474张图像及像素级标注(覆盖782个拍摄位置,标注背景、甜瓜果实和茎部3个类别)。以拍摄位置为最小划分单元划分训练集、验证集和测试集,确保同一场景的7种颜色图像不跨集合,并组织为7个单颜色子集和4个组合颜色子集。采用9种代表性语义分割模型进行基线评测,并以UNet构建7×7跨颜色泛化矩阵。结果9种模型在7种光源下的背景、果实和茎部的类别交并比(intersection over union,IoU)均值分别为99.05%、86.39%和38.84%,茎部因形态细长且易受遮挡影响而分割难度最大。白光和黄光下9种模型平均交并比(mean intersection over union,mIoU)均值较高,分别达78.17%和77.94%;红光和蓝光下相对较低,分别为72.93%和73.23%。UNet同颜色测试平均mIoU为80.38%,跨颜色测试平均mIoU为44.25%。该结果显示,在本数据集的设备、品种和采集条件下,不同补光配置及自动成像过程共同作用下,训练与测试补光配置不一致时模型性能出现明显下降。结论MelonNightColor提供了夜间甜瓜多颜色成组图像和像素级标注。未来,数据集MelonNightColor可为特定夜间人工补光条件下的甜瓜语义分割基线评测和跨配置模型研究提供公开数据基础。数据集已在中国科学院科学数据银行公开,数字对象标识符(digital object identifier,DOI)为https://doi.org/10.57760/sciencedb.j00240.00237。