最新刊期

    杨洋, 吴一全

    DOI:10.11834/jig.260249
    img
    摘要:多模态表面缺陷检测系统通过整合各类多模态数据,能够有效突破单一模态的信息局限,实现检测精度与泛化能力的显著提升,但同时也引入了多模态数据噪声、模态质量退化、以及多模态对齐与融合偏差等鲁棒性扰动因素,对多模态融合的可靠性提出了严峻挑战。本文聚焦于多模态表面缺陷检测系统鲁棒性这一核心研究对象,围绕表面缺陷检测场景下的鲁棒性定义与评价、关键影响因素与典型鲁棒性挑战,以及相应的鲁棒性优化路径,系统梳理了近三年来国内外相关研究进展。首先,阐述了多模态表面缺陷检测系统的架构及系统鲁棒性定义,并进一步从外部环境工况与硬件设备、内部系统交互与数据处理两个维度对多模态表面缺陷检测系统的鲁棒性影响因素进行了分析。其次,分别针对多模态表面缺陷检测系统的感知层鲁棒性、交互层鲁棒性以及大模型驱动的多模态系统鲁棒性等三个方面,重点探讨了相关鲁棒性问题、挑战及制约因素,并深入总结了对应的鲁棒性增强、应对策略及典型应用案例。随后,围绕表面缺陷检测领域多模态鲁棒性研究的数据集与评价体系,系统剖析了相关公开数据集的特性,以及鲁棒性评价的核心参数与量化方法。最后,结合当前研究现状与实际应用需求,对面向表面缺陷检测领域的多模态鲁棒性技术的未来发展趋势进行了展望。  
    关键词:表面缺陷检测;多模态系统鲁棒性;鲁棒性影响因素;系统感知层鲁棒性;系统交互层鲁棒性;大模型鲁棒性   
    3
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 168490480 false
    更新时间:2026-08-12

    张若楠, 耿莹, 马凯, 周奥临, 刘立波

    DOI:10.11834/jig.260212
    img
    摘要:点云场景识别是三维感知领域的核心方向,本文聚焦于大规模三维点云检索驱动的地点识别与重定位任务,在自动驾驶、机器人导航等传统应用中发挥重要作用,并在低空经济等新兴场景展现出应用潜力。然而,受点云数据稀疏、无序、密度不均及低空复杂环境干扰影响,现有方法在真实动态场景中仍面临三大核心挑战:特征表达存在“语义盲区”、多模态关联存在“关系误区”、系统框架存在“适配限区”。本文从系统综述视角,将方法划分为特征表达、多模态关联及系统框架三类进行梳理,其中,特征表达包括点特征、体素特征与复值域特征表达,多模态关联涵盖点云内部多特征关联、外部输入源关联及多模态特征融合,系统框架分为单模态与多模态框架以适应不同应用场景。结合Oxford、KITTI、nuScenes等典型数据集,本文整理并对比了代表性方法的性能、适用条件及局限,揭示不同技术路线在识别精度、环境适应性、计算复杂度和部署可行性上的权衡。最后,总结研究瓶颈并展望鲁棒表征、多模态融合、通用化框架设计及统一评测体系等方向,为点云场景识别方法的系统理解与应用提供参考。  
    关键词:点云场景识别;特征表达;多模态关联;复值域特征;系统框架   
    3
    |
    1
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 168490432 false
    更新时间:2026-08-12

    赵明明, 张二虎

    DOI:10.11834/jig.260260
    img
    摘要:目的针对多类别无监督工业品缺陷检测中,现有重建模型难以兼顾浅层细节特征,且易陷入“捷径学习”导致细粒度缺陷漏检的问题,提出一种语义—细节协同融合的细粒度缺陷检测方法SDSF-ViTAD(Semantic-Detail Synergistic Fusion-ViTAD)。方法首先,采用基于DINO先验的纯视觉Transformer提取多层级密集先验;其次,设计语义—细节协同融合模块SDSFM(Semantic-Detail Synergistic Fusion Module),利用交叉注意力机制实现深浅层特征的对齐,并引入空间感知门控机制动态过滤背景噪声,精准强化细粒度特征;接着,在重建阶段引入基于信息瓶颈的特征扰动机制,切断特征直接复制的通路,并结合Top-K稀疏注意力优化解码过程,强制模型通过全局上下文推断正常模式,从而在推理时显著放大异常区域的重建误差;最后,引入结合难分样本挖掘的余弦距离损失函数,使得模型在训练过程中重点关注难以拟合的正常区域,增强模型对细粒度异常的判别能力。结果在VisA(visual anomaly detection dataset)数据集上的实验结果表明,本文算法与基准模型ViTAD相比,在图像级平均受试者工作特征曲线下面积mAUROC(mean area under the receiver operating characteristic curve)、平均精度mAP(mean average precision )和平均F1分数mF1(mean F1-score)指标上分别提升了3.28%、3.00%和3.70%,在像素级mAP和mF1指标上分别提升了3.84%和2.98%,其中对微小缺陷高度敏感的平均区域重叠率曲线下面积 mAUPRO(mean area under the per-region overlap)指标提升了3.8%,同时,在金属零件缺陷检测MPDD(Metal Parts Defect Detection)和BeanTech异常检测(BeanTech Anomaly Detection, BTAD)公开数据集上的实验进一步证明了该模型在应对不同工业场景多类别统一检测中的通用性与有效性。结论SDSF-ViTAD模型提升了复杂工业场景下的细粒度缺陷检测精度,优于现有主流多类别无监督算法。  
    关键词:多类别无监督缺陷检测;细粒度缺陷;视觉Transformer;注意力机制;捷径学习;特征扰动   
    2
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 168490349 false
    更新时间:2026-08-12

    白宇帆, 钱文华, 杨荣懿

    DOI:10.11834/jig.260168
    img
    摘要:目的东巴画作为纳西族传统视觉文化的重要载体,具有古朴写意的笔触与鲜明的色彩特征。利用图像生成技术辅助东巴画创作,对其数字传播、风格理解与活态传承具有重要意义。然而,通用扩散模型仅以噪声预测损失为训练目标,缺乏针对艺术化人体结构的显式语义约束,直接应用于东巴画人像生成任务时,生成的结果存在人体结构伪影与风格退化现象,严重影响视觉质量。为此,本文提出一种融合躯体奖励与风格约束的东巴画人像生成方法。方法针对扩散模型生成东巴画人像的结构伪影问题,设计东巴画躯体伪影奖励函数,将人体结构伪影显式建模为奖励信号,引导生成模型向结构合理分布收敛,减少人体结构伪影;针对抑制伪影过程中的风格退化问题,设计东巴画风格约束奖励函数,将风格一致性转化为奖励约束,引导生成模型保持东巴画风格分布,缓解风格退化。在此基础上,提出自适应权重调度策略,动态平衡躯体奖励损失、风格约束损失与噪声预测损失,实现生成过程中结构合理性与风格一致性的协同优化。结果在自建东巴画人像图文数据集上的实验表明,本文方法的风格一致性指标FID(Fréchet inception distance,数值越低表示风格分布匹配度越高)降至0.1164,躯体合理性指标MAF(mean artifact frequency,数值越低表示人体结构伪影越少)降至0.6767,相对基线模型Stable Diffusion v1.5分别降低1.27%和2.39%。客观指标与主观视觉质量评估结果表明,本文方法能有效抑制人体结构伪影并保持东巴画风格一致性。结论本文首次针对东巴画人像生成任务开展系统性研究,有效解决了伪影抑制与风格退化难以兼顾的矛盾,实现了结构合理性与风格一致性的协同优化,为东巴画人像的高保真数字化生成提供了新的技术路径,对东巴画的数字化保护与活态传承具有重要意义。  
    关键词:东巴画;扩散模型;图像生成;人体伪影;风格约束;偏好对齐   
    2
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 168489774 false
    更新时间:2026-08-12

    王华珍, 吴鹭平, 胡建刚, 孙菁, 赵毅飞

    DOI:10.11834/jig.260196
    img
    摘要:目的图像辅助词汇习得是国际中文教育的重要教学策略,但现有提示词生成方法未能有效融合国际中文教育等级标准等领域专业知识,导致所生成图像在词义指向性、认知难度匹配性与教学适用性等方面存在显著不足。针对上述问题,本文提出一种面向国际中文教育词汇图像生成的渐进式提示词扩展模型( Progressive prompt expansion model for vocabulary image generation,PPEM-VIG)。方法PPEM-VIG将词汇的认知等级、难度等级、词性、释义等离散教学要素统一建模为结构化教学要素集,并通过渐进式两阶段优化策略自动生成语义准确、结构规范且教学适用的图像提示词。监督学习阶段基于LLaMA模型以模板结构一致性损失与语言流畅性损失为约束,实现提示词的结构化生成;强化学习阶段基于监督微调LLaMA模型并增加模板内容相关性与基于CLIP的词图语义一致性奖励,对提示词进行深度优化,以实现提示词的拓展生成。结果本文构建了首个面向国际中文教育场景的词汇图像提示词数据集(international chinese language education vocabulary image prompt dataset, ICLE-VIPD)。实验结果表明,PPEM-VIG在模板结构覆盖率、CLIP语义一致性得分、及教师主观评价等核心指标上较最优的基线模型分别提升了4.10%,3.13%,4.54%。结论本文提出的渐进式监督-强化优化范式为词汇教学图像资源智能化生成上提供可借鉴的技术路线。  
    关键词:国际中文教育;词汇教学;AIGC;图像生成;提示词模型   
    4
    |
    1
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 168489727 false
    更新时间:2026-08-12

    黄京乐, 周四望

    DOI:10.11834/jig.260307
    img
    摘要:目的现有基于卷积网络或Transformer的图像超分辨率方法受限于像素级损失函数的设计,重建结果常出现细节模糊、高频纹理重建不足等问题。近年来扩散模型凭借强大的生成先验在感知质量上取得了显著提升,但在纹理与边缘等细节区域容易生成与输入视觉内容不一致的幻觉纹理。针对上述问题,提出一种双阶段梯度引导的扩散模型图像超分辨率方法,从训练与推理两个阶段同时增强生成过程的视觉一致性。方法训练阶段引入频域视觉一致性损失,通过前向视觉算子刻画高分辨率图像的频谱结构,并将其梯度注入噪声预测,引导模型更准确地重建高频细节;推理阶段基于扩散后验采样,设计测量一致性与流形粘合的双重约束,对每一步潜变量更新进行校正,使采样轨迹既符合观测退化模型,又保持在自然图像分布内。结果在RealSR(real-world super-resolution)和DRealSR(diverse real-world super-resolution)两个数据集上与现有主流方法进行对比实验。客观指标方面,与基线扩散超分辨率方法相比,所提方法在RealSR数据集上的峰值信噪比(peak signal-to-noise ratio,PSNR)提升1.756 dB,结构相似性(structural similarity index measure,SSIM)提升0.0115,感知图像块相似度(learned perceptual image patch similarity,LPIPS)降低2.76%;在DRealSR数据集上PSNR提升2.139 dB,SSIM提升0.0203,LPIPS降低10.88%。主观评价方面,该方法在字符纹理等高频细节区域有效抑制了幻觉伪影,结构准确性与纹理真实感优于对比方法。消融实验验证了各模块的有效性及协同增益。结论所提出的双阶段梯度引导的扩散模型图像超分辨率方法通过训练阶段的频域视觉引导与推理阶段的双重约束后验采样,有效抑制了幻觉纹理,提升了重建结果的保真度与结构一致性,在感知质量与重建保真度的综合权衡上优于现有方法。  
    关键词:图像超分辨率;扩散模型;梯度引导;扩散后验采样;重建保真度   
    3
    |
    0
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 168489697 false
    更新时间:2026-08-12

    都双丽, 刘梓扬, 赵明华, 胡静, 石程, 李鹏

    DOI:10.11834/jig.260223
    img
    摘要:目的针对复杂交通场景中车辆转弯引起的活动轨迹状态更新不稳定,以及短期丢失轨迹缺乏针对性更新机制的问题,提出一种面向车辆转弯场景的轨迹状态更新与关联增强多目标跟踪,以缓解车辆转弯过程中易出现的漏检、身份切换和轨迹中断现象。方法首先该方法设计快慢双时间尺度记忆模块,针对车辆转弯时运动方向和空间位置变化快、外观信息变化相对缓慢的特点,分别对外观慢变信息与运动快变信息进行递推建模,并通过状态融合缓解单一流状态递推中快慢信息相互干扰的问题。其次该方法设计了短期丢失轨迹状态更新模块,结合最近更新轨迹嵌入、边界框变化趋势与丢失时长,对短期丢失轨迹进行状态递推,缓解了短期丢失轨迹与当前目标的状态偏移现象。结果该方法在FastTracker、CityFlow和TrafficMOT数据集上,在高阶跟踪准确率(higher order tracking accuracy,HOTA)、关联准确率(association accuracy,AssA)、身份切换次数(identity switches,IDs)以及轨迹碎片化次数(fragmentations,Frag)等跟踪相关指标上取得较优表现。结论所提方法能够有效提升车辆转弯场景下轨迹关联的稳定性与连续性,增强复杂交通场景中的车辆多目标跟踪性能。  
    关键词:车辆多目标跟踪;车辆转弯;关联增强;轨迹状态更新;快慢双时间尺度记忆   
    103
    |
    71
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 163156681 false
    更新时间:2026-07-28

    刘菁薏, 张劲松, 马健, 李坤

    DOI:10.11834/jig.260062
    img
    摘要:头发的三维重建作为计算机视觉与计算机图形学领域中的重要研究方向,旨在精确建模头发复杂的几何结构与外观特性。现有的头发重建方法大多建立在理想光照假设下,能够在简单发型上取得较好效果,但在面对复杂光照条件以及致密卷发、高卷曲发型等高复杂度发型时,难以保持几何结构的准确性与重建结果的稳定性。本文提出一种基于自适应高斯椭球表示并具备复杂光照鲁棒性的多视图三维头发重建方法,能够在真实复杂场景中实现高精度的头发几何结构建模及细节丰富、外观一致的纹理重建。具体来说,本文提出了一种结合视觉语言模型(Vision-Language Model,VLM)与三维高斯泼溅(3D Gaussian Splatting,3DGS)的重建框架,实现对复杂发型(如致密卷发、高卷曲发型)的精细几何建模与逼真外观恢复。本文在多视图三维头发重建领域引入VLM对多视角图像进行光照质量评估与发型复杂度分析,构建光照-复杂度双感知的闭环引导机制。智能定位低光及逆光视角,动态调整高斯椭球密度,实现稀疏几何区域的自适应填充。本文设计了几何-纹理解耦优化策略,先联合优化几何与颜色,再在固定几何下微调颜色。实验结果表明,本文方法在自建数据和公共数据集上的定性结果均优于现有最先进方法(如Gaussian Haircut、Im2Haircut、DiffLocks),在几何精度、方向一致性和纹理恢复上均取得提升。与 Gaussian Haircut 相比,本文方法的PSNR(Peak Signal-to-Noise Ratio) 提高0.54dB,SSIM (Structural Similarity Index Measure)提高0.004,LPIPS(Learned Perceptual Image Patch Similarity)降低0.01,验证了本文方法在重建质量与视觉一致性方面的有效性。综上,本文方法通过引入视觉语言模型与自适应密度控制的协同机制,提升了复杂光照与高复杂度发型条件下的三维头发几何重建精度与稳定性,实现了几何结构与外观纹理的一致重建,并增强了方法在真实场景中的鲁棒性与泛化能力。本文方法的代码已开源至GitHub平台(https://github.com/Blueekyyy/CURL),同时已在ScienceDB平台完成代码公开(https://doi.org/10.57760/sciencedb.j00240.00223)。  
    关键词:三维头发重建;视觉语言模型;复杂光照;自适应密度控制;几何-纹理解耦   
    71
    |
    69
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 163156492 false
    更新时间:2026-07-28

    陆俊, 吴尚容, 孙仕泽, 许祥宇, 龚钢军, 刘向军

    DOI:10.11834/jig.260071
    img
    摘要:目的电力图像监测主要分为传输与识别过程,传统监测方法未从语义层面考虑将二者进行联合优化,使得传输过程中目标语义信息无法充分提取,进一步导致了图像识别率偏低。针对电力图像受噪声干扰导致监测效率低下问题,提出一种基于语义通信联合优化的端到端电力图像监测方法。方法首先,在语义通信框架下设计轻量化卷积自编码器(convolutional autoencoder,CAE)传输模型,并引入基于通道注意力机制模块,使得模型更关注电力语义特征。其次,以vision transformer(ViT)为主体架构设计ViT识别模型,提出注意力引导的卷积编码模块,使得模型更好的理解电力图像局部语义特征。级联上述模型得到CAE-ViT模型,作为电力图像监测框架,并基于所提框架的参数空间扩展与语义优化方向设计联合训练方法,实现语义通信联合优化的电力图像监测。结果实验采用中国电力线路绝缘子数据集(chinese power line Insulator dataset,CPLID)和电力线路资产巡检数据集(inspection power line asset dataset,InsPLAD)进行验证,与对比方法相比,本文方法在低信噪比(-10dB~10dB)条件下电力图像监测识别率提高了4%~26%,验证了所提方法有效性。结论本文提出的方法在复杂电磁环境无线信道中更具鲁棒性,且进一步提升了电力图像的监测效率,为电力图像监测实际应用部署提供了有益的技术借鉴。  
    关键词:语义通信;电力图像监测;语义图像传输;电力图像识别;复杂电磁环境;联合训练;语义优化方向   
    117
    |
    63
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 163156403 false
    更新时间:2026-07-28

    程勇, 张卓成, 孟逸飞, 韩长霖, 吴长春, 李超凡

    DOI:10.11834/jig.260053
    img
    摘要:针对雾霾场景下图像低对比度、目标边缘模糊以及复杂背景干扰导致目标检测性能下降的问题,提出一种面向雾霾场景的特征增强目标检测网络SD-YOLO11。该方法以YOLO11为基础,从主干网络与颈部网络两个层面对模型进行协同优化。在主干网络中,引入SIBlock模块,通过递归空间交互增强模糊目标与小目标的特征表达能力;结合GhostConv与ADown模块,在降低计算冗余的同时提高关键特征保留能力。在颈部网络中,设计改进的BifpnCat特征融合结构,以增强多尺度语义信息与细节信息的交互能力;同时引入DASI注意力机制,对目标相关特征进行自适应增强,从而提升复杂雾霾场景下的目标感知能力。此外,通过优化特征拼接路径并增加P2检测头,进一步增强网络对小目标与低分辨率目标的检测能力。为了验证所提方法的有效性,在HazyDet、Foggy Cityscapes和RTTS数据集上开展对比实验。实验结果表明,SD-YOLO11在HazyDet数据集上的mAP50mAP50-95分别达到78.8%和61.4%,较YOLO11分别提升1.4个百分点和2.0个百分点;在Foggy Cityscapes和RTTS数据集上同样取得优于主流检测方法的检测性能,并在小目标与低对比度目标检测任务中表现出更好的鲁棒性。研究结果表明,所提方法能够有效提升雾霾场景下目标检测的精度与稳定性,同时保持较好的实时检测性能,可为低能见度环境下的视觉感知任务提供有效技术支撑。  
    关键词:雾霾场景;目标检测;特征提取;注意力机制;特征融合   
    109
    |
    69
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 163156356 false
    更新时间:2026-07-28

    空中目标跟踪, 王瀚正, 李伟, 张家铭, 何鸿涛, 黄荀

    DOI:10.11834/jig.260136
    img
    摘要:目的分割一切模型(segment anything model 2, SAM 2)在目标跟踪领域已取得显著进展,其具备强泛化的分割先验以及长时序建模能力,能够目标跟踪提供空间信息支持,缓解背景混淆与遮挡后重现易丢失等跟踪关键难题。然而,SAM 2无法利用高光谱数据中的光谱判别信息,当目标与背景在空间纹理上高度相似等情况时,仅依赖空间语义先验生成的掩码可能出现漂移。因此,针对高光谱目标跟踪中目标与背景分离不充分等问题,提出一种面向高光谱目标跟踪的光谱提示与混合注意力方法。方法以分割一切模型SAM 2为基础构建跟踪框架:在空间维度,利用语义掩码进行像素级目标—背景分离;在时序维度,通过记忆库与记忆注意力建立跨帧长时依赖,增强遮挡重现后的关联与恢复;在光谱维度,提出混合嵌入网络以对齐高光谱数据分布,并引入混合注意力与光谱嵌入模块,将目标光谱信息编码为提示向量、学习波段间深层语义关系。此外,为了促进相关领域研究,构建了首个高光谱空中目标跟踪数据集AHOT。结果在3个数据集上与6种最新方法对比,所提方法在HOTC-2024-RedNIR数据集上DP_20相比第二名提升4.08%,在AHOT数据集上DP_20相比第二名提升15.57%,对比实验结果证明所提算法改善了目标跟踪的性能。此外,本文方法的推理速度达到15.4 FPS,在实现较高精度的同时具有近实时的工程效率。结论通过掩码级目标分离与长时记忆建模,并结合光谱嵌入与注意力融合策略,所提方法显著提升了复杂场景下高光谱目标跟踪的精度与鲁棒性。构建数据集将在科学数据银行公开(31253.11.sciencedb.j00240.00255)。  
    关键词:高光谱目标跟踪;分割一切模型;注意力机制;光谱提示;特征提取   
    73
    |
    69
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 163155936 false
    更新时间:2026-07-28

    马帅, 何进荣

    DOI:10.11834/jig.260254
    img
    摘要:目的针对高光谱图像开集识别中存在的异物同谱现象,以及传统深度模型基于闭集假设对未知类产生过度自信误判的问题,提出一种频域知识引导的高光谱开集识别方法(frequency knowledge-guided contrastive learning,FKCL)。方法本文提出一种数据驱动与物理知识协同的双分支网络架构。其中,特征分支利用3D-2D混合卷积网络提取深层空谱语义特征。频域分支利用实值快速傅里叶变换提取地物中心光谱的频域物理属性,并通过指数移动平均在线更新各类别的频域原型。在此基础上,该方法引入基于类锚点聚类损失的双重距离决策机制,从而在特征度量空间与频域物理空间中为已知类构建准确的判别边界。结果在 WHU-Hi-LongKou、Pavia University 和 Salinas 三个公开高光谱数据集上,采用类别留出协议构造伪未知类,对 FKCL 方法进行开集识别评估。实验结果表明,FKCL 在保持已知类分类性能的同时能够提升对伪未知类的拒识能力。其中,在 Pavia University 数据集上,模型总体准确率(overall accuracy,OA)达到 92.02%,未知类识别准确率为 100.00%。同时,不同数据集上的性能提升存在差异,Salinas 中多个未知类与已知类光谱高度相似,未知类拒识仍更具挑战性。结论本文方法通过引入频域物理先验知识作为特征距离度量的补充,缓解了传统深度学习模型对伪未知类样本过度自信的问题。在类别留出构造的伪未知评测协议下,FKCL 提升了模型对训练阶段未见地物类别的鉴别与拒识能力。  
    关键词:高光谱图像;开集识别;频域引导;类锚点聚类;空谱融合;双分支架构   
    126
    |
    123
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 161717374 false
    更新时间:2026-07-16

    王云柯, 陶林伟, 林雨恬, 杜博, 徐畅

    DOI:10.11834/jig.260149
    img
    摘要:目的视觉模仿学习旨在从高维图像观测中学习智能体控制策略,但相比基于低维本体状态的方法,其性能仍存在明显差距。主要原因在于,像素观测中的关键行为差异较为细微,视觉编码器难以学习具有充分判别性的状态表征。已有视觉对抗模仿学习方法主要关注专家样本与智能体样本之间的区分,未充分利用智能体回放样本的内部结构信息,也未显式建模智能体策略在训练过程中逐步接近专家策略的动态演化特征。为提升高维视觉观测下的表征判别能力与训练稳定性,本文提出一种基于校准对比学习的视觉对抗模仿学习方法。方法本文在生成对抗模仿学习框架中引入校准对比表示学习机制,通过“拉近相似状态、分离差异状态”的方式增强视觉编码器的判别能力。不同于已有方法主要关注专家样本与智能体样本之间的静态区分,本文进一步挖掘回放缓冲区的内部样本结构,并建模智能体样本质量随训练过程逐步提升的动态特征。具体而言,本文将智能体样本视为高质量样本与低质量样本的混合分布,并利用校准监督对比损失自适应调整其与专家样本之间的对比关系,从而提升视觉表征质量和对抗训练稳定性。结果在DMControl Suite的9个连续控制任务上进行了实验验证。实验结果表明,所提出方法CAIL(contrastive adversarial imitation learning)在多个任务上取得了更高的累计回报,并在训练早期表现出更好的样本效率。与代表性方法PCIL(policy contrastive imitation learning)相比,CAIL在1M时间步的平均性能提升了22.6%。消融实验进一步验证了智能体无监督对比损失和校准监督对比损失的有效性,可视化结果表明CAIL能够更加准确地关注智能体关节等行为相关区域。结论本文提出的校准对比视觉对抗模仿学习方法能够更充分地利用智能体回放样本,并动态刻画智能体样本质量随训练过程变化的特征,从而提升视觉状态表征的判别能力和对抗训练稳定性。该方法为高维视觉观测条件下的模仿学习提供了一种有效的表征学习思路。  
    关键词:强化学习;模仿学习;对抗模仿学习;对比学习;表征学习   
    154
    |
    124
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 160306234 false
    更新时间:2026-07-02

    李哲, 罗靖, 柳宇, 高彬智, 石伟伟, 王晓帆, 黑新宏

    DOI:10.11834/jig.260209
    img
    摘要:目的针对实际视频监控场景中,无人机目标像素占比小、外观特征微弱,易被复杂动态背景掩盖,传统单帧目标检测算法无法有效利用帧间时序运动信息,导致微小目标漏检、误检频发的核心问题,开展视频微小无人机目标检测方法研究,为低空安防系统提供可靠的视觉检测方案。方法提出时序运动感知双分支网络(Temporal Motion-Aware Dual-Branch Network, TMAD-Net)。具体地,空间语义提取分支提取多帧堆叠图像的空间语义特征,显式运动先验分支通过去噪帧差图像捕捉目标高频运动特征,并使用运动-空间自适应融合模块融合双分支特征,从运动与空间维度自适应增强目标信号、抑制背景噪声,后输入主干网络完成微小无人机目标检测。结果在公开的ARD-MAV数据集以及真实场景采集的Phone与DJI两个无人机数据集上开展对比实验,结果表明,在ARD-MAV数据集中,mAP50从基线的0.264提升至0.588,mAP50-95从0.155提升至0.334;在Phone数据集中,mAP50从基线的0.802提升至0.887,mAP50-95从0.590提升至0.638;在DJI数据集中,mAP50从0.316提升至0.822,mAP50-95从0.083提升至0.266;推理速度达122FPS,满足实时检测需求。结论所提时序运动感知双分支网络模型通过显式分离并深度融合多帧空间与运动特征,结合运动-空间自适应融合模块精准校准,有效弥补了传统单帧算法对微小目标特征表征能力不足的缺陷,突破了复杂背景下视频微小目标检测的性能瓶颈,显著提升了微小无人机目标检测的准确率与鲁棒性。  
    关键词:视频目标检测;无人机;微小目标;运动解耦;时序运动感知;空间语义提取   
    139
    |
    101
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 160306154 false
    更新时间:2026-07-02

    刘石佳, 闫晓金, 任浩杰, 苏兆品

    DOI:10.11834/jig.260150
    img
    摘要:目的语音深度伪造归因是指通过捕捉不同语音合成模型生成语音时留下的独特模型特征,精准识别并确认伪造语音来源的技术,不仅能为人工智能治理提供可解释性证据,也能推动AI语音行业的规范发展,倒逼平台落实内容溯源与监管义务,已成为人工智能安全的研究热点之一。然而,已有方法存在特征提取能力不足、泛化性能有限的问题,难以满足实际应用需求。方法为此,本文提出一种少样本数据下的语音深度伪造归因方法(Low-resource Audio Deepfake Attribution,LADAR),利用多层特征融合的特征提取策略与多原型学习机制,实现少样本数据下的语音深度伪造精准归因。具体来说,首先构建基于多层特征融合的特征提取方法,通过可学习注意力权重聚合预训练Wav2Vec2-BERT 2.0模型的各层隐藏状态,并引入浅层偏置因子,将全局特征动态融合,生成强判别性的模型嵌入表示;其次,设计多原型学习模块,为每类伪造方法生成多个原型向量以丰富类内多样性,提高识别准确率;最后,分别在已知和未知语音伪造场景下验证LADAR方法的归因性能。结果与已有方法相比,针对已知语音伪造方法场景,LADAR方法的准确率分别提升35.25%、26.26%、9.22%和5.65%,F1分数分别提升38.82%、27.42%、7.23%和5.74%;针对未知语音伪造方法场景,LADAR方法的准确率分别提升了15.80%、37.51%、10.73%和10.42%,F1分数分别提升了20.29%、34.17%、11.40%和12.33%;结论对比实验结果表明,LADAR方法可有效解决语音深度伪造归因问题,具有较强的准确性和泛化性,可为司法取证、溯源追踪等实际场景提供了有效的技术支撑。  
    关键词:语音深度伪造归因;少样本学习;特征融合;多原型网络;音频鉴伪   
    76
    |
    82
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 160306036 false
    更新时间:2026-07-02

    陈勇奇, 冯收, 任春颖, 唐英杰, 任慧鑫, 赵春晖

    DOI:10.11834/jig.260051
    img
    摘要:目的多光谱遥感图像林地变化检测是生态监测领域的重要研究方向之一。针对双时相图像中成像条件差异引起的伪变化,以及复杂地物变化在尺度与形态上的多样性问题,设计了一种频域增强分层交互网络,以提升复杂场景下林地变化检测的准确性与鲁棒性。方法首先,构建频域特征增强模块,在频域对双时相特征进行增强,以抑制由成像条件不一致引起的风格差异等伪变化干扰。其次,设计跨时相相关引导交互模块,通过对双时相特征的充分交互与相关性引导,增强网络对局部细微变化区域的识别能力。最后,通过空-谱耦合交互模块,对不同网络深度的变化特征进行整合,融合浅层细粒度结构信息与深层语义信息,实现对多尺度、多形态林地变化对象的联合感知。结果实验在3个林地变化检测数据集上与Spectral-Former、CSANet(cross-temporal interaction symmetric attention network)、TriTF(triplet Transformer framework)、DIEFEN(differential information-enhanced feature exchange network)、FrFTML(fractional Fourier transform domain decoupling-based adaptive weighted metric learning network)和AIWSEN(Adaptive information weighting and synchronized enhancement network)等先进方法进行了对比分析。在R1数据集中,所提出方法的Kappa系数达到0.8102,相比性能次优方法提升1.09%;在R2数据集中,Kappa系数提升2.62%;在R3数据集中,Kappa系数提升1.74%。同时,在三个数据集上的消融实验进一步验证了所提模块的有效性。结论本文所提方法能有效缓解双时相风格差异引起的伪变化干扰,并提升对细微变化与多尺度变化对象的检测能力,从而获得更为准确、稳定的林地变化检测结果。  
    关键词:多光谱遥感图像;林地变化检测;频域特征;特征交互;多尺度变化感知   
    104
    |
    87
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 160305928 false
    更新时间:2026-07-02

    岳书同, 刘春晓

    DOI:10.11834/jig.260178
    img
    摘要:目的随着人脸伪造技术的快速发展与广泛传播,由其引发的虚假信息泛滥与身份冒用诈骗等社会问题日益严峻。现有的基于人脸图像重建的伪造检测方法仅进行真实或伪造人脸的单视角重建,未显式放大二者重建前后的差异,导致网络模型的检测准确率和泛化性能提升有限。针对上述问题,提出一种差异化重建驱动的残差引导人脸伪造检测方法,扩大真伪人脸重建前后的差异,显著提升了模型检测性能。方法首先,为了显式放大真伪人脸重建前后的差异,提出一种对比差异化重建网络(Contrastive Differential Reconstruction Network,CDRNet),分别为真实与伪造人脸构建清晰与模糊图像的重建目标,提升整体网络模型对真伪人脸的辨别能力。其次,考虑到现有检测方法对残差图的引导信息利用不充分等问题,设计了残差双域引导模块(Residual Dual-Domain Guidance Module,RDDGM),深度融合图像的空间域与高频域特征,并利用重建残差信息引导融合后的双域特征,增强了网络模型捕捉细微伪造痕迹的能力。此外,为了促使模型学习不同伪造方法之间的通用伪造特征,设计了文本感知损失模块(Text-Aware Loss Module,TALM),通过引入文本模态信息的引导,进一步优化对比差异化重建结果,大幅提升了网络模型对未知伪造方式的泛化性能。结果在域内实验中,与性能最好的对比方法相比,该方法的准确率(accuracy,ACC)与曲线下面积(area under the curve,AUC)指标分别提升2.83%和1.75%。在跨域实验中,该方法在5个公开测试集上与13种典型方法进行性能测试与比较,平均AUC指标提高1.75%。结论本文在人脸伪造检测中创新性结合对比学习与图像差异化重建,显著提升了模型对未知伪造方式的检测准确率,在多个基准测试中性能优于已有方法。  
    关键词:深度伪造检测;人脸伪造检测;多任务学习;对比差异化重建;残差双域引导   
    141
    |
    111
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 160305869 false
    更新时间:2026-07-02

    王进, 杜欣豫, 丁新

    DOI:10.11834/jig.260186
    img
    摘要:目的小样本图像分类旨在利用极少量标注样本完成新类别识别。现有图文语义增强方法多依赖类别名称或简短提示,语义粒度较粗,难以充分刻画类别局部属性、外观细节及类间细微差异;同时,文本语义与视觉特征之间存在模态鸿沟,简单融合方式难以实现充分对齐。为此,提出一种面向多粒度语义对齐的图文语义多分支对齐网络(text-visual semantic multi-branch alignment network,TSMA-Net)。方法设计语义信息挖掘模块,以类别名称为语义锚点,引导大语言模型离线生成包含外观特征、局部属性和差异线索的细粒度语义描述,并通过语义精炼压缩冗余信息与歧义表达。进一步通过语义适配模块,将类别名称语义与多角度细粒度语义表示进行加权融合,得到更加稳健且具有判别性的类别文本表示。在此基础上,提出多分支对齐模块,将融合语义投影到多个独立子空间,与视觉特征进行深度对齐和交互,并结合残差重校准结构抑制跨模态噪声,提升语义特征的表达能力。最终通过视觉原型与语义增强原型双路径协同完成查询样本分类。结果在miniImageNet、tieredImageNet、CIFAR-FS和FC100上,TSMA-Net均取得稳定提升。与相同Visformer-Tiny骨干的SimpleFSL相比,在1-shot/5-shot任务上分别提升2.11%/0.47%、2.35%/0.49%、1.21%/0.28%和0.54%/0.10%。消融实验验证了各模块的有效性。结论所提出的TSMA-Net能够在小样本场景下有效挖掘更丰富、更具判别性的类别语义信息,并实现语义与视觉特征的深度对齐,从而提升类别原型的表征能力与分类性能。该方法在多个标准基准数据集上表现出良好的有效性与泛化能力,尤其在1-shot任务中优势更为明显。  
    关键词:小样本学习;小样本图像分类;原型学习;多模态学习;跨模态语义对齐;大语言模型   
    87
    |
    133
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 160305823 false
    更新时间:2026-07-02

    刘煜, 冯瑛超, 张伊丹, 李宁, 刁文辉, 胡岩峰

    DOI:10.11834/jig.260248
    img
    摘要:无人机凭借全天候、全天时探测优势,在边境监控及灾害救援等领域发挥重要作用。然而,现有的红外-可见光(IR-VIS)多模态目标检测研究过度依赖理想化的“像素级对齐”假设,且数据集普遍存在目标尺度分布极化、类别同质化等问题,导致现有算法在处理具有真实视差及动态尺度演变的无人机航拍数据时,极易出现特征失配、定位漂移及漏检误识。基于以上问题,文中构建了一个面向真实弱配准场景的多模态、多尺度、多类别无人机目标检测基准数据集DIV(drone-based IR-VIS object detection)。该数据集保留了红外与可见光图像之间因无人机传感器安装差异、视角变化及飞行抖动等因素在实际应用中产生的非线性空间偏移。数据集内容涵盖从像素占比极低的微小型目标到显著区域的大型目标,并引入了行人、非机动车、各类车辆等多样化类别。拍摄环境覆盖城市、山区及乡村,并细分为日间、傍晚和弱光三种典型光照场景。同时,通过独立模态的人工高精度标注及多轮交叉验证机制,确保了弱对齐约束下的语义一致性。选取了9种主流多模态目标检测算法在所提数据集上进行基准测试。实验结果表明,在理想对齐数据集中表现优异的方法,在本数据集的弱配准场景下性能出现不同程度的下滑。一些模型方法在特定维度上表现出色,但在应对极端复杂环境时的综合感知能力仍显不足。面对真实环境中的复合挑战,构建一套多维协同优化体系以强化对多模态信息的提取与整合能力,是提升无人机平台感知鲁棒性的关键。提出的数据集有效弥合了多模态探测算法的“理想假设”与无人机数据“现实分布”之间的鸿沟,为构建多维协同优化体系提供了真实的验证平台,在数据层面为弱对齐约束下的跨模态特征融合与鲁棒检测研究提供了关键支撑。DIV数据集发布地址为:https://www.scidb.cn/preview?dataSetId=d1e8909592e04cc2a1095e62f579ead1&version=V1。  
    关键词:航空遥感影像;多模态图像融合;跨模态对齐;红外与可见光;目标检测   
    65
    |
    48
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 160305759 false
    更新时间:2026-07-02

    赵子璐, 王峰, 焦念刚, 尤红建

    DOI:10.11834/jig.260140
    img
    摘要:遥感图像配准作为遥感图像处理中的基础性与关键性任务,始终是国内外学者的研究热点,具有重要的理论意义与应用价值。然而,遥感图像常面临显著几何畸变、非线性辐射差异、复杂地物遮挡及噪声干扰等挑战,制约了其高精度鲁棒配准的实现。本文系统梳理了遥感图像配准算法:首先,概述配准的基本概念与技术框架;其次,将现有方法划分为两类进行归纳梳理——基于知识驱动专家设计的方法与基于数据驱动深度学习的方法。前者依托手工设计特征及变换模型,通过显式特征提取与迭代优化实现传统场景下的可解释性配准,典型代表为尺度不变特征变换及其改进算法;后者利用深度学习网络自动学习图像对间的特征或映射关系,提取高级特征用于配准或端到端预测变换模型,有效应对显著几何畸变、非线性辐射差异等复杂场景,典型方法包括基于卷积神经网络的特征匹配网络及其改进网络。最后,总结现有方法的局限性,并展望遥感图像配准领域的未来发展趋势与面临的关键挑战。  
    关键词:遥感图像配准;知识驱动;数据驱动;特征匹配;深度学习   
    116
    |
    151
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 158900536 false
    更新时间:2026-06-22
0