最新刊期

    徐光柱, 吴昀其, 柯志, 雷帮军

    DOI:10.11834/jig.260305
    img
    摘要:目的开放场景中,待识别车牌版式多样、字符位数不统一,现有车牌识别算法在通用性、识别精度与推理速度方面通常难以兼顾。另外,双行及复杂背景车牌数据集的匮乏,限制了多类型车牌识别技术的发展。针对上述问题本文提出基于并行编解码架构的广域车牌识别网络,同时提出基于冗余回收策略的多类型车牌数据生成方案。方法首先通过专用轻量级卷积网络,实现车牌字符的多尺度特征高效提取。随后,将骨干网特征送入局部-全局交互模块,通过并行分组Transformer实现局部与全局特征的高效交互建模。接着,经过模态适配器聚合后送入并行查询式非自回归双层解码器,实现先粗后精的递进式匹配识别。数据生成方案通过回收单行测试数据集中的冗余样本,利用其背景及车牌区域的位置参数,结合程序化生成的虚拟目标车牌进行几何贴合,构建虚实结合的多类型车牌实验数据。结果实验在CCPD数据集及通过冗余回收策略构建的混合数据集上开展,并与18种有代表性的开源及闭源算法进行对比,同时在两个公开数据集上进行跨数据集测试。结果表明,所提算法在通用性、识别精度和推理速度上均显著优于对比算法,在CCPD数据集上平均车牌识别准确率为99.05%,模型参数量为1.44 M,推理帧率为208.6 FPS。结论基于冗余回收的数据生成方案有效缓解了多类型车牌样本不足的问题;基于并行编解码架构的轻量级车牌识别网络实现了通用性、准确性与实时性的协同优化,具有良好的理论研究与工程应用价值。  
    关键词:通用车牌识别;开放场景;Transformer;并行编解码架构;双行车牌合成   
    65
    |
    33
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171109203 false
    更新时间:2026-09-15

    王晨绮, 喻迟槿, 翟明玮, 谭欢, 徐梦文, 黄凯雯, 周涛

    DOI:10.11834/jig.260242
    img
    摘要:半监督学习为缓解医学图像分割中高质量标注数据稀缺的难题提供了重要途径。近年来,伪标签生成、一致性正则化与协同训练等技术在充分挖掘未标注数据潜力、提升模型泛化能力方面取得显著进展。本文系统综述了半监督医学图像分割的关键方法,重点回顾了基于伪标签的方法在高置信度伪监督信号生成、边界感知增强等方面的技术创新;探讨了一致性方法在多域异构性与复杂解剖结构下的改进策略,如多层次特征对齐和不确定性对抗训练;分析了协同训练方法通过多模型协作提升分割稳健性的研究进展。随后,本文深入讨论了当前面临的核心挑战,包括伪标签质量控制、类别不平衡以及数据隐私保护,并展望了未来结合医学知识驱动、自适应阈值策略与隐私保护机器学习的新方向。通过全面梳理现有研究,本文旨在为半监督医学图像分割的持续发展提供系统性参考和研究启示。  
    关键词:半监督学习;医学图像分割;伪标签;一致性正则化;协同训练   
    52
    |
    39
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171109171 false
    更新时间:2026-09-15

    于英, 柏栋, 张珂, 李凯, 李磊, 李力, 冯新月

    DOI:10.11834/jig.260239
    img
    摘要:目的真实场景下,由于目标自身特性、环境交互及成像条件共同作用,导致军用车辆目标在可见光遥感成像条件下的可分辨性、可分离性显著降低。尽管基于深度学习的遥感图像目标检测技术近年来取得了显著进展,但现有研究对遥感图像特殊性的充分适应、效率与精度的平衡、以及真实场景下的泛化能力等方面,仍有待进一步突破。针对真实场景目标检测的难点,基于YOLOv11(you only look once)算法提出一种雾密度引导的真实场景军用车辆遥感图像检测算法(YOLO for military vehicle detection under foggy conditions, MVF-YOLO)。方法在网络输入端增加一个基于雾密度权重的边缘特征恢复模块(fog density-driven edge restoration, FDER),自适应恢复被雾衰减的边缘信息;在网络颈部设计了空间注意力引导的频域信息选择模块(spatial attention-based frequency selection, SFS),增强高频判别特征并抑制低频噪声,并且利用遥感车辆刚性目标特性和目标长宽比先验知识,使用基于目标长宽比先验的分类损失函数(aspect ratio binary cross-entropy Loss, ar_BCELoss)优化分类精度。结果在MVRSD-V2.0数据集上,所提方法在IoU阈值为0.5时的平均准确率达到87.6%,较基线模型提升4.4%。结论试验结果表明,该方法在真实场景下具有强鲁棒性和军用车辆检测能力。  
    关键词:遥感图像;军用车辆;目标检测;真实场景;雾密度   
    31
    |
    35
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171109048 false
    更新时间:2026-09-15

    胡静, 吕晓鹏, 王芳, 张睿

    DOI:10.11834/jig.260246
    img
    摘要:目的针对现有半监督语义分割方法特征表达不足,以及全图统一一致性约束易造成语义边界模糊和目标内部预测不连贯的问题,提出空频一致性驱动的半监督语义分割框架SF-Match(Spatial-Frequency Match)。方法以自监督预训练DINOv2为编码器、DPT(Dense Prediction Transformer)为解码器,构建兼顾全局语义与局部细节的密集预测网络;在教师—学生框架中,对CutMix后的强增强图像构造高频和低频视图,并依据教师伪标签的形态学梯度动态生成边界与内部掩膜;分别在边界区域施加高频一致性约束、在内部区域施加低频一致性约束,与RGB全局一致性和监督损失联合优化,实现频域信息与空间语义区域的解耦对齐。结果在Pascal VOC 2012和Cityscapes数据集上开展多标注比例对比、消融、困难类别、复杂度及定性实验。Pascal VOC 2012上,SF-Match的平均交并比(mean Intersection over Union,mIoU)为86.4%~90.6%,较semiVL提高1.9~3.6个百分点,较UniMatch提高9.4~11.2个百分点;Cityscapes上,mIoU为83.6%~85.0%,较各划分下最佳外部对比方法提高3.7~5.1个百分点。消融实验中,Pascal VOC 2012的1/4标注划分下,mIoU由传统基线的77.8%提高至89.6%,表明网络重构与区域化空频对齐具有协同作用。结论目前的实验结果支持SF-Match用于少量像素级标注、较多同域未标注图像且重视边界细节的自然场景和城市街景分割。其区域化空频对齐思想具有扩展至其他教师—学生式分割框架的潜力,但尚需进一步验证;对于高度遮挡、远距离小目标、复杂高频背景和跨领域数据,其有效性仍有限或未得到充分验证,且多视角训练会增加计算量与显存开销。  
    关键词:半监督学习;语义分割;空域-频域一致性;边界感知;视觉Transformer   
    32
    |
    21
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171109003 false
    更新时间:2026-09-15

    周涛, 陈铮, 沈飞宇, 万之瑜, 吕科, 周涛, 胡伏原, 许铮铧, 李晨

    DOI:10.11834/jig.260378
    img
    摘要:医学图像识别是医学人工智能的重要研究方向,已广泛应用于病灶检测、疾病分类、器官分割和辅助诊断等任务。然而,在医学图像识别中,病灶区域占比小、疾病类别分布不均、跨机构成像差异和标注标准不一致等因素,可能使模型对小病灶、罕见疾病、特定患者群体或特定医疗中心的识别性能下降,并使模型依赖背景、设备和人群属性等与诊断目标无直接关系的信息。针对上述问题,本文围绕医学图像识别中的去偏见方法进行总结。首先,从偏见出现的位置出发,将相关问题归纳为像素级偏见、样本级偏见、特征级偏见和算法级偏见;然后,针对如何提升小病灶的权重的问题,像素级去偏归纳为像素重加权去偏,边界重加权去偏和区域重加权去偏;针对如何提高少数类样本的训练贡献,样本级去偏归纳为样本重平衡去偏和样本扩充与生成去偏;针对如何解决跨域特征分布不均的问题,特征级去偏归纳为特征对齐去偏,特征解耦去偏和知识蒸馏去偏;针对如何解决模型对非目标属性的依赖的问题,算法级去偏归纳为因果约束去偏;最后,本文总结医学图像识别的公平性问题研究在偏见来源、去偏与诊断信息的平衡、生成的医学图像的真实性、跨中心公平性评价体系等方面面临的挑战。本文为医学图像识别中偏见缓解方法的研究与应用提供参考。  
    关键词:公平性问题;像素级偏见;样本级偏见;特征级偏见;算法级偏见   
    26
    |
    27
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171108935 false
    更新时间:2026-09-15

    林泽辉, 沈忠伟

    DOI:10.11834/jig.260280
    img
    摘要:目的组合零样本学习旨在利用训练阶段已见的状态与物体原语识别测试阶段未见的状态—物体组合。现有基于视觉语言预训练模型的方法主要关注组合语义建模和全局跨模态对齐,但仍存在对训练图像风格分布依赖较强、局部判别区域利用不足等问题,导致模型在未见组合场景下泛化能力受限。方法针对上述问题,提出一种风格解偏与局部语义聚焦相结合的组合零样本学习方法。在视觉编码前端,引入风格解偏模块,通过对中间卷积特征的通道均值和标准差进行随机混合,降低模型对颜色、纹理和背景统计模式的依赖;在跨模态交互阶段,设计文本锚引导的局部语义聚焦模块,利用组合、属性和物体分支的文本原型构造语义锚点,对视觉 patch token 进行相似度计算、Top-K 稀疏筛选和重加权,从而突出与当前语义相关的关键局部区域。在此基础上,结合三分支关系建模框架完成属性、物体和组合的联合匹配预测。结果在 MIT-States、UT-Zappos 和 C-GQA 3个基准数据集上进行闭世界和开放世界实验。闭世界设定下,本文方法在 MIT-States、UT-Zappos 和 C-GQA 上的 AUC 分别达到 22.9%、42.8% 和 13.1%;开放世界设定下,AUC 分别达到 7.8%、33.8% 和 3.24%,均优于基线模型。消融实验表明,风格解偏模块和局部语义聚焦模块均能带来稳定性能提升,二者结合后取得最优结果。结论所提方法能够有效缓解视觉风格偏移对组合识别的影响,并增强模型对局部关键语义证据的关注能力,从而提升组合零样本学习中未见状态—物体组合的识别性能和泛化能力。  
    关键词:组合零样本学习;视觉语言模型;风格解偏;局部语义聚焦;跨模态对齐   
    7
    |
    7
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171784334 false
    更新时间:2026-09-15

    胡中华, 李晓宁, 宋江玲, 张瑞

    DOI:10.11834/jig.260266
    img
    摘要:目的针对连续视频动作分割与预测任务中局部动作动态与长时语义上下文之间交互建模不足、连续动作过渡阶段边界表征不足以及未来序列预测稳定性不足等问题,提出一种融合跨尺度时序交互与边界概率细化的连续动作分割与预测方法。方法面向动作分割与预测两类任务,构建由局部时空编码、跨尺度时序交互和边界概率细化组成的统一框架。对于分割任务,采用膨胀三维卷积网络(inflated 3D convolutional network,I3D)对RGB视频序列进行时空特征编码;对于预测任务,采用X3D网络对RGB序列与光流序列同时进行时空特征提取,并通过双向交叉注意力机制实现多模态信息融合。在此基础上,设计跨尺度时序交互模块,对不同层级时空特征进行编码—解码式建模,刻画不同时间尺度下的上下文依赖关系,增强模型对局部动态变化与全局时序结构的协同表征能力;进一步引入边界概率细化模块,对动作边界进行显式建模,从而提升动作分割与预测结果的稳定性及边界定位精度。结果在50Salads、GTEA、Breakfast等生活场景连续动作分割数据集以及JIGSAWS手术手势数据集上进行了实验验证。所提方法在50Salads、GTEA、Breakfast和JIGSAWS分割任务上的准确率(accuracy,Acc)分别达到92.3%、88.0%、83.2%和90.5%,Edit分别达到89.0%、95.8%、84.7%和95.2%;在JIGSAWS手术动作预测任务中,预测准确率达到90.3%。实验结果表明,所提方法在多数指标上优于现有代表性方法。结论所提方法能够有效兼顾局部动态特征建模、长程时序依赖建模与边界结构优化,在连续动作分割与预测任务中表现出良好的泛化能力与稳定性。  
    关键词:连续动作分割与预测;跨尺度时序交互;边界概率细化;时空特征编码;多模态融合   
    11
    |
    7
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171784291 false
    更新时间:2026-09-15

    谭春晖, 侍佼, 雷雨, 徐骁翰, 张江涛, 彭富伦, 王静

    DOI:10.11834/jig.260237
    img
    摘要:目的高光谱图像具有丰富的光谱信息,能够为低空场景下地物的精细分类提供重要支撑,但其高维特性也带来了较大的存储与计算负担。因此,在低空平台载荷受限且标记样本稀缺的条件下,获取低维但表示能力优秀的波段子集成为一个值得研究的方向。现有半监督波段选择方法通常仅依赖单一数据集中的标记与未标记样本,受标记样本不足的影响,所获得的波段子集判别能力有限。由于同一传感器获取的高光谱图像具有相似的反射和辐射特性,协同分析多个高光谱数据集能够有效缓解单一数据集监督信息不足的问题。方法本文提出一种进化多任务优化的多数据集协同波段选择方法(Evolutionary Multitasking Optimization-based Multi-dataset Collaborative Band Selection, EMDCBS)。该算法为每个数据集建立了各自的私有无监督波段选择任务,充分挖掘各个数据集具有丰富地物信息的波段子集。此外,设计了一个共享监督波段选择任务,同时利用多数据集的标记样本缓解了标记样本不足的问题,获取判别能力强的波段子集。在优化过程中,借助进化多任务优化机制实现不同任务之间的知识迁移与协同搜索,其中私有无监督任务以信息熵为目标,共享监督任务以类间散度与类内散度构成的可分性准则为目标。进一步地,针对不同任务获得的多样化最优波段子集,设计多波段子集融合策略,从信息量、判别性和冗余性三个方面进行综合筛选,最终为各数据集生成综合性能更优的波段子集。结果在 PaviaU、PaviaC、LongKou 和 HongHu 4 个公开高光谱数据集上的实验表明,在每类仅使用 50 个标记样本、波段子集大小设置为 20 的条件下,所提方法取得了优于对比波段选择方法的综合分类性能。其总体分类精度(OA)分别达到 90.05%、95.89%、93.39% 和 79.21%。此外,实验部分还展示了各种参数对实验结果的影响,对算法进行了收敛性分析,并验证了所提出策略的有效性。结论所提 EMDCBS 方法能够充分挖掘并利用同一传感器多数据集之间潜在的公共光谱知识,在有限标记样本条件下实现更高效、更具判别性的波段选择。通过联合私有无监督任务与共享监督任务,并结合进化多任务优化和子集融合策略,该方法有效提升了任务优化效率和最优波段子集性能。  
    关键词:高光谱图像;波段选择;半监督学习;多数据集协同学习;进化多任务优化;低空经济   
    7
    |
    3
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171784226 false
    更新时间:2026-09-15

    宋健, 付强, 杨皓杰, 龙昱承, 李战武, 寇人可

    DOI:10.11834/jig.260317
    img
    摘要:目的反无人机场景中无人机目标强机动特性对红外多目标跟踪算法的轨迹关联能力提出极高要求。现有反无人机红外数据集存在评测偏向性,普遍关注低信杂比场景的目标检测能力。同时,其无人机运动模式普遍较为平缓且类型单一,既难以还原真实场景下无人机非线性、非平稳的强机动特性,也难以对复杂动态环境中跟踪算法的鲁棒性开展定量评测。针对上述问题,本文构建了面向高机动场景的合成反无人机红外多目标跟踪数据集(Maneuver Infrared Anti-UAV Tracking Dataset,MIATrack)。方法该数据集从公开红外数据源提取纯净背景与无人机目标素材,通过物理仿真建模生成高度非线性、非平稳复杂运动轨迹,复现无人机多样机动行为;并通过生成参数调控使目标保持较高信杂比,以降低检测不确定性,将算法的评估重心从目标检测能力转向复杂动态下的跟踪鲁棒性,为高机动红外无人机多目标跟踪提供专用评测基准。结果在MIATrack数据集上对主流跟踪算法开展基准测试,结果表明,相比现有公开数据集,检测性能仍保持在较高水平,但各类跟踪算法在本数据集上的轨迹关联性能均出现明显下滑。结论这一对比证明,当前红外无人机跟踪算法的性能瓶颈已由目标检测转向复杂非线性机动条件下的稳健轨迹关联。数据集与项目代码已开源发布于:https://github.com/SongJgit/TBDTracker。  
    关键词:红外弱小目标检测与跟踪;强机动目标;多目标跟踪;反无人机红外数据集;序列图像   
    78
    |
    56
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171109371 false
    更新时间:2026-09-07

    杨秀红, 张聿璇, 石争浩, 刘晗涛, Oktay Karakus, 戴佳锟

    DOI:10.11834/jig.260468
    img
    摘要:目的梨锈病病斑检测是梨树病害监测和精准防控的重要环节。在无人机自然采集条件下,锈病叶片常伴随阴影、遮挡、局部曝光、亮点等混杂信息,传统目标检测模型在学习病斑特征时易将这些非病害区域与锈病标签之间的虚假统计关联作为判别依据,导致大量误检。针对上述问题,本文提出一种因果启发去混杂的无人机梨锈病检测方法。方法其核心是提出因果混杂判别筛选(Causal Confounder Discriminative Filtering, CCDF)模块,旨在显式建模预测查询中的混杂风险,并对检测置信度进行后门调整和稳定校准,无需依赖像素级混杂掩码或域标签。首先,构建查询级目标代理和混杂代理。从实时检测Transformer(Real-Time Detection Transformer, RT-DETR)解码器分类头输入端提取256维查询特征,将与真实标注(Ground Truth, GT)有效匹配的查询聚合为目标原型集合,作为真实病斑证据在查询特征空间中的目标代理(正例),将高置信度、低交并比(Intersection over Union, IoU)的误检查询聚合为混杂原型集合,作为混杂因素在查询特征空间中的可观测混杂代理(负例);然后,设计轻量多层感知机(Multilayer Perceptron, MLP)作为判别器,充当后门路径的显式阻断器。利用正负查询对学习真实病斑与混杂模式间的非线性判别边界,为每个预测查询输出独立的混杂概率,为后续可微分的连续化后门调整作准备;最后,采用连续且单调的混杂感知重评分函数,在不改变边界框位置和类别预测的前提下,对高风险预测进行差异化分数抑制,使预测置信度逐步剥离混杂因素的虚假影响,趋近于仅由真实病斑证据驱动。结果实验表明,在GYMNSA 测试集上,本文方法将精确率(Precision, P)提升至0.781,IoU=0.50时平均精度均值(mean Average Precision at IoU=0.50, mAP50)提升至0.723,假阳性(False Positive, FP)数量降至348,召回率(Recall, R)为0.641。不同抑制强度的消融实验进一步表明,随着抑制增强,精确率持续提高,呈现出明确的Precision-Recall (P-R)权衡关系。结论CCDF模块能够针对性地压低由阴影、高光、叶脉和相似纹理等混杂因素引起的误检分数,在不重新训练检测器、不改变框回归结果的前提下提升检测结果的可信度,尤其适用于误检代价较高的梨锈病早期筛查与无人机巡检场景。  
    关键词:梨锈病检测;因果推理;去混杂;后门调整;无人机影像   
    41
    |
    30
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171109285 false
    更新时间:2026-09-07

    刘伟俣, 吴一全

    DOI:10.11834/jig.260377
    img
    摘要:锂离子电池在各类消费电子、电动汽车、储能行业中有广泛的应用。因其具有爆燃的风险,缺陷的存在,有可能造成严重的安全事故。锂离子电池无损成像缺陷检测具有非侵入性和高精度的优点,在锂离子电池的生产和质检环节普遍采用。本文全面综述了可见光/非可见光与三维成像方式的锂离子电池缺陷检测方法。首先,将基于可见光图像的锂离子电池缺陷检测方法,按照传统机器学习以及深度学习方法进行阐述,并在深度学习类方法中强化了小样本数据扩充和Transformer模型。然后综述了基于非可见光成像的锂离子电池缺陷检测方法,这些非可见光成像方式包括激光、红外、超声、CT、X射线和电磁成像等,分析了不同成像方式适用的检测场景与性能指标。随后专门对基于三维成像的锂离子电池缺陷检测方法按照图像处理方法和深度学习方法进行了讨论。总结了上述每种处理方法的实现方式和性能指标,分析了相关方法的优缺点及适用范围。最后指出了基于可见光/非可见光与三维成像的锂离子电池缺陷检测方法存在的问题,展望了未来可能的研究方向。  
    关键词:锂离子电池;缺陷检测;可见光成像;非可见光成像;三维成像;图像处理;深度学习;性能评价指标   
    43
    |
    34
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 171109241 false
    更新时间:2026-09-07

    王怡琳, 孟瑜, 席智浩, 邓毓弸, 刘帝佑, 陈静波

    DOI:10.11834/jig.250521
    img
    摘要:目的针对高分辨率遥感影像中山区道路因地形复杂、形态多样及背景干扰严重而难以准确提取的问题,以及现有道路提取数据集对山区道路适应性不足的现状,构建了首个覆盖亚洲多国典型山区的高分辨率遥感影像山区道路数据集(AsiaMountain-Road),并提出多分辨率自适应双聚合网络(multi-resolution adaptive feature dual aggregation network,MR-AFDANet)以支持山区道路自动提取算法的研究与应用。方法数据集从亚洲多国典型山区选取了29个高分辨率遥感影像区域,总覆盖面积达1 836 km²。结合道路稀疏、弯曲、遮挡等复杂场景特征进行采样与标注,最终形成涵盖多种地貌和道路类型的山区道路影像与精细标注。基于该数据集,对多种主流遥感道路提取算法进行了系统基准评测,并验证了所提MR-AFDANet模型在复杂山区环境下的分割性能。结果实验表明,现有主流道路提取方法在AsiaMountain-Road数据集上表现出显著差异,其性能受到山区道路狭窄、弯曲、遮挡及多尺度特征的影响较大。该数据集有效揭示了现有算法在复杂山区环境中的局限性,并为算法鲁棒性提升与结构优化提供了基准支持。结论AsiaMountain-Road数据集填补了高分辨率遥感影像山区道路提取领域的基准数据空白,MR-AFDANet模型有效解决了复杂地形下的道路断裂与漏检问题。两者共同为山区遥感影像的智能化解译提供了高质量的数据基础与方法参考。论文相关数据集与代码下载地址:https://cstr.cn/31253.11.sciencedb.j00240.00109和https://github.com/wyl-ucas/AsianMountain-DataSet。  
    关键词:山区道路提取;高分辨率遥感;遥感基准数据集;复杂地形道路检测;深度学习语义分割   
    28
    |
    39
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 170966454 false
    更新时间:2026-09-04

    丘文安, 钱文华, 刘朋, 李华光

    DOI:10.11834/jig.260388
    img
    摘要:目的运动模糊是图像采集过程中常见的退化现象,严重影响着三维场景重建与新视角合成的质量。现有基于三维高斯泼溅的去模糊方法存在两个问题:一是相机轨迹建模缺乏物理一致性保证,二是采用单一变换难以精确描述复杂非匀速运动。方法针对上述问题,提出一种面向运动去模糊的辛几何双路解耦三维高斯泼溅方法。该方法引入哈密顿动力学框架,将相机运动建模为相空间中的位置-动量对偶演化,再利用辛几何微分方程求解器确保相流满足辛保持性质,从物理本质上保证相机运动轨迹的连续性;在此基础上,提出一种物理先验与残差精修协同的双路自适应运动解耦框架,将相机运动分解为提供全局位姿基线的刚体运动分支和补偿细微运动偏差与积分近似误差的残差精修分支,两条支路通过自适应协同组合实现复杂非匀速运动的稳定表达;结果在 Deblur-NeRF 合成/真实数据集和 ExBluRF 极端模糊数据集上进行验证实验,与主流方法相比,在真实数据集和 ExBluRF 数据集上指标均达到最优,在合成数据集上 PSNR 和 LPIPS 达到最优,其中 PSNR 在三个数据集上较次优方法提升分别达0.12 dB、1.75 dB、1.87 dB,在复杂非匀速运动场景下优势尤为明显。结论实验结果表明,所提方法通过辛几何建模与双路解耦策略,有效提升了运动模糊场景下的三维重建质量。  
    关键词:三维高斯泼溅;运动模糊;辛几何;运动解耦;新视角合成   
    45
    |
    61
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 170759934 false
    更新时间:2026-09-03

    李骑宏, 马丙鹏

    DOI:10.11834/jig.260448
    img
    摘要:目的无监督可见光-红外行人重识别(Unsupervised Visible-Infrared Person Re-identification,USVI-ReID)旨在无标注条件下实现跨模态行人匹配。然而,现有方法中的困难样本挖掘策略通常未考虑困难正负样本在对比学习中的不同优化作用,导致模型的类内紧凑性不足且类间分离性有限。针对上述问题,提出一种角色感知难样本建模方法,在嵌入空间中对困难正负样本进行差异化建模,以协同优化类内一致性与类间判别性。方法首先,基于共享伪标签构建模态特定身份中心,并利用同一身份在不同模态中心之间的偏移生成困难正样本,使生成样本能够在保持身份一致性的同时包含更具挑战性的跨模态差异;其次,通过子簇划分与近邻簇搜索,挖掘不同身份间的局部相似关系,并沿近邻簇方向构造困难负样本,以增强模型对易混淆身份的判别能力;此外,受课程学习思想启发,引入渐进式训练策略,通过逐步调整困难样本生成幅度控制训练难度,提高模型优化稳定性。结果在SYSU-MM01和RegDB两个公开可见光-红外行人重识别数据集上的实验结果表明,所提方法能够有效提升无监督跨模态特征学习性能。在SYSU-MM01数据集全搜索模式下,相比现有最优方法,Rank-1和mAP(mean average precision)分别提升5.5%和4.1%;在RegDB数据集的可见光-热成像搜索模式中,Rank-1和mAP分别达到93.0%和86.2%。结论通过区分困难正负样本在对比学习中的优化角色,并针对性地构造跨模态变化样本和类别边界样本,所提方法能够同时增强跨模态一致性和身份判别能力,为无监督可见光-红外行人重识别提供了一种有效的难样本建模策略。  
    关键词:计算机视觉;行人重识别;可见光-红外;无监督学习;难样本学习;对比学习   
    29
    |
    51
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 170759525 false
    更新时间:2026-09-03

    罗维薇, 刘俊彤, 甘博宇

    DOI:10.11834/jig.260327
    img
    摘要:目的空域自适应隐写算法通常根据图像内容复杂度选择嵌入位置,使隐写修改呈现强内容自适应性和稀疏分布特征。由于嵌入扰动幅度较小,隐写残差容易被图像纹理、边缘和背景噪声掩盖,现有隐写分析模型在弱隐写信号检测中仍存在频带信息利用不足、局部噪声与全局上下文联合建模不充分、特征空间判别边界不清晰等问题。针对上述问题,本文提出一种融合等分辨率频带与对比聚类的图像隐写分析网络 CRF-CCNet(Image Steganalysis Network Integrating Equal-resolution Frequency Bands and Contrastive Clustering),以增强模型对微弱隐写残差的表征和判别能力。方法在预处理阶段,本文构建了等分辨率拉普拉斯频带分解模块,在不进行下采样的条件下提取高频、中频和低频残差信息,并在各频带上引入 SRM 高通滤波器组,以增强不同频率成分中的隐写响应;随后通过自适应注意力融合机制动态调整各频带残差的贡献。在特征提取阶段,本文设计多路径特征增强模块,由轻量级 Swin Transformer 路径、深度可分离卷积路径和中央差分卷积路径并行组成,分别用于建模全局上下文关系、提取局部纹理特征以及增强邻域差值和边缘扰动响应,并通过门控机制实现多路径特征融合。在分类优化阶段,引入多尺度对比聚类损失,通过动态类别原型约束载体图像与隐写图像在特征空间中的分布,压缩类内距离并扩大类间间隔,同时利用跨尺度一致性约束保持不同层级隐写特征之间的结构一致性。结果在 BOSSBase 1.01和BOWS2数据集上,采用WOW、HILL和S-UNIWARD三种典型空域自适应隐写算法进行实验。结果表明,在 BOSS+BOWS2 数据集、0.4 bpp 嵌入率条件下,CRF-CCNet对WOW、HILL和S-UNIWARD的检测准确率分别达到 94.81%、89.55% 和 92.47%,较 HSMNet 分别提高0.83、1.55和1.15%。与轻量级隐写分析网络 LWENet 相比,本文方法在 WOW0.4bpp 条件下将检测准确率由90.59%提高至94.81%,提高4.22%;同时参数量由0.82 M降至0.67M,减少约18.3%。在计算复杂度方面,CRF-CCNet的FLOPs为20.25 G,与LWENet的19.45G处于同一量级,推理速度达到82.4FPS。结论CRF-CCNet 通过等分辨率多频带残差建模、多路径特征增强和多尺度对比聚类优化,提高了模型对弱隐写扰动的感知能力和特征判别能力。在保持较低参数量和较高推理效率的同时,所提方法在多种空域自适应隐写算法上取得了较好的检测准确率,可为轻量化图像隐写分析模型设计提供参考。  
    关键词:图像隐写分析;空域自适应隐写;等分辨率频带分解;多路径特征增强;对比聚类   
    38
    |
    50
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 170759474 false
    更新时间:2026-09-03

    刘鹏栋, 林翰冉, 吴茂念, 郑博, 朱绍军, 施星仁

    DOI:10.11834/jig.260410
    img
    摘要:目的夜间甜瓜识别和采摘严重依赖人工光源。不同人工补光配置下,甜瓜果实和茎部的图像表观可能不同,语义分割模型的训练和跨配置测试结果也可能存在差异。为助力夜间农产品识别和采摘,构建了多颜色人工光照甜瓜分割图像数据集MelonNightColor。方法在保持相机位置、拍摄距离和补光灯方位一致的条件下,切换补光灯红、绿、蓝通道配置,获取红、蓝、绿、青、紫、黄、白7种人工补光配置下的夜间甜瓜图像。当前已发布5474张图像及像素级标注(覆盖782个拍摄位置,标注背景、甜瓜果实和茎部3个类别)。以拍摄位置为最小划分单元划分训练集、验证集和测试集,确保同一场景的7种颜色图像不跨集合,并组织为7个单颜色子集和4个组合颜色子集。采用9种代表性语义分割模型进行基线评测,并以UNet构建7×7跨颜色泛化矩阵。结果9种模型在7种光源下的背景、果实和茎部的类别交并比(intersection over union,IoU)均值分别为99.05%、86.39%和38.84%,茎部因形态细长且易受遮挡影响而分割难度最大。白光和黄光下9种模型平均交并比(mean intersection over union,mIoU)均值较高,分别达78.17%和77.94%;红光和蓝光下相对较低,分别为72.93%和73.23%。UNet同颜色测试平均mIoU为80.38%,跨颜色测试平均mIoU为44.25%。该结果显示,在本数据集的设备、品种和采集条件下,不同补光配置及自动成像过程共同作用下,训练与测试补光配置不一致时模型性能出现明显下降。结论MelonNightColor提供了夜间甜瓜多颜色成组图像和像素级标注。未来,数据集MelonNightColor可为特定夜间人工补光条件下的甜瓜语义分割基线评测和跨配置模型研究提供公开数据基础。数据集已在中国科学院科学数据银行公开,数字对象标识符(digital object identifier,DOI)为https://doi.org/10.57760/sciencedb.j00240.00237。  
    关键词:设施农业;夜间图像;甜瓜分割;人工光源;多颜色数据集;语义分割   
    31
    |
    49
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 170759423 false
    更新时间:2026-09-03

    钟可毅, 黄旭慧, 万欢, 缪轩磊, 魏欣

    DOI:10.11834/jig.250632
    img
    摘要:目的肝肿瘤的精确分割常受限于高质量标注数据的稀缺。尽管数据合成技术提供了替代方案,但现有的一些合成方法容易生成缺乏解剖合理性的样本。此外,合成图像中存在的非自然伪影,可能导致模型陷入捷径学习,进而影响其在真实临床数据上的泛化性能。为应对这些挑战,设计一种无需真实肿瘤标注的肝肿瘤分割框架Know2Seg。方法首先,结合相关临床影像知识,在不同的合成环节设置相应约束,实现临床知识引导的合成策略:利用椭球先验与弹性变形等方法生成肿瘤掩膜,通过全变分去噪与小波变换等处理构建多尺度的合成纹理,进而生成符合临床解剖规律的CT(computed tomography)扫描及其分割标签。其次,为缓解合成伪影对模型训练的干扰,利用合成过程的中间态真值,以及模型输出的肿瘤后验概率,作为辅助监督信号。通过基于图像解耦思想的训练架构引导模型将输入图像显式解耦为健康解剖与病灶纹理两个成分,引导模型将注意力从合成伪影转移至深层语义病理特征。结果实验表明,Know2Seg在不使用真实肿瘤标注的前提下,分割性能与同等实验条件下的全监督方法相当,并且优于一些其他的无标注方法。在LiTS数据集上,Know2Seg的Dice相似系数(dice similarity coefficient, DSC)达到62.9%、归一化表面Dice(normalized surface dice, NSD)达到65.5%、表面距离(surface distance, SD)降至14.0 mm、豪斯多夫距离(95% hausdorff distance, HD95)降至40.4 mm。结论本文通过将相关临床影像知识转化为可计算的合成约束,并利用图像解耦思想缓解了捷径学习问题,构建了一个兼顾可解释性与鲁棒性的无标注肿瘤分割框架。  
    关键词:无标注学习;3D肿瘤分割;临床知识;数据合成;图像解耦   
    89
    |
    63
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169636624 false
    更新时间:2026-08-24

    韩涵, 杨创, 荆纬, 王琦

    DOI:10.11834/jig.250621
    img
    摘要:目的现有自然场景文本编辑方法聚焦在仅包含单一文本内容图像块的同语编辑,无法实现跨语言文本编辑。针对此问题,本文提出一种端到端的英文到中文自然场景图像文本寻译框架SceneTrans,实现自然场景图像文本的精准定位、英文到中文的跨语言翻译及视觉风格一致的图像文本编辑。方法以MiniCPM-V 2.6多模态大模型为基线,设计基于位置增强提示模板的微调策略实现文本定位与翻译的联合学习;设计中文字形结构编码器实现中文字形先验的精准建模,引入中文字形识别监督机制保障生成图像文本的字形准确性;为解决领域内文本寻译数据匮乏的难题,构建英中配对的SynthTrans专用数据集,收集多种中英兼容字体,合成了20万对包含弯曲、倾斜等复杂字形变换的英中匹配自然场景文本图像。结果实验在文本检测数据集及自建SynthTrans数据集上与其他方法进行了比较。在图像文本定位任务上,所提方法的F1值接近主流模型的检测效果;在图像文本编辑任务上,所提方法的平均结构相似性(structural similarity index measure,SSIM)达0.622、峰值信噪比(peak signal-to-noise ratio,PSNR)达18.51,文本渲染准确率(accuracy,ACC)值提升至71.13%;整体框架具备高效的自然场景图像文本寻译能力。结论本文所提出的端到端寻译框架,实现了自然场景图像文本“定位-翻译-编辑”的一体化流程,可生成字形精确、与原始图像文本风格一致的中文图像文本,突破了传统方法的无法定位及同语编辑的局限,为自然场景图像文本寻译提供了新的解决方案与数据集支撑。  
    关键词:自然场景图像文本检测;自然场景文本编辑;图像文本寻译;多模态大模型微调;扩散生成   
    64
    |
    71
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169635965 false
    更新时间:2026-08-24

    杨锦旭, 王志远, 赵鹏铖, 陈雁翔

    DOI:10.11834/jig.260297
    img
    摘要:目的当前人工智能生成图像技术在推动高质量视觉内容创作的同时,也带来了信息安全挑战。在图像伪造检测任务中,现有训练与评测数据中的真实图像与伪造图像存在细粒度语义内容差异,使语义内容与真伪标签之间容易形成虚假关联,从而形成语义偏见——这是一种捷径学习现象,即检测器借助真伪图像间易于区分的语义内容差异进行判别,而非真正学习生成过程遗留的伪造痕迹;这意味着检测器在现有基准上借助语义差异取得的高性能,并不能代表其在语义对齐条件下的真实泛化能力。针对以上问题,提出了一种基于语义对齐约束的图像伪造检测数据集与检测基准。方法为解决上述语义偏见问题,本文以实例级语义对齐为约束构建AIGI-Align数据集:将每张真实图像作为语义参照,生成与之在细粒度语义维度上对齐的伪造图像,从数据层面弱化语义偏见的形成条件。具体而言,从ImageNet中筛选真实图像,利用多模态大模型进行语义类别验证,确保真实图像内容与类别标签一致;在此基础上,引入视觉语言模型为真实图像生成细粒度结构化图像描述,并利用这些描述驱动12种生成模型生成与真实图像语义高度对齐的伪造图像。结果实验表明,现有检测器可能利用真伪图像之间的语义差异进行捷径判别,而AIGI-Align能够提高真实图像与伪造图像之间的语义对齐程度,缓解语义偏见对检测器判别过程的干扰,从而提升其跨生成模型泛化能力。在3个公开基准和AIGI-Align基准上对8种代表性检测器进行了泛化性评估,结果显示:在传统训练设置下,部分检测器在语义对齐测试场景中的性能明显下降,说明其原有性能可能部分依赖语义捷径而非对伪造痕迹的鲁棒识别;在引入语义对齐训练数据后,多数检测器在AIGI-Align和公开基准上的跨生成模型检测性能均得到提升。训练数据控制消融进一步表明,实例级语义对齐约束对AIGI检测任务具有实际意义。结论本文构建了一个面向AIGI检测任务的大规模实例级语义对齐数据集AIGI-Align。在训练方面,语义对齐数据能够引导模型关注底层伪造痕迹,降低真伪判别中对语义内容差异的依赖,从而提升对未见生成模型的泛化能力;在评测方面,AIGI-Align测试集提供了控制语义变量的评估场景,能够在削弱语义捷径的条件下评估模型的真实泛化性能,有助于更准确地反映检测器的跨生成模型泛化水平。论文相关数据集地址:https://huggingface.co/datasets/likeYousif617/AIGI-Align。  
    关键词:人工智能生成图像;图像伪造检测;语义偏见;语义对齐;数据集;基准   
    82
    |
    84
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169634666 false
    更新时间:2026-08-24

    张兴鹏, 刘晓鹏, 李伟, 王秋里

    DOI:10.11834/jig.260306
    img
    摘要:目的精准的多模态磁共振脑肿瘤亚区分割对临床诊疗至关重要。但胶质瘤形态异质性强,现有分割网络常面临边界建模困难、空间信息与深层语义特征融合不充分等问题,易在低对比度区域出现定位偏差与拓扑断裂。为此,本文提出一种融合显式边界先验的多模态脑肿瘤分割网络(boundary prior enhanced network,BPE-Net)。方法设计辅助监督边界预测模块(boundary predictor module,BPM),聚合编码器多尺度层级特征提取具有类别感知能力的边界先验,提供类别相关的空间信息;构建边界特征增强模块(edge feature enhancement module,EFM),利用空间-通道解耦注意力机制以残差方式将边界先验融入解码特征,在优化局部拓扑结构的同时保护核心语义表征。引入边界加权Dice损失(boundary weighted Dice loss,BWD),通过像素级权重矩阵强化对模糊边缘像素的约束,缓解传统算法的体积评估偏见。结果在脑肿瘤分割挑战赛(brain tumor segmentation,BraTS)2019和BraTS 2020数据集上与7种主流方法对比,本方法平均Dice相似系数(Dice similarity coefficient,Dice)分别为93.69%和92.51%,平均95%豪斯多夫距离(95% Hausdorff distance,HD95)分别为1.96mm和2.33mm,较最优对比方法Swin-Unet平均Dice分别提高7.43和8.60个百分点,平均HD95分别降低1.23mm和1.43mm;其中增强肿瘤(enhancing tumor,ET)区域的Dice提升最为明显,分别提高9.91和10.43个百分点。结论显式边界引导策略有助于缓解低对比度区域的边界混淆,为医学图像准确分割与复杂拓扑重建提供了一种有效的新方法。本文代码开源在链接:https://www.scidb.cn/s/eeiMBv。  
    关键词:脑肿瘤分割;多模态磁共振成像;边界先验;辅助监督学习;解耦注意力   
    69
    |
    69
    |
    0
    <HTML>
    <网络PDF><WORD><Meta-XML>
    <引用本文> <批量引用> 169633234 false
    更新时间:2026-08-24
0