摘要:目的针对多类别无监督工业品缺陷检测中,现有重建模型难以兼顾浅层细节特征,且易陷入“捷径学习”导致细粒度缺陷漏检的问题,提出一种语义—细节协同融合的细粒度缺陷检测方法SDSF-ViTAD(Semantic-Detail Synergistic Fusion-ViTAD)。方法首先,采用基于DINO先验的纯视觉Transformer提取多层级密集先验;其次,设计语义—细节协同融合模块SDSFM(Semantic-Detail Synergistic Fusion Module),利用交叉注意力机制实现深浅层特征的对齐,并引入空间感知门控机制动态过滤背景噪声,精准强化细粒度特征;接着,在重建阶段引入基于信息瓶颈的特征扰动机制,切断特征直接复制的通路,并结合Top-K稀疏注意力优化解码过程,强制模型通过全局上下文推断正常模式,从而在推理时显著放大异常区域的重建误差;最后,引入结合难分样本挖掘的余弦距离损失函数,使得模型在训练过程中重点关注难以拟合的正常区域,增强模型对细粒度异常的判别能力。结果在VisA(visual anomaly detection dataset)数据集上的实验结果表明,本文算法与基准模型ViTAD相比,在图像级平均受试者工作特征曲线下面积mAUROC(mean area under the receiver operating characteristic curve)、平均精度mAP(mean average precision )和平均F1分数mF1(mean F1-score)指标上分别提升了3.28%、3.00%和3.70%,在像素级mAP和mF1指标上分别提升了3.84%和2.98%,其中对微小缺陷高度敏感的平均区域重叠率曲线下面积 mAUPRO(mean area under the per-region overlap)指标提升了3.8%,同时,在金属零件缺陷检测MPDD(Metal Parts Defect Detection)和BeanTech异常检测(BeanTech Anomaly Detection, BTAD)公开数据集上的实验进一步证明了该模型在应对不同工业场景多类别统一检测中的通用性与有效性。结论SDSF-ViTAD模型提升了复杂工业场景下的细粒度缺陷检测精度,优于现有主流多类别无监督算法。
摘要:目的图像辅助词汇习得是国际中文教育的重要教学策略,但现有提示词生成方法未能有效融合国际中文教育等级标准等领域专业知识,导致所生成图像在词义指向性、认知难度匹配性与教学适用性等方面存在显著不足。针对上述问题,本文提出一种面向国际中文教育词汇图像生成的渐进式提示词扩展模型( Progressive prompt expansion model for vocabulary image generation,PPEM-VIG)。方法PPEM-VIG将词汇的认知等级、难度等级、词性、释义等离散教学要素统一建模为结构化教学要素集,并通过渐进式两阶段优化策略自动生成语义准确、结构规范且教学适用的图像提示词。监督学习阶段基于LLaMA模型以模板结构一致性损失与语言流畅性损失为约束,实现提示词的结构化生成;强化学习阶段基于监督微调LLaMA模型并增加模板内容相关性与基于CLIP的词图语义一致性奖励,对提示词进行深度优化,以实现提示词的拓展生成。结果本文构建了首个面向国际中文教育场景的词汇图像提示词数据集(international chinese language education vocabulary image prompt dataset, ICLE-VIPD)。实验结果表明,PPEM-VIG在模板结构覆盖率、CLIP语义一致性得分、及教师主观评价等核心指标上较最优的基线模型分别提升了4.10%,3.13%,4.54%。结论本文提出的渐进式监督-强化优化范式为词汇教学图像资源智能化生成上提供可借鉴的技术路线。
摘要:目的电力图像监测主要分为传输与识别过程,传统监测方法未从语义层面考虑将二者进行联合优化,使得传输过程中目标语义信息无法充分提取,进一步导致了图像识别率偏低。针对电力图像受噪声干扰导致监测效率低下问题,提出一种基于语义通信联合优化的端到端电力图像监测方法。方法首先,在语义通信框架下设计轻量化卷积自编码器(convolutional autoencoder,CAE)传输模型,并引入基于通道注意力机制模块,使得模型更关注电力语义特征。其次,以vision transformer(ViT)为主体架构设计ViT识别模型,提出注意力引导的卷积编码模块,使得模型更好的理解电力图像局部语义特征。级联上述模型得到CAE-ViT模型,作为电力图像监测框架,并基于所提框架的参数空间扩展与语义优化方向设计联合训练方法,实现语义通信联合优化的电力图像监测。结果实验采用中国电力线路绝缘子数据集(chinese power line Insulator dataset,CPLID)和电力线路资产巡检数据集(inspection power line asset dataset,InsPLAD)进行验证,与对比方法相比,本文方法在低信噪比(-10dB~10dB)条件下电力图像监测识别率提高了4%~26%,验证了所提方法有效性。结论本文提出的方法在复杂电磁环境无线信道中更具鲁棒性,且进一步提升了电力图像的监测效率,为电力图像监测实际应用部署提供了有益的技术借鉴。
摘要:目的分割一切模型(segment anything model 2, SAM 2)在目标跟踪领域已取得显著进展,其具备强泛化的分割先验以及长时序建模能力,能够目标跟踪提供空间信息支持,缓解背景混淆与遮挡后重现易丢失等跟踪关键难题。然而,SAM 2无法利用高光谱数据中的光谱判别信息,当目标与背景在空间纹理上高度相似等情况时,仅依赖空间语义先验生成的掩码可能出现漂移。因此,针对高光谱目标跟踪中目标与背景分离不充分等问题,提出一种面向高光谱目标跟踪的光谱提示与混合注意力方法。方法以分割一切模型SAM 2为基础构建跟踪框架:在空间维度,利用语义掩码进行像素级目标—背景分离;在时序维度,通过记忆库与记忆注意力建立跨帧长时依赖,增强遮挡重现后的关联与恢复;在光谱维度,提出混合嵌入网络以对齐高光谱数据分布,并引入混合注意力与光谱嵌入模块,将目标光谱信息编码为提示向量、学习波段间深层语义关系。此外,为了促进相关领域研究,构建了首个高光谱空中目标跟踪数据集AHOT。结果在3个数据集上与6种最新方法对比,所提方法在HOTC-2024-RedNIR数据集上DP_20相比第二名提升4.08%,在AHOT数据集上DP_20相比第二名提升15.57%,对比实验结果证明所提算法改善了目标跟踪的性能。此外,本文方法的推理速度达到15.4 FPS,在实现较高精度的同时具有近实时的工程效率。结论通过掩码级目标分离与长时记忆建模,并结合光谱嵌入与注意力融合策略,所提方法显著提升了复杂场景下高光谱目标跟踪的精度与鲁棒性。构建数据集将在科学数据银行公开(31253.11.sciencedb.j00240.00255)。
摘要:目的随着人脸伪造技术的快速发展与广泛传播,由其引发的虚假信息泛滥与身份冒用诈骗等社会问题日益严峻。现有的基于人脸图像重建的伪造检测方法仅进行真实或伪造人脸的单视角重建,未显式放大二者重建前后的差异,导致网络模型的检测准确率和泛化性能提升有限。针对上述问题,提出一种差异化重建驱动的残差引导人脸伪造检测方法,扩大真伪人脸重建前后的差异,显著提升了模型检测性能。方法首先,为了显式放大真伪人脸重建前后的差异,提出一种对比差异化重建网络(Contrastive Differential Reconstruction Network,CDRNet),分别为真实与伪造人脸构建清晰与模糊图像的重建目标,提升整体网络模型对真伪人脸的辨别能力。其次,考虑到现有检测方法对残差图的引导信息利用不充分等问题,设计了残差双域引导模块(Residual Dual-Domain Guidance Module,RDDGM),深度融合图像的空间域与高频域特征,并利用重建残差信息引导融合后的双域特征,增强了网络模型捕捉细微伪造痕迹的能力。此外,为了促使模型学习不同伪造方法之间的通用伪造特征,设计了文本感知损失模块(Text-Aware Loss Module,TALM),通过引入文本模态信息的引导,进一步优化对比差异化重建结果,大幅提升了网络模型对未知伪造方式的泛化性能。结果在域内实验中,与性能最好的对比方法相比,该方法的准确率(accuracy,ACC)与曲线下面积(area under the curve,AUC)指标分别提升2.83%和1.75%。在跨域实验中,该方法在5个公开测试集上与13种典型方法进行性能测试与比较,平均AUC指标提高1.75%。结论本文在人脸伪造检测中创新性结合对比学习与图像差异化重建,显著提升了模型对未知伪造方式的检测准确率,在多个基准测试中性能优于已有方法。