目的遥感图像指代分割旨在根据自然语言指令生成目标区域的像素级掩码。然而,通用分割基础模型迁移至遥感场景时,仍面临深层跨模态交互过程中语义约束逐渐衰减、解码阶段层级查询信息利用不充分以及复杂目标边界监督不充分等问题。方法针对上述问题,提出一种用于遥感图像指代分割的语义动态边界增强方法—SDM-SAM2。该框架以SAM2(Segment Anything Model 2)为基础,在图像编码阶段构建阶段感知文本记忆,通过保存并检索不同阶段的文本信息,以维持指代表达约束,从而缓解深层语义传播中的语义衰减问题;在Mask Decoder中引入任务自适应多层查询融合模块,通过可学习层级权重对初始查询和不同解码层查询进行融合,使浅层定位信息与深层语义表征共同参与掩码预测,提升模型对复杂目标的定位与分割能力;同时设计文本加权Sobel边界损失,在连续前景概率图上提取可反向传播的边界响应,并结合文本指定目标对目标轮廓施加显式约束。结果在RefSegRS和RRSIS-D两个数据集上开展实验。完整模型在RefSegRS测试集上取得78.05%的平均交并比(Mean Intersection over Union,mIoU)和84.16%的总体交并比(Overall Intersection over Union,oIoU),在RRSIS-D测试集上取得68.49%的mIoU和78.59%的oIoU。两个数据集上的消融结果表明,阶段感知文本记忆、任务自适应多层查询融合和文本加权Sobel边界损失均能从不同环节改善基础模型;其中,阶段感知文本记忆在两个数据集上均取得最高的单模块mIoU。不同边界算子对比结果表明,Sobel算子取得了三种候选算子中最高的mIoU。结论SDM-SAM2从语义保持、动态解码和边界建模三个方面增强了SAM2对遥感图像指代分割任务的适配能力,能够改善复杂遥感场景下文本指定目标的定位和掩码预测效果。代码链接:https://github.com/3038794185-cloud/SDM-SAM2。
目的精准分割牙齿与牙龈对于牙齿正畸及隐形矫治器的设计至关重要,同时可视化的模拟也能显著提升诊断效率,加强医患沟通。然而,现有研究对缺牙和重叠情况下的分割问题关注较少。为此,本文提出一种名为HaTransTooth的混合深度学习框架。方法总体采用“由粗到细”的策略:首先,通过平行投影将三维扫描模型转换为二维深度图像,并利用改进的YOLOv8(you only look once version 8)检测算法实现牙齿的快速检测和编号,有效解决了三维空间中牙齿实例分离的难题,提升了牙位识别的准确率和效率;随后,通过建立的映射关系,将二维检测区反向投影至三维空间,提取出包含单个牙齿及其周边牙龈的三维感兴趣区域(3D regions of interest, 3D ROI);最后,针对每个3D ROI,引入了分层自适应注意力机制的点云转换网络(point cloud transformer,PCT)进行精细分割,同时使用了Focal Loss和Dice Loss的组合损失函数和梯度累积训练策略。结果实验在自行采集的真实病例数据上与经典的7种方法进行了比较,仅是平均准确率(mean accuracy,mACC)位列第二,达到了96.74%,与第一几乎持平,而平均交并比(mean intersection over union,mIoU)和Dice相似系数(the dice similarity coefficient ,DSC)分别比第二名高出4.86%和2.41%。此外还验证了平均表面距离(average symmetric surface distance,ASSD)、召回率(recall,R值)和F1分数(F1 score),均达到了较高水平,具有较高的临床价值。在公开数据集Teeth3DS(teeth 3D scan dataset)上的交叉验证进一步证明了模型的泛化能力。结论本文提出的框架显著提升了对牙齿-牙龈模糊边界的分割精度,并能准确分割具有缺牙和牙齿重叠情况的牙颌,通过实验表明,此框架在多项指标上优于现有主流方法。
目的场景文字视频问答是多模态理解领域的关键任务,现有多模态大语言模型在处理长视频时受输入帧数限制,直接输入全部视频帧会导致计算开销大,而均匀采样减少视频帧会导致关键文本信息丢失。为了解决以上问题,本文提出一种文本语义协同筛选与区域感知的场景文字视频问答方法,以提升场景文字视频问答的准确性和效率。方法首先,提出基于文本-语义协同的关键帧选择方法,利用多模态大语言模型生成的候选答案作为语义锚点,通过计算其与场景文本的Levenshtein编辑距离精准选择关键帧,并辅以对比语言-图像预训练(contrastive language–image pre-training,CLIP)补充视觉语义相关帧,以解决视频中细粒度文本信息稀疏容易丢失的问题;同时,设计文字区域感知方法,通过基于掩膜的亮度衰减策略构建视觉“聚光灯”效应,抑制无关背景噪声使模型聚焦文本区域,结合推理的置信度差异动态优选答案,从而提升场景文字视频问答的准确率。结果在M4-ViteVQA(multi-category multi-frame multi-resolution multi-modal benchmark for video text visual question answering)、RoadTextVQA(road text video question answering)和NewsVideoQA(news video question answering)三个公开场景文字视频问答数据集上进行充分实验,所提方法在准确率(accuracy,Acc)指标上分别取得 65.55%、72.03% 和 75.54% 的得分,相比均匀采样基线分别提升了 3.04%、0.76% 和 1.08%,优于现有方法。消融实验进一步验证了关键帧选择模块和文字区域感知模块的有效性。结论本文提出的方法有效解决了场景文字视频问答中计算效率与信息完整性的矛盾,通过文本-语义协同选帧策略增强了对细粒度文本的捕获能力,并通过视觉引导抑制背景噪声,从而提升了场景文字视频问答的准确性与鲁棒性。
目的针对食道病理图像中细胞密集分布、重叠严重及形态复杂等特点,现有检测与实例分割方法难以兼顾目标定位精度与边界表达能力,多任务学习过程中检测与分割分支之间的特征协同不足,影响复杂病理场景下的识别性能。方法提出一种面向食道病理图像细胞检测与实例分割的协同多任务模型DGSeg-YOLO。在统一网络框架下联合完成细胞检测与实例分割任务,设计双向特征交互模块(bidirectional feature interaction module,BFIM),实现检测与分割分支间的跨任务特征融合;设计自适应检测感知分割模块(adaptive detection-aware segmentation module,ADGS),利用BFIM输出的跨任务交互特征生成目标感知权重,并对分割特征进行自适应加权增强;结合难度感知联合损失函数(difficulty-aware joint loss,DAL),动态协调检测与分割任务优化过程,提高模型对复杂样本的学习能力。结果在自建食道病理细胞数据集上的实验结果表明,DGSeg-YOLO在边界框平均精度均值(box mean average precision,Box mAP)@0.5、掩码平均精度均值(mask mean average precision,Mask mAP)@0.5和Dice指标上分别达到0.900、0.909和0.8351,在细胞密集分布及重叠区域具有较好的检测与实例分割性能。消融实验验证了BFIM、ADGS及DAL各模块对模型性能提升的有效性。同时,所提出模型已集成至食道病理智能分析系统,可实现病理细胞的自动检测、实例分割及统计分析,验证了方法在实际应用中的可行性。结论DGSeg-YOLO通过检测与分割任务间的协同特征学习,增强了复杂病理图像中细胞目标的结构表达与边界刻画能力,在保持模型规模适中的同时兼顾检测性能与工程应用需求,可为食道病理细胞自动分析提供一种有效的技术方案。