仪器仪表学报

北大核心,CA,JST,EI,CSCD

国内刊号:11-2179/TH

国际刊号:0254-3087

仪器仪表学报杂志2026年第1期:多模态信息融合下的监控视频人员身份重识别

发布日期:

作者:吴军,陈慧,徐刚,赵雪梅,陈睿星

单位:吴军,桂林电子科技大学电子工程与自动化学院桂林541004,wujun93161@163.com,陈慧,桂林电子科技大学电子工程与自动化学院桂林541004,,徐刚,中国科学院宁波材料技术与工程研究所宁波315201,,赵雪梅,桂林电子科技大学电子工程与自动化学院桂林541004,,陈睿星,中国科学院宁波材料技术与工程研究所宁波315201,

关键词:视频监控;人员身份识别;YOLO目标检测;多模态模型CLIP

基金:国家自然科学基金(42361071,42261061)、广西重点研发计划(桂科FN2504240020)、宁波市科技计划(2024Z016)项目资助

针对目前监控视频人员身份重识别任务难以有效应对低分辨率小目标、人员姿(形)态变化及遮挡检测问题,以YOLOv9为基础网络并结合多模态预训练神经网络(CLIP)模型提出一种多模态信息融合下的监控视频人员身份识别新方法,主要涉及两个方面工作:1)通过引入感受野增强模块与可变形卷积计算提高目标人员不同姿态(形)态下的特征检测性能、引入空间增强注意力机制学习特征间的关系以恢复被遮挡人员特征、引入基于归一化高斯距离的损失度量以增强低分辨率目标人员特征检测敏感性等系列模块设计,构建网络ReID-YOLO有效增强监控视频在不同姿态、形态及低分辨率、遮挡条件下的目标人员特征检测精度、鲁棒性;2)将CLIP跨模态信息融合优势迁移到视频人员身份重识别任务并利用CLIP图像-文本信息对齐优势对前一阶段提取的人员目标特征进行身份预测,在利用ReID-YOLO(Re-identificationwithYOLO)人员视觉特征有效区分能力缓解CLIP全局场景过度依赖的同时,借助CLIP模型场景泛化优势有效克服YOLO系列网络在整合场景信息深入解析目标方面的不足,从而整体提高网络模型的监控视频人员身份重识别精度与场景泛化能力。在低分辨率、消融与身份重叠等条件下的实验结果表明,所提方法视频人员身份重识别性能表现出色,优于YOLO系列网络及其他7个主流的视频人员身份重识别网络模型,具有良好应用前景。

来源:2026年第1期

《仪器仪表学报》期刊编辑部

查看仪器仪表学报杂志2026年第1期

联系我们

  • 地址:北京市东城区北河沿大街79号
  • 电话:010-64044400
  • E-mail:cjsiedit@cis.org.cn

咨询工作人员