近日,第34届ACM国际多媒体会议(The 34rd ACM International Conference on Multimedia,简称ACM MM 2026)公布论文录用结果。信息与通信工程学院孙福明、王法胜、贺建军三位老师带领团队分别在伪装目标检测、无人机目标跟踪、满文档案识别方面完成的3篇学术论文被成功录用。这是本年度继AAAI、CVPR之后,信息与通信工程学院师生再度在中国计算机学会(CCF)推荐A类会议上发表高水平学术论文,也是我校首次在同一CCF A类会议上发表多篇不同研究方向高水平学术成果。
ACM MM自1993年首次举办以来,已成为多媒体领域学术界和工业界交流的重要平台,是该领域最具影响力的国际顶级会议之一,也是中国计算机学会(CCF)推荐的多媒体领域唯一A类国际学术会议。本届会议将于11月10日至14日在巴西里约热内卢举行。
近年来,信息与通信工程学院坚持聚焦国家重大战略需求、以解决真问题为导向,打造“社会服务、科学研究、人才培养”一体化发展模式,本次师生多项成果能够获得国际顶级学术会议认可,正是学院系统化推进各项工作的具体体现。
此次被录用论文相关信息如下:
论文题目1:CT-CLIP: Calibrating Semantic Occupancy Tokens for Class-Guided Camouflaged Object Detection
论文作者:张国辉,孙福明,周兴蕊,曹阳,孙静,王法胜
论文简介:类引导的伪装目标检测(CGCOD)利用类别级语义先验来提升模型在复杂伪装场景中的感知能力。然而,当将CLIP等视觉-语言模型应用于像素级分割时,其Vision Transformer的深层会生成大量语义占据令牌(SOT),从而削弱视觉特征的空间结构。这进一步加剧了语义判别与像素级定位之间的优化冲突,成为限制细粒度分割性能的关键瓶颈。为解决这一问题,我们提出CT-CLIP%(校准令牌CLIP),一种用于类引导伪装目标检测的新型框架,通过对SOT进行校准以恢复空间结构。其核心是多阶段注意力校准模块,该模块通过三种协同操作依次缓解SOT引起的空间退化:SOT重分配将注意力从SOT重新分配到目标区域;分层注意力融合自适应地聚合经校正的多层注意力图,以增强最后一层的空间感知;以及DINO引导增强引入DINO的自监督注意力作为细粒度结构先验,实现高保真注意力重建。在恢复特征的基础上,设计了一个语义查询解码器,将分割重构为语义引导的视觉查询过程,其中文本嵌入作为查询,CLIP视觉特征与DINO增强特征的拼接作为交叉注意力中的键和值,从而逐步实现语义与空间结构的对齐。在CGCOD基准上的实验结果表明,CT-CLIP显著优于现有方法。
论文题目2:DiffMamba: Learning Diffusion Enhanced Mamba Tracker with Temporal Memory for Day-and-night UAV Tracking
论文作者:王彬彬,王法胜,王立锋,胡露飘,颜子清,孙福明,李豪杰
论文简介:昼夜场景下全天无人机目标跟踪存在诸多难点,包括光照剧烈波动、暗光噪声、目标遮挡与高速运动问题。上述干扰会引发特征表征退化、目标外观大幅畸变,使得传统模板匹配算法失效。现有方法大多采用规则化模板更新或短期特征自适应方案,在极端光照与长期外观变化场景下难以稳定输出鲁棒的目标表征。为解决上述问题,提出一种带时序记忆的扩散增强Mamba跟踪框架。首先,设计条件扩散引导的增强表征学习模块(DERL),在特征空间中引入可学习噪声先验与单步轻量化扩散策略,以原始模板为条件约束完成特征重建。该机制可在维持语义一致性的同时自适应强化模板特征,有效抑制暗光、纹理退化等场景噪声。其次,构建基于 Mamba 融合时序记忆的目标建模单元(MFTM-OM)。该单元结合质量感知记忆存储机制与状态空间模型(SSM),融合前向、后向及层间 Token 偏移信息,建模目标在长时序下的外观演化规律,提升模型对光照、姿态变化的抗干扰能力。最后,提出扩散锚定记忆模板适配器(DiMT-Adapter),实现扩散增强模板与时序记忆模板的特征交互。适配器以扩散先验为约束锚点,借助动态可分离卷积核与门控残差连接,高效融合扩散增强特征与时序记忆特征。在多个昼夜无人机跟踪基准数据集上开展大量实验,结果证明DiffMamba在日间、夜间场景均取得显著性能提升,为全天无人机目标跟踪任务提供了一种有效的解决方案。
论文题目3:MAWD15935: A Large-Scale Manchu Archives Word Dataset
论文作者:贺建军,王宇骋,宝凤至,周瑜,金政旭,郑蕊蕊
论文简介:满文档案是中国清代形成的具有重要价值的历史档案,但是受满文档案单词识别技术的限制,目前几乎未被开发利用。主要原因在于满语已成为濒危语言,能够阅读满文的人极少,且满文单词图像标注工作极具挑战性,因此迄今为止尚未有可用于满文档案文字识别的大规模数据集。鉴于此,经过作者团队六年多的努力,本文建立了首个面向满文档案识别问题的大规模满文单词数据集MAWD15935。该数据集包含来自15,935个满文单词的1,092,744个样本,其中印刷体样本975,301个,手写体样本117,443个,手写体样本全部来自真实满文档案扫描图像。该数据集具有三大显著优势:(1) 权威性——它涵盖了《新满汉大词典》中收录的所有满文词条,该词典是满文档案研究领域最权威、收词量最大的参考工具书;(2) 可靠性——所有数据均由满文专业人员进行标注;(3) 丰富性——涵盖单词种类广泛,样本规模庞大。本文成果将显著推动满文档案数字化技术的发展,并加速满文档案的开发利用进程。