我院师生在国际顶级期刊《IEEE TMM》发表最新研究成果

发布者:人工智能发布时间:2026-09-07浏览次数:200分享

  近日,谈球吧人工智能与大数据学院在计算机视觉与图像处理领域取得重要研究进展相关研究成果“SMART: Semantic Merging Adaptive Regional Transformer for Image Captioning”被计算机视觉与多媒体领域顶级学术期刊IEEE Transactions on Multimedia》(IEEE TMM)正式录用。该论文由蒋峰岭副教授担任第一作者,2024级硕士曹俞晋为主要学生作者,邹乐教授担任通讯作者,谈球吧体育官网人工智能与大数据学院为第一完成单位。 

SMART 模型总览

  研究背景与挑战:图像描述是连接计算机视觉与自然语言处理的核心技术,在视障辅助、图像检索、人机交互等领域应用前景广阔。当前主流方法多依赖网格特征提取视觉信息,易造成语义完整物体的碎片化分割,同时普遍缺乏对文本语义先验信息的有效融合,生成的描述内容粗糙,难以精准捕捉物体属性与空间关系等细节,成为制约技术性能提升的核心挑战。

  解决方法:针对上述痛点,研究团队构建端到端的SMART 框架,通过三大模块协同解决上述问题:空间连续区域聚合模块在空间连续性约束下,将离散网格特征聚合为语义连贯的伪区域表征;语义感知区域增强模块引入 CLIP 预训练语义标签,通过跨模态对齐为视觉表征注入深层语义先验;自适应区域 - 网格特征融合模块基于图像复杂度动态筛选关键区域,通过双注意力机制实现细粒度网格细节与高层语义的深度融合。

  实验结果:实验表明,该模型在MS COCO 基准数据集上 CIDEr 得分达 138.2,取得当前最优性能。该研究突破了传统网格特征的语义局限,为多模态图像理解提供了全新技术路径,兼具重要学术价值与产业应用潜力。

  该论文的成功发表,是我院人工智能与多媒体图像处理领域长期积淀下产出的又一标志性成果。学院始终在该领域持续探索精进,科研成果不断涌现,科研水平与研究生培养质量稳步提高,学科建设也同步向纵深推进、持续升级。本研究联合了安徽大学,英国思克莱德大学以及美国密西西比州立大学的顶尖学者共同合作完成。

  论文链接:https://doi.org/10.1109/TMM.2026.3717485

  代码链接:https://github.com/VPIPLaboratory/SMART-Semantic-Merging-Adaptive-Regional-Transformer-for-Image-Captioning

  期刊简介:IEEE Transactions on Multimedia(TMM)是多媒体领域国际顶刊,属 CCF 计算机图形学与多媒体领域 A 类期刊、中科院计算机科学 1 区 TOP 期刊,最新影响因子 9.9,聚焦计算机视觉、多媒体智能、跨模态信息处理等前沿方向,是该领域最具影响力的学术期刊之一。

(人工智能与大数据学院 撰稿:邹乐 初审:嵇圣硙 复审:吴志泽 终审:胡萍