发布时间:2026-07-10
今日,我实验室1篇论文被ACM 国际多媒体会议(ACM International Conference on Multimedia,简称 ACM MM)录用。MM是由美国计算机协会(ACM)主办的国际多媒体领域顶级盛会,也是中国计算机学会(CCF)推荐的 A 类会议。该会议始于 1993 年,每年举办一次。会议专注于多媒体技术领域的最新研究成果、技术创新和行业趋势,涵盖多媒体内容的创建、处理、传输和交互等多个方面,旨在促进学术界和工业界在多媒体技术应用和产品开发方面的交流与合作。
本届会议共收到7053篇有效投稿,我实验室录用论文的相关信息如下:
Toward In-the-Wild Gloss-Free Sign Language Translation via Domain-Adaptive Cross-Modal Alignment
作者:Changhao Lai, Yuegan Yi, Rui Zhao*, Xiaoyun Zheng, Jinsong Su, Yidong Chen*
该文由我实验室2023级硕士生赖昌豪,2025级硕士生易粤赣,2024级硕士生郑小云,2025级博士生赵瑞,陈毅东教授共同完成。
论文介绍:
现有的手语翻译模型大多在背景单一、视觉干净的实验室数据上进行训练。当这些模型被部署到背景复杂的真实世界时,会出现严重的域偏移。在使用复杂环境数据进行训练时,模型往往会“偷懒”,把复杂的环境背景(如特定的房间、光照)当作对齐文本的“捷径”,而不是去关注真正的手语动作细节。这导致模型在真实场景下性能呈现断崖式下降。为了让模型解耦环境特征并专注于手语动作,本文提出了 DACL 框架。1. 基于课程学习的域适应:首先在视觉干净的“源域”(实验室数据集,如 CSL-Daily)上进行预训练,让模型在没有干扰的情况下建立准确的“手语动作-文本”语义映射,之后将模型迁移到复杂的“目标域”(真实世界数据集,如 CE-CSL)。在迁移过程中,保留部分源域数据进行混合训练,以防止模型产生灾难性遗忘。2. 纯背景正则化:利用多模态大语言模型(如 Gemini 3 Flash Image)进行零样本图像修复,将目标域视频中的“人物”完全抹去,生成保留复杂光影和环境的“纯背景”视频。在训练中,将这些纯背景视频与“空文本”配对,作为一个显式的正则化项加入训练,帮助解耦环境噪音。该框架通过训练策略的优化,就在富有挑战性的真实场景数据集上取得了显著的性能提升。