大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26
详细介绍
自动手语翻译中,一直存在一个隐蔽难题:模型即使已经较好地对齐了视觉与文本,也可能在逐词生成时,被某个局部合理、却缺少视觉证据支持的词带偏。
手语不是把口语逐字换成手势,而是拥有自身语法、空间表达与非手部信息的视觉语言。自动手语翻译要把连续的视频或姿态序列转换为自然语言,让手语使用者与不懂手语的人能够跨越语言模态直接交流。它连接的不只是两种表达方式,也是现实世界与数字服务之间的一道接口。
自动手语翻译同时面对模态差异、时间粒度差异和语言结构差异:手部动作可能非常细微,相近手势容易混淆,动作边界并不总是清楚,表情、口型等非手部线索也可能不完整。近年来,研究重点多放在视觉—语言对齐上,让模型先学会把动作与文字放进同一个语义空间。
PPO、GRPO等策略优化方法会限制新旧策略的概率比,避免单次更新迈得太大。传统上限是固定的:所有“正优势”词元共享同一个裁剪范围。这个规则简单有效,却忽略了词元之间截然不同的状态。
对于正优势词元,CAPO根据旧策略为该词分配的概率动态设置上裁剪边界。旧策略置信度越高,上限越接近保守范围;置信度越低,则保留更大的正向更新空间。论文将基础上限设为0.2、最大放宽到0.3。

没有CAPO时,模型会把“我分别介绍这几位同事”翻译成“我是一个由几个人组成的团队”;把“天黑了,我害怕”译成“天黑了,我睡着了”;还会把“这部电影的女演员很漂亮”改写成“这部电影讲的是女演员的爱情故事”。这些句子都算流畅,却替换了谓词、实体关系或事件含义。
GRPO的平均熵先快速下降,随后在训练后期重新上升,反映策略不确定性再次增加;CAPO则在早期下降后逐渐稳定,没有出现突然的熵坍塌,也没有后期明显反弹。置信度感知裁剪让词元级更新更受控,与方法希望改善的“生成阶段稳定性”一致。
CAPO-SLT的价值不在于再叠加一个更大的视觉编码器,而在于把关注点从“模型有没有看懂动作”延伸到“模型怎样把理解稳定地说出来”。当奖励来自整句、更新却发生在每个词时,给所有词相同的更新上限未必合理;旧策略置信度提供了一个无需额外模型、可直接计算的控制信号。
CAPO在美国手语翻译上的增益比CSL-Daily更温和。当前奖励完全依赖参考译文,将BLEU、ROUGE-L等重叠指标与BERTScore结合,仍难完整覆盖合理改写、篇章级充分性和细粒度语义偏好。未来,团队计划探索学习式偏好模型或面向手语翻译的专用语义评估器。
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner
