量子位 昨天
大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

自动手语翻译中,一直存在一个隐蔽难题:模型即使已经较好地对齐了视觉与文本,也可能在逐词生成时,被某个局部合理、却缺少视觉证据支持的词带偏。

这样造成的偏差,又会成为后续生成的上下文,最终累积成整句语义偏移。

vivo AI Lab 研究团队把问题进一步追到强化学习的 " 更新规则 " 上,并提出CAPO-SLT(Confidence-Aware Policy Optimization for Sign Language Translation),在不更换视觉编码器与奖励函数的前提下,让强化学习阶段的手语翻译生成更稳、更忠实。

从沟通无障碍到数字包容:手语翻译为什么重要?

手语不是把口语逐字换成手势,而是拥有自身语法、空间表达与非手部信息的视觉语言。自动手语翻译要把连续的视频或姿态序列转换为自然语言,让手语使用者与不懂手语的人能够跨越语言模态直接交流。它连接的不只是两种表达方式,也是现实世界与数字服务之间的一道接口。

在公共服务、医疗沟通、教育课堂、应急信息、客户服务、职场协作和在线视频等场景中,专业手语翻译资源并不总能随时覆盖。可靠的自动翻译技术可以补充人工服务,为信息获取、内容生产与双向沟通提供更及时的支持,并推动无障碍能力从少数专门场景走向日常产品。

社会价值对应着更高的可靠性要求:" 流畅却译错 " 往往比明显的不通顺更难察觉。一个关键词、否定关系或事件主体的偏移,就可能改变整句话的含义。因此,手语翻译不仅要追求指标提升,更要忠实于视觉证据并保持生成稳定。

同样是正优势词元,统一裁剪无法区分其置信度;CAPO 按旧策略置信度分配不同的更新上限。手语翻译模型 " 看懂 " 之后,为什么还会 " 说错 "?

自动手语翻译同时面对模态差异、时间粒度差异和语言结构差异:手部动作可能非常细微,相近手势容易混淆,动作边界并不总是清楚,表情、口型等非手部线索也可能不完整。近年来,研究重点多放在视觉—语言对齐上,让模型先学会把动作与文字放进同一个语义空间。

但 " 对齐得好 " 并不等于 " 生成得稳 "。翻译是自回归过程:模型生成一个词,再把它连同此前内容用于预测下一个词。强语言先验会让某些续写听起来很自然;一旦它们没有得到视觉证据充分支撑,流畅反而可能掩盖错误。

强化学习本可直接根据整句质量优化模型,却又引入新的噪声:奖励通常在句子层面给出,优势值却要分配到每个生成词上。模型知道 " 这一整句总体更好或更差 ",但未必能准确判断究竟是哪个词做对了、哪个词造成了偏移。

症结:所有词共用同一把 " 限速器 "

PPO、GRPO 等策略优化方法会限制新旧策略的概率比,避免单次更新迈得太大。传统上限是固定的:所有 " 正优势 " 词元共享同一个裁剪范围。这个规则简单有效,却忽略了词元之间截然不同的状态。

旧策略已经高度确信的词,可能只是语言先验下的 " 顺口选择 ",继续大幅放大其概率容易强化错误路径;旧策略概率较低、但获得正优势的词,可能正是值得纠正和探索的方向,却被同一上限压住了更新空间。

CAPO 并不把 " 高置信度 " 当成 " 语义正确 " 的证明。旧策略概率只被当作控制更新幅度的信号,用来回答:这个词已经被旧模型偏好到什么程度,还需要多大的增幅?

解决思路:让每个词拥有不同的更新上限

对于正优势词元,CAPO 根据旧策略为该词分配的概率动态设置上裁剪边界。旧策略置信度越高,上限越接近保守范围;置信度越低,则保留更大的正向更新空间。论文将基础上限设为0.2、最大放宽到0.3

这并不是压制高置信度词。高置信度且获得正优势的词依旧会被强化,只是不被不必要地过度放大。对于负优势词元,CAPO 进一步为损失幅度设置上限,降低句级奖励噪声把个别词 " 罚得过重 " 的风险。

先建立跨模态表征与翻译能力,再用 CAPO 约束强化学习阶段的词元级更新。从姿态到句子:模型是怎样训练出来的?

监督初始化:从视频提取全身姿态关键点,拆分为面部、身体、左手和右手四组;用 ST-GCN 建模空间关节关系与时间运动信息,并学习视觉—文本共享语义表示。

强化学习微调:对同一段手语采样多条候选译文,综合 BLEU-1、BLEU-4、ROUGE-L 与 BERTScore 计算句级奖励,再得到组内相对优势。

置信度感知更新:对正优势词元使用随旧策略置信度变化的上限,对负优势词元限制过大的损失,在不改变奖励与主干网络的情况下稳定更新。

中文侧使用 CSL-News 进行大规模预训练,再在 CSL-Daily 上监督微调、强化学习与评测;英文侧使用 YouTube-ASL 预训练,并在 How2Sign 上验证美国手语翻译。论文还在 WLASL2000 上进行孤立词识别评估。

结果:仅用姿态输入,中文手语三项指标均取得表中最佳

在 CSL-Daily 测试集上,与此前同样只使用 Pose 输入的 Geo-Sign 相比,三项指标分别提升2.93、1.260.64分;与 Pose-only 的 Uni-Sign 相比,则分别提升4.96、3.073.67分。论文对比表还包含同时使用 Pose 与 RGB 的方法,而 CAPO-SLT 在仅用姿态的情况下仍拿到三项最高值

CSL-Daily 主结果。CAPO-SLT 仅使用 Pose 输入;红色为表中最佳结果,蓝色为第二名。跨语言与辅助任务

在 How2Sign 上,CAPO-SLT 仅使用 Pose,取得 41.4BLEU-1、15.2BLEU-4 和 34.9ROUGE-L;相较同样使用 Pose 的 Uni-Sign,分别提升1.0、0.70.6分。在 WLASL2000 上,Per-Instance 与 Per-Class 准确率分别为63.77%61.91%,说明姿态表征在另一类手语理解任务上仍保持竞争力。

消融实验:增益来自哪里?

研究团队让 SFT、GRPO、DAPO 和 CAPO 共用同一监督检查点、同一奖励与训练设置,只替换策略优化规则。相较 DAPO,CAPO 的三项指标分别提升0.30、0.500.67分。移除负优势上限后,结果降至58.48/28.03/57.80;把反比例置信度映射换成相同范围的线性映射,BLEU-4 与 ROUGE-L 分别下降0.730.60分。

" 听起来对 " 与 " 意思真的对 ",差别就在几个关键词

没有 CAPO 时,模型会把 " 我分别介绍这几位同事 " 翻译成 " 我是一个由几个人组成的团队 ";把 " 天黑了,我害怕 " 译成 " 天黑了,我睡着了 ";还会把 " 这部电影的女演员很漂亮 " 改写成 " 这部电影讲的是女演员的爱情故事 "。这些句子都算流畅,却替换了谓词、实体关系或事件含义。

加入 CAPO 后,这三组译文均恢复到与参考答案一致或语义等价的表达。剩余错误主要是局部遗漏、时间表达偏差或轻微措辞差异,而不是整句意义彻底翻转。

绿色为正确表达,红色为错误或缺乏视觉支持的内容。训练曲线也给出同一方向的证据

GRPO 的平均熵先快速下降,随后在训练后期重新上升,反映策略不确定性再次增加;CAPO 则在早期下降后逐渐稳定,没有出现突然的熵坍塌,也没有后期明显反弹。置信度感知裁剪让词元级更新更受控,与方法希望改善的 " 生成阶段稳定性 " 一致。

GRPO(上)与 CAPO(下)的策略熵和 KL 散度。CAPO 的熵在早期下降后趋于稳定。从 " 对齐 " 走向 " 稳定生成 "

CAPO-SLT 的价值不在于再叠加一个更大的视觉编码器,而在于把关注点从 " 模型有没有看懂动作 " 延伸到 " 模型怎样把理解稳定地说出来 "。当奖励来自整句、更新却发生在每个词时,给所有词相同的更新上限未必合理;旧策略置信度提供了一个无需额外模型、可直接计算的控制信号。

这种设计也具有工程上的可移植性:CAPO 不修改视觉主干和奖励函数,只替换策略优化中的裁剪规则。对于已经具备监督初始化和 PPO/GRPO 式强化学习流程的手语翻译系统,它提供了一条相对低侵入的稳定化路径。

局限与下一步

CAPO 在美国手语翻译上的增益比 CSL-Daily 更温和。当前奖励完全依赖参考译文,将 BLEU、ROUGE-L 等重叠指标与 BERTScore 结合,仍难完整覆盖合理改写、篇章级充分性和细粒度语义偏好。未来,团队计划探索学习式偏好模型或面向手语翻译的专用语义评估器。

论文标题:《CAPO-SLT: Confidence-Aware Policy Optimization for Stable Sign Language Translation Generation》

作者:Ling Zhou、Yuhao Chen、Lin Cheng、Chengwen Yao、Donghui Sun、Xiaoxin Chen。Ling Zhou 与 Yuhao Chen 为共同一作,Donghui Sun 为通讯作者。

论文链接:https://openreview.net/pdf?id=l4bCsrSkYx

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目 / 主页链接,以及联系方式

  我们会 ( 尽量 ) 及时回复你 : )

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

翻译 语法
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论