FEATURED机器之心 · 公众号· rssZH04:06 · 05·04
ACL 2026:港理工开源“会思考”的手语翻译模型 SignThought,不用中间标注直接出文字
香港理工大学和四川大学搞了个叫 SignThought 的手语翻译模型,中了 ACL 2026 主会,还被推荐做口头报告。它最大的不同是不依赖“手语注释”(gloss),直接看视频出文字,省掉了中间那层人工标注。做法是让模型先在心里盘一遍大概意思(latent thoughts),再分两步走:先规划再落地(plan-then-ground),最后用双流...
#Multimodal#Reasoning#Vision#Hong Kong Polytechnic University
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
港理工和川大做了个直接看手语视频出文字翻译的模型,不靠人工标注的中间层,在五个数据集上拿了最高分。但正文被微信验证页挡住了,具体效果和限制看不到。
锐评
SignThought 这个模型的核心思路挺直接:跳过手语注释(gloss)这层人工标注,让模型直接从视频里理解手语并输出文字。做法是让模型先在心里盘一遍大概意思,再分两步走——先规划再落地,最后用双流解码出结果。在五个手语翻译基准上拿了无注释条件下的最高 BLEU-4 分,还专门建了个 1311 小时、43 万多个片段、14 个手语者的香港手语数据集 LC-HKSLT。
不过这篇推送的正文被微信环境验证页挡住了,我只能看到摘要里的技术路线和数字,看不到论文里的具体实验设置、错误分析、以及模型在真实场景下的表现。比如 BLEU-4 分数到底是多少、比第二名高多少、在不同手语类型上的稳定性怎么样,这些关键信息都缺失。另外,手语翻译的落地难点往往不在模型本身,而在视频采集质量、方言差异、实时性要求这些工程问题上,论文有没有讨论这些也看不到。
如果只看公开信息,这个方向有意义,但具体有多好用,得等看到完整论文再判断。
HKR 分解
hook ✓knowledge ✓resonance ✓