手语是听障群体开展教育、医疗和社会交往的重要语言载体。现有系统多集中于“识别成文本”“屏幕呈现”或调用预定义动作,难以在真实服务场景中同时完成理解、回复生成、标准词条对齐和机器人执行。为解决语言理解与物理表达相互割裂的问题,论文提出 EmbodiedSign,将具身手语交互构建为“手语视频—识别文本—回复文本—标准词条序列—机器人动作轨迹”的完整闭环。
系统首先通过教师—学生蒸馏获得可在机器人侧部署的轻量化手语理解模型;随后融合当前输入、对话历史与场景约束进行上下文感知回复规划;再通过同义词归一、功能词过滤、短语优先匹配和最长匹配切分,将开放式回复映射为标准手语词条;最后从结构化词库中检索和组合关键帧,经连续插值与动作重定向,将手型、腕部和手臂轨迹映射至 Unitree G1 人形机器人与 LinkerHand L10 灵巧手。

图1 EmbodiedSign 总体框架:从手语输入到机器人
执行的闭环
系统构建了包含 5,587 个标准化可执行词条的手语库,并在真实人形机器人平台上开展端到端测试。完整系统总体任务成功率达到 87.5%,语义一致性和标准表达质量分别为 4.24/5 和 4.21/5,平均完整响应周期为 8.0 秒。引入当前输入、对话历史和场景约束后,多轮对话成功率提高 10.0 个百分点;文本规范化模块将标准词条命中率由 72.4% 提升至 89.6%,动作序列可执行率由 76.8% 提升至 88.3%。结果表明,轻量理解、上下文规划、标准化对齐与机器人执行的协同设计,是形成稳定具身手语交互链路的关键。

图2 EmbodiedSign 实验平台与代表性交互案例