浙江大学宋吉舟教授团队在《Science Advances》上发表了题为“Fine-grained multi-level gesture recognition based on a stretchable multichannel ultrasonic device”的研究成果。该团队成功研制出一种高顺应性、可拉伸的多通道幅值模式(A-mode)超声贴片。结合专为高频声学波形定制的多尺度一维卷积神经网络(1D-CNN),该系统首次实现了对掌指关节(MCP)角度变化仅 3.2°至4.9°的微精细多级手势识别,整体识别准确率高达 98.75%。
这一突破不仅将人机接口的运动感知精度推向了亚毫米级的解剖学维度,更通过“空间分布式肌肉-肌腱超声解码”范式,一举克服了传统单通道超声及表面肌电(sEMG)传感器在跨受试者泛化、长效稳定性以及抗位置偏移等方面的固有短板。该项研究与近年Meta旗下CTRL-labs发表于《Nature》的表面肌电手环研究,以及麻省理工学院(MIT)发表于《Nature Electronics》的手腕超声成像追踪系统形成呼应,共同构成了下一代隐形人机接口的技术前沿。
驱动概念解析:突破传统传感瓶颈,开启微姿态控制新范式
在当前命令式人机交互中,离散手势识别能够将特定动作直接映射为预设指令,但现有离散接口大多建立在大幅度、形态迥异的手势基础之上。微精细多级手势控制(Fine-grained multi-level command control)旨在将手指极小幅度的分级运动映射为不同的控制指令或同一指令的不同强度等级,从而大幅扩充低生理负担下的交互指令容量。
然而,捕捉此类微小肌肉形态变化对传感技术的物理特性提出了近乎苛刻的要求。目前主流的肢体感知技术路线均存在无法回避的物理局限:
光学术路线(计算机视觉)极易受到环境光线起伏、视角遮挡及复杂背景的干扰,且面临严重的隐私隐患。惯性测量单元(IMU)虽然能捕捉姿态变化,但在静态微小幅度维持时存在不可避免的累计积分漂移。作为目前产业界关注焦点的表面肌电(sEMG)技术(如 Meta 基于手腕 sEMG 的神经接口),虽然能够直接读取大脑下达的肌肉电生理指令,但其信号仅来源于浅层皮下,极易受到肌肉疲劳、出汗以及运动伪影的干扰,且无法有效解耦解剖位置深叠、空间紧密邻近的深层肌肉群活动。
相比之下,超声传感技术能够以无创方式直接穿透皮肤,深入捕获皮下数厘米处的深层肌肉与肌腱的几何形态变化。早期的超声人机交互主要依赖图像级的 B 模式(B-mode)超声,虽然成像直观,但其庞大的阵列元器件与复杂的图像重建算法带来了极高的算力与功耗负担。
浙江大学团队选择的 A 模式(A-mode)超声通过高频声波在不同组织界面的反射获取一维射频波形,免去了繁重的图像重建过程,能够以极低算力实时监控特定肌群的形态演变。团队进一步通过可拉伸多通道阵列设计,将局部单点声学测距升级为前臂肌肉群的空间分布式形态解码,赋予了 A 模式超声前所未有的微姿态辨识能力与工程鲁棒性。
|
|
|
|
|
|
|
|---|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
结构与材料创新:扇形柔性构型与可拉伸多通道阵
为了保证超声波在动态佩戴过程中能够高效、稳定地耦合入人体组织,换能器必须与皮肤保持连续紧密的物理接触。传统刚性超声探头不仅笨重,而且需要施加较大的预紧力并配合大量液态耦合膏,极易在肢体运动时发生相对位移。
研究团队打破传统布局,研制出一种具有扇形构型的高顺应性可拉伸多通道超声贴片。贴片整体呈扇形展开,巧妙匹配了人体前臂由近端向远端自然收缩的解剖学轮廓。贴片集成了 4 个功能站点(Functional Sites),共包含 16 个独立的压电模块。
整个器件采用了巧妙的四层柔性薄膜集成架构: 封装层采用低模量(60 kPa)、高延展性(断裂伸长率约 900%)的 Eco-flex 00-30 硅胶(厚度约 1.05 mm)。其声阻抗为 1.04 Mrayl,与人体皮肤高度匹配,极大地降低了声波在界面处的反射损失。电路层采用“聚酰亚胺(25 µm)- 铜(12 µm)- 聚酰亚胺(25 µm)”的三层夹心柔性电路,通过非对称蛇形微导线连接各个模块。基底层为厚度约 50 µm 的 Eco-flex 薄膜,作为电路与压电单元的支撑载体。贴片底部粘接层摒弃了易干涸的液态耦合膏,采用了厚度约 13 µm 的 Derma-Tac 医用级有机硅压敏胶。该压敏胶不仅具备与皮肤匹配的声阻抗,还能提供稳固的长效粘附,消除了因水分蒸发导致的声学信号衰减。
贴片的核心发声单元——压电模块,采用了各向异性 1-3 压电复合材料。该材料将高性能压电陶瓷(PZT-5H)柱体嵌入环氧树脂基体中,有效抑制了侧向剪切振动模式,显著提升了纵向机电耦合系数,同时将其整体声阻抗降至约 15 Mrayl,大幅改善了与软组织的声学匹配。模块背面粘接有一块厚度为 0.5 mm 的背压块(Backing Layer),能有效吸收背向声能并抑制压电层的过度自振,从而显著拓宽超声信号的响应带宽。
在力学设计方面,仅置于三个特定区域的非对称蛇形互连结构赋予了器件高达 30% 的单轴拉伸能力。有限元分析(FEA)表明,在 30% 的拉伸变形下,聚酰亚胺层(4.18%)与金属铜层(0.088%)的最大主应变均远低于各自的材料破坏极限。这种卓越的力学顺应性使贴片能够完美贴合不同粗细的前臂曲面,保证了传感器在肢体运动过程中的几何稳定性。
物理与声学表征:亚毫米级分辨力与长效生物安全性
在超声换能器的设计中,工作频率的选择体现了深刻的物理权衡:频率过高会导致声波在软组织中指数级衰减,无法到达深层肌肉;频率过低则会牺牲纵向空间分辨率,无法捕捉微小的组织位移。研究团队将工作频率定为 5 MHz,在组织穿透深度与分辨率之间取得了最佳平衡。
为了确定压电模块的最优几何尺寸,研究人员利用 COMSOL Multiphysics 建立了二维声学-结构-电磁多物理场耦合模型。仿真分析了 1 mm、3 mm 和 5 mm 三种模块宽度在前臂 1 cm(浅层肌群)和 4 cm(深层肌群)深度处的声强分布: 当模块宽度仅为 1 mm 时,声束发生严重发散,4 cm 深处的能量衰减严重,无法维持高信噪比探测。当宽度扩大至 5 mm 时,近场区长度显著延长,导致 1~4 cm 关键监测区域内出现剧烈的声强起伏。最终选定的 3 mm 模块宽度能在 1 cm 至 4 cm 深度范围内形成能量集中且分布平稳的聚焦声束。
脉冲响应测试表明,背压块的引入使器件的余振时间(Ringing time)从无背压块时的约 9 µs 缩短至约 6 µs,降幅达 33.3%。在 -6 dB 标准下,贴片获得了 49.23% 的超宽工作带宽,纵向分辨率达到了惊人的 461 µm(低于 0.5 mm)。
阻抗分析显示,16 个压电通道展现出极高的制造一致性:平均谐振频率为4.67MHz±77.4kHz ,反谐振频率为5.23MHz±72.8kHz 。在 30% 疲劳拉伸循环 4000 次后,典型通道的电气阻抗未见明显变化。即便在连续激励 24 小时后,回波波形依然保持高度稳定。
针对可穿戴设备的安全性要求,团队进行了严苛的热学与细胞毒性评估。在模拟冬季穿戴羽绒服(限制散热)的极限场景下,器件连续工作 3 小时,皮肤界面温度始终稳定在38.5℃ 以下,远低于人体热损伤阈值。体外 C2C12 小鼠成肌细胞暴露实验表明,在长达 12 小时的超声脉冲辐射下,细胞存活率与对照组无异。受试者连续佩戴 24 小时后,皮肤无压痕、红斑或发炎现象,证实了其出色的长期穿戴生物相容性。
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
解剖映射与波形捕获:从局部点测到空间分布式解码
为了精准评估设备对微小运动的辨识极限,研究团队设计了一套极具挑战性的微精细手势实验范式。该范式包含 1 个静态放松休息状态,以及 5 根手指各自从 0 cm 逐步抬升至 3.0 cm(以 0.5 cm 为递增间隔)的 30 个分级抬升动作,共计 31 种手势类别。
运动学分析表明,指尖 0.5 cm 的微小抬升仅对应掌指关节(MCP)约3.2°至4.9°的微小角度变化。该范式在保持手掌与手腕相对固定的前提下,排除了多关节耦合与手腕补偿性运动的干扰,为评价解剖级微运动识别提供了客观的物理标尺。
在前臂解剖结构中,贴片的 4 个功能站点被精准贴附于前臂中段 6 块核心目标肌肉群的体表投影位置: 肱桡肌(BR)辅助手腕旋转与前臂姿态控制;拇长屈肌(FPL)控制拇指独立屈曲;指浅屈肌(FDS)与指深屈肌(FDP)协同控制食指、中指、无名指和小指的多级屈曲;尺侧腕屈肌(FCU)维持手腕姿态稳定并抑制补偿性位移;指伸肌(ED)控制五指伸展,提供对抗性拮抗信号。
当受试者执行微小手指抬升时,尽管掌指关节角度变化仅为 ~3.6°,16 个超声通道中的波形包络均展现出清晰的相位偏移与振幅调制。
值得注意的是,由于肌肉形态变化的解剖局域性,某些通道(如 Ch3 或 Ch8)在特定手指动作下可能表现出相对平缓的信号响应,而其他通道则呈现剧烈变化。这种空间异质性恰恰揭示了多通道配置的不可替代性:分布式多通道超声成功将传统的“单点声学测距”升级为“前臂肌肉群三维形态学的分布式声学投影”。即便个别通道信号不敏感,互补的通道阵列依然能够提供足够丰富的信息重构运动意图。在全部 31 种手势的 496 组 SNR 测定中,99.4% 的通道-手势组合 SNR 远高于 15 dB 的高质量安全阈值。
深度学习与泛化机制:多尺度算法、空间多样性与轻量校准
原始 A 模式超声回波信号包含高达 1278 个采样点。为了从高频时域波形中高效提取与微小解剖形态变化相关的特征,研究团队构建了一种专为超声波形打造的多分支一维卷积神经网络(1D-CNN)。
该网络引入了并行多尺度感知野设计,在同一卷积层中并行集成了尺寸为 1、3、5、7 和 11 的卷积核: 较小的卷积核(1, 3)对高采样率信号进行精细扫描,精确捕捉肌腱快速微动引发的高频瞬态声学特征;较大的卷积核(7, 11)则捕获跨越较长时域的肌肉变形整体轮廓。残差连接(Residual Connections)与自适应池化(Adaptive Pooling)确保了梯度的稳定传播,并能容忍不同采样帧之间的微小时间漂移。
实验数据集由 8 名健康受试者(采集 6200 帧/人)构成。t-SNE 高维特征投影图清晰显示,经过最后一层卷积特征提取后,31 种精细手势的特征向量在二维平面上形成了彼此孤立、边界清晰的紧凑聚类,展现出极高的类间可分性。算法最终实现了 98.75% 的整体分类准确率。
详尽的消融实验进一步揭示了多通道配置背后的深层机制:
首先,多通道融合彻底消除了分类系统中的“长尾效应”。当仅使用单通道数据时,模型会出现严重的手势识别偏好与性能短板(如 Ch2 在识别中指抬升 2 cm 时准确率仅有 75.8%,Ch14 在识别无名指抬升 0.5 cm 时准确率跌至 57.8%)。随着通道数由 1 个增加至 16 个(4 个站点),系统中最难识别手势的最低准确率(Worst-case accuracy)从 76.06% 爆发式提升至 94.10%,消除了少部分难辨识动作拖累整体体验的致命短板。
其次,实验证明“空间多样性(Space)”显著优于“局部密度(Density)”。研究人员对比了两种 4 通道配置策略:策略一(Density)将 4 个通道全部集中在同一功能站点;策略二(Space)将 4 个通道均匀分布在 4 个不同的功能站点。受试者级配对分析表明,空间分布式策略的准确率显著高于局部高密度策略。这一结论印证了人机交互中的声学解码核心在于覆盖更多解剖肌群,而非在局部进行无意义的高密度冗余采样。
此外,多通道配置极大提升了对异质性多受试者数据的稳健学习能力。随着训练集受试者数量从 1 人增加到 8 人,单通道模型的识别率因无法克服个体间肌肉解剖结构的巨大差异而从 94.65% 下滑至 89.11%。而在 16 通道“4 站点”完整配置下,模型的跨受试者准确率始终稳定在 99.16%±0.31%的极高水平。
针对实际穿戴中不可避免的传感器位置偏移(如沿前臂四周偏移 1 cm 的 Shift 1~4 条件)以及面对未见过的全新用户(S9, S10, S11),团队提出了轻量化微调校准策略:冻结骨干网络绝大部分参数,仅解冻最后两个卷积层(Conv30 和 Conv40),每个手势仅需采集 10 帧数据(仅需 1 秒采集时间)进行快速微调。校准后,面对 1 cm 位置偏移,贴片依然保持了 92.58% ~ 97.07% 的准确率;面对全新受试者,识别准确率达到 95.44% ~ 98.22%,展现出极高的工程落地价值。
|
|
|
|
|
|
|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
实时人机交互演示与产业竞争格局
为了验证该技术在真实场景中的应用潜力,研究团队基于柔性超声贴片构建了一套面向失语症、术后插管、吞咽困难或严重运动功能障碍患者的“无声辅助沟通系统”。
在该演示中,患者仅需通过极小幅度的分级手指抬起,即可实时触发高优先级的医疗求助指令: 拇指抬升 1 cm、2 cm 和 3 cm 分别映射为“轻度呼吸不适”、“呼吸困难”与“严重呼吸急促”;食指抬升 1 cm、2 cm 和 3 cm 分别映射为“轻度疼痛”、“中度疼痛”与“剧烈疼痛”;无名指抬升 2 cm 则直接触发“紧急呼叫”。
在实时推理过程中,系统采用了双帧连续一致性校验机制(连续两帧预测一致且 Softmax 置信度超过 50% 方可输出指令)。在普通 CPU 平台上,单帧模型推理时间低于 3 ms,端到端平均系统延迟仅为 227.5±140.8ms。在实测中,“无需求放松状态”与“紧急呼叫”均实现了 100% 的准确触发,低延迟与高可靠性证实了微精细手势在低生理负担辅助交互中的巨大实用价值。
从人机交互的技术演进视角看,该研究正处于生物信号隐形交互跨越的关键拐点:
Meta 旗下 CTRL-labs 在 2025 年凭借其基于 sEMG 的手腕带打破了离散手势与手写输入的跨人泛化壁垒。但 sEMG 在面对细微肌肉等长收缩和微小关节屈伸时,受限于浅层电信号叠加与电极漂移,极易出现信号饱和与误触。麻省理工学院(MIT)团队在 2026 年展示的腕部超声成像技术,虽然在连续手部姿态追踪上表现亮眼,但其对二维图像处理的依赖导致计算功耗高昂,难以长久集成于轻量级智能手表或 AR 眼镜框中。
浙江大学团队提出的柔性多通道 A 模式超声技术,巧妙地在“深层组织感知”与“超低计算开销”之间找到了黄金平衡点。A 模式超声直接处理一维高频射频波形而非二维图像,其算力需求仅为 B 模式超声的几十分之一,使其极易被移植至低功耗边缘侧芯片(Edge AI)中,为可穿戴设备提供长效续航基础。
结论与展望
浙江大学团队开发的扇形柔性多通道超声贴片,通过高机电性能的 1-3 压电复合材料、可拉伸蛇形电路与多尺度 1D-CNN 算法的有机融合,成功克服了传统肌电与光学术路线的固有缺陷,在亚毫米空间分辨率下实现了掌指关节小于 5°变化的高精度解码。
该技术不仅为运动障碍患者提供了低生理负担的无声沟通通道,更为主流消费电子、空间计算(Spatial Computing)、AR/VR 隐形手势控制以及高灵敏度智能假肢控制奠定了坚实的硬件与算法基础。未来,随着单片集成信号处理芯片(SoC)与无线传输模块的进一步融合,这种“无感贴附、深层解码”的超声交互界面有望正式走出实验室,重塑人类与数字世界相连的边界。
参考资料
Xinyi Lin et al. ,Fine-grained multi-level gesture recognition based on a stretchable multichannel ultrasonic device.Sci. Adv.12,eaef1101(2026).DOI:10.1126/sciadv.aef1101
审核 | 医工学人理事会








