Nature communications | 通过耳内音频传感测量心脏每搏输出量,剑桥大学团队用日常耳机实现每搏输出量精准监测,误差仅5.24 mL

★ 星标「医工学人」,第一时间获取医工交叉领域新闻动态

心脏每搏输出量是衡量心血管健康的核心指标,但其测量长期依赖昂贵、笨重的临床设备。剑桥大学团队近日在《自然·通讯》上提出一种基于深度学习的方法,仅利用日常耳塞的内置麦克风采集耳内心音信号,即可在未见过的新用户上实现平均每搏输出量的精准估算——平均绝对误差5.24 mL,一致性误差11.05%,远低于临床可接受的30%阈值。这项技术有望将心血管监测从医院诊室“解放”到日常生活场景中。

临床刚需与测量困境

每搏输出量——左心室每次收缩泵出的血液体积——是心血管生理学中最基础也最重要的度量之一。它直接反映了心肌收缩效率、心脏前负荷与后负荷的平衡,不仅是评价心脏泵血功能的核心指标,也是诊断心力衰竭、心律失常和瓣膜病的关键依据。在运动医学领域,每搏输出量更是评估心肺适能(cardiorespiratory fitness)的金标准性指标:训练有素的运动员通常具有更高的每搏输出量,反映其心血管系统更高的效率。

然而,这样一个临床价值极高的生理参数,其测量手段却长期被困在医院的四面墙之内。

当前的临床“金标准”——直接Fick法——需要通过肺动脉导管或经肺热稀释导管进行有创测量,操作复杂、劳动强度大且伴随感染风险,仅在重症监护等有限场景下使用。临床上更为普及的替代方案是超声心动图(心脏超声),结合多普勒血流速度记录来估算每搏输出量。但这一技术高度依赖操作者的专业技能,不同操作者之间的测量变异性显著,且无法实现连续监测。

对于需要持续监测的场景,目前临床上可选的是指套式连续血流动力学监测系统(如Finapres NOVA)。这类设备利用可充气指套和光电容积描记法(PPG)重建动脉血压波形并推算每搏输出量,但其体积笨重、佩戴不适,且每次使用前需用超声心动图进行校准,极大地限制了其在日常场景中的应用。

在可穿戴设备领域,研究者已尝试用胸贴集成单导联心电图(ECG)和三轴加速度计、PPG传感器、甚至改装浴室体重秤来实现每搏输出量的估算。但这些方案面临三个共性瓶颈:第一,形态笨重、佩戴不适,用户依从性差;第二,多数依赖专用传感器或需额外校准设备,无法利用已有消费电子终端;第三,监测是“片段式”而非“连续式”的,仅在用户主动佩戴或测量时才能获取数据。

换言之,目前没有任何一种方案能够仅依靠日常商用设备的原生传感器,实现无感、连续、可负担的每搏输出量监测。

技术原理与架构创新

剑桥大学团队提出的CardiAural系统,其核心洞察建立在一个物理声学现象之上——堵耳效应(occlusion effect)。当耳塞封闭耳道形成密封时,耳道被转化为一个低通滤波器,低频信号(0 – 100 Hz)在耳道内被放大,增益最高可达40 dB。在这些被放大的低频分量中,心脏活动产生的微弱振动信号可以被耳塞的内向麦克风有效捕获。

但问题的复杂性在于:耳内心音信号与每搏输出量之间的关系并非显式的线性映射。 研究团队发现,即使从耳内音频中提取了数十种经典声学特征(信号统计量、时域/频域特征、MFCC等)和心脏相关特征(逐搏间期、心率、峰幅度),这些特征与每搏输出量的皮尔逊相关系数最高仅为中等水平(约0.3–0.4),且在不同受试者之间展现出极大的信号差异性——不同参与者的耳内音频均方根能量可相差近一倍,偏度、峰度、过零率等指标亦各不相同。

Figure 1 | 耳内音频、ECG、每搏输出量信号的信号特性,以及耳内音频信号与每搏输出量之间的相关性。  (a–d)两名参与者在等长运动前后各60秒的耳内音频、ECG、逐搏间期(IBI)和每搏输出量。(a)-(b)分别为参与者1运动前和运动后;(c)-(d)分别为参与者2运动前和运动后。耳内音频呈现出一致的心跳信号,其峰值与ECG信号中的每一次心跳相对应。运动前,每搏输出量保持稳定水平;运动后,每搏输出量升高并逐渐恢复至基线水平。(e)从耳内音频中提取的特征与每搏输出量之间的相关性。心脏相关属性与每搏输出量之间、以及音频特征与每搏输出量之间均存在弱相关性。这凸显了利用耳内音频估算每搏输出量的潜力,同时也强调了需要先进的学习技术来智能地利用这些弱相关性。
Figure 1 | 耳内音频、ECG、每搏输出量信号的信号特性,以及耳内音频信号与每搏输出量之间的相关性。 (a–d)两名参与者在等长运动前后各60秒的耳内音频、ECG、逐搏间期(IBI)和每搏输出量。(a)-(b)分别为参与者1运动前和运动后;(c)-(d)分别为参与者2运动前和运动后。耳内音频呈现出一致的心跳信号,其峰值与ECG信号中的每一次心跳相对应。运动前,每搏输出量保持稳定水平;运动后,每搏输出量升高并逐渐恢复至基线水平。(e)从耳内音频中提取的特征与每搏输出量之间的相关性。心脏相关属性与每搏输出量之间、以及音频特征与每搏输出量之间均存在弱相关性。这凸显了利用耳内音频估算每搏输出量的潜力,同时也强调了需要先进的学习技术来智能地利用这些弱相关性。

换言之,传统的手工特征工程方法在处理耳内心音与每搏输出量之间的复杂、非线性、受试者依赖性强的关系时,表现不佳。 这正是深度学习施展能力的空间。

CardiAural的技术架构采用了一个两阶段训练策略,其设计精妙地应对了该任务中的两大核心挑战——标注数据稀缺与跨受试者泛化困难。

第一阶段:生成式自监督预训练。 团队构建了一个基于Transformer架构的掩码自编码器(masked autoencoder),在大规模未标注耳内音频数据集上(涵盖约1165分钟、34,940个10秒样本,包含静坐、办公、说话等多种日常场景)进行预训练。输入频谱图以70%的比例随机掩码,模型被训练去重建被掩码的部分。这一过程迫使编码器学习到关于耳内心音信号的鲁棒、高层次的潜在表征,而非简单地记忆特定的标注模式。

第二阶段:有监督微调。 预训练完成后,移除解码器,在编码器顶端接入一个全连接回归层,利用23名健康志愿者在静息和等长运动后恢复状态下的专用标注数据集进行微调。微调阶段采用了一种加权均方误差(weighted MSE)损失函数,有意识地对分布在数据集两端的每搏输出量样本赋予更高权重,以缓解模型对中心值的偏好,提升对极值预测的准确性。

维度
传统特征工程方法
CardiAural深度学习方法
特征提取
手工设计统计/频域/MFCC特征,依赖先验知识
自监督预训练自动学习最优表征,无需先验假设
跨受试者泛化
较差,个体间信号差异导致特征失效
预训练阶段学习通用表征,微调阶段适配特定任务
标注数据依赖
需要大量标注数据驱动特征选择
利用大量未标注数据预训练,大幅降低标注需求
极值预测能力
无针对性设计,对均值回归敏感
加权损失函数主动强化对极值样本的学习

实验验证与性能评估

团队招募了23名健康志愿者(13男10女,年龄21–58岁,BMI 19–42,覆盖正常至肥胖范围),设计了静息基线 → 30秒等长握力运动 → 恢复期的实验流程。真实值采用Finapres NOVA连续血流动力学监测系统获取,该设备已通过FDA批准,且与超声心动图校准后偏差仅为0 ± 4.2%。

Figure 2 | 每搏输出量预测性能。  (a)每位参与者在整个实验流程中的平均每搏输出量预测值与真实值的散点图(含恒等线)。(b)每位参与者预测的平均每搏输出量的平均绝对百分比误差(MAPE)。(c)整体平均每搏输出量的Bland-Altman分析图。(d)运动前与运动后条件下每搏输出量预测值与真实值的对比。(e)每位参与者在运动前和运动后条件下的预测误差。结果显示,系统对未见过受试者的平均每搏输出量预测具有高精度和强泛化能力。
Figure 2 | 每搏输出量预测性能。 (a)每位参与者在整个实验流程中的平均每搏输出量预测值与真实值的散点图(含恒等线)。(b)每位参与者预测的平均每搏输出量的平均绝对百分比误差(MAPE)。(c)整体平均每搏输出量的Bland-Altman分析图。(d)运动前与运动后条件下每搏输出量预测值与真实值的对比。(e)每位参与者在运动前和运动后条件下的预测误差。结果显示,系统对未见过受试者的平均每搏输出量预测具有高精度和强泛化能力。

核心性能指标

  • 平均绝对误差(MAE): 5.24 mL
  • 平均绝对百分比误差(MAPE): 6.83%
  • 皮尔逊相关系数(r): 0.94(p < 0.001)
  • 决定系数(R²): 0.88
  • 一致性界限百分比误差(PE): 11.05%

其中,11.05%的PE值尤为关键——Critchley和Critchley的Meta分析指出,临床可接受的新型每搏输出量测量设备的PE阈值是30%。CardiAural不仅大幅低于该阈值,而且在现有可穿戴方案的横向对比中表现最佳:胸贴式ECG+加速度计方案的PE为28%,胸贴式PPG方案为25.6%,指套式PPG方案为16.2%,而嵌入式的定制传感器体重秤方案甚至达到了36.73%(已超出临床可接受范围)。

Figure 3 | 定制耳塞设备。  包含3D打印的耳塞外壳、麦克风、扬声器、耳塞帽、耳塞套、连接线、定制PCB板、音频编解码器以及Raspberry Pi 4。该设备用于采集耳道内的低频心脏信号。
Figure 3 | 定制耳塞设备。 包含3D打印的耳塞外壳、麦克风、扬声器、耳塞帽、耳塞套、连接线、定制PCB板、音频编解码器以及Raspberry Pi 4。该设备用于采集耳道内的低频心脏信号。

运动应激响应验证: 等长运动后,参与者的每搏输出量平均从77 ± 13 mL上升至79 ± 14 mL(Wilcoxon检验p < 0.05),CardiAural成功捕捉到这一群体层面的变化趋势。在个体层面,除2名参与者外,其余21人的运动前/后MAPE均低于10%,证明了系统在不同生理状态下的泛化稳定性。

对照实验: 作为合理性验证,团队仅使用人口统计学特征(年龄、体重、身高、性别)预测每搏输出量,MAE为11.24 mL(15%误差),相关性r = 0.40且p值不显著;仅使用心率预测,MAE为10.72 mL(14%误差),相关性r = 0.2且不显著。这两组对照实验有力地证明了:CardiAural的预测能力来自于深度学习模型从耳内音频中提取的有效表征,而非简单地记忆人口统计信息或心率与每搏输出量之间的弱相关性

Figure 4 | CardiAural管道概览。  (a)数据采集流程:参与者佩戴定制耳塞,同时使用Finapres NOVA连续血流动力学监测系统获取每搏输出量真实值。(b)预处理:将音频下采样、分窗、生成梅尔频谱图。(c)预训练阶段:使用未标注的耳内音频数据集,对掩码频谱图进行重建训练,采用Transformer-based自编码器。(d)微调阶段:使用带标注的每搏输出量耳内音频数据集,移除解码器,在编码器顶部添加全连接层进行每搏输出量回归预测。
Figure 4 | CardiAural管道概览。 (a)数据采集流程:参与者佩戴定制耳塞,同时使用Finapres NOVA连续血流动力学监测系统获取每搏输出量真实值。(b)预处理:将音频下采样、分窗、生成梅尔频谱图。(c)预训练阶段:使用未标注的耳内音频数据集,对掩码频谱图进行重建训练,采用Transformer-based自编码器。(d)微调阶段:使用带标注的每搏输出量耳内音频数据集,移除解码器,在编码器顶部添加全连接层进行每搏输出量回归预测。

从实验室到生活场景的跨越

CardiAural的技术意义远不止于“又一项可穿戴健康监测研究”。它标志着心血管核心生理指标的监测首次有可能脱离专用医疗设备,真正嵌入消费者的日常电子生态中

对于临床医学而言: 每搏输出量的连续、无感监测将首次使心功能评估从“片段式快照”转变为“连续动态曲线”。这意味着心衰患者的院外随访可以不再依赖定期回院超声检查,而是通过日常佩戴的耳塞持续追踪每搏输出量的日间波动和长期趋势,为药物剂量调整和早期预警提供客观数据支撑。当前约2%的成年人群体存在未被诊断的心力衰竭,初级医疗中的误诊率可高达68%——连续监测的早期异常信号检测能力有望显著改善这一状况。

对于运动与健康管理而言: 每搏输出量是心血管适能的最直接客观指标之一,其变化轨迹是训练效果评估和运动处方调整的核心依据。目前运动员和健身爱好者评估心血管适应能力主要依赖心率变异性(HRV)和最大摄氧量(VO₂max)等间接指标。CardiAural首次使每搏输出量的日常追踪成为可能,为个性化训练方案的制定提供了更直接、更及时的生理反馈。

对于商业落地而言: 当前主流降噪耳塞(如Apple AirPods Pro、Samsung Galaxy Buds系列等)已标配内向麦克风,CardiAural本质上是一个纯软件算法方案,无需对硬件进行任何改动。这意味着其边际部署成本极低,具备通过OTA固件更新或App集成的方式快速触达数亿级存量设备用户的潜力。

然而,从实验室到大规模商用之间,仍存在若干关键待解问题

该研究的局限性同样需要被清醒审视。首先,样本量(N=23)和群体范围(仅健康成年人)有限,未纳入心血管疾病患者群体。病理状态下的每搏输出变异模式可能与健康人群有本质差异,模型在疾病状态下的泛化能力尚待验证。其次,当前数据集仅包含静息和等长运动恢复两种状态,跑步、骑行等高动态运动场景下的信号质量和预测稳定性尚未评估。第三,Finapres NOVA虽为FDA批准的临床设备,但其本身并非直接Fick法的“金标准”,团队在方法学部分坦诚地承认了这一点,并通过对标超声心动图的交叉验证部分缓解了这一疑虑,但这仍提示未来需进行与金标准的直接对比研究。

结语

尽管上述挑战客观存在,但CardiAural的意义在于它首次完整论证了一条从物理声学现象出发→利用自监督深度学习突破标注数据瓶颈→在未见过的新用户上实现跨个体泛化→仅依赖商用设备原生传感器的完整技术链路。这条路径的技术可行性已被11.05%的百分比误差所实证——这不仅是学术论文中一个漂亮的数字,更是将每搏输出量监测从医院专用设备的“特权”转化为日常可及资源的里程碑。

可以预见,随着更大规模、涵盖更广泛人群和更动态场景的数据集持续积累,以及算法在商用耳塞平台上的工程化适配,基于耳内音频的心血管健康监测有望在3–5年内成为继光电容积描记法心率监测之后,消费级可穿戴设备领域又一具有实质临床价值的核心健康指标

剑桥团队的这项研究,本质上是一场关于“听见心脏”的技术民主化实验——让耳塞不再只是声音的接收器,更成为生命信号的解读器。 从诊室到耳道,心血管监测的下一站,或许就在每个人的耳机里。

参考资料

Butkow, KJ., Jalaludeen, N., Liu, Y. et al. Measuring cardiac stroke volume through in-ear audio sensing. Nat Commun (2026). https://doi.org/10.1038/s41467-026-75642-0


撰文 | 郝娅婷
审核 | 医工学人理事会
扫码加入医工学人,进入综合及细分领域群聊,参与线上线下交流活动
医工学人二维码

发表回复