一项机器学习模型研究显示,美国官方统计的新冠死亡人数可能遗漏了疫情最初两年内超过15万例未被识别的死亡。
根据这项新估算,从2020年3月到2021年12月,美国因新冠导致的死亡人数为995,787例,比同期官方统计的840,251例(即死亡证明上任何位置列有新冠的病例)高出近20%(调整报告比1.19,95%不确定区间1.18-1.19)。该研究由波士顿大学Andrew Stokes博士及其同事完成。
这些未被识别的新冠死亡更常见于老年人、非白人、低收入人群以及美国某些地区的居民。研究团队在《科学进展》上报告指出,“美国死亡调查系统以系统性的不平等方式报告新冠死亡,掩盖了疫情死亡率和不平等的真实程度。”
Stokes对MedPage Today表示:“如果我们改进死亡调查系统和国家死亡监测数据的质量,我们将能更好地提前且更全面地发现下一次疫情。我们还可以应用这些机器学习方法来了解其他长期被低估的死因,例如自杀死亡率、阿尔茨海默病和痴呆症死亡率、糖尿病、药物过量等。”
此前的研究依赖超额死亡模型来估算未被识别的新冠死亡人数。使用这些模型(比较观察到的全因死亡与预期疫情前趋势)的研究发现,仅2020年一年,超额死亡就比报告的新冠死亡高出14%至38%。根据一项统计,2020年至2021年的超额死亡人数在全球达到惊人的1820万,而官方归因于新冠的死亡人数为590万。
然而,Stokes表示,这些模型无法区分哪些死亡是未被统计的新冠死亡,哪些是间接疫情效应(如医疗中断和延误)。超额死亡模型使用高度汇总的数据,也使得详细的分组分析变得困难。
Stokes解释说,为了更精确地估算,机器学习算法使用了“金标准”——即正确分类的院内新冠死亡(在疫情早期,SARS-CoV-2检测几乎普遍),来预测院外死亡(此类检测并非普遍)是否可能与新冠相关。
基于这种方法,许多预测的院外未被识别的新冠死亡被归因于阿尔茨海默病、心血管疾病或糖尿病等病因。
研究人员发现,未被识别的新冠死亡在疫情初期(2020年3月至5月)最有可能发生(调整报告比1.49,95%不确定区间1.48-1.51),随后在后续疫情波中下降。2021年1月和2020年4月预测的未被识别新冠死亡人数最多,分别为35,665例和32,110例。
未被识别新冠死亡可能性最高的州包括阿拉巴马州(调整报告比1.67)、俄克拉荷马州(1.51)和南卡罗来纳州(1.47)。绝对未被识别死亡人数最多的州是德克萨斯州(24,024例)、纽约州(23,005例)、加利福尼亚州(11,613例)、阿拉巴马州(11,501例)和佛罗里达州(7,718例)。
西班牙裔族群(调整报告比1.31,95%不确定区间1.30-1.32)与更多未被识别死亡相关,男性(1.22,95%不确定区间1.21-1.23)以及老年人群:65-74岁(1.21,1.21-1.22),75-84岁(1.22,1.21-1.23)也是如此。
与低估新冠死亡相关的其他社会人口因素包括:
- 居住在西南中部地区(调整报告比1.31,95%置信区间1.29-1.33)
- 居住在中大西洋地区(1.26,1.24-1.27)
- 教育程度低于高中(1.29,1.28-1.31)
- 家庭收入中位数最低五分位的县(1.34,1.31-1.36)
- 报告健康状况较差或一般的居民较多的县(1.30,1.28-1.33)
Stokes及其同事总结道:“受新冠死亡低估影响的社区可被解读为死亡调查系统中结构性种族主义、阶级歧视和体能歧视的表现,这值得进一步研究和政策关注。”
研究的局限性包括假设机器学习模型训练数据集中的院内新冠死亡分类是正确的。
【全文结束】

